标签
DeAR是一个分散式代理推理框架,通过能力锚定与协作思维导航,在知识密集型推理任务中提升准确性,在多模态基准测试上优于集中式方法。
This paper presents a unified global-to-local paradigm for video anomaly detection, introducing a training-free framework (GtS) and a tool-augmented agentic reasoning method with reinforcement learning, along with a new benchmark VAGU-T and metric JeAUG.
QuantumMind 提出了一种可审计的智能体工作流,通过类型化角色专用操作和确定性验证器,自动生成并筛选量子加速假设。
Maxime Labonne 强调了 LFM2.5-2.6B 的早期微调成果,同时 Bad Theory Labs 发布了两个开放权重模型:BTL-4 35B(前沿智能体推理模型)和 Macaw 2.7B(设备端 Mac 智能体),在 BFCL v4 上表现突出。
CastFSR 是一种快-慢-反思智能体推理框架,利用大语言模型进行上下文感知时间序列预测,结合快速的轻量级预测器、缓慢的深思熟虑推理以及反思性评估,以提高预测的准确性和一致性。
提出了一种智能体图令牌推理方法,将图令牌化重新构建为LLM逐步推理过程的一部分,使模型能够在推理过程中动态选择图视图和粒度。该方法在七个图领域上优于基线,并能零样本迁移到未见领域。
本文介绍了LedgerMind,一种来源约束的多模态智能体推理框架,它使用结构化证据账本确保视觉问答中推理的立足性和忠实性,解决幻觉和过度推理等失败模式。
SCAIR引入了一种无需训练的框架,用于企业知识图谱的推理。该框架通过注入基于模式的结构先验,并在多跳推理过程中强制进行模式感知的遍历,在真实的CMDB基准测试上展现了性能提升。
Legora 推出了 Legora BAR 基准,用于评估法律工作流中 AI 的 agentic reasoning,利用真实案例和 Legora harness 来衡量系统级性能。
本文介绍了FinanceComplexQA,这是一个全面的基准测试,用于评估工业级金融文档上的智能体推理能力,具有双语支持、专家级问题以及跨六个场景和七个任务的复杂布局。
本文综述了地理空间基础模型(GeoFMs)的新兴范式,这些模型在海量地理空间数据集上进行预训练,以实现对卫星和航空影像的快速微调和零样本分析。内容涵盖范式转变、模型适配策略,以及以大语言模型(LLMs)为编排器的智能体地理空间推理的前瞻性愿景。
AGORA 是一个新的基准,用于评估大型语言模型在工作场所文档上进行基于档案的推理任务,包含 362 个问题,涉及 9,664 份真实文档。最强模型仅达到 59.4% 的准确率,凸显出巨大的改进空间。
Nemotron 3 Ultra 是一个550B参数的混合Mamba-Attention专家混合语言模型,在20T tokens上预训练,扩展至1M上下文,并通过SFT、RL和MOPD进行后训练。相比同等精度的一流LLM,其推理吞吐量最高可提升6倍,并已开源。
PhotoCraft 提出了一种无需训练的层次化记忆系统,用于照片搜索智能体,集成了工作记忆、情景记忆和语义记忆,以维持长期上下文并在任务间迁移知识,在 DISBench 上取得了高达 18.5% 的提升。
本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。
本文介绍了DAR(Deontic Agentic Reasoning),一个智能体框架,使LLM能够交互式地查询法律法规和政策,用于法律/监管推理任务。在DeonticBench上评估的结果表明,智能体引导可以提升前沿模型,但可能会导致较弱模型在数值任务上表现下降,同时消耗更多令牌。
CP-Agent 提出了一种借助大型语言模型的校准风险控制方法,用于反馈驱动型竞赛编程,无需参数更新即可在基准测试上取得显著改进。
本文提出 SAM,一个状态自适应记忆框架,能够动态管理长程智能体推理中的交互历史,实现意图驱动的回忆,而无需重新训练基础模型。它在多个基准测试(如 BrowseComp 和 HLE)上优于强基线方法。
OpenAI 的 GPT-5.5 模型在复杂的智能体任务和代码生成方面显示出显著改进,超越了先前版本以及如 Claude Opus 等竞争模型。
介绍了 SR²AM,一种通过自我调节的模拟规划实现高效代理推理的框架,在推理 token 减少 26-95% 的同时,达到了与 20-30 倍参数规模模型相竞争的性能。