agentic-reasoning

标签

Cards List
#agentic-reasoning

DeAR:通过能力锚定与协作思维导航的分散式代理推理

arXiv cs.AI · 昨天 缓存

DeAR是一个分散式代理推理框架,通过能力锚定与协作思维导航,在知识密集型推理任务中提升准确性,在多模态基准测试上优于集中式方法。

0 人收藏 0 人点赞
#agentic-reasoning

Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning

arXiv cs.AI · 2026-08-13 缓存

This paper presents a unified global-to-local paradigm for video anomaly detection, introducing a training-free framework (GtS) and a tool-augmented agentic reasoning method with reinforcement learning, along with a new benchmark VAGU-T and metric JeAUG.

0 人收藏 0 人点赞
#agentic-reasoning

QuantumMind:量子计算中加速分析的基于约束的智能体推理

arXiv cs.AI · 2026-08-11 缓存

QuantumMind 提出了一种可审计的智能体工作流,通过类型化角色专用操作和确定性验证器,自动生成并筛选量子加速假设。

0 人收藏 0 人点赞
#agentic-reasoning

@maximelabonne:不到两天就出现了LFM2.5-2.6B的首批微调版本。这个看起来很棒!

X AI KOLs Following · 2026-08-06 缓存

Maxime Labonne 强调了 LFM2.5-2.6B 的早期微调成果,同时 Bad Theory Labs 发布了两个开放权重模型:BTL-4 35B(前沿智能体推理模型)和 Macaw 2.7B(设备端 Mac 智能体),在 BFCL v4 上表现突出。

0 人收藏 0 人点赞
#agentic-reasoning

CastFSR:面向上下文感知时间序列预测的快-慢-反思智能体推理框架

arXiv cs.AI · 2026-08-05 缓存

CastFSR 是一种快-慢-反思智能体推理框架,利用大语言模型进行上下文感知时间序列预测,结合快速的轻量级预测器、缓慢的深思熟虑推理以及反思性评估,以提高预测的准确性和一致性。

0 人收藏 0 人点赞
#agentic-reasoning

智能体图令牌推理

arXiv cs.LG · 2026-08-04 缓存

提出了一种智能体图令牌推理方法,将图令牌化重新构建为LLM逐步推理过程的一部分,使模型能够在推理过程中动态选择图视图和粒度。该方法在七个图领域上优于基线,并能零样本迁移到未见领域。

0 人收藏 0 人点赞
#agentic-reasoning

LEDGERMIND:基于结构化证据账本的来源约束多模态智能体推理

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了LedgerMind,一种来源约束的多模态智能体推理框架,它使用结构化证据账本确保视觉问答中推理的立足性和忠实性,解决幻觉和过度推理等失败模式。

0 人收藏 0 人点赞
#agentic-reasoning

SCAIR:模式条件代理迭代推理用于企业知识图谱

arXiv cs.AI · 2026-07-28 缓存

SCAIR引入了一种无需训练的框架,用于企业知识图谱的推理。该框架通过注入基于模式的结构先验,并在多跳推理过程中强制进行模式感知的遍历,在真实的CMDB基准测试上展现了性能提升。

0 人收藏 0 人点赞
#agentic-reasoning

Legora Agentic Reasoning 基准评测(4分钟阅读)

TLDR AI · 2026-07-27 缓存

Legora 推出了 Legora BAR 基准,用于评估法律工作流中 AI 的 agentic reasoning,利用真实案例和 Legora harness 来衡量系统级性能。

0 人收藏 0 人点赞
#agentic-reasoning

FinanceComplexQA: 面向工业级金融文档的智能体推理基准评估

Hugging Face Daily Papers · 2026-07-21 缓存

本文介绍了FinanceComplexQA,这是一个全面的基准测试,用于评估工业级金融文档上的智能体推理能力,具有双语支持、专家级问题以及跨六个场景和七个任务的复杂布局。

0 人收藏 0 人点赞
#agentic-reasoning

地理空间基础模型的新兴范式:从预训练到智能体推理

arXiv cs.AI · 2026-07-15 缓存

本文综述了地理空间基础模型(GeoFMs)的新兴范式,这些模型在海量地理空间数据集上进行预训练,以实现对卫星和航空影像的快速微调和零样本分析。内容涵盖范式转变、模型适配策略,以及以大语言模型(LLMs)为编排器的智能体地理空间推理的前瞻性愿景。

0 人收藏 0 人点赞
#agentic-reasoning

AGORA: 基于档案的智能体工作场所文档推理基准

arXiv cs.CL · 2026-06-24 缓存

AGORA 是一个新的基准,用于评估大型语言模型在工作场所文档上进行基于档案的推理任务,包含 362 个问题,涉及 9,664 份真实文档。最强模型仅达到 59.4% 的准确率,凸显出巨大的改进空间。

0 人收藏 0 人点赞
#agentic-reasoning

Nemotron 3 Ultra:用于智能体推理的高效开源混合专家Mamba-Transformer模型

Hugging Face Daily Papers · 2026-06-12 缓存

Nemotron 3 Ultra 是一个550B参数的混合Mamba-Attention专家混合语言模型,在20T tokens上预训练,扩展至1M上下文,并通过SFT、RL和MOPD进行后训练。相比同等精度的一流LLM,其推理吞吐量最高可提升6倍,并已开源。

0 人收藏 0 人点赞
#agentic-reasoning

PhotoCraft: 基于层次化自演化记忆的深度图像搜索智能体推理

arXiv cs.CL · 2026-06-03 缓存

PhotoCraft 提出了一种无需训练的层次化记忆系统,用于照片搜索智能体,集成了工作记忆、情景记忆和语义记忆,以维持长期上下文并在任务间迁移知识,在 DISBench 上取得了高达 18.5% 的提升。

0 人收藏 0 人点赞
#agentic-reasoning

自适应潜在智能体推理

arXiv cs.CL · 2026-06-03 缓存

本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。

0 人收藏 0 人点赞
#agentic-reasoning

DAR:基于智能体框架的道义推理

Hugging Face Daily Papers · 2026-06-03

本文介绍了DAR(Deontic Agentic Reasoning),一个智能体框架,使LLM能够交互式地查询法律法规和政策,用于法律/监管推理任务。在DeonticBench上评估的结果表明,智能体引导可以提升前沿模型,但可能会导致较弱模型在数值任务上表现下降,同时消耗更多令牌。

0 人收藏 0 人点赞
#agentic-reasoning

CP-Agent:一种用于反馈驱动型竞赛编程的校准风险控制代理

arXiv cs.CL · 2026-05-26 缓存

CP-Agent 提出了一种借助大型语言模型的校准风险控制方法,用于反馈驱动型竞赛编程,无需参数更新即可在基准测试上取得显著改进。

0 人收藏 0 人点赞
#agentic-reasoning

SAM:面向长程推理智能体的状态自适应记忆

Hugging Face Daily Papers · 2026-05-23 缓存

本文提出 SAM,一个状态自适应记忆框架,能够动态管理长程智能体推理中的交互历史,实现意图驱动的回忆,而无需重新训练基础模型。它在多个基准测试(如 BrowseComp 和 HLE)上优于强基线方法。

0 人收藏 0 人点赞
#agentic-reasoning

@reach_vb: GPT-5.5 为 Omarchy 4 分支生成了 3 万行 QML 代码,并精准完成了微妙的智能体推理!!

X AI KOLs Following · 2026-05-22 缓存

OpenAI 的 GPT-5.5 模型在复杂的智能体任务和代码生成方面显示出显著改进,超越了先前版本以及如 Claude Opus 等竞争模型。

0 人收藏 0 人点赞
#agentic-reasoning

通过自我调节的模拟规划实现高效代理推理

Hugging Face Daily Papers · 2026-05-21 缓存

介绍了 SR²AM,一种通过自我调节的模拟规划实现高效代理推理的框架,在推理 token 减少 26-95% 的同时,达到了与 20-30 倍参数规模模型相竞争的性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈