agentic-models

标签

Cards List
#agentic-models

基于Docker化环境的大规模终端智能体轨迹生成

arXiv cs.CL · 2026-07-20 缓存

TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。

0 人收藏 0 人点赞
#agentic-models

智能体模型在信息抽取中的行为可控性:从固定工作流到反思型智能体

arXiv cs.AI · 2026-07-20 缓存

本文以会议论文数据集抽取为测试平台,研究反思与记忆等智能体机制是否能在学术PDF信息抽取中,相对于固定LLM工作流带来可控的改进。

0 人收藏 0 人点赞
#agentic-models

TACO:面向智能体工具使用的工具增强信用优化

Hugging Face Daily Papers · 2026-06-29 缓存

TACO提出了一种针对代码工具智能体的新型信用优化方法,该方法使用差分奖励探针和结果门控优势路由来区分有用、冗余或误导性的工具调用,从而提升多模态智能体的性能。

0 人收藏 0 人点赞
#agentic-models

OpenThoughts-Agent: 面向智能体模型的数据配方

Hugging Face Daily Papers · 2026-06-23 缓存

本文介绍了OpenThoughts-Agent,一个开源的用于训练智能体语言模型的数据整理流程,在七项基准测试中取得了44.8%的平均准确率,并通过系统性实验超越了先前的开源数据集。

0 人收藏 0 人点赞
#agentic-models

OpenBioRQ:面向智能体的未解决生物医学研究问题

Hugging Face Daily Papers · 2026-06-20 缓存

OpenBioRQ 是一个包含12,553个未解决生物医学研究问题的新基准,用于测试智能体模型验证来源和避免虚假引用的能力。该基准揭示,当前模型经常链接到错误的论文,并在难题上出现智能体崩溃。

0 人收藏 0 人点赞
#agentic-models

@TeksEdge: 天哪!新开源LLM之王!击败领先开源模型。开始测试以验证基准。Nex-N2-Pr…

X AI KOLs Timeline · 2026-06-08 缓存

Nex-N2-Pro是NexEcosystem新推出的开源LLM,据报道在基准测试中优于Kimi-K2.6和DeepSeek-V4-Pro等领先模型,具有自适应和连贯思维的特点。

0 人收藏 0 人点赞
#agentic-models

@DanKornas:大多数 AI 智能体仍然将视觉、语言和行动分离到不同的系统中。Magma 是微软研究院的一个基础…

X AI KOLs Timeline · 2026-05-23 缓存

Magma 是微软研究院推出的一个开源仓库,用于构建整合视觉、语言和行动的多模态 AI 智能体,提供模型链接、推理示例、训练说明和演示。

0 人收藏 0 人点赞
#agentic-models

@ms_aifrontiers: 与MagenticLite一起,我们推出了Fara1.5:一系列小型浏览器代理,参数规模分别为4B、9B和27B。它在Online-Mind2Web上取得了63%的成绩……

X AI KOLs Following · 2026-05-21 缓存

微软推出了Fara1.5系列小型浏览器代理(4B、9B、27B),在计算机使用基准测试中取得了最先进的性能,在Online-Mind2Web上得分63%,并超越了Operator和Gemini等更大规模的模型。

0 人收藏 0 人点赞
#agentic-models

@karpathy: 有人最近告诉我,OpenClaw时刻如此重大的原因是因为这是大量非技术人员第一次接触到…

X AI KOLs · 2026-04-09 缓存

Andrej Karpathy讨论了OpenClaw时刻之所以引起广泛共鸣,是因为非技术受众首次接触到了超越ChatGPT消费级产品的先进agentic AI模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈