标签
本文介绍了ConRub-Med,一种利用多个语言模型生成的共识评分标准来对开放医学问答进行奖励的强化学习方法,在包括HealthBench-Hard在内的多个基准上取得了最先进的结果。
一篇综述论文,提出了智能体系统中协同进化的三阶段分类法,涵盖智能体-智能体、智能体-环境以及元协同进化,以实现超越固定人工设计路径的开放式改进。
BigBang 是一个通用大语言模型,基于 Qwen 3.6 35B-A3B 通过对抗性自进化合成数据训练构建,在科学研究、编程和推理基准上取得了前沿水平的结果,尽管数据规模有限。
InferenceBench是一个基准测试,用于评估AI代理在多个瓶颈场景下使用H100 GPU优化LLM推理速度的表现。结果显示,代理虽然优于简单基线,但常常收敛于单一框架,且性能不及简单的超参数搜索,表明需要更好的探索策略。
Pantograph推出了Pan,一个拥有40亿参数的目标条件模型,该模型在互联网视频上进行训练,能够在Minecraft中执行各种任务,例如与怪物战斗、建造结构和探索。该方法利用事后重新标记在预训练期间学习目标导向行为。
本文表明,在没有提供参考答案的情况下,LLM评委倾向于对错误答案给予过多评分,而添加参考可以将判定结果翻转多达85%,从而更符合人类判断。作者提出了在无参考设置中使用LLM评委的校准步骤。
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
本文提出混合开放式三方进化(HOTE)框架,该框架使用混合模式强化学习协同进化提议者、求解者和评判者,用于深度研究任务,以8B模型实现了超越更大静态模型的最优结果。
DailyReport 是一个开放式基准,用于评估搜索代理在日常生活搜索任务中的表现,包含150个任务和3,546条评分标准,可实现可解释的、以用户为中心的评估。
介绍StatefulDiscovery,一个用于开放端科学发现的框架,它利用外部化的调查状态来校准证据和主张,在生成得到充分支持的高价值主张方面优于基线方法。
AgentOdyssey 是一款开放式文本游戏生成引擎,专为持续学习智能体设计,打破训练与测试的界限。
GTA-2 引入了一个分层基准,用于评估通用工具Agent在原子工具使用和开放式工作流中的表现,揭示了显著的能力鸿沟:前沿模型在复杂任务上仅取得14.39%的成功率,尽管在原子任务上表现尚可。