open-ended

标签

Cards List
#open-ended

ConRub-Med:基于共识评分标准的开放医学问答强化学习

arXiv cs.CL ↗ · 2026-08-12 缓存

本文介绍了ConRub-Med,一种利用多个语言模型生成的共识评分标准来对开放医学问答进行奖励的强化学习方法,在包括HealthBench-Hard在内的多个基准上取得了最先进的结果。

0 人收藏 0 人点赞
#open-ended

智能体系统中的协同进化:走向超越人类设计的自我导向进化

Hugging Face Daily Papers ↗ · 2026-08-10 缓存

一篇综述论文,提出了智能体系统中协同进化的三阶段分类法,涵盖智能体-智能体、智能体-环境以及元协同进化,以实现超越固定人工设计路径的开放式改进。

0 人收藏 0 人点赞
#open-ended

endless-frontier/BigBang-v1

Hugging Face Models Trending ↗ · 2026-08-02 缓存

BigBang 是一个通用大语言模型,基于 Qwen 3.6 35B-A3B 通过对抗性自进化合成数据训练构建,在科学研究、编程和推理基准上取得了前沿水平的结果,尽管数据规模有限。

0 人收藏 0 人点赞
#open-ended

InferenceBench:面向AI代理的开放式LLM推理优化基准测试

arXiv cs.AI ↗ · 2026-07-24 缓存

InferenceBench是一个基准测试,用于评估AI代理在多个瓶颈场景下使用H100 GPU优化LLM推理速度的表现。结果显示,代理虽然优于简单基线,但常常收敛于单一框架,且性能不及简单的超参数搜索,表明需要更好的探索策略。

0 人收藏 0 人点赞
#open-ended

一个通用的目标条件Minecraft模型

Hacker News Top ↗ · 2026-07-15 缓存

Pantograph推出了Pan,一个拥有40亿参数的目标条件模型,该模型在互联网视频上进行训练,能够在Minecraft中执行各种任务,例如与怪物战斗、建造结构和探索。该方法利用事后重新标记在预训练期间学习目标导向行为。

0 人收藏 0 人点赞
#open-ended

当没有参考答案时,LLM评委可能过于慷慨

arXiv cs.CL ↗ · 2026-07-15 缓存

本文表明,在没有提供参考答案的情况下,LLM评委倾向于对错误答案给予过多评分,而添加参考可以将判定结果翻转多达85%,从而更符合人类判断。作者提出了在无参考设置中使用LLM评委的校准步骤。

0 人收藏 0 人点赞
#open-ended

新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]

Reddit r/MachineLearning ↗ · 2026-07-14

介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。

0 人收藏 0 人点赞
#open-ended

Hybrid Open-Ended Tri-Evolution 打造更好的深度研究者

arXiv cs.AI ↗ · 2026-06-15 缓存

本文提出混合开放式三方进化(HOTE)框架,该框架使用混合模式强化学习协同进化提议者、求解者和评判者,用于深度研究任务,以8B模型实现了超越更大静态模型的最优结果。

0 人收藏 0 人点赞
#open-ended

DailyReport:一个用于评估日常搜索任务中搜索代理的开放式基准

arXiv cs.AI ↗ · 2026-06-12 缓存

DailyReport 是一个开放式基准,用于评估搜索代理在日常生活搜索任务中的表现,包含150个任务和3,546条评分标准,可实现可解释的、以用户为中心的评估。

0 人收藏 0 人点赞
#open-ended

StatefulDiscovery: 开放端科学发现中基于证据校准的主张形成

arXiv cs.AI ↗ · 2026-06-11 缓存

介绍StatefulDiscovery,一个用于开放端科学发现的框架,它利用外部化的调查状态来校准证据和主张,在生成得到充分支持的高价值主张方面优于基线方法。

0 人收藏 0 人点赞
#open-ended

@zheyuanzhang99:发布 AgentOdyssey——一款面向测试时持续学习智能体的开放式长程文本游戏生成引擎

X AI KOLs Timeline ↗ · 2026-04-20 缓存

AgentOdyssey 是一款开放式文本游戏生成引擎,专为持续学习智能体设计,打破训练与测试的界限。

0 人收藏 0 人点赞
#open-ended

GTA-2:从原子工具使用到开放式工作流的通用工具Agent基准测试

Hugging Face Daily Papers ↗ · 2026-04-17 缓存

GTA-2 引入了一个分层基准,用于评估通用工具Agent在原子工具使用和开放式工作流中的表现,揭示了显著的能力鸿沟:前沿模型在复杂任务上仅取得14.39%的成功率,尽管在原子任务上表现尚可。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈