来自 HuggingFace 的文章
本文介绍Fuse,一个多智能体模拟框架,用于评估LLM助手的社会推理能力。它通过用户介导的交互提供可验证的真实依据,并通过人类研究进行了验证,应用于12个LLM。
EvolveTrade 引入了一个针对 LLM 交易代理的自我进化框架,该框架利用决策轨迹和投资组合反馈来优化工具使用策略,在不同市场状态下改善夏普比率和累计收益率。
本文介绍了Zing-0.5,一个50亿参数的自回归世界模型,用于生成可通过键盘和文本控制实时交互的可玩世界。它在导航任务中表现出高性能,并展示了以24 FPS进行低成本实时推理的能力。
本文介绍了XConf,一种经验性置信度估计方法,该方法利用模型的过去经验,以提升语言模型在推理、编码和智能体任务中的置信度校准。
LimiX-2 是一个用于结构化数据的预训练基础模型,它使用上下文机制网络在主要表格基准测试中排名第一,支持多种任务而无需针对特定任务的参数更新。
本文提出EventEgoHands++,一个基于事件的3D手部网格重建框架,从自我中心视角出发,结合手部检测和自适应注意力,并引入新的真实世界数据集EEH-R用于训练和评估。
FLAT是一个表示预训练框架,联合优化共享多模态编码器与下游文本到图像和图像到文本解码器,使用柔性长度对齐的1D序列,实现具有最先进结果的跨模态检索与生成。
本文介绍了ImpossibleRubrics,一个开源评估框架,它使用细粒度的对抗性评分标准对大型语言模型进行压力测试,旨在减少评估偏差并揭示隐藏的失败模式。
ScienceBuddy 引入了一种递归中递归的自我改进范式,用于交互式科学代理,通过研究员合作与反馈实现持续演进。
贝尔曼策略优化 (BPO) 是一种无评论家的强化学习方法,它利用贝尔曼方程重新表述策略镜像下降 (PMD),用于具有终端奖励的自回归生成,从而提升大语言模型的数学推理能力。
EvoOntology 引入了一种自进化本体层,封装为 MCP 服务器,以弥合代理-数据鸿沟,并提高在异构数据任务上的性能,如基准测试所示。
本文评估了 nnU-Net 在 BraTS-GoAT 2026 挑战中脑肿瘤分割的泛化能力,报告了性能指标并分析了失败案例。
HypoEvolve 提出了一种利用遗传算法来协调多代理大型语言模型(LLM)的框架,用于科学假设的发现,并通过癌症研究中的药物重定位案例展示了其性能优于基准方法。
HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。
ModularRSI 提出了一种模块化、可泛化的递归式自我改进框架,用于智能体框架。该框架利用跨任务的对比学习独立演进模块,提升在未见任务上的性能。
本文介绍了Gavel,这是一种通过线性投影从冻结LLM中引出原生技能路由的方法,实现了高效的工具选择而不会造成上下文过载,并在基准测试中超越了现有流程。