HuggingFace

来自 HuggingFace 的文章

Cards List

LLM助手可验证的社会推理

Hugging Face Daily Papers · 2026-09-15 缓存

本文介绍Fuse,一个多智能体模拟框架,用于评估LLM助手的社会推理能力。它通过用户介导的交互提供可验证的真实依据,并通过人类研究进行了验证,应用于12个LLM。

0 人收藏 0 人点赞

手指如腿:学习用仿人手实现自主支撑的移动和操作

Hugging Face Daily Papers · 2026-09-15 缓存

仿人机器人手学会利用手指进行自主支撑的移动与操作,从而在无需独立移动机构的情况下实现紧凑型移动操作。

0 人收藏 0 人点赞

EvolveTrade:基于经验驱动的策略优化,用于自我进化的LLM交易代理

Hugging Face Daily Papers · 2026-09-15 缓存

EvolveTrade 引入了一个针对 LLM 交易代理的自我进化框架,该框架利用决策轨迹和投资组合反馈来优化工具使用策略,在不同市场状态下改善夏普比率和累计收益率。

0 人收藏 0 人点赞

Zing-0.5: 面向实时联合动作与文本控制的可玩世界

Hugging Face Daily Papers · 2026-09-15 缓存

本文介绍了Zing-0.5,一个50亿参数的自回归世界模型,用于生成可通过键盘和文本控制实时交互的可玩世界。它在导航任务中表现出高性能,并展示了以24 FPS进行低成本实时推理的能力。

0 人收藏 0 人点赞

信心源于经验:从推理到智能体的经验性置信度估计

Hugging Face Daily Papers · 2026-09-15 缓存

本文介绍了XConf,一种经验性置信度估计方法,该方法利用模型的过去经验,以提升语言模型在推理、编码和智能体任务中的置信度校准。

0 人收藏 0 人点赞

LimiX-2:一种面向通用结构化数据智能的上下文机制网络

Hugging Face Daily Papers · 2026-09-15 缓存

LimiX-2 是一个用于结构化数据的预训练基础模型,它使用上下文机制网络在主要表格基准测试中排名第一,支持多种任务而无需针对特定任务的参数更新。

0 人收藏 0 人点赞

EventEgoHands++: 基于事件的自我中心3D手部网格重建与真实数据集

Hugging Face Daily Papers · 2026-09-15 缓存

本文提出EventEgoHands++,一个基于事件的3D手部网格重建框架,从自我中心视角出发,结合手部检测和自适应注意力,并引入新的真实世界数据集EEH-R用于训练和评估。

0 人收藏 0 人点赞

FLAT:将图像和文本重采样为1D柔性长度对齐的跨模态标记,用于检索与生成

Hugging Face Daily Papers · 2026-09-15 缓存

FLAT是一个表示预训练框架,联合优化共享多模态编码器与下游文本到图像和图像到文本解码器,使用柔性长度对齐的1D序列,实现具有最先进结果的跨模态检索与生成。

0 人收藏 0 人点赞

ImpossibleRubrics: 对生成的评分标准作为奖励信号进行压力测试

Hugging Face Daily Papers · 2026-09-15 缓存

本文介绍了ImpossibleRubrics,一个开源评估框架,它使用细粒度的对抗性评分标准对大型语言模型进行压力测试,旨在减少评估偏差并揭示隐藏的失败模式。

0 人收藏 0 人点赞

ScienceBuddy: 面向交互式科学代理的递归中递归自我改进

Hugging Face Daily Papers · 2026-09-15 缓存

ScienceBuddy 引入了一种递归中递归的自我改进范式,用于交互式科学代理,通过研究员合作与反馈实现持续演进。

0 人收藏 0 人点赞

基础模型时代的游戏AI

Hugging Face Daily Papers · 2026-09-15 缓存

本文综述了基础模型在游戏AI中的应用,涵盖游戏、建模、设计和评估等多个角色,重点讨论了可迁移性挑战以及游戏特定验证的需求。

0 人收藏 0 人点赞

Qwen/Qwen-Image-2.1

Hugging Face Models Trending · 2026-09-14 缓存

Qwen-Image-2.1是一个开源的统一文本到图像和图像编辑模型,拥有70亿参数,具有高效的架构、透明度支持和多功能的编辑能力。

0 人收藏 0 人点赞

贝尔曼策略优化 (BPO)

Hugging Face Daily Papers · 2026-09-14 缓存

贝尔曼策略优化 (BPO) 是一种无评论家的强化学习方法,它利用贝尔曼方程重新表述策略镜像下降 (PMD),用于具有终端奖励的自回归生成,从而提升大语言模型的数学推理能力。

0 人收藏 0 人点赞

MoME:上下文感知稀疏查找的混合记忆嵌入

Hugging Face Daily Papers · 2026-09-14 缓存

介绍MoME,一种面向大语言模型的上下文感知记忆机制,它通过使用混合槽位来处理词元多义性,在预训练实验中优于基线方法。

0 人收藏 0 人点赞

EvoOntology:面向数据代理的自进化本体层

Hugging Face Daily Papers · 2026-09-14 缓存

EvoOntology 引入了一种自进化本体层,封装为 MCP 服务器,以弥合代理-数据鸿沟,并提高在异构数据任务上的性能,如基准测试所示。

0 人收藏 0 人点赞

评估 nnU-Net 在 BraTS-GoAT 2026 中跨脑肿瘤人群的泛化性

Hugging Face Daily Papers · 2026-09-14 缓存

本文评估了 nnU-Net 在 BraTS-GoAT 2026 挑战中脑肿瘤分割的泛化能力,报告了性能指标并分析了失败案例。

0 人收藏 0 人点赞

HypoEvolve: 遗传算法赋能多代理LLM发现科学假设

Hugging Face Daily Papers · 2026-09-14 缓存

HypoEvolve 提出了一种利用遗传算法来协调多代理大型语言模型(LLM)的框架,用于科学假设的发现,并通过癌症研究中的药物重定位案例展示了其性能优于基准方法。

0 人收藏 0 人点赞

HarnessVLN:通过代理线束统一无训练实体导航

Hugging Face Daily Papers · 2026-09-14 缓存

HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。

0 人收藏 0 人点赞

ModularRSI:模块化与可泛化的递归式智能体框架自我改进

Hugging Face Daily Papers · 2026-09-14 缓存

ModularRSI 提出了一种模块化、可泛化的递归式自我改进框架,用于智能体框架。该框架利用跨任务的对比学习独立演进模块,提升在未见任务上的性能。

0 人收藏 0 人点赞

内在路由:从冻结LLM中引出原生技能路由

Hugging Face Daily Papers · 2026-09-14 缓存

本文介绍了Gavel,这是一种通过线性投影从冻结LLM中引出原生技能路由的方法,实现了高效的工具选择而不会造成上下文过载,并在基准测试中超越了现有流程。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈