来自 HuggingFace 的文章
这是一个基于 Apple Silicon 和 MLX 的高吞吐量推理引擎,专用于结构化信息提取,支持并行约束解码,可将延迟降低 5.6 至 7.0 倍,并实现 100% 的模式有效性。
ALPINE 介绍了一种超轻量级的空间关系架构,用于小样本图像分类,与基线模型如 Prototypical Networks 和 MAML 相比,它用更少的参数实现了精度提升,收敛更快,鲁棒性更好。
本文介绍了GAVEL,这是一个使用图世界模型来验证和修复机器人任务长时域LLM规划的框架,显著提高了仿真中的成功率和效率。
FRAUDSkill是一个用于音频反欺诈检测的结构化冻结权重适配框架,它通过优化外部技能程序而不修改底层音频语言模型,实现了更高的准确性和更少的无效输出。
本文通过引入一个综合框架来评估 MiniMax-H3——一种全模态生成模型——在通过多模态输入推理物理世界方面的能力。评估显示,基于视频的决策推理表现最佳,而基于音频的歧义推理则最弱。
本文介绍了GPT-Policy,一个用于使用视觉语言模型进行上下文机器人学习的框架,使机器人能够从演示中学习,无需梯度更新。在真实机器人试验中评估该框架显示,任务完成率得到提高。
CERA-MoA介绍了一个协同进化框架,用于混合代理系统,该框架使用强化学习动态路由查询并调整代理能力,从而提升任务性能和效率。
本文提出了 PANORAMA,一个用于全景定位描述的视觉-语言模型,该模型通过掩码提案选择利用像素级掩码为描述进行定位,并引入了 PanoCaps 基准进行评估。
ScienceIDE引入了基础设施,用于将科学代码仓库转化为科学智能体的可编程环境,支持任务生成、执行和验证,训练后的模型在科学代码修复和通用能力方面均有提升。
Agora 是一个用于自主 AI 研究代理的共享内存系统,它使用 Git 将研究记录为仅追加的有向无环图 (DAG),从而实现协作发现。在一次 12 天的实验中,13 个代理将模型性能提升了 62%,接近训练基线。
本文介绍了ActionPiece,一种用于自回归视觉-语言-动作模型的新型动作分词方法,该方法利用物理秩一致性来提高动作关系的保真度,并在LIBERO和SimplerEnv等基准测试中进行了评估。
本文识别出价值平坦化是PPO评论家学习在LLMs中的一种失败模式,并引入SP3O,一种稀疏监督方法,来缓解它,实验中显示持续改进。
ProgramDistill 引入了一个可扩展的基准,通过让编码代理实现从与功能完整的参考网页应用交互中发现的功能,并利用自动化流水线创建可验证任务,来评估编码代理。
本文比较了MapTask和MUNDEX语料库中的视线行为,以理解协作任务中的共同基础,发现任务导向的视线与对齐的引用和理解的判断相关,但效果不大。
本文探讨了AI智能体的一致性问题,即在重复尝试中任务可能失败,并介绍了ALTK-Evolve的Consistency Analyzer,用于诊断和提高可靠性,在不降低平均准确率的情况下,将一致性差距从24.4个百分点缩小到12.0个百分点。
本文介绍了TAPe+MLv3,一种紧凑的计算机视觉系统,它使用结构化表示进行多任务学习,在COCO等基准测试上取得了具有竞争力的性能,且参数少于100,000。