标签
本文介绍了TW3Cast,一个时间序列预测系统,它使用基于轻度微调基础模型的冻结路由器,在GIFT-Eval基准上取得顶尖性能,且无需代理或语言模型
本文审计了多语言情感生成基准测试,揭示系统排名由测量伪影而非真实性能差异驱动,标注者变异性在其中扮演关键角色。
Vals AI 对 Grok 4.7 进行了评估,发现其在 Vals 指数中排名第 24,得分 54.2%,较 Grok 4.6 下降,但在法律和医疗领域显示改进。
本文提出了RoboDawn,一种将视觉语言模型智能迁移至机器人控制的方法。该方法通过零样本和单样本学习在基准测试中取得了先进结果,并在真实世界应用中验证成功。
一项耶鲁大学主导的论文发现,前沿AI模型在物理基准测试中表现不佳,主要是由于基准测试的缺陷,而非模型本身的局限性,这表明基准测试质量是准确评估的关键瓶颈。
本文提出CLEAR,一种用于跨源证据裁决的代理框架,旨在通过处理来自多个知识源的冲突来提升医学领域大语言模型的性能。该框架在多个基准测试中表现出竞争力,在直接推理或检索能力较弱的场景中取得了显著提升。
本文介绍了REALM,一个用于LLM代理长期记忆的框架,它利用检索驱动的再巩固来自主地将记忆组织成认知图,从而在长期记忆基准测试中取得更好的性能。
本研究通过重新运行具有相同输入的任务并比较医嘱,考察了临床LLM智能体的行为级可靠性,发现了基准测试可能忽略的显著分歧,并提出了增强的评估方法。
本文提出了一种Program-Solve接口,临床语言模型生成Python代码,交由确定性执行器进行数学计算。通过在MedCalc-Bench上的评估,我们发现大型模型如Qwen2.5-32B相比直接算术和手写库,准确性有所提升。
Apodex-1.1 是一款专注于优先推理的 AI 模型,专为复杂的长期研究任务设计,支持端到端执行、自适应智能体团队,并内置验证机制以提供可验证的结果。
本文研究代理框架优化,以改进大语言模型工具代理而无需重新训练,重点关注提示和工具边界中间件,并引入了一个协议和PRISM优化器以实现可测量的增益。
RecKAN 为 Kolmogorov-Arnold 网络引入了可学习的递归多项式基,在分类和预测任务上超越了现有的 KAN 变体。
本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。
本文介绍了FactoSR,一个因子化强化学习框架,通过将4D属性分解为正交子目标,增强了视觉-语言模型的空间推理能力,在多视角和视频基准测试中取得了显著的性能提升。
本文提出了一种结合神经网络均值与精确Matérn kernel校正的方法,用于偏微分方程中的算子学习,在结构力学和OCO-2辐射传输模拟等公开基准测试中达到了竞争性或改进的性能。
本文识别了多模态学习中的强模态坍缩现象,其中融合会降低主导模态的性能,并提出了 Inverted Asymmetric Fusion (IAF) 来保留主导模态,从而在单模态基线上取得改进。
本文重新评估了针对大型语言模型的未完成体悖论基准测试,识别出概念和评估上的误规范,并引入了词汇匹配的最小对以揭示模型语义推理中的充分性偏差。
本文提出一种权重变化审计方法,用于分析语言模型中的医疗专业化,考察超越端点基准分数的内部更新变化。
本文提出转换复杂度剖面(TCP)这组指标,用于量化游戏世界建模中的状态转换预测难度,旨在为强化学习与世界模型研究建立标准化的基准评估体系。
本文审计了多个模型在金融新闻自然语言处理基准中的时间泄漏,发现随机划分会夸大性能指标,并确定并购事件是在时序评估下具有局部正向信号的一个类别。