标签
这篇立场论文认为,用于高风险决策的AI系统应以与其用户相似的方式进行推理,并忠实地传达这种推理,同时概述了实现这种“认知对齐AI”的研究议程。
本文认为,现代AI对齐技术尽管旨在防止有害输出,但属于双重用途技术,可能被滥用于审查和操纵,并敦促社区正视这一风险。
这篇立场论文认为,AI推理缺乏清晰的操作性定义,削弱了评估的有效性,并提出将推理定义为一种可学习的基于规则的过程,同时提供研究最佳实践的检查清单。
This position paper argues that many LLM failures stem from evaluating outputs independently and proposes a self-consistency framework that treats diverse techniques as special cases of consistency optimization.
This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.
This position paper argues that language model evaluation scores should be treated as perishable knowledge claims, not ground truth, and proposes explicit metadata such as formality tier, scope declaration, and expiration date to counter 'trust inflation' caused by averaging weak and strong signals.
本文立场论文反驳了自然语言可以完全取代形式语言(如编程语言)的观点,提出了一个基于信息论的特定性框架,并证明了一个交叉定理,表明形式语言在高特定性任务中更具优势。
本文主张从被动的AI飞轮维护(出现错误时修补)转向主动的测试驱动方法,将反馈映射到任务条件的测试空间,并从数学上证明主动方法能以更少的迭代实现更好的长期扩展。
这篇立场论文主张理论级别的自动形式化,即将包括公理、定义和引理在内的整个理论形式化为一致的库,而不是孤立的陈述。它讨论了这种转变的重要性、不同观点、开放挑战,并为形式化研究中的这一转变提出了前进方向。
本立场论文认为,机器学习中的真实标准数据集并非客观真理,而是由选择塑造的人为构建,并主张阐明这些选择以提高可靠性、透明度和问责性。
这篇立场论文回顾了LLM驱动的形式化数学的现状,指出了将这些系统应用于开放性研究数学的关键局限性,并提出了一条战略性路线图,用于开发能够推进数学前沿的AI智能体。
本文立场是,强化学习研究者需区分求解模拟器和将模拟器作为真实部署的代理使用,并指出若不加以区分会引发的问题。
本立场文件认为,术语“机器遗忘”在大型语言模型研究中被过度使用,主张采用更严格的术语,将其与数据集定义的删除和重训练等价性保证挂钩。
亚利桑那州立大学的Subbarao Kambhampati教授及研究人员在一篇立场论文中提出,LLM中的思维链推理制造了一种推理假象,业界需要超越昂贵的token生成,转向替代推理机制。
这篇ICML 2026 spotlight立场论文识别了图像生成对齐中的一个失败模式:美学偏好优化会覆盖用户的明确意图,将其称为'逆向对齐',并在反美学提示上进行了测试。
这篇立场论文认为,当前的人工智能范式不足以应对全球系统性风险,并提出以地球为中心的AI(PCAI)作为一种新的设计理念,将地球的互联系统视为首要关注对象。
这篇观点文章认为,整合与人类海马体记忆类似的显式记忆,对于推动LLMs迈向AGI至关重要。它借鉴神经科学,提出高阶认知功能需要超越隐式统计学习的显式记忆。
这篇立场论文认为,当前评估人工智能资源使用的方法不足,并倡导采用生命周期评估(LCA)来正确核算整个机器学习流程(从硬件制造到训练和推理)中的能源和环境成本。