position-paper

标签

Cards List
#position-paper

人工智能评估应与人类协作

arXiv cs.AI · 11小时前 缓存

这篇立场论文主张,人工智能评估应转向评估人机团队,而非超人类性能,以促进更好的社会成果。

0 人收藏 0 人点赞
#position-paper

立场:我们需要实用的AI对齐方法来镜像人类推理

arXiv cs.AI · 3天前 缓存

这篇立场论文认为,用于高风险决策的AI系统应以与其用户相似的方式进行推理,并忠实地传达这种推理,同时概述了实现这种“认知对齐AI”的研究议程。

0 人收藏 0 人点赞
#position-paper

立场:对齐社区无意中正在构建审查工具包

arXiv cs.AI · 3天前 缓存

本文认为,现代AI对齐技术尽管旨在防止有害输出,但属于双重用途技术,可能被滥用于审查和操纵,并敦促社区正视这一风险。

0 人收藏 0 人点赞
#position-paper

立场:推理是一种可学习的基于规则的过程

arXiv cs.AI · 3天前 缓存

这篇立场论文认为,AI推理缺乏清晰的操作性定义,削弱了评估的有效性,并提出将推理定义为一种可学习的基于规则的过程,同时提供研究最佳实践的检查清单。

0 人收藏 0 人点赞
#position-paper

Position: It's Time to Optimize LLMs for Self-Consistency

arXiv cs.CL · 2026-08-07 缓存

This position paper argues that many LLM failures stem from evaluating outputs independently and proposes a self-consistency framework that treats diverse techniques as special cases of consistency optimization.

0 人收藏 0 人点赞
#position-paper

立场:LLMs 无法跳跃

Hacker News Top · 2026-08-05 缓存

一篇立场论文,认为大语言模型存在根本性局限,用“无法跳跃”这一隐喻来突出推理或泛化方面的不足。

0 人收藏 0 人点赞
#position-paper

Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance

arXiv cs.LG · 2026-07-31 缓存

This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.

0 人收藏 0 人点赞
#position-paper

Position: Evaluation Scores Are Perishable Knowledge Claims

arXiv cs.AI · 2026-07-31 缓存

This position paper argues that language model evaluation scores should be treated as perishable knowledge claims, not ground truth, and proposes explicit metadata such as formality tier, scope declaration, and expiration date to counter 'trust inflation' caused by averaging weak and strong signals.

0 人收藏 0 人点赞
#position-paper

立场:自然语言不应完全取代形式语言

arXiv cs.CL · 2026-07-24 缓存

本文立场论文反驳了自然语言可以完全取代形式语言(如编程语言)的观点,提出了一个基于信息论的特定性框架,并证明了一个交叉定理,表明形式语言在高特定性任务中更具优势。

0 人收藏 0 人点赞
#position-paper

立场:停止每次被动修补模型,开始主动测试驱动的AI开发

arXiv cs.LG · 2026-07-24 缓存

本文主张从被动的AI飞轮维护(出现错误时修补)转向主动的测试驱动方法,将反馈映射到任务条件的测试空间,并从数学上证明主动方法能以更少的迭代实现更好的长期扩展。

0 人收藏 0 人点赞
#position-paper

理论级别的自动形式化:从孤立陈述到统一形式知识库

arXiv cs.AI · 2026-07-16 缓存

这篇立场论文主张理论级别的自动形式化,即将包括公理、定义和引理在内的整个理论形式化为一致的库,而不是孤立的陈述。它讨论了这种转变的重要性、不同观点、开放挑战,并为形式化研究中的这一转变提出了前进方向。

0 人收藏 0 人点赞
#position-paper

立场:每一个真实标准都是人为构建的,而非客观真理

arXiv cs.LG · 2026-07-14 缓存

本立场论文认为,机器学习中的真实标准数据集并非客观真理,而是由选择塑造的人为构建,并主张阐明这些选择以提高可靠性、透明度和问责性。

0 人收藏 0 人点赞
#position-paper

从求解器到研究者:大型语言模型驱动的前沿形式化数学

arXiv cs.CL · 2026-07-10 缓存

这篇立场论文回顾了LLM驱动的形式化数学的现状,指出了将这些系统应用于开放性研究数学的关键局限性,并提出了一条战略性路线图,用于开发能够推进数学前沿的AI智能体。

0 人收藏 0 人点赞
#position-paper

立场:强化学习研究者需区分求解模拟器与将模拟器作为代理使用

arXiv cs.LG · 2026-06-30 缓存

本文立场是,强化学习研究者需区分求解模拟器和将模拟器作为真实部署的代理使用,并指出若不加以区分会引发的问题。

0 人收藏 0 人点赞
#position-paper

观点:术语“机器遗忘”在大型语言模型中过度使用

arXiv cs.CL · 2026-06-29 缓存

本立场文件认为,术语“机器遗忘”在大型语言模型研究中被过度使用,主张采用更严格的术语,将其与数据集定义的删除和重训练等价性保证挂钩。

0 人收藏 0 人点赞
#position-paper

@rao2z: \"当LLM输出逐步计划时,它会产生一种强烈的错觉,让你以为正在观看机器推理...

X AI KOLs Following · 2026-06-21 缓存

亚利桑那州立大学的Subbarao Kambhampati教授及研究人员在一篇立场论文中提出,LLM中的思维链推理制造了一种推理假象,业界需要超越昂贵的token生成,转向替代推理机制。

0 人收藏 0 人点赞
#position-paper

ICML 2026 spotlight:通用美学对齐缩小艺术表达范围 [R]

Reddit r/MachineLearning · 2026-06-16

这篇ICML 2026 spotlight立场论文识别了图像生成对齐中的一个失败模式:美学偏好优化会覆盖用户的明确意图,将其称为'逆向对齐',并在反美学提示上进行了测试。

0 人收藏 0 人点赞
#position-paper

观点:人工智能必须以地球为中心,而不仅仅是以人类为中心

arXiv cs.AI · 2026-06-15 缓存

这篇立场论文认为,当前的人工智能范式不足以应对全球系统性风险,并提出以地球为中心的AI(PCAI)作为一种新的设计理念,将地球的互联系统视为首要关注对象。

0 人收藏 0 人点赞
#position-paper

观点:海马体显式记忆是AGI的基石

arXiv cs.AI · 2026-06-11 缓存

这篇观点文章认为,整合与人类海马体记忆类似的显式记忆,对于推动LLMs迈向AGI至关重要。它借鉴神经科学,提出高阶认知功能需要超越隐式统计学习的显式记忆。

0 人收藏 0 人点赞
#position-paper

评估机器学习资源利用需要模型生命周期评估

arXiv cs.LG · 2026-06-09 缓存

这篇立场论文认为,当前评估人工智能资源使用的方法不足,并倡导采用生命周期评估(LCA)来正确核算整个机器学习流程(从硬件制造到训练和推理)中的能源和环境成本。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈