人工智能评估应与人类协作
摘要
这篇立场论文主张,人工智能评估应转向评估人机团队,而非超人类性能,以促进更好的社会成果。
arXiv:2608.13577v1 公告类型:新
摘要:这篇立场论文认为,人工智能评估的主流范式(侧重于超人类自主性能,因此隐含目标为替代人类)正引导人工智能开发走向错误方向。相反,人工智能社区应转向评估人机团队的性能。我们认为,这种协作转变将促进人工智能系统成为人类能力的真正补充,从而比当前过程带来更好的社会成果。
查看缓存全文
缓存时间: 2026/08/17 09:38
# 人工智能评估应与人类协作 来源:https://arxiv.org/abs/2608.13577 查看PDF文档 (https://arxiv.org/pdf/2608.13577) > 摘要:本文主张,当前主流的人工智能评估范式(聚焦超人类自主性能,并隐含以替代人类为目标)正将AI发展引向错误方向。人工智能学界应转向评估人类与AI协作团队的性能。我们认为这种协作范式的转变将促使AI系统真正成为人类能力的互补者,从而比现行评估模式带来更优越的社会效益。 ## 提交历史 来自:Jan Kulveit \[查看邮箱 (https://arxiv.org/show-email/90b83c8c/2608.13577)\] **\[版本1\]** 2026年7月6日 周一 21:14:15 UTC \(2,904 KB\)
相似文章
Towards an Argumentative Foundation for Evaluative AI
This position paper advocates computational argumentation as a formal foundation for Evaluative AI, which supports human decision-making by presenting competing hypotheses with evidence for and against, rather than single recommendations.
我们正在构建更智能的AI代理。但人类是否也在构建更好的方式来决定它们何时应该行动?
本文反思了人类与AI之间不断演变的关系,认为随着AI变得更加自主,关键挑战在于理解人类的决策和目的,而不仅仅是技术能力。它建议将AI从单纯的工具转变为增强人类判断力的协作工具。
AI的目标应该是什么?我认为应该是保护人类能动性。
本文认为,AI的主要目标应该是保护人类能动性,将能动性视为价值观、偏好和一致性对齐的基础基质。它探讨了能动性的削弱如何破坏有意义的评估和行动,并提出AI系统的合法性必须来自在局部层面可证明的能动性保护。
设计抗AI的技术评估方案
Anthropic工程师Tristan Hume探讨了为招聘性能工程师设计抗AI技术作业测试的挑战,并详细介绍了近期Claude模型如何开始超越人类候选人的表现。
AI是否应该更多地反问人类?
本文认为,AI代理不应只是顺从地执行任务,而应在任务模糊、矛盾或存在风险时主动质疑人类,从而从工具转变为真正的协作者。