人工智能评估应与人类协作

arXiv cs.AI 论文

摘要

这篇立场论文主张,人工智能评估应转向评估人机团队,而非超人类性能,以促进更好的社会成果。

arXiv:2608.13577v1 公告类型:新 摘要:这篇立场论文认为,人工智能评估的主流范式(侧重于超人类自主性能,因此隐含目标为替代人类)正引导人工智能开发走向错误方向。相反,人工智能社区应转向评估人机团队的性能。我们认为,这种协作转变将促进人工智能系统成为人类能力的真正补充,从而比当前过程带来更好的社会成果。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:38

# 人工智能评估应与人类协作
来源:https://arxiv.org/abs/2608.13577
查看PDF文档 (https://arxiv.org/pdf/2608.13577)

> 摘要:本文主张,当前主流的人工智能评估范式(聚焦超人类自主性能,并隐含以替代人类为目标)正将AI发展引向错误方向。人工智能学界应转向评估人类与AI协作团队的性能。我们认为这种协作范式的转变将促使AI系统真正成为人类能力的互补者,从而比现行评估模式带来更优越的社会效益。

## 提交历史
来自:Jan Kulveit \[查看邮箱 (https://arxiv.org/show-email/90b83c8c/2608.13577)\] **\[版本1\]** 2026年7月6日 周一 21:14:15 UTC \(2,904 KB\)

相似文章

Towards an Argumentative Foundation for Evaluative AI

arXiv cs.AI

This position paper advocates computational argumentation as a formal foundation for Evaluative AI, which supports human decision-making by presenting competing hypotheses with evidence for and against, rather than single recommendations.

AI的目标应该是什么?我认为应该是保护人类能动性。

Reddit r/ArtificialInteligence

本文认为,AI的主要目标应该是保护人类能动性,将能动性视为价值观、偏好和一致性对齐的基础基质。它探讨了能动性的削弱如何破坏有意义的评估和行动,并提出AI系统的合法性必须来自在局部层面可证明的能动性保护。

设计抗AI的技术评估方案

Anthropic Engineering

Anthropic工程师Tristan Hume探讨了为招聘性能工程师设计抗AI技术作业测试的挑战,并详细介绍了近期Claude模型如何开始超越人类候选人的表现。

AI是否应该更多地反问人类?

Reddit r/AI_Agents

本文认为,AI代理不应只是顺从地执行任务,而应在任务模糊、矛盾或存在风险时主动质疑人类,从而从工具转变为真正的协作者。