人工智能评估应与人类协作
摘要
这篇立场论文主张,人工智能评估应转向评估人机团队,而非超人类性能,以促进更好的社会成果。
arXiv:2608.13577v1 公告类型:新
摘要:这篇立场论文认为,人工智能评估的主流范式(侧重于超人类自主性能,因此隐含目标为替代人类)正引导人工智能开发走向错误方向。相反,人工智能社区应转向评估人机团队的性能。我们认为,这种协作转变将促进人工智能系统成为人类能力的真正补充,从而比当前过程带来更好的社会成果。
查看缓存全文
缓存时间: 2026/08/17 09:38
# 人工智能评估应与人类协作 来源:https://arxiv.org/abs/2608.13577 查看PDF文档 (https://arxiv.org/pdf/2608.13577) > 摘要:本文主张,当前主流的人工智能评估范式(聚焦超人类自主性能,并隐含以替代人类为目标)正将AI发展引向错误方向。人工智能学界应转向评估人类与AI协作团队的性能。我们认为这种协作范式的转变将促使AI系统真正成为人类能力的互补者,从而比现行评估模式带来更优越的社会效益。 ## 提交历史 来自:Jan Kulveit \[查看邮箱 (https://arxiv.org/show-email/90b83c8c/2608.13577)\] **\[版本1\]** 2026年7月6日 周一 21:14:15 UTC \(2,904 KB\)
相似文章
为什么我们通过AI能取代什么来衡量其进步,而不是它能让人类做什么?
本文批评了AI取代人类角色的主流焦点,并提出通过AI如何增强人类能力来评估其进步,从而使人们能够完成之前无法完成的任务。
超越“人工智能协助人类”:智能体时代人机团队决策导向的评估设计
本文提出TEAM-Design,一种预算规则,用于分配重放任务以评估人机工作流相对于纯人类或纯智能体替代方案的有效性,应用于临床和编码环境。
Towards an Argumentative Foundation for Evaluative AI
This position paper advocates computational argumentation as a formal foundation for Evaluative AI, which supports human decision-making by presenting competing hypotheses with evidence for and against, rather than single recommendations.
立场:科学团队中的AI代理应作为人-代理系统来研究
本文立场论文认为,科学团队中的AI代理应作为人-代理系统来研究,以增强协作并缓解风险,例如科学探究中多样性的减少。
我们正在构建更智能的AI代理。但人类是否也在构建更好的方式来决定它们何时应该行动?
本文反思了人类与AI之间不断演变的关系,认为随着AI变得更加自主,关键挑战在于理解人类的决策和目的,而不仅仅是技术能力。它建议将AI从单纯的工具转变为增强人类判断力的协作工具。