理解代理AI系统中认知引发的风险

Hugging Face Daily Papers 论文

摘要

本文系统分析了代理AI系统中由扩展认知能力在物理、社会和自反性层面引发的风险,并提出了缓解策略以确保其安全发展。

由大型语言模型(LLMs)驱动的前沿代理系统展现出类人的认知模式。随着这些系统在不同领域的深度融合,它们的认知参与引发了人类社会的关键担忧,这些担忧尚未得到充分研究。为了解决这一空白,我们系统分析了由扩展认知能力引发的风险,遵循由其认知范围定义的三级框架:从物理认知到社会认知,最后到自反性认知。我们研究了它们对人类能动性、自主性和控制能力的潜在风险,对应于每个认知层面。我们最终提出了缓解这些风险的策略,并增强代理AI系统的可控性,确保其长期安全发展。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:53

论文页面 - 理解智能体AI系统中的认知诱发风险

来源:https://huggingface.co/papers/2608.15304

摘要

基于大语言模型构建的智能体系统,正通过物理、社会及自指认知三个层面,对人类能动性与自主性构成日益升级的风险,这要求我们采取有针对性的缓解策略。

由大语言模型驱动的前沿智能体系统表现出类人的认知模式。随着这些系统深度融入各个领域,其认知参与对人类社会带来的关键影响仍缺乏充分研究。为填补这一空白,我们依据认知范围定义的三重框架——从物理认知到社会认知,再到自指认知——系统性地分析了由认知能力扩展诱发的风险。我们研究了这些风险在各自认知层面对人类能动性、自主性和控制能力的潜在影响。最后,我们提出了缓解这些风险、提升智能体AI系统可控性的策略,以确保其长期安全发展。

查看arXiv页面 (https://arxiv.org/abs/2608.15304) 查看PDF (https://arxiv.org/pdf/2608.15304) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.15304)

引用此论文的模型 0

没有模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2608.15304 以从本页链接到它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2608.15304 以从本页链接到它。

引用此论文的Spaces 0

没有Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2608.15304 以从本页链接到它。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接到它。

相似文章

AI认知风险:新兴机制与证据 [R]

Reddit r/MachineLearning

一篇由30位专家合著的新论文探讨了来自人工智能的认知风险—即对我们形成准确信念和良好推理能力的威胁—包括说服、认知卸载和反馈循环等机制,并概述了减轻这些风险的方向。

Agentic AI 的安全与隐私:重大挑战与未来方向

arXiv cs.AI

本文基于一项包含三十位国际专家的前瞻性扫描活动,提出了 Agentic AI 安全与隐私方面的关键挑战和未来研究方向。该活动识别出由于 AI 自主性和权限增加而带来的新兴风险,包括提示注入攻击和恶意应用。

AI安全与对齐

Reddit r/artificial

文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。