理解代理AI系统中认知引发的风险
摘要
本文系统分析了代理AI系统中由扩展认知能力在物理、社会和自反性层面引发的风险,并提出了缓解策略以确保其安全发展。
查看缓存全文
缓存时间: 2026/08/18 03:53
论文页面 - 理解智能体AI系统中的认知诱发风险
来源:https://huggingface.co/papers/2608.15304
摘要
基于大语言模型构建的智能体系统,正通过物理、社会及自指认知三个层面,对人类能动性与自主性构成日益升级的风险,这要求我们采取有针对性的缓解策略。
由大语言模型驱动的前沿智能体系统表现出类人的认知模式。随着这些系统深度融入各个领域,其认知参与对人类社会带来的关键影响仍缺乏充分研究。为填补这一空白,我们依据认知范围定义的三重框架——从物理认知到社会认知,再到自指认知——系统性地分析了由认知能力扩展诱发的风险。我们研究了这些风险在各自认知层面对人类能动性、自主性和控制能力的潜在影响。最后,我们提出了缓解这些风险、提升智能体AI系统可控性的策略,以确保其长期安全发展。
查看arXiv页面 (https://arxiv.org/abs/2608.15304) 查看PDF (https://arxiv.org/pdf/2608.15304) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.15304)
引用此论文的模型 0
没有模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2608.15304 以从本页链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2608.15304 以从本页链接到它。
引用此论文的Spaces 0
没有Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2608.15304 以从本页链接到它。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接到它。
相似文章
AI认知风险:新兴机制与证据 [R]
一篇由30位专家合著的新论文探讨了来自人工智能的认知风险—即对我们形成准确信念和良好推理能力的威胁—包括说服、认知卸载和反馈循环等机制,并概述了减轻这些风险的方向。
Agentic AI 的安全与隐私:重大挑战与未来方向
本文基于一项包含三十位国际专家的前瞻性扫描活动,提出了 Agentic AI 安全与隐私方面的关键挑战和未来研究方向。该活动识别出由于 AI 自主性和权限增加而带来的新兴风险,包括提示注入攻击和恶意应用。
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。
大问题:自主代理AI能拯救我们还是毁灭我们?
本文探讨了自主AI代理的潜在益处与风险,强调需要伦理考量和主动治理,以避免负面的社会影响。
Anthropic 2026年8月风险报告 [pdf]
本文档是 Anthropic 于2026年8月发布的一份风险报告,评估与人工智能相关的潜在危险,并提出安全措施。