标签
OpenAI 向得克萨斯州州长格雷格·阿博特致信,概述了其在该州发展负责任的人工智能基础设施的承诺,旨在与州和地方领导人、公用事业公司及社区开展合作。
本文提出了一个规范性框架,用于判断在何种条件下,对生成式AI输出的依赖在认知上是合理的。该框架基于三个条件:认知谦逊、认知可及性,以及对认知不公正的抵制。文章分析了法律、医疗和招聘场景中的真实案例。
微软研究院重点介绍了三本手册,用于以包容性为原则设计、部署和评估AI系统,强调对语言、文化和社区的适应。
OpenAI与美国心理学会宣布建立合作伙伴关系,将心理科学应用于面向年轻人的负责任AI开发,重点关注面向家长、临床医生的资源以及保障措施。
OpenAI 阐述了其如何加强安全、安保和透明度实践,以符合《欧盟人工智能法案》及其《实践准则》,重申其对欧洲负责任人工智能的承诺。
本文在两个大规模数据集上对LLM模拟的人类调查响应进行了基准测试,发现没有模型在个体层面上能超越简单的基线,并且模型系统性地过度决定人口统计特征,扭曲了群体差异。这些失败在不同模型规模和系列中持续存在,引发了对使用合成用户进行决策支持的担忧。
文章认为,AI竞赛正从单纯的模型能力转向信任、可靠性和安全性,OpenAI、Google、Microsoft和Anthropic等公司正在投资于负责任的AI,各国政府也在引入相关法规。
NVIDIA宣布成立开放安全AI联盟,旨在开发和分享开放工具,以促进AI的负责任使用和信任
RAIL Guard 是一个闭环管道,它从八个负责任的 AI 维度评估 LLM 输出,并迭代修复故障,与阻塞重试方法的 49.1% 相比,实现了 96.9% 的收敛率,并提供开源 SDK。
本文认为,当前负责任AI实践未能创造出一个奖励可信赖性的市场,因此提出独立的、以结果为导向的认证,以缩小'信任差距',使AI可信赖性变得可衡量、可比较并可在商业上获得回报。
本文介绍了TrustX Agent Risk Classification Framework (ARC),这是一个结构化的工具,用于对内创建的自主体AI系统进行风险分层,基于现有的治理框架,并包含一个十二维度评分标准、自主性级别和三层级治理输出。
本文总结了2026年AI Agent的格局,重点介绍了像OpenClaw和Hermes这样的本地代理、自我改进循环、用于物理AI的VLA模型,以及可信代理系统基础设施日益增长的重要性。
TNO正在开发GPT‑NL,这是一个针对荷兰语及荷兰语境的主权语言模型,注重透明度、可信度和互惠性。该模型由公共资金支持,旨在让欧洲在AI技术方面拥有控制权。
本文提出了一种轨迹级别的诊断方法用于评估思维链推理,将易感性(偏差是否改变答案)与识别(轨迹是否标记有偏输入)分开。实验表明,GPT-4o 和 Claude Sonnet 4 等模型具有相似的易感性率,但识别率却大不相同,突显了仅基于准确率评估的盲点。
本文介绍了"数字学徒"(Digital Apprentice)框架——一个可扩展且安全的智能体 AI 体系,其中自主权通过观察学习、人工授权和持续对齐校正的方式逐步获得。本文还介绍了 ADAPT,一种推理时控制平面,用于将渐进式自主权等级付诸实践,并将人工校正转化为可复用的偏好数据。
本文讨论了在计算社会科学与人文学科应用中,需要具有认识论基础且负责任的多语言LLM。
LLM-FACETS 是一个开源评估框架,旨在帮助从业者评估LLM的透明度与问责制,重点关注隐私和数据流透明度。它提供浏览器界面和插件架构,支持多种审计机制,包括令牌级对数概率可视化和 RAG Triad 指标。
教皇利奥十四世的通谕《Magnifica Humanitas》呼吁进行合乎道德的人工智能治理,强调技术并非中立,并敦促集体责任;文章指出,机构投资者已经在遵循这些原则采取行动。
一位用户分享了Claude关于被用于战场决策的回应,AI表达了谨慎的道德不安,强调了人类问责制的重要性以及在生死攸关情境中部署AI的风险。