标签
该论文将修辞鲁棒性(Rhetorical Robustness)引入 AI 科学审稿人的评估目标,提出了包含 1,260 个论文版本的 RobustReview 基准,并介绍了 SciCore——一种双分支审稿人,将全文评估与基于科学核心内容抽取的判断相结合,在保持与人类对齐的同时提升审稿稳定性。
本文评估了开源权重指令微调的语言模型在长对抗性对话中能否保持安全行为,发现在第1轮时安全回应率为85-100%,到第101轮时降至15-44%,表明强大的单轮安全性并不能在持续交互中保持。
Queloz 和 Beckmann 指出,大语言模型(LLM)的理解问题一直被一种「单声部」式假设所误导;他们从机制层面证明,模型输出其实是多种平行机制组成的「复调」联盟共同作用的结果,并据此提出一种新的理解概念——以可可靠调用的控制性回路为基础,从而指导人们对 AI 的信任。
AJ Ratner 将于10月1日在旧金山的 Modal Runtime 活动上演讲,讨论如何随着AI代理能力增强来构建可信的基准测试。
LabourCrew 是一个多智能体RAG框架,专为劳动法的可信对抗性审议和法规推理而设计,包含基础机制以控制错误接受率并提高答案相关性。
本文质疑为什么AI基准测试在90%以上准确率时被视为饱和,并主张瞄准100%或开发新的基准。
论文回顾了基于LLM的可信代理AI系统的故障模式和缓解策略,并介绍了可信代理开发生命周期(TADL)框架,用于安全开发。
本文分享了七个实用的基于代码的守护措施,通过减轻失败来使AI代理更加可靠,例如在执行前验证操作和确保状态一致性,这些措施补充了提示改进。
本文提出了一种统一的评估框架,用于评估大语言模型、智能体AI和多模态系统的可信度,整合了八个可信度维度,并映射到治理标准如EU AI Act。
本文回顾了鲁棒性、操作设计域(ODD)和可解释性等关键领域,以构建对铁路应用中人工智能系统的信任,旨在满足严格的安全标准并实现更广泛的应用。
该推文声称,Grok是最中立的AI,在中立性和政治偏见测试中一直表现优异,并能提供可信赖的、基于现实的答案。
本文全面调查了可信代理AI系统的网络安全挑战和防御机制,涵盖威胁环境、架构和开放研究问题。
本文提出了ATAL,一种决策保障框架,用于评估空中交通管理中AI生成输出的可靠性,以确保安全和操作一致性。
本文对EU AI Act的高风险要求进行系统分析,推导出AI特定风险源列表,以桥接法律义务与AI风险管理实践。
本文介绍了XConf,一种经验性置信度估计方法,该方法利用模型的过去经验,以提升语言模型在推理、编码和智能体任务中的置信度校准。
本文介绍了Agent Incident Registry (AIR),这是一个包含487个从2022年至2026年AI代理相关事件的精选目录,旨在通过区分实际危害和已验证漏洞来支持安全评估。
本文提出了一种多目标神经基模型(MONBM)框架,旨在同时优化广义加法神经网络的准确性、可解释性与公平性,揭示了这些可信度维度之间复杂的权衡关系。
推广ELLIS博士后项目的帖子,详细阐述其优势、学习方向和研究领域,包括AI可解释性、安全以及AI应用于科学。
前MIT研究人员现于IBM任职,通过MIT-IBM计算研究实验室探讨他们在AI与量子应用上的工作,着重于从学术研究到实际部署的转型。