标签
作者描述了一项为期三周的实验,测试AI代理的可靠性,发现使用相同模型的代理之间的一致性不可靠,并概述了一个需要人工批准关键决策的系统。
文章讨论了信任AI代理处理现实任务的标准,质疑实用性与风险之间的平衡,并寻求用户在实际工作流程中的见解。
本文评估了小型语言模型在公平性、鲁棒性、隐私和伦理方面的可信度,对比了预训练SLMs与压缩后的大模型,发现量化比剪枝能更好地保持可信度,且蒸馏可进一步提升可靠性。
TRACE 是一种面向公共服务聊天机器人的检索增强对话引擎,通过增强对嘈杂目录的检索质量来改进约束感知推荐,同时减少幻觉响应。
一项系统的跨架构实证研究,衡量小语言模型领域适配的可信度成本,发现安全保持的微调策略并不能可靠地迁移对齐性。
本综述针对关键工程系统中的代理型AI提出了一个可信模型,涵盖了安全、鲁棒性、透明性、可问责性和安全性,涉及电力系统、自动驾驶车辆等领域。
ConceptSMILE是一个基于扰动的审计框架,用于评估基于概念的可解释人工智能的可靠性,已在视网膜眼底图像上进行了测试。
本文介绍了GraphEVAL,一个基于图的框架用于量化LLM推理中的不确定性,并提出了一种新的指标——图推理一致性得分(GRCS),该指标捕捉语义-结构共识并检测自信幻觉。作者还提出了图自一致性(GSC),一种优先考虑推理忠实度而非名义准确性的解码策略。
本文提出SolarChain-Eval,一个物理约束的基准,用于评估去中心化能源市场中的可信经济代理,集成了基于LLM的规划/审计层,并揭示了效用-安全性权衡。
Cognition发布了SWE-1.7,该模型基于开源Kimi K2.7构建,并通过可信性训练来解决对中国基础模型的担忧。
一个思想实验,质疑人工智能系统是否应该维护一个可验证的记忆轨迹,记录其在决策时的知识和信念,以增强信任和问责制。
本文提出了Robust-TO,一个智能视频理解框架,它整合了每帧的可信度来解决盲信任问题,在真实扰动下实现了显著的精度提升。
Robust-TO通过将每帧可信度集成到智能框架中,解决了视频推理中的盲目信任问题,通过校准证据加权和可靠性感知推理,在现实扰动下提高了准确性。
本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。
介绍TrustLDM,一个全面评估语言扩散模型安全性、隐私性和公平性的基准测试,揭示其对齐行为在恶意后上下文环境下会退化。提出自动评估框架TrustLDM-Auto,用于识别脆弱配置。
本文刻画了多类分类中离散属性的近似属性校准,利用Lipschitz连续属性作为中介,将复杂度从类别数量降低到诱导复杂度维度。
本文挑战了当前视觉语言模型忠实地融合多模态数据的假设,提出了一种基于信息论的 Modality Translation Protocol,并引入了新指标(Toll、Curse、Fallacy of Seeing)来评估可信度,而非传统的多模态增益。
这篇愿景论文认为,代理间(A2A)网络中的信任必须从一开始就集成其中,因为现有的代理对齐技术不足以解决诸如对抗性组合和语义错位等系统性漏洞。