trustworthiness

标签

Cards List
#trustworthiness

面向关键系统的可信代理型人工智能工程

arXiv cs.AI · 昨天 缓存

本综述针对关键工程系统中的代理型AI提出了一个可信模型,涵盖了安全、鲁棒性、透明性、可问责性和安全性,涉及电力系统、自动驾驶车辆等领域。

0 人收藏 0 人点赞
#trustworthiness

ConceptSMILE:审计基于概念的可解释人工智能的可信度

arXiv cs.AI · 2026-07-13 缓存

ConceptSMILE是一个基于扰动的审计框架,用于评估基于概念的可解释人工智能的可靠性,已在视网膜眼底图像上进行了测试。

0 人收藏 0 人点赞
#trustworthiness

我们能否信任LLM的逻辑?通过基于图的框架量化不确定性、一致性和稳健性

arXiv cs.CL · 2026-07-10 缓存

本文介绍了GraphEVAL,一个基于图的框架用于量化LLM推理中的不确定性,并提出了一种新的指标——图推理一致性得分(GRCS),该指标捕捉语义-结构共识并检测自信幻觉。作者还提出了图自一致性(GSC),一种优先考虑推理忠实度而非名义准确性的解码策略。

0 人收藏 0 人点赞
#trustworthiness

SolarChain-Eval:面向去中心化能源市场中可信经济代理的物理约束基准

arXiv cs.AI · 2026-07-10 缓存

本文提出SolarChain-Eval,一个物理约束的基准,用于评估去中心化能源市场中的可信经济代理,集成了基于LLM的规划/审计层,并揭示了效用-安全性权衡。

0 人收藏 0 人点赞
#trustworthiness

@cognition: 昨天我们发布了基于开源Kimi K2.7的SWE-1.7。关于中国基础模型的担忧是真实存在的:K2.7完成…

X AI KOLs Following · 2026-07-09 缓存

Cognition发布了SWE-1.7,该模型基于开源Kimi K2.7构建,并通过可信性训练来解决对中国基础模型的担忧。

0 人收藏 0 人点赞
#trustworthiness

人工智能是否应该能够证明它当时知道什么?

Reddit r/artificial · 2026-07-06

一个思想实验,质疑人工智能系统是否应该维护一个可验证的记忆轨迹,记录其在决策时的知识和信念,以增强信任和问责制。

0 人收藏 0 人点赞
#trustworthiness

问题不在于AI犯错,而在于它犯错时如此自信

Reddit r/ArtificialInteligence · 2026-06-29

讨论了AI模型以高置信度产生错误答案的问题,强调了AI输出中的过度自信问题。

0 人收藏 0 人点赞
#trustworthiness

@_akhaliq:论文:

X AI KOLs Following · 2026-06-26 缓存

本文提出了Robust-TO,一个智能视频理解框架,它整合了每帧的可信度来解决盲信任问题,在真实扰动下实现了显著的精度提升。

0 人收藏 0 人点赞
#trustworthiness

面向鲁棒视频理解的置信感知工具编排

Hugging Face Daily Papers · 2026-06-25 缓存

Robust-TO通过将每帧可信度集成到智能框架中,解决了视频推理中的盲目信任问题,通过校准证据加权和可靠性感知推理,在现实扰动下提高了准确性。

0 人收藏 0 人点赞
#trustworthiness

探测、融合与可信度:面向多模态癌症分析的基础模型表征系统评估

arXiv cs.LG · 2026-06-17 缓存

本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。

0 人收藏 0 人点赞
#trustworthiness

TrustLDM:语言扩散模型可信度基准测试

arXiv cs.CL · 2026-06-02 缓存

介绍TrustLDM,一个全面评估语言扩散模型安全性、隐私性和公平性的基准测试,揭示其对齐行为在恶意后上下文环境下会退化。提出自动评估框架TrustLDM-Auto,用于识别脆弱配置。

0 人收藏 0 人点赞
#trustworthiness

离散分类任务中近似$\Gamma$校准的平滑诱导复杂度

arXiv cs.LG · 2026-05-25 缓存

本文刻画了多类分类中离散属性的近似属性校准,利用Lipschitz连续属性作为中介,将复杂度从类别数量降低到诱导复杂度维度。

0 人收藏 0 人点赞
#trustworthiness

视觉的代价:在单一范式中实现可信的多模态推理

Hugging Face Daily Papers · 2026-05-21 缓存

本文挑战了当前视觉语言模型忠实地融合多模态数据的假设,提出了一种基于信息论的 Modality Translation Protocol,并引入了新指标(Toll、Curse、Fallacy of Seeing)来评估可信度,而非传统的多模态增益。

0 人收藏 0 人点赞
#trustworthiness

可信代理网络:代理网络中的信任必须内建而非外加

arXiv cs.AI · 2026-05-20 缓存

这篇愿景论文认为,代理间(A2A)网络中的信任必须从一开始就集成其中,因为现有的代理对齐技术不足以解决诸如对抗性组合和语义错位等系统性漏洞。

0 人收藏 0 人点赞
#trustworthiness

大型音频语言模型综述:泛化、可信度与展望

Hugging Face Daily Papers · 2026-05-18 缓存

一篇全面综述,回顾了大型音频语言模型(LALMs)的可信度挑战,包括跨模态越狱和声学后门等漏洞,并提出了纵深防御路线图。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈