trustworthiness

标签

Cards List
#trustworthiness

不确定这是否有用,但这是我与AI获得一致结果的方法。

Reddit r/AI_Agents · 5天前

作者描述了一项为期三周的实验,测试AI代理的可靠性,发现使用相同模型的代理之间的一致性不可靠,并概述了一个需要人工批准关键决策的系统。

0 人收藏 0 人点赞
#trustworthiness

模型崩溃与对策综述

arXiv cs.AI · 2026-08-25 缓存

本文提供了生成AI中模型崩溃现象的最新概述,并回顾了缓解该问题的对策,强调了挑战和未来的研究机会。

0 人收藏 0 人点赞
#trustworthiness

AI代理在什么时候变得足够有用,可以信任它处理实际工作?

Reddit r/AI_Agents · 2026-08-18

文章讨论了信任AI代理处理现实任务的标准,质疑实用性与风险之间的平衡,并寻求用户在实际工作流程中的见解。

0 人收藏 0 人点赞
#trustworthiness

SLMs可信度基准测试:预训练模型与压缩模型对比

arXiv cs.CL · 2026-08-13 缓存

本文评估了小型语言模型在公平性、鲁棒性、隐私和伦理方面的可信度,对比了预训练SLMs与压缩后的大模型,发现量化比剪枝能更好地保持可信度,且蒸馏可进一步提升可靠性。

0 人收藏 0 人点赞
#trustworthiness

TRACE:可信检索增强对话引擎

arXiv cs.AI · 2026-08-12 缓存

TRACE 是一种面向公共服务聊天机器人的检索增强对话引擎,通过增强对嘈杂目录的检索质量来改进约束感知推荐,同时减少幻觉响应。

0 人收藏 0 人点赞
#trustworthiness

小语言模型领域适配的可信度成本:跨架构实证研究

arXiv cs.CL · 2026-08-04 缓存

一项系统的跨架构实证研究,衡量小语言模型领域适配的可信度成本,发现安全保持的微调策略并不能可靠地迁移对齐性。

0 人收藏 0 人点赞
#trustworthiness

面向关键系统的可信代理型人工智能工程

arXiv cs.AI · 2026-07-22 缓存

本综述针对关键工程系统中的代理型AI提出了一个可信模型,涵盖了安全、鲁棒性、透明性、可问责性和安全性,涉及电力系统、自动驾驶车辆等领域。

0 人收藏 0 人点赞
#trustworthiness

ConceptSMILE:审计基于概念的可解释人工智能的可信度

arXiv cs.AI · 2026-07-13 缓存

ConceptSMILE是一个基于扰动的审计框架,用于评估基于概念的可解释人工智能的可靠性,已在视网膜眼底图像上进行了测试。

0 人收藏 0 人点赞
#trustworthiness

我们能否信任LLM的逻辑?通过基于图的框架量化不确定性、一致性和稳健性

arXiv cs.CL · 2026-07-10 缓存

本文介绍了GraphEVAL,一个基于图的框架用于量化LLM推理中的不确定性,并提出了一种新的指标——图推理一致性得分(GRCS),该指标捕捉语义-结构共识并检测自信幻觉。作者还提出了图自一致性(GSC),一种优先考虑推理忠实度而非名义准确性的解码策略。

0 人收藏 0 人点赞
#trustworthiness

SolarChain-Eval:面向去中心化能源市场中可信经济代理的物理约束基准

arXiv cs.AI · 2026-07-10 缓存

本文提出SolarChain-Eval,一个物理约束的基准,用于评估去中心化能源市场中的可信经济代理,集成了基于LLM的规划/审计层,并揭示了效用-安全性权衡。

0 人收藏 0 人点赞
#trustworthiness

@cognition: 昨天我们发布了基于开源Kimi K2.7的SWE-1.7。关于中国基础模型的担忧是真实存在的:K2.7完成…

X AI KOLs Following · 2026-07-09 缓存

Cognition发布了SWE-1.7,该模型基于开源Kimi K2.7构建,并通过可信性训练来解决对中国基础模型的担忧。

0 人收藏 0 人点赞
#trustworthiness

人工智能是否应该能够证明它当时知道什么?

Reddit r/artificial · 2026-07-06

一个思想实验,质疑人工智能系统是否应该维护一个可验证的记忆轨迹,记录其在决策时的知识和信念,以增强信任和问责制。

0 人收藏 0 人点赞
#trustworthiness

问题不在于AI犯错,而在于它犯错时如此自信

Reddit r/ArtificialInteligence · 2026-06-29

讨论了AI模型以高置信度产生错误答案的问题,强调了AI输出中的过度自信问题。

0 人收藏 0 人点赞
#trustworthiness

@_akhaliq:论文:

X AI KOLs Following · 2026-06-26 缓存

本文提出了Robust-TO,一个智能视频理解框架,它整合了每帧的可信度来解决盲信任问题,在真实扰动下实现了显著的精度提升。

0 人收藏 0 人点赞
#trustworthiness

面向鲁棒视频理解的置信感知工具编排

Hugging Face Daily Papers · 2026-06-25 缓存

Robust-TO通过将每帧可信度集成到智能框架中,解决了视频推理中的盲目信任问题,通过校准证据加权和可靠性感知推理,在现实扰动下提高了准确性。

0 人收藏 0 人点赞
#trustworthiness

探测、融合与可信度:面向多模态癌症分析的基础模型表征系统评估

arXiv cs.LG · 2026-06-17 缓存

本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。

0 人收藏 0 人点赞
#trustworthiness

TrustLDM:语言扩散模型可信度基准测试

arXiv cs.CL · 2026-06-02 缓存

介绍TrustLDM,一个全面评估语言扩散模型安全性、隐私性和公平性的基准测试,揭示其对齐行为在恶意后上下文环境下会退化。提出自动评估框架TrustLDM-Auto,用于识别脆弱配置。

0 人收藏 0 人点赞
#trustworthiness

离散分类任务中近似$\Gamma$校准的平滑诱导复杂度

arXiv cs.LG · 2026-05-25 缓存

本文刻画了多类分类中离散属性的近似属性校准,利用Lipschitz连续属性作为中介,将复杂度从类别数量降低到诱导复杂度维度。

0 人收藏 0 人点赞
#trustworthiness

视觉的代价:在单一范式中实现可信的多模态推理

Hugging Face Daily Papers · 2026-05-21 缓存

本文挑战了当前视觉语言模型忠实地融合多模态数据的假设,提出了一种基于信息论的 Modality Translation Protocol,并引入了新指标(Toll、Curse、Fallacy of Seeing)来评估可信度,而非传统的多模态增益。

0 人收藏 0 人点赞
#trustworthiness

可信代理网络:代理网络中的信任必须内建而非外加

arXiv cs.AI · 2026-05-20 缓存

这篇愿景论文认为,代理间(A2A)网络中的信任必须从一开始就集成其中,因为现有的代理对齐技术不足以解决诸如对抗性组合和语义错位等系统性漏洞。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈