trustworthy-ai

标签

Cards List
#trustworthy-ai

立场:我们需要实用的AI对齐方法来镜像人类推理

arXiv cs.AI · 3天前 缓存

这篇立场论文认为,用于高风险决策的AI系统应以与其用户相似的方式进行推理,并忠实地传达这种推理,同时概述了实现这种“认知对齐AI”的研究议程。

0 人收藏 0 人点赞
#trustworthy-ai

以可信数据扩展AI智能体

MIT Technology Review · 4天前 缓存

一份基于对300位数据与技术高管的调查报告,探讨了遗留数据系统如何限制企业AI智能体的效能与扩展,并指出那些为智能体提供更广泛数据访问的“数据领导者”会获得更高的信任与成功。

0 人收藏 0 人点赞
#trustworthy-ai

神经符号AI的RAIL原则:推理、保证、接口与学习

arXiv cs.AI · 2026-08-06 缓存

本文介绍了用于设计神经符号AI系统的RAIL原则(推理、保证、接口、学习),该系统将机器学习与符号推理相结合,并论证了这种方法对于可靠、高效和可信的AI至关重要。

0 人收藏 0 人点赞
#trustworthy-ai

基于解释的运行时验证:实现可信赖的机器学习驱动光网络

arXiv cs.LG · 2026-07-24 缓存

本文介绍了基于解释的运行时验证方法,用于机器学习驱动的光网络。该方法利用模型解释来评估各个决策的合理性,在决策执行于网络控制回路之前进行判断,展示了在拦截错误决策的同时保持高自动化率的有效性。

0 人收藏 0 人点赞
#trustworthy-ai

代理科学合成中引用忠实性的评估与防护

arXiv cs.AI · 2026-07-24 缓存

本文评估了代理科学合成系统中的引用忠实性,表明当前验证器的不可靠性,无支持引用率根据严格程度在3%到18%之间变化。它提出了一种以黄金标准锚定的评估协议和一个可部署的保护机制,该机制使用分裂共形预测为真正无支持的引用提供无分布界限。

0 人收藏 0 人点赞
#trustworthy-ai

零幻觉,通过构造实现:面向可信企业AI的幻觉感知分层监督

arXiv cs.CL · 2026-07-21 缓存

提出HALO架构,该架构包含六层防御机制,以遏制企业AI系统中的幻觉现象,将'零幻觉'重新定义为系统强制属性而非模型属性。

0 人收藏 0 人点赞
#trustworthy-ai

缩小AI信任差距:论证可信人工智能的独立认证

arXiv cs.AI · 2026-07-20 缓存

本文认为,当前负责任AI实践未能创造出一个奖励可信赖性的市场,因此提出独立的、以结果为导向的认证,以缩小'信任差距',使AI可信赖性变得可衡量、可比较并可在商业上获得回报。

0 人收藏 0 人点赞
#trustworthy-ai

对可信人工智能工具、信任标记框架及实施鸿沟的批判性分析

arXiv cs.AI · 2026-07-20 缓存

本文批判性地分析了用于实现可信人工智能的工具和信任标记框架,发现伦理关注点及生命周期覆盖存在不对称。论文识别了实施差距,并提出了更全面的AI治理建议。

0 人收藏 0 人点赞
#trustworthy-ai

联邦可解释人工智能:角色、架构、评估与开放挑战

arXiv cs.LG · 2026-07-16 缓存

对联邦可解释人工智能(FedXAI)的系统性综述,涵盖角色、架构、评估实践和开放挑战。提出了一个多轴分类法,讨论了从模型无关到可解释性设计的方法,强调了标准化和隐私感知评估方面的空白。

0 人收藏 0 人点赞
#trustworthy-ai

@OpenAI: AI 代理已被用于提升我们下一代模型的能力。我们相信通过 GPT-Red…

X AI KOLs · 2026-07-15 缓存

OpenAI 宣布 AI 代理被用于改进下一代模型,并且 GPT-Red 代表了一种新方法,利用今天的模型使明天的模型更稳健、更对齐、更可信。

0 人收藏 0 人点赞
#trustworthy-ai

可扩展且可信的地球观测基础模型

arXiv cs.LG · 2026-07-10 缓存

本章回顾了地球观测基础模型的设计原则和当前格局,强调了领域特定适应、物理上合理的表示以及一致评估基准的必要性。包含关于有害藻华预测和自适应监测站点选择的案例研究。

0 人收藏 0 人点赞
#trustworthy-ai

@rohanpaul_ai: 更强的AI智能体不仅来自更大的模型,更来自围绕它们的更优系统。问题在于,许多AI…

X AI KOLs Following · 2026-07-09 缓存

该推文讨论了论文《从模型规模化到系统规模化》,该论文认为,更强大的AI智能体需要更好的系统设计(框架),包括上下文控制、记忆和路由,而不仅仅是更大的模型。

0 人收藏 0 人点赞
#trustworthy-ai

@FinanceYF5: Bin Yu构建了PCS框架,让可信AI不再是一句口号,而是可以实际验证的东西。正如…

X AI KOLs Following · 2026-07-04 缓存

Bin Yu开发了PCS框架,使可信AI变得可验证,应对模型日益不透明的挑战。

0 人收藏 0 人点赞
#trustworthy-ai

Theoria: 非正式推理状态下的重写可接受性验证

arXiv cs.AI · 2026-07-02 缓存

Theoria 是一种验证架构,将 AI 解决方案重写为可审计的状态转换,在 HLE 问题上实现了高精度,并能检测隐藏前提、虚假引用等细微错误。

0 人收藏 0 人点赞
#trustworthy-ai

可信AI的去中心化评估(DATA)

Reddit r/artificial · 2026-06-26

可信AI的去中心化评估(DATA)是一种伦理评估工具,允许用户和社区基于领先的伦理框架(如联合国教科文组织和欧盟指南)客观地审计AI公司。

0 人收藏 0 人点赞
#trustworthy-ai

面向心理健康交互的大语言模型中框架敏感行为不稳定性审计

arXiv cs.CL · 2026-06-26 缓存

本文研究了上下文框架如何影响大语言模型在心理健康交互中的响应,发现了系统性的行为变异,并证明了内部表示在Transformer各层中编码了框架信息。

0 人收藏 0 人点赞
#trustworthy-ai

从稀疏特征到可信代理:认证基于SAE的可解释性

arXiv cs.LG · 2026-06-18 缓存

本文提出了一种事后认证框架,用于基于稀疏自编码器(SAE)的可解释性,通过可测量量推导出冻结语言模型风险的上界。该框架在GPT-2 Small、Gemma-2B和Llama-3-8B上得到了验证,显示出非空洞的界,并揭示了深度相关的行为。

0 人收藏 0 人点赞
#trustworthy-ai

Upsolve AI

Product Hunt · 2026-06-17

Upsolve AI 是一个用于构建可靠、受治理且值得信赖的数据代理的工具。

0 人收藏 0 人点赞
#trustworthy-ai

LegalHalluLens:类型化幻觉审计与校准的多智能体辩论,实现可信赖的法律AI

arXiv cs.AI · 2026-06-17 缓存

本文介绍了LegalHalluLens,一个用于审计法律AI中幻觉的框架,提供类型化幻觉档案和风险方向指数,以提升可信赖部署。

0 人收藏 0 人点赞
#trustworthy-ai

用于法律AI的神经符号AI-TRISM:值得信赖、可靠、可解释、安全的模型

arXiv cs.AI · 2026-06-16 缓存

本立场论文提出了TRISM框架,该框架将神经符号AI与LLMs和RAG相结合,以解决法律AI中的幻觉和可解释性问题,引入了RASOR RAG用于生成可解释的理由,并形式化了符号化法律知识库。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈