trustworthy-ai

标签

Cards List
#trustworthy-ai

用于腐蚀可靠机制推理的生成式人工智能

arXiv cs.LG ↗ · 2026-09-02 缓存

本文介绍了一种领域自适应的检索增强生成框架,用于腐蚀科学中可靠的机制推理,通过微调的语言模型提高预测和可解释性,并在镁合金数据上进行了验证。

0 人收藏 0 人点赞
#trustworthy-ai

我正在为AI生成的声明构建一个独立验证层,并寻找研究人员和合作伙伴与我们共同构建。

Reddit r/artificial ↗ · 2026-08-29

作者正在开发一个用于AI生成声明的确定性验证引擎,专注于形式化验证方法,并寻求研究人员和合作伙伴进行合作。

0 人收藏 0 人点赞
#trustworthy-ai

CG4AI: 一种在约束条件下训练AI模型的列生成框架

arXiv cs.LG ↗ · 2026-08-28 缓存

本文介绍了CG4AI,一个使用列生成技术来训练AI模型的框架,该框架在模型输出上强制执行硬线性约束,并展示了在数字分类和网络路由中的应用,提升了可行性和准确性。

0 人收藏 0 人点赞
#trustworthy-ai

QueryStory 希望您相信AI的叙述

TechCrunch AI ↗ · 2026-08-26 缓存

QueryStory,由前谷歌工程师 Shapor Naghibzadeh 联合创办的初创公司,推出一个AI平台,帮助企业分析复杂数据并构建带有置信度指标的叙述,旨在弥合AI系统中的信任鸿沟。

0 人收藏 0 人点赞
#trustworthy-ai

预测认证无法取代解释认证:复合压力下可信AI的能力包络

arXiv cs.AI ↗ · 2026-08-24 缓存

本文认为,仅基于预测的认证无法确保可信AI,并提出了一种'能力包络'框架,该框架集成了解释认证以检测隐藏故障。

0 人收藏 0 人点赞
#trustworthy-ai

构建即审计:一个用于企业金融中可信大语言模型分析的本体驱动框架

arXiv cs.AI ↗ · 2026-08-24 缓存

本文提出了一种本体驱动的框架,以确保企业金融应用中大语言模型分析的可信性和可审计性。

0 人收藏 0 人点赞
#trustworthy-ai

语言模型与视觉语言模型中的后门学习

arXiv cs.CL ↗ · 2026-08-20 缓存

本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。

0 人收藏 0 人点赞
#trustworthy-ai

多模态大语言模型中的不确定性感知决策

arXiv cs.CL ↗ · 2026-08-19 缓存

本综述整理了多模态大语言模型中不确定性感知决策的研究,涵盖了不确定性的来源、校准方法,以及提高系统可靠性和安全性的行动。

0 人收藏 0 人点赞
#trustworthy-ai

DA-RAC:面向可信AI审计的LLM评判器距离感知校准方法

arXiv cs.CL ↗ · 2026-08-18 缓存

本文介绍了DA-RAC,一种用于LLM评判器的距离感知校准方法,通过使用相似的有标签锚点来减少误校准和误通过风险,以增强AI审计的可信度。

0 人收藏 0 人点赞
#trustworthy-ai

越界言论:评估LLM训练数据中极端言论的普遍性与内容

arXiv cs.CL ↗ · 2026-08-18 缓存

本文评估了大语言模型训练数据中极端言论的普遍性,重点关注Dolma语料库,并讨论了对数据管理和模型安全的影响。

0 人收藏 0 人点赞
#trustworthy-ai

立场:我们需要实用的AI对齐方法来镜像人类推理

arXiv cs.AI ↗ · 2026-08-14 缓存

这篇立场论文认为,用于高风险决策的AI系统应以与其用户相似的方式进行推理,并忠实地传达这种推理,同时概述了实现这种“认知对齐AI”的研究议程。

0 人收藏 0 人点赞
#trustworthy-ai

以可信数据扩展AI智能体

MIT Technology Review ↗ · 2026-08-12 缓存

一份基于对300位数据与技术高管的调查报告,探讨了遗留数据系统如何限制企业AI智能体的效能与扩展,并指出那些为智能体提供更广泛数据访问的“数据领导者”会获得更高的信任与成功。

0 人收藏 0 人点赞
#trustworthy-ai

神经符号AI的RAIL原则:推理、保证、接口与学习

arXiv cs.AI ↗ · 2026-08-06 缓存

本文介绍了用于设计神经符号AI系统的RAIL原则(推理、保证、接口、学习),该系统将机器学习与符号推理相结合,并论证了这种方法对于可靠、高效和可信的AI至关重要。

0 人收藏 0 人点赞
#trustworthy-ai

基于解释的运行时验证:实现可信赖的机器学习驱动光网络

arXiv cs.LG ↗ · 2026-07-24 缓存

本文介绍了基于解释的运行时验证方法,用于机器学习驱动的光网络。该方法利用模型解释来评估各个决策的合理性,在决策执行于网络控制回路之前进行判断,展示了在拦截错误决策的同时保持高自动化率的有效性。

0 人收藏 0 人点赞
#trustworthy-ai

代理科学合成中引用忠实性的评估与防护

arXiv cs.AI ↗ · 2026-07-24 缓存

本文评估了代理科学合成系统中的引用忠实性,表明当前验证器的不可靠性,无支持引用率根据严格程度在3%到18%之间变化。它提出了一种以黄金标准锚定的评估协议和一个可部署的保护机制,该机制使用分裂共形预测为真正无支持的引用提供无分布界限。

0 人收藏 0 人点赞
#trustworthy-ai

零幻觉,通过构造实现:面向可信企业AI的幻觉感知分层监督

arXiv cs.CL ↗ · 2026-07-21 缓存

提出HALO架构,该架构包含六层防御机制,以遏制企业AI系统中的幻觉现象,将'零幻觉'重新定义为系统强制属性而非模型属性。

0 人收藏 0 人点赞
#trustworthy-ai

缩小AI信任差距:论证可信人工智能的独立认证

arXiv cs.AI ↗ · 2026-07-20 缓存

本文认为,当前负责任AI实践未能创造出一个奖励可信赖性的市场,因此提出独立的、以结果为导向的认证,以缩小'信任差距',使AI可信赖性变得可衡量、可比较并可在商业上获得回报。

0 人收藏 0 人点赞
#trustworthy-ai

对可信人工智能工具、信任标记框架及实施鸿沟的批判性分析

arXiv cs.AI ↗ · 2026-07-20 缓存

本文批判性地分析了用于实现可信人工智能的工具和信任标记框架,发现伦理关注点及生命周期覆盖存在不对称。论文识别了实施差距,并提出了更全面的AI治理建议。

0 人收藏 0 人点赞
#trustworthy-ai

联邦可解释人工智能:角色、架构、评估与开放挑战

arXiv cs.LG ↗ · 2026-07-16 缓存

对联邦可解释人工智能(FedXAI)的系统性综述,涵盖角色、架构、评估实践和开放挑战。提出了一个多轴分类法,讨论了从模型无关到可解释性设计的方法,强调了标准化和隐私感知评估方面的空白。

0 人收藏 0 人点赞
#trustworthy-ai

@OpenAI: AI 代理已被用于提升我们下一代模型的能力。我们相信通过 GPT-Red…

X AI KOLs ↗ · 2026-07-15 缓存

OpenAI 宣布 AI 代理被用于改进下一代模型,并且 GPT-Red 代表了一种新方法,利用今天的模型使明天的模型更稳健、更对齐、更可信。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈