trustworthy-ai

标签

Cards List
#trustworthy-ai

可信 AI 审稿人缺失的一环:从修辞鲁棒性基准评测到 SciCore 审稿

arXiv cs.CL ↗ · 18小时前 缓存

该论文将修辞鲁棒性(Rhetorical Robustness)引入 AI 科学审稿人的评估目标,提出了包含 1,260 个论文版本的 RobustReview 基准,并介绍了 SciCore——一种双分支审稿人,将全文评估与基于科学核心内容抽取的判断相结合,在保持与人类对齐的同时提升审稿稳定性。

0 人收藏 0 人点赞
#trustworthy-ai

评估语言模型在长对抗性对话中的安全性

arXiv cs.CL ↗ · 18小时前 缓存

本文评估了开源权重指令微调的语言模型在长对抗性对话中能否保持安全行为,发现在第1轮时安全回应率为85-100%,到第101轮时降至15-44%,表明强大的单轮安全性并不能在持续交互中保持。

0 人收藏 0 人点赞
#trustworthy-ai

AI 理解的复调式构想

arXiv cs.AI ↗ · 昨天 缓存

Queloz 和 Beckmann 指出,大语言模型(LLM)的理解问题一直被一种「单声部」式假设所误导;他们从机制层面证明,模型输出其实是多种平行机制组成的「复调」联盟共同作用的结果,并据此提出一种新的理解概念——以可可靠调用的控制性回路为基础,从而指导人们对 AI 的信任。

0 人收藏 0 人点赞
#trustworthy-ai

@SnorkelAI:本周四,10月1日,@ajratner 将在 @modal 的 Runtime 活动中于旧金山演讲,主题是如何随着AI代理能力的提升来构建可信的基准测试。

X AI KOLs Following ↗ · 4天前 缓存

AJ Ratner 将于10月1日在旧金山的 Modal Runtime 活动上演讲,讨论如何随着AI代理能力增强来构建可信的基准测试。

0 人收藏 0 人点赞
#trustworthy-ai

LabourCrew: 一个用于劳动法可信对抗性审议和法规推理的多智能体RAG框架

arXiv cs.CL ↗ · 2026-09-24 缓存

LabourCrew 是一个多智能体RAG框架,专为劳动法的可信对抗性审议和法规推理而设计,包含基础机制以控制错误接受率并提高答案相关性。

0 人收藏 0 人点赞
#trustworthy-ai

有人能解释一下为什么我们认为90%以上的基准被视为饱和吗?

Reddit r/ArtificialInteligence ↗ · 2026-09-23

本文质疑为什么AI基准测试在90%以上准确率时被视为饱和,并主张瞄准100%或开发新的基准。

0 人收藏 0 人点赞
#trustworthy-ai

可信代理AI:故障模式、缓解策略与自主LLM系统的生命周期框架

arXiv cs.AI ↗ · 2026-09-23 缓存

论文回顾了基于LLM的可信代理AI系统的故障模式和缓解策略,并介绍了可信代理开发生命周期(TADL)框架,用于安全开发。

0 人收藏 0 人点赞
#trustworthy-ai

让AI代理变得可靠到值得信任的7个守护措施

Reddit r/AI_Agents ↗ · 2026-09-22

本文分享了七个实用的基于代码的守护措施,通过减轻失败来使AI代理更加可靠,例如在执行前验证操作和确保状态一致性,这些措施补充了提示改进。

0 人收藏 0 人点赞
#trustworthy-ai

校准作为LLM评估的首要标准

Hugging Face Daily Papers ↗ · 2026-09-22 缓存

本文主张校准应作为LLM评估的首要标准,以增强可信度并解决部署和研究流程中的校准问题。

0 人收藏 0 人点赞
#trustworthy-ai

可信大语言模型、智能体AI和多模态系统的统一评估框架

arXiv cs.AI ↗ · 2026-09-18 缓存

本文提出了一种统一的评估框架,用于评估大语言模型、智能体AI和多模态系统的可信度,整合了八个可信度维度,并映射到治理标准如EU AI Act。

0 人收藏 0 人点赞
#trustworthy-ai

构建对人工智能的信任:铁路应用的必要性

arXiv cs.AI ↗ · 2026-09-17 缓存

本文回顾了鲁棒性、操作设计域(ODD)和可解释性等关键领域,以构建对铁路应用中人工智能系统的信任,旨在满足严格的安全标准并实现更广泛的应用。

0 人收藏 0 人点赞
#trustworthy-ai

@XFreeze: 只有Grok是最中立的AI……字面意思,这已经在不同的中立性和政治偏见测试中保持一致

X AI KOLs Timeline ↗ · 2026-09-16 缓存

该推文声称,Grok是最中立的AI,在中立性和政治偏见测试中一直表现优异,并能提供可信赖的、基于现实的答案。

0 人收藏 0 人点赞
#trustworthy-ai

可信代理AI:威胁环境、防御架构与开放挑战的全面网络安全与系统调查

arXiv cs.AI ↗ · 2026-09-15 缓存

本文全面调查了可信代理AI系统的网络安全挑战和防御机制,涵盖威胁环境、架构和开放研究问题。

0 人收藏 0 人点赞
#trustworthy-ai

面向空中交通管理中AI辅助飞行规划的决策保障层

arXiv cs.AI ↗ · 2026-09-15 缓存

本文提出了ATAL,一种决策保障框架,用于评估空中交通管理中AI生成输出的可靠性,以确保安全和操作一致性。

0 人收藏 0 人点赞
#trustworthy-ai

从法律文本到AI特定风险源:EU AI Act高风险要求的系统分析

arXiv cs.AI ↗ · 2026-09-15 缓存

本文对EU AI Act的高风险要求进行系统分析,推导出AI特定风险源列表,以桥接法律义务与AI风险管理实践。

0 人收藏 0 人点赞
#trustworthy-ai

信心源于经验:从推理到智能体的经验性置信度估计

Hugging Face Daily Papers ↗ · 2026-09-15 缓存

本文介绍了XConf,一种经验性置信度估计方法,该方法利用模型的过去经验,以提升语言模型在推理、编码和智能体任务中的置信度校准。

0 人收藏 0 人点赞
#trustworthy-ai

Agent Incident Registry:迈向预防AI代理重复失败

arXiv cs.AI ↗ · 2026-09-12 缓存

本文介绍了Agent Incident Registry (AIR),这是一个包含487个从2022年至2026年AI代理相关事件的精选目录,旨在通过区分实际危害和已验证漏洞来支持安全评估。

0 人收藏 0 人点赞
#trustworthy-ai

基于多目标学习的可解释与公平广义加法神经网络

arXiv cs.LG ↗ · 2026-09-10 缓存

本文提出了一种多目标神经基模型(MONBM)框架,旨在同时优化广义加法神经网络的准确性、可解释性与公平性,揭示了这些可信度维度之间复杂的权衡关系。

0 人收藏 0 人点赞
#trustworthy-ai

@boknilev: 我正在通过@ELLISforEurope招募学生。请考虑申请并提及我的名字:https://ellis.eu/…

X AI KOLs Timeline ↗ · 2026-09-07 缓存

推广ELLIS博士后项目的帖子,详细阐述其优势、学习方向和研究领域,包括AI可解释性、安全以及AI应用于科学。

0 人收藏 0 人点赞
#trustworthy-ai

从MIT到IBM,加速人工智能与量子技术的部署

MIT News — Artificial Intelligence ↗ · 2026-09-02 缓存

前MIT研究人员现于IBM任职,通过MIT-IBM计算研究实验室探讨他们在AI与量子应用上的工作,着重于从学术研究到实际部署的转型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈