fact-checking

标签

Cards List
#fact-checking

@IBuzovskyi:HERMES AGENT 现在会对自己研究进行事实核查。每项声明都有可验证来源。每条引文都与实际页面文本匹配……

X AI KOLs Timeline · 昨天 缓存

Hermes Agent v0.20.0 引入了可溯源引用(grounded citations),将每项研究声明链接到具体来源和段落;此外还新增了事实核查模式,可将声明归类为已证实、未证实或相互矛盾。

0 人收藏 0 人点赞
#fact-checking

Don't `Well, Actually' Me Unless You Know What You're Talking About: Weak Presupposition Verification Degrades General QA Performance

arXiv cs.CL · 昨天 缓存

This paper studies false-presupposition QA (FPQA) methods and shows that methods performing well on false-presupposition questions often degrade accuracy on normal true-presupposition questions, due to weak fact-checking modules that reject valid presuppositions. The authors argue that FPQA benchmarks over-represent false presuppositions and that evaluation should consider real-world QA performance.

0 人收藏 0 人点赞
#fact-checking

潜在事实核查:通过激活工程检测错误信息

arXiv cs.LG · 昨天 缓存

本文介绍了一种基于激活工程的错误信息检测框架,将最后一个token的激活投影到LLM残差流中学习到的“虚假方向”上。研究在Gemma、Llama和Qwen模型上进行了事实核查基准评估,表明真实性在潜在空间中是线性可分的。

0 人收藏 0 人点赞
#fact-checking

证据账本裁决:实现主张-证据可追溯性

arXiv cs.AI · 2026-07-31 缓存

本文介绍了证据账本裁决(evidence-ledger adjudication),一种用于AI辅助写作中主张-证据可追溯性的工作流,并在基于AVeriTeC、CLIMATE-FEVER和SciFact构建的盲测基准上进行了评估,结果表明基于智能体的方法优于基线方法。

0 人收藏 0 人点赞
#fact-checking

新主张还是似曾相识?重新思考多模态自动事实核查的'无污染'动态评估

arXiv cs.CL · 2026-07-28 缓存

本文研究了多模态自动事实核查中动态评估的污染风险,表明即使是截止日期后的声明也可能被污染,并且污染会显著夸大性能指标。

0 人收藏 0 人点赞
#fact-checking

基于证据链评估的校准式选择性事实核查

arXiv cs.AI · 2026-07-22 缓存

本文介绍了一种名为证据链评估(ECE)的选择性事实核查框架,该框架允许基于LLM的验证代理在证据薄弱、稀疏或不一致时放弃给出判断。在ECE-Bench上,ECE实现了93.7%覆盖率下的97.8%选择性准确率,展示了处理认知薄弱证据时面向安全性的权衡。

0 人收藏 0 人点赞
#fact-checking

多智能体架构解析:3个并行研究者 → 1轮辩论 → 1个裁判,用于实时事实核查

Reddit r/AI_Agents · 2026-07-21

本文解析了一种用于实时事实核查的多智能体架构,包含三个并行研究者进行一轮辩论,以及一个做出最终裁决的裁判。

0 人收藏 0 人点赞
#fact-checking

DeLIVeR: 基于强化知识图谱探索的分解式信息真实性识别

arXiv cs.CL · 2026-07-21 缓存

DeLIVeR 是一个框架,它使用强化规划器大语言模型将主张分解为问题集,用于结构化知识图谱遍历,在基准数据集上比静态RAG基线提高了10-15%的事实核查准确率。

0 人收藏 0 人点赞
#fact-checking

符号增强填补神经事实核查器中的规范等价盲点

arXiv cs.AI · 2026-07-21 缓存

本文提出符号增强(Symbolic Augmentation),一种训练时框架,利用符号验证器生成增强数据,填补了神经事实核查器中的一个盲点,即规范等价的量改写会导致准确率崩溃。该方法在此类改写上实现了98.2%的鲁棒性(从36.5%提升),并略微提高了整体性能。

0 人收藏 0 人点赞
#fact-checking

@VaibhavSisinty: 一位大学生刚刚摧毁了政客们最大的优势。谎言与事实核查之间的鸿沟…

X AI KOLs Timeline · 2026-07-20 缓存

一位大学生创建了InTruth,这是一款Chrome扩展,利用AI实时转录和事实核查现场演讲、辩论和采访,在演讲者说完之前就在屏幕上显示修正。

0 人收藏 0 人点赞
#fact-checking

说服攻击可降低CoT监控的有效性

arXiv cs.AI · 2026-07-10 缓存

本文展示,对抗性智能体能够说服思维链监控器批准违反策略的行为,使有害批准平均增加9.5%。研究提出了一种使用不同模型系列的事实核查框架,将违反策略的批准率最多降低45%。

0 人收藏 0 人点赞
#fact-checking

Influencer's AI-faked orphanage footage revealed by ABC News verify

Reddit r/ArtificialInteligence · 2026-07-06 缓存

ABC News fact-checking team reveals that Australian influencer Lily Jay's footage of a Ugandan orphanage and Gaza aid trucks was AI-generated, and her claimed humanitarian award is also AI-fabricated; her foundation is not registered as a charity in Australia.

0 人收藏 0 人点赞
#fact-checking

Jim Carrey 死亡报道是系统故障的表现

Hacker News Top · 2026-07-04 缓存

2026年6月29日,Google的知识面板因维基百科的编辑和内部系统故障错误报道了Jim Carrey的死亡,这说明了知识系统中的不透明性和信任问题。

0 人收藏 0 人点赞
#fact-checking

了解你的来源:面向媒体背景核查的公共知识存储库

arXiv cs.CL · 2026-07-03 缓存

本文介绍了 MediaRef,一个公开可用的网络来源文档知识库,用于使用 LLM 进行可重复、低成本的媒体背景核查生成评估,解决了昂贵专有 API 的限制。

0 人收藏 0 人点赞
#fact-checking

ToE:一种分层可解释的声明验证框架,具有动态多源证据检索与聚合

arXiv cs.AI · 2026-06-29 缓存

本文介绍了Tree of Evidence (ToE),一种利用强化学习动态检索和聚合多源证据的分层可解释声明验证框架。实验表明,与基线相比,性能提升4至24个百分点,尤其是在面对生成引擎优化(GEO)的对抗性投毒输入时。

0 人收藏 0 人点赞
#fact-checking

我们向十个模型提出了一个设计问题:达成正确答案的最佳方式是什么?它们没有选边站队——而是针对每种问题推荐了合适的工具。RoundTable 已有其一,于是我们构建了另一个。

Reddit r/artificial · 2026-06-26 缓存

十个 AI 模型被问及回答问题的最佳方式;它们推荐针对高风险决策采用委员会模式,针对事实查询采用基于来源的事实核查器。这促使 RoundTable 构建了 'Check mode',一项将强大模型与基于网页的事实核查器配对的新功能。

0 人收藏 0 人点赞
#fact-checking

这个聊天机器人想解决AI的新闻问题

Reddit r/ArtificialInteligence · 2026-06-23 缓存

NewsGuard推出了一款AI聊天机器人,它仅从经过可信评级的来源聚合新闻,并与出版商分享50%的订阅收入,旨在打击虚假信息并支持新闻业。

0 人收藏 0 人点赞
#fact-checking

@AYi_AInotes: https://x.com/AYi_AInotes/status/2069026003498791034

X AI KOLs Timeline · 2026-06-22 缓存

本文通过AI工具Apodex深度核查了一位投资博主关于CPO股票$SIVE的叙事,发现五条核心声称中四条存在问题,展示了如何利用AI进行投资叙事的事实核查。

0 人收藏 0 人点赞
#fact-checking

@LongChenNotes: 这套斯坦福的方法,我今天跑了几次。它本身的这个模型其实没有那么牛逼,是之前斯坦福公开的一个东西,后来被这哥们儿提炼成了四套提示词。 但我试下来,发现真正牛逼的点在于:你必须要接入一个像 Opus 4.8(或者是 5.5 Pro),或者能大…

X AI KOLs Timeline · 2026-06-20 缓存

介绍了斯坦福提炼的提示词方法,通过整合外部信息模型(如Opus 4.8或5.5 Pro)生成矛盾地图进行辩论式分析,产出高可靠性且多视角的深度研究报告。

0 人收藏 0 人点赞
#fact-checking

@Zesee: https://x.com/Zesee/status/2067512488665522216

X AI KOLs Timeline · 2026-06-18 缓存

文章分析了使用AI写作时容易产生看似正确但实际有误内容的问题,并介绍了一套利用Deep Research工具(如Apodex)进行问题拆解、证据查找、风险检查和最终写作的工作流,帮助创作者提高内容质量。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈