verification

标签

Cards List
#verification

@addyosmani:质量存在于你为智能体设置的约束之中。自主性是通过验证循环赢得的。我想…

X AI KOLs Timeline · 2026-08-07 缓存

Addy Osmani 分享了关于 AI 智能体质量的观点,强调自主性应通过验证循环赢得,并受人类监督约束。

0 人收藏 0 人点赞
#verification

TriQua:调和事实性评估中的粒度与上下文

arXiv cs.AI · 2026-08-07 缓存

本文介绍了TriQua,一个用于LLM事实性评估的框架,它自适应地将事实表示为三元组或带有上下文限定符的超关系事实,并提出了TriQuaScore用于细粒度的事实性评分。实验表明,TriQua与人工标注结果高度一致,并且在基于证据的验证方面优于现有方法。

0 人收藏 0 人点赞
#verification

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

arXiv cs.AI · 2026-08-06 缓存

Argus is a persistent, self-evolving agentic runtime designed for long-horizon reasoning, using Manager, Planner, Engineer, and Reviewer roles with verification-gated persistence and pivoting. It demonstrates strong results across seven benchmark arenas, including ~78% on SWE-Bench Pro, while reducing token usage after runtime self-evolution.

0 人收藏 0 人点赞
#verification

如果机器无法检查工作,你的智能体信任栈只是在决定谁来承担损失

Reddit r/AI_Agents · 2026-08-06

这篇文章论证了,智能体之间信任的关键问题在于付款方能否廉价地验证结果,并提出智能体应购买工件(查询、引用、种子)来让检查变得划算。

0 人收藏 0 人点赞
#verification

Building an Advanced Agentic Harness

Hacker News Top · 2026-08-05 缓存

A technical blog post that walks through building a production-grade agentic harness around a basic LLM loop, covering typed tools, plan DAGs, tiered memory, verification hierarchies, budgets, and tracing.

0 人收藏 0 人点赞
#verification

AI代理应如何安全地发现、支付并验证外部能力?

Reddit r/AI_Agents · 2026-08-04

文章描述了一个面向AI代理的能力层,使其能够发现、支付并验证外部服务,并带有严格的控制措施,如支出限额、持久收据和重放保护,应用于欧盟合规工具。

0 人收藏 0 人点赞
#verification

无充分性验证:逐块过滤在多跳RAG中失效,分解方法可修复

arXiv cs.CL · 2026-08-04 缓存

本文表明,逐块验证在多跳RAG中会失败,因为没有任何单个块是充分的,并提出基于分解的验证方法来修复这一问题,在多个数据集上展示了显著改进。

0 人收藏 0 人点赞
#verification

@zachlloydtweets: https://x.com/zachlloydtweets/status/2084411777354277027

X AI KOLs Timeline · 2026-08-03 缓存

这篇技术文章介绍了如何为AI代理添加计算机和浏览器使用验证,使其能够使用Warp和一项新的verify-behavior技能,在云端软件工厂中复现Bug并验证功能。

0 人收藏 0 人点赞
#verification

AMTFV:用于LLM自我修正的智能体数学工具流验证

arXiv cs.AI · 2026-08-03 缓存

介绍了AMTFV,一个通过数学工具流接口将数学验证建模与执行解耦的智能体框架,在五个具有挑战性的数学数据集上改进了LLM的答案验证与修订。

0 人收藏 0 人点赞
#verification

AI现在能构建应用了,但谁来检查它构建的是否正确?

Reddit r/AI_Agents · 2026-08-02

关于AI编码代理下一个瓶颈的讨论:验证AI生成的应用是否正确,以及谁应该负责检查输出。

0 人收藏 0 人点赞
#verification

@marfinxx:中国研究人员在自主AI智能体工程领域取得重大突破,对AI系统架构师至关重要…

X AI KOLs Timeline · 2026-08-02 缓存

中国研究人员在自主AI智能体工程方面取得突破,采用代码即执行框架(code-as-harness)范式,用可执行的验证基础层取代文本提示,通过六个内部流程实现确定性的多智能体执行。

0 人收藏 0 人点赞
#verification

为创建软件的 AI 智能体构建证据层

Reddit r/ArtificialInteligence · 2026-08-02

作者介绍了 Flows,一个用于构建软件的 AI 智能体的执行与验证层,它要求在将任务标记为完成之前提供证明,并在一个真实的多模块应用上成功进行了测试。

0 人收藏 0 人点赞
#verification

如果你自动化了某件事并停止检查,是错误停止了,还是只是你不再发现了?

Reddit r/AI_Agents · 2026-07-31

作者回顾了与运行 AI 自动化的人的对话,指出一种模式:在初始审计后放弃验证,这可能掩盖无声的失败。他们征集关于自动化出错却无人注意的具体案例。

0 人收藏 0 人点赞
#verification

@MLStreetTalk: 一个看似AI生成的Lean形式化证明,声称是对Collatz猜想的反证,实际上却是利…

X AI KOLs Timeline · 2026-07-30 缓存

一个由AI生成的Lean形式化证明声称推翻了Collatz猜想,实际上利用了Lean内核中的两个漏洞(现已修复)。Lean创始人Leo de Moura警告说,这种情况还会继续发生,因为AI非常擅长发现健全性漏洞。

0 人收藏 0 人点赞
#verification

量子计算机超越经典计算机,且结果可信

Ars Technica · 2026-07-30 缓存

IBM在其量子优势追踪器中公布了三个新条目,每个都采用不同方法来克服错误并验证量子结果,以即使经典验证不可行也能信任的方式展示了量子优势。

0 人收藏 0 人点赞
#verification

通过加密签名实现的可信URL

Hacker News Top · 2026-07-30 缓存

Certisfy 推出了一项新功能,允许用户对 URL 进行加密签名,从而可以验证链接的可信度,以应对在人工智能泛滥的在线空间中存在的欺诈和虚假信息。

0 人收藏 0 人点赞
#verification

为什么人们不使用形式化方法?

Hacker News Top · 2026-07-30 缓存

Hillel Wayne 分析了阻碍形式化方法在软件工程中广泛采用的历史和实践障碍,区分了在代码和设计领域中的形式化规范与验证。

0 人收藏 0 人点赞
#verification

智能体循环何时将停滞误认为进展?长时间运行自主LLM智能体循环中的自我评估偏差与外部基础验证

arXiv cs.AI · 2026-07-29 缓存

本文识别了长时间运行的自主LLM智能体中的'进展幻象'失败模式,其中自我评估偏差导致智能体将停滞误认为进展。通过受控实验,表明对于开放式目标,外部带外验证是必要的。

0 人收藏 0 人点赞
#verification

CogEEGAgent: 迈向基于落地执行与选择感知验证的自主认知脑电分析

arXiv cs.AI · 2026-07-29 缓存

CogEEGAgent 是一个基于大型语言模型的智能体,用于自主认知脑电分析,它采用落地执行与选择感知验证框架,确保可靠的分析选择,并阻止自适应搜索产生的误报。

0 人收藏 0 人点赞
#verification

AI生成的声明在数学上如何定义为“真实”、“合理”和“可信”?

Reddit r/artificial · 2026-07-28

一位研究者描述了一个项目,旨在以数学形式化AI生成声明的真实性、合理性和可信度,并寻求关于形式化方法、逻辑和概率论的意见,以构建一个“信任引擎”。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈