标签
Argus is a persistent, self-evolving agentic runtime designed for long-horizon reasoning, using Manager, Planner, Engineer, and Reviewer roles with verification-gated persistence and pivoting. It demonstrates strong results across seven benchmark arenas, including ~78% on SWE-Bench Pro, while reducing token usage after runtime self-evolution.
这篇文章论证了,智能体之间信任的关键问题在于付款方能否廉价地验证结果,并提出智能体应购买工件(查询、引用、种子)来让检查变得划算。
A technical blog post that walks through building a production-grade agentic harness around a basic LLM loop, covering typed tools, plan DAGs, tiered memory, verification hierarchies, budgets, and tracing.
文章描述了一个面向AI代理的能力层,使其能够发现、支付并验证外部服务,并带有严格的控制措施,如支出限额、持久收据和重放保护,应用于欧盟合规工具。
本文表明,逐块验证在多跳RAG中会失败,因为没有任何单个块是充分的,并提出基于分解的验证方法来修复这一问题,在多个数据集上展示了显著改进。
这篇技术文章介绍了如何为AI代理添加计算机和浏览器使用验证,使其能够使用Warp和一项新的verify-behavior技能,在云端软件工厂中复现Bug并验证功能。
介绍了AMTFV,一个通过数学工具流接口将数学验证建模与执行解耦的智能体框架,在五个具有挑战性的数学数据集上改进了LLM的答案验证与修订。
中国研究人员在自主AI智能体工程方面取得突破,采用代码即执行框架(code-as-harness)范式,用可执行的验证基础层取代文本提示,通过六个内部流程实现确定性的多智能体执行。
作者介绍了 Flows,一个用于构建软件的 AI 智能体的执行与验证层,它要求在将任务标记为完成之前提供证明,并在一个真实的多模块应用上成功进行了测试。
作者回顾了与运行 AI 自动化的人的对话,指出一种模式:在初始审计后放弃验证,这可能掩盖无声的失败。他们征集关于自动化出错却无人注意的具体案例。
一个由AI生成的Lean形式化证明声称推翻了Collatz猜想,实际上利用了Lean内核中的两个漏洞(现已修复)。Lean创始人Leo de Moura警告说,这种情况还会继续发生,因为AI非常擅长发现健全性漏洞。
IBM在其量子优势追踪器中公布了三个新条目,每个都采用不同方法来克服错误并验证量子结果,以即使经典验证不可行也能信任的方式展示了量子优势。
Certisfy 推出了一项新功能,允许用户对 URL 进行加密签名,从而可以验证链接的可信度,以应对在人工智能泛滥的在线空间中存在的欺诈和虚假信息。
Hillel Wayne 分析了阻碍形式化方法在软件工程中广泛采用的历史和实践障碍,区分了在代码和设计领域中的形式化规范与验证。
本文识别了长时间运行的自主LLM智能体中的'进展幻象'失败模式,其中自我评估偏差导致智能体将停滞误认为进展。通过受控实验,表明对于开放式目标,外部带外验证是必要的。
CogEEGAgent 是一个基于大型语言模型的智能体,用于自主认知脑电分析,它采用落地执行与选择感知验证框架,确保可靠的分析选择,并阻止自适应搜索产生的误报。
一位研究者描述了一个项目,旨在以数学形式化AI生成声明的真实性、合理性和可信度,并寻求关于形式化方法、逻辑和概率论的意见,以构建一个“信任引擎”。
PyTorch团队讨论了PyTorch作为深度学习领域既作为参考语言又作为实现语言的概念,强调了其在验证优化的内核实现中的作用,以及大型语言模型生成明确的前向-后向代码的潜力。
本文介绍了Hybrid-to-NeSy (H2N)框架,该框架系统地将混合机理-数据驱动模型转化为神经符号人工智能设计,从而能够推导出结构违规率和信念离散度等指标,作为机理部分认知不确定性的度量。