标签
This paper introduces a contract-grade verifier of twelve adversarial gates for checking LLM-generated GPU kernels, finding that 39.5% of kernels accepted by standard loose tests are broken. It also presents the first native Blackwell training backward kernel for the GDN (gated-linear-recurrence) family.
文章认为,“AI slop”的争论混淆了作者归属、生产力和工程质量,并提议将生成式编码系统视为工程控制回路中的高吞吐量、易出错的生产者,将稀缺技能转向规范制定、验证和问责。
文章认为,AI辅助开发中的真正分歧并非AI与人类编码的对立,而是无监督生成与经过验证的工程之间的对立;工程师应当围绕AI生成器构建验证与控制系统。
作者描述了如何通过确定性代码、事实集验证和限定范围的数字匹配,而不是依赖提示规则,来让他们的AI增长代理Alice值得信赖。他们为任何需要向用户报告数字的代理分享了实用经验。
This paper proves that local verification in agentic AI is structurally incomplete, using cohomology theory to show that harmonic evidence conflicts (non-transportability) are undetectable by any local checks. It proposes Ksetra, a method that gates abstention on harmonic energy, and provides a statistical test for global claims.
这篇文章认为,AI代理采用的主要限制不是能力,而是验证,包括公司如何定义质量、评估持续表现以及整合反馈。文章探讨了隐性标准、公司特定评估、反馈所有权和自我改进循环等挑战。
教程介绍用Talkatone配合eSIM低成本获取美国手机号的方法,包括注册、保号、配置和使用步骤。
本文提出一种基于区块链的提交-揭示协议,以去中心化LLM基准测试中的信任,使用匿名多模型验证器来解决基准声明中的身份感知偏差和操纵问题。
作者构建了一个确定性验证层,重新计算AI副驾生成的财务数字以捕捉错误,并正在寻求金融和AI从业者的反馈。
本预印本对LLM评审团的聚合独立性指标提出质疑,表明验证信号仅在关键的“一票之差”查询上提升准确率,并提出一种按票数差距分层的调用缩减规则。
作者反思了对AI的依赖,并认为人类对AI输出的验证可能是进步的最终极限。他们提出,超人类主义和神经增强可以让人类继续有意义地参与其中,使未来成为人类增强而非被淘汰的未来。
SymDiag 是一种神经符号框架,将思维链推理转化为符号约束,并执行步骤级可满足性检查,以定位 LLM 推理中的失败,从而区分翻译错误与推理错误。
作者描述了连续七天使用 AI 模型 GPT 5.6 Sol 和 Fable 5 解决无线通信理论中一个 25 年悬而未决的问题,并指出验证是最大的瓶颈。
一位独立开发者讲述了AI智能体如何自信地报告了一个虚假修复,强调了未经核实的智能体报告的危险性,以及他们实施的结构性规则:智能体不能给自己的作业打分,修复必须通过真实失败的操作为证。
一位开发者描述了如何构建一个 Claude Code 技能,在导出前验证 AI 生成的 CAD 几何体,利用体积、边界框和点分类检查捕获 OpenCASCADE 的静默故障,例如未抽壳的零件和位置错误的切割。
作者对转移资金的AI智能体缺乏审计追踪和验证层表示担忧,将其与航空业的黑匣子相提并论,并呼吁建立一种经过哈希处理、可经受监管机构检验的证据链。
Addy Osmani 分享了关于 AI 智能体质量的观点,强调自主性应通过验证循环赢得,并受人类监督约束。
本文介绍了TriQua,一个用于LLM事实性评估的框架,它自适应地将事实表示为三元组或带有上下文限定符的超关系事实,并提出了TriQuaScore用于细粒度的事实性评分。实验表明,TriQua与人工标注结果高度一致,并且在基于证据的验证方面优于现有方法。