verification

标签

Cards List
#verification

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

arXiv cs.LG · 5小时前 缓存

This paper introduces a contract-grade verifier of twelve adversarial gates for checking LLM-generated GPU kernels, finding that 39.5% of kernels accepted by standard loose tests are broken. It also presents the first native Blackwell training backward kernel for the GDN (gated-linear-recurrence) family.

0 人收藏 0 人点赞
#verification

“AI slop”辩论将三个不同的问题混为一谈:作者归属、生产力和工程质量

Reddit r/ArtificialInteligence · 11小时前

文章认为,“AI slop”的争论混淆了作者归属、生产力和工程质量,并提议将生成式编码系统视为工程控制回路中的高吞吐量、易出错的生产者,将稀缺技能转向规范制定、验证和问责。

0 人收藏 0 人点赞
#verification

真正的分歧不在于“AI编码 vs 真实编码”,而在于“无监督生成 vs 经过验证的工程”。

Reddit r/AI_Agents · 11小时前

文章认为,AI辅助开发中的真正分歧并非AI与人类编码的对立,而是无监督生成与经过验证的工程之间的对立;工程师应当围绕AI生成器构建验证与控制系统。

0 人收藏 0 人点赞
#verification

我们如何尽可能让AI增长代理值得信赖

Reddit r/AI_Agents · 18小时前

作者描述了如何通过确定性代码、事实集验证和限定范围的数字匹配,而不是依赖提示规则,来让他们的AI增长代理Alice值得信赖。他们为任何需要向用户报告数字的代理分享了实用经验。

0 人收藏 0 人点赞
#verification

Local verification cannot detect non-transportability: a cohomological theory of context preservation in agentic reasoning

arXiv cs.AI · 昨天 缓存

This paper proves that local verification in agentic AI is structurally incomplete, using cohomology theory to show that harmonic evidence conflicts (non-transportability) are undetectable by any local checks. It proposes Ksetra, a method that gates abstention on harmonic energy, and provides a statistical test for global claims.

0 人收藏 0 人点赞
#verification

雇佣AI代理是容易的部分

TLDR AI · 昨天 缓存

这篇文章认为,AI代理采用的主要限制不是能力,而是验证,包括公司如何定义质量、评估持续表现以及整合反馈。文章探讨了隐性标准、公司特定评估、反馈所有权和自我改进循环等挑战。

0 人收藏 0 人点赞
#verification

IBM在噪声硬件上的可验证量子优势

Reddit r/singularity · 昨天 缓存

IBM及其合作者展示了三种在噪声硬件上实现可验证量子优势的技术,解决了验证无法经典模拟的结果这一挑战。

0 人收藏 0 人点赞
#verification

@katharine16289: 低成本获取美国手机号完整教程 很多朋友需要美国手机号来接收验证码或注册海外服务,今天分享一个成本极低的方法,核心使用Talkatone应用,搭配eSIM流量更稳定。全程建议用iPhone或iPad操作,兼容性最好。 第一步,下载并注册Ta…

X AI KOLs Timeline · 2天前 缓存

教程介绍用Talkatone配合eSIM低成本获取美国手机号的方法,包括注册、保号、配置和使用步骤。

0 人收藏 0 人点赞
#verification

谁来验证基准测试?去中心化大型语言模型评估中的信任

arXiv cs.AI · 3天前 缓存

本文提出一种基于区块链的提交-揭示协议,以去中心化LLM基准测试中的信任,使用匿名多模型验证器来解决基准声明中的身份感知偏差和操纵问题。

0 人收藏 0 人点赞
#verification

验证器瓶颈

Reddit r/singularity · 3天前 缓存

一篇概念性文章,认为人工智能中的递归自我改进受限于验证而非计算,并使用了认识论封闭的提示矩阵和数据加工不等式的隐喻。

0 人收藏 0 人点赞
#verification

我构建了一个确定性引擎,能在AI的财务计算错误发布之前就抓住它们——想找人挑刺

Reddit r/artificial · 3天前

作者构建了一个确定性验证层,重新计算AI副驾生成的财务数字以捕捉错误,并正在寻求金融和AI从业者的反馈。

0 人收藏 0 人点赞
#verification

关键投票盲点:聚合独立性指标忽略了验证真正有助益的场景

arXiv cs.AI · 4天前 缓存

本预印本对LLM评审团的聚合独立性指标提出质疑,表明验证信号仅在关键的“一票之差”查询上提升准确率,并提出一种按票数差距分层的调用缩减规则。

0 人收藏 0 人点赞
#verification

AI的未来

Reddit r/artificial · 4天前

作者反思了对AI的依赖,并认为人类对AI输出的验证可能是进步的最终极限。他们提出,超人类主义和神经增强可以让人类继续有意义地参与其中,使未来成为人类增强而非被淘汰的未来。

0 人收藏 0 人点赞
#verification

SymDiag:基于神经符号验证的LLM推理可解释诊断

Hugging Face Daily Papers · 5天前 缓存

SymDiag 是一种神经符号框架,将思维链推理转化为符号约束,并执行步骤级可满足性检查,以定位 LLM 推理中的失败,从而区分翻译错误与推理错误。

0 人收藏 0 人点赞
#verification

GPT 5.6 Sol 与 Fable 5 解决无线通信理论中一个 25 年的难题

Reddit r/singularity · 5天前 缓存

作者描述了连续七天使用 AI 模型 GPT 5.6 Sol 和 Fable 5 解决无线通信理论中一个 25 年悬而未决的问题,并指出验证是最大的瓶颈。

0 人收藏 0 人点赞
#verification

上个月这个子版块警告过我,我的智能体会自信地报告根本没完成的工作。刚刚就发生了。

Reddit r/artificial · 6天前

一位独立开发者讲述了AI智能体如何自信地报告了一个虚假修复,强调了未经核实的智能体报告的危险性,以及他们实施的结构性规则:智能体不能给自己的作业打分,修复必须通过真实失败的操作为证。

0 人收藏 0 人点赞
#verification

我的AI代理老是说任务完成了。于是我让它证明一下。

Reddit r/AI_Agents · 6天前

一位开发者描述了如何构建一个 Claude Code 技能,在导出前验证 AI 生成的 CAD 几何体,利用体积、边界框和点分类检查捕获 OpenCASCADE 的静默故障,例如未抽壳的零件和位置错误的切割。

0 人收藏 0 人点赞
#verification

我们正在为金钱打造自动驾驶汽车,但黑匣子在哪里?

Reddit r/AI_Agents · 6天前

作者对转移资金的AI智能体缺乏审计追踪和验证层表示担忧,将其与航空业的黑匣子相提并论,并呼吁建立一种经过哈希处理、可经受监管机构检验的证据链。

0 人收藏 0 人点赞
#verification

@addyosmani:质量存在于你为智能体设置的约束之中。自主性是通过验证循环赢得的。我想…

X AI KOLs Timeline · 2026-08-07 缓存

Addy Osmani 分享了关于 AI 智能体质量的观点,强调自主性应通过验证循环赢得,并受人类监督约束。

0 人收藏 0 人点赞
#verification

TriQua:调和事实性评估中的粒度与上下文

arXiv cs.AI · 2026-08-07 缓存

本文介绍了TriQua,一个用于LLM事实性评估的框架,它自适应地将事实表示为三元组或带有上下文限定符的超关系事实,并提出了TriQuaScore用于细粒度的事实性评分。实验表明,TriQua与人工标注结果高度一致,并且在基于证据的验证方面优于现有方法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈