validation

标签

Cards List
#validation

CASCADE:一种患者数据验证的下游扰动预测智能体调控网络框架

arXiv cs.AI · 2天前 缓存

CASCADE是一个智能体框架,利用调控网络预测基因扰动的下游转录效应,并在TCGA癌症类型中进行患者数据验证。该论文展示了MYC及其他调控因子的方向一致性,尽管其并未超越现有的精选知识。

0 人收藏 0 人点赞
#validation

TSON – A JSON superset with immutable, hash-pinned schemas

Hacker News Top · 4天前 缓存

TSON is a schema system and JSON superset with immutable, hash-pinned schemas whose definitions are themselves data. It offers a compact schema grammar and a working Java implementation.

0 人收藏 0 人点赞
#validation

Agent 配置可以通过验证,但仍然可能是不好的指令。在运行前我们应该 lint 什么?

Reddit r/AI_Agents · 5天前

作者构建了 LintLang,一个用于 agent 配置的确定性 linter,它能在运行时之前捕获结构性的语言缺陷,例如模糊的工具描述和相互冲突的指令,并指出 Character.AI 的 Larch 框架已在 CI 中采用它。这篇文章向开发者询问哪些运行时失败应该被静态捕获。

0 人收藏 0 人点赞
#validation

基准测试不等于验证:金融大语言模型应用的系统级视角

arXiv cs.CL · 6天前 缓存

本文认为,金融大语言模型应用需要超越基准测试分数的系统级验证,涵盖数据、模型设计、检索、智能体行为、治理和实施。文章主张持续的验证纪律,并提出了面向系统感知评估的研究议程。

0 人收藏 0 人点赞
#validation

超越组件测试:验证智能体AI系统

arXiv cs.AI · 6天前 缓存

本综述综合了257篇关于智能体AI系统验证的论文,提出了一个涵盖行为、安全、时间、监管和多智能体问题的五维分类法。它指出了时间有效性、运行时证据维护、监管可读性和开放式多智能体保障方面的空白,认为可信赖的部署需要在上下文中验证轨迹。

0 人收藏 0 人点赞
#validation

IBM:通过可信量子计算实现量子优势

Reddit r/singularity · 2026-07-30 缓存

IBM及其合作者报告了通过掺杂Clifford采样和误差缓解技术实现带有内置验证的量子优势示范,使得可信量子计算超越经典验证。

0 人收藏 0 人点赞
#validation

Dart中的证明类型:使用final类作为计算见证

Lobsters Hottest · 2026-07-28 缓存

本文解释了如何使用Dart的带有私有构造函数的final类来创建证明类型,这些类型在编译时强制执行验证,确保在使用值之前已经执行了某些计算。

0 人收藏 0 人点赞
#validation

GEMCo:一种经过验证的、可伦理发布的代理,用于替代不可获取的咨询数据

arXiv cs.CL · 2026-07-28 缓存

本文介绍了GEMCo,这是首个公开可用的德语多轮电子邮件咨询对话语料库,经过真实咨询数据验证,可作为不可获取敏感数据的可伦理发布代理。

0 人收藏 0 人点赞
#validation

基于物理可验证证据与LLM报告的轴承故障诊断

arXiv cs.LG · 2026-07-28 缓存

本文介绍了诊断证据网络(DENet),一个多任务框架,它将基于AI的轴承故障诊断扩展为生成物理可验证的证据,例如预测的特征频率和脉冲的时间定位,同时使用QLoRA适配的语言模型生成受限的诊断报告,以减少幻觉内容。

0 人收藏 0 人点赞
#validation

为何优秀的AI代理仍会产出糟糕的系统输出

Reddit r/artificial · 2026-07-25

一位实践者分享了关于多代理AI管道常在交接点失败的原因,并提出了验证、上下文控制和日志记录等实践来保持可靠性。

0 人收藏 0 人点赞
#validation

Agent 运行越久,我就越不在意提示词

Reddit r/AI_Agents · 2026-07-24

作者反思了长期运行的人工智能代理如何遭遇与初始提示无关的失败,并认为环境设计(工具、文档、验证、架构规则)更为重要。他们讨论了诸如 harness 工程、保持 AGENTS.md 文件精简、使用 linter 和评估器代理等概念,同时指出了成本权衡。

0 人收藏 0 人点赞
#validation

@googledevs: The standard software validation loop takes too much time, time you often don’t have. See how YouTube engineers moved a…

X AI KOLs Following · 2026-07-22 缓存

YouTube engineers built a mirrored version of the platform using AI Studio to accelerate AI prototyping, reducing validation from quarters to weeks.

0 人收藏 0 人点赞
#validation

@charliermarsh: ty 现在内置了对 Pydantic 的一流支持 例如:我们现在区分 Pydantic 字段的宽松模式和严格模式…

X AI KOLs Following · 2026-07-21 缓存

Python 工具 'ty' 现在包含了对 Pydantic 的一流支持,区分了宽松模式和严格模式,并遵循 Pydantic 的类型强制规则。

0 人收藏 0 人点赞
#validation

FixItFlow:基于云事故的自动故障排查指南生成

arXiv cs.AI · 2026-07-16 缓存

FixItFlow是一个自动化系统,利用大语言模型从历史云事故数据生成故障排查指南,缩短缓解时间2.3倍,并获得了工程师的积极反馈。

0 人收藏 0 人点赞
#validation

@geekbb: 一套让 AI 画出"对且好看"的 draw 架构图的框架加命令行工具。 靠真实 stencil 校验和自动布局,覆盖 AWS/Azure/GCP/Databricks/BPMN,专门治 AI 瞎编图形 ID 画出空白框的毛病。 https…

X AI KOLs Timeline · 2026-07-12 缓存

A framework and CLI tool that enables AI agents to generate structurally precise and aesthetically standardized draw.io diagrams for AWS, Azure, GCP, Databricks, and BPMN architectures, using real stencil validation and automatic layout to prevent hallucinated empty shapes.

0 人收藏 0 人点赞
#validation

在社会科学生中验证LLMs:认知威胁与新兴规范

arXiv cs.CL · 2026-07-10 缓存

本文分析了在社会科学中使用LLMs作为测量工具的验证实践,识别了认知威胁,并提出了稳健验证的新兴规范。

0 人收藏 0 人点赞
#validation

从提示到契约:面向可审计企业级LLM代理的约束工程

arXiv cs.AI · 2026-07-10 缓存

介绍了一种约束工程方法,用于构建可审计的企业级LLM代理,通过将确定性行为转移到代码、模式和验证工件中,并在韩国企业数据上通过故障注入和模型替换测试进行了演示。

0 人收藏 0 人点赞
#validation

搜索、失败、恢复:一种面向纠错感知推理的训练框架

arXiv cs.AI · 2026-07-09 缓存

介绍了Pyligent,一种利用任务验证器标记失败并在推理中教导大语言模型回溯的训练框架,提高了隐藏图、数独和积木世界的求解率。

0 人收藏 0 人点赞
#validation

我构建了一个开源的神经网络形状验证器 [P]

Reddit r/MachineLearning · 2026-07-05

作者构建并分享了一个用于验证神经网络形状的开源工具。

0 人收藏 0 人点赞
#validation

减少假设,让你的代码膨胀

Lobsters Hottest · 2026-07-04 缓存

文章对比了使用 Python 和 Rye 脚本下载 PDF 的方式,强调了最初优雅的代码对成功做了许多假设。随后展示了添加验证的过程,虽然降低了可读性,但提高了健壮性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈