标签
CASCADE是一个智能体框架,利用调控网络预测基因扰动的下游转录效应,并在TCGA癌症类型中进行患者数据验证。该论文展示了MYC及其他调控因子的方向一致性,尽管其并未超越现有的精选知识。
TSON is a schema system and JSON superset with immutable, hash-pinned schemas whose definitions are themselves data. It offers a compact schema grammar and a working Java implementation.
作者构建了 LintLang,一个用于 agent 配置的确定性 linter,它能在运行时之前捕获结构性的语言缺陷,例如模糊的工具描述和相互冲突的指令,并指出 Character.AI 的 Larch 框架已在 CI 中采用它。这篇文章向开发者询问哪些运行时失败应该被静态捕获。
本文认为,金融大语言模型应用需要超越基准测试分数的系统级验证,涵盖数据、模型设计、检索、智能体行为、治理和实施。文章主张持续的验证纪律,并提出了面向系统感知评估的研究议程。
本综述综合了257篇关于智能体AI系统验证的论文,提出了一个涵盖行为、安全、时间、监管和多智能体问题的五维分类法。它指出了时间有效性、运行时证据维护、监管可读性和开放式多智能体保障方面的空白,认为可信赖的部署需要在上下文中验证轨迹。
IBM及其合作者报告了通过掺杂Clifford采样和误差缓解技术实现带有内置验证的量子优势示范,使得可信量子计算超越经典验证。
本文解释了如何使用Dart的带有私有构造函数的final类来创建证明类型,这些类型在编译时强制执行验证,确保在使用值之前已经执行了某些计算。
本文介绍了GEMCo,这是首个公开可用的德语多轮电子邮件咨询对话语料库,经过真实咨询数据验证,可作为不可获取敏感数据的可伦理发布代理。
本文介绍了诊断证据网络(DENet),一个多任务框架,它将基于AI的轴承故障诊断扩展为生成物理可验证的证据,例如预测的特征频率和脉冲的时间定位,同时使用QLoRA适配的语言模型生成受限的诊断报告,以减少幻觉内容。
一位实践者分享了关于多代理AI管道常在交接点失败的原因,并提出了验证、上下文控制和日志记录等实践来保持可靠性。
作者反思了长期运行的人工智能代理如何遭遇与初始提示无关的失败,并认为环境设计(工具、文档、验证、架构规则)更为重要。他们讨论了诸如 harness 工程、保持 AGENTS.md 文件精简、使用 linter 和评估器代理等概念,同时指出了成本权衡。
YouTube engineers built a mirrored version of the platform using AI Studio to accelerate AI prototyping, reducing validation from quarters to weeks.
Python 工具 'ty' 现在包含了对 Pydantic 的一流支持,区分了宽松模式和严格模式,并遵循 Pydantic 的类型强制规则。
FixItFlow是一个自动化系统,利用大语言模型从历史云事故数据生成故障排查指南,缩短缓解时间2.3倍,并获得了工程师的积极反馈。
A framework and CLI tool that enables AI agents to generate structurally precise and aesthetically standardized draw.io diagrams for AWS, Azure, GCP, Databricks, and BPMN architectures, using real stencil validation and automatic layout to prevent hallucinated empty shapes.
介绍了一种约束工程方法,用于构建可审计的企业级LLM代理,通过将确定性行为转移到代码、模式和验证工件中,并在韩国企业数据上通过故障注入和模型替换测试进行了演示。
介绍了Pyligent,一种利用任务验证器标记失败并在推理中教导大语言模型回溯的训练框架,提高了隐藏图、数独和积木世界的求解率。
文章对比了使用 Python 和 Rye 脚本下载 PDF 的方式,强调了最初优雅的代码对成功做了许多假设。随后展示了添加验证的过程,虽然降低了可读性,但提高了健壮性。