一个拒绝猜测的符号化引擎
摘要
Chiron 是一个精确定位或拒绝的证据门,用于结构化输出,将声明验证为 VERIFIED(已验证)、REFUTED(已驳斥)或 REFUSED(已拒绝),并配有公开的评估历史记录和源代码。
大多数 AI 评估最终都会给出一个分数。这很有用,但它无法回答一个更具体的问题:这个特定输出是否足够可靠,以至于无需再次询问人工即可发布?我构建 Chiron 就是为了处理那些可以精确定位答案的情况。它是一个针对受支持的结构化输出的“精确定位或拒绝”证据门。对于序列类数据,Chiron 会恢复一个受限的候选规则,然后在未见过的保留项上进行测试。精确预测可得到 verified: true;而仅仅拟合可见数据的公式仍只是一个候选。对于文本中受支持的声明,它会将每个声明报告为 VERIFIED(已验证)、REFUTED(已驳斥)或 REFUSED(已拒绝),然后显示覆盖边界。周围的自由格式文本不会仅仅因为一次检查通过就被默认批准。请在此处尝试一个非敏感示例:https://jiannotti5040.github.io/chiron/ 公开的证据是刻意限定且可运行的。当前冻结的外部评估结果如下:22 个已盖章输出、22 个外部正确、0 个错误盖章、12 次拒绝。失败历史也是公开的:早期对 109 个序列的扫描发现了 3 个错误盖章。这些失败已被公布、从根源修复并重新运行。我认为这比呈现一个看起来完美无缺、却未说明如何证伪的系统更有用。eval/grade.py 根据 OEIS 真实情况对这些冻结输出进行评分,而 challenge.py 允许你选择序列。协议在此:https://github.com/jiannotti5040/chiron/tree/main/eval 这并不是声称要认证任意散文、取代专家或解决泛化的“AI 安全”问题。它旨在与追踪、LLM 评判和更广泛的评估一起使用,当受支持的结果需要精确的发布条件——或者明确的中止条件时。该仓库的源代码可供非商业使用;完整引擎的商用许可适用于组织部署。我尤其珍视反例、范围异议,以及那些不应使用“精确定位或拒绝”门的工作流示例。
相似文章
Crucible。一个判断引擎:注册一个论点,为每个主张构建最强反对论证,对照基底进行衡量,优化最薄弱的轴。
Crucible是一个开源判断引擎,它将一个论点转化为一组主张,通过对抗性测试为其构建最强反对论证,对照基底预言机进行衡量,并迭代优化最薄弱的轴,产生诸如MATCH、DRIFT或UNVERIFIABLE等裁决。
ScientistOne:通过 Chain-of-Evidence 实现人类级自主研究
ScientistOne 引入了 Chain-of-Evidence,这是一个面向自主研究代理的可验证性框架,确保每个声明都可追溯到证据来源。该框架实现了零幻觉引用、完美的分数验证,并在 75 篇论文中达到了最高的方法-代码对齐度,同时在五个前沿研究任务上达到或超过了人类专家水平。
@SixZzshOtRipZz:我可以为此发声。我做了类似的测试,看Ornith是否会在决策上妥协,甚至试图欺骗我……
该推文描述了一项测试,其中Ornith-1.0成功识破了一个关于使用Redis的错误前提,突显了其在自主编程中的诚实性。附带的Hugging Face页面宣布了Ornith-1.0,这是一系列开源编码智能体模型,具有最先进的基准测试成绩。
Theoria: 非正式推理状态下的重写可接受性验证
Theoria 是一种验证架构,将 AI 解决方案重写为可审计的状态转换,在 HLE 问题上实现了高精度,并能检测隐藏前提、虚假引用等细微错误。
超越单一方向:思维链破坏简单的拒绝引导
这篇论文研究了大型推理模型中的思维链推理如何使基于激活的拒绝行为控制变得复杂。在DeepSeek-R1-Distill-LLaMA-8B上的实验表明,拒绝行为同时编码在残差流激活和思维链痕迹中,使得模型对激活层面的干预更加鲁棒,但同时也暴露了思维链作为另一个攻击面。