标签
本文认为,AI 智能体的安全性应在运行时通过预防性控制和可验证证据来强制执行,而非仅仅依赖训练时的对齐。该立场基于对安全事件、虚假完成、轨迹模式(trajectory schemas)以及发表趋势的审计。
本文介绍了一种名为证据链评估(ECE)的选择性事实核查框架,该框架允许基于LLM的验证代理在证据薄弱、稀疏或不一致时放弃给出判断。在ECE-Bench上,ECE实现了93.7%覆盖率下的97.8%选择性准确率,展示了处理认知薄弱证据时面向安全性的权衡。
Apodex 1.0 是一个用于深度研究的重型AI智能体团队,通过搜索网络、推理证据并生成带有可验证证据链的报告,实现了最先进的性能(SOTA)。