我开源了Aletheia——一个用于调查没有明确验证者的问题的代理循环。
摘要
Aletheia是一个开源的代理循环,专为调查答案不易验证的问题而设计,例如供应商可信度或财务健康状况。它维护一个明确的信念状态,选择搜索以最大化信息增益,并在证据不足时可以停止而不强行得出结论。
大多数代理循环在结果可被验证时表现最佳:代码编译通过、测试通过、任务完成。我想探索当答案无法以那种方式验证时,循环应该是什么样的。例如:这个供应商声称的市场吸引力可信吗?这家公司财务健康吗?科学标题与研究结果一致吗?对于这些问题,每个搜索结果都只是部分且可能具有误导性的线索。因此,我构建了Aletheia——不确定性循环代理。其循环为:信念→行动→观察→更新。它保持对可能真实情况的明确看法,选择下一个搜索以改变该看法,并允许矛盾证据降低其置信度。它的第一个工作应用是一个开源调查工具,返回带有证据、矛盾信号、明确置信度和未解决未知项的判决。当证据不足以得出结论时,它也可以停止而不强行下结论。Aletheia目前用于公司和供应商尽职调查,但该循环是领域无关的:可适用于任何真相被隐藏、证据不完整、充满噪音或存在争议的场景。Aletheia目前运行于Claude Code和OpenAI Codex。技能、轨迹、测试和可选调优周期保持本地化;网络调查使用工作台的搜索能力。这是对循环工程新兴方面的探索尝试,并非声称问题已解决。来源质量和现实世界的校准仍然困难,相关证据可能欺骗任何系统。
相似文章
@logic_int: Aleph,我们全自主的AI智能体系统,用于形式验证,在所有主要定理证明基准测试中表现出色,包括…
Aleph,一个全自主的AI智能体系统,用于形式验证,在包括PutnamBench、VeriSoftBench和Verina在内的主要定理证明基准测试中取得了顶尖性能。
EVE-Agent: 可验证证据的自我进化智能体
EVE-Agent 提出了一个自我进化搜索智能体框架,通过生成问题、答案和证据片段,并基于证据的边际准确性增益进行训练,确保证据可验证性。这提高了基于依据的正确性,且无需人工标注。
我构建了一个信任引擎,帮助AI智能体逐步实现自主运行
一个开源信任引擎(测试版),帮助AI智能体从引导模式逐步过渡到协同工作再到自主状态,具备决策理由记录和人在回路审批功能,目前正在寻找早期采用者。
我正在为AI代理构建一个信念数据库。这是一个原型——你有真实数据集可以测试吗?
Verus 是一个为AI代理设计的开源信念数据库,能够追踪来自多个来源的冲突声明,并附带置信度评分和冲突检测功能;作者正在寻找真实世界的数据集和反馈。
迈向可审计的AI科学家:面向LLM代理的假设演化协议
本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。