AutoFyn 技术报告:面向长期代理的非参数化专家迭代
摘要
AutoFyn 是一个非参数化代理框架,采用专家迭代机制,具备持久状态和外部验证,在数学、数据科学和网络安全任务中提升了表现。
arXiv:2609.05446v1 Announce Type: new
摘要:我们介绍了 AutoFyn,一个受专家迭代算法启发的代理框架,通过更新持久状态(基于验证奖励信号)而非模型权重,在多个回合中适应冻结模型。每个回合从一个全新的模型会话开始,持久信息仅通过明确接口(如持久化内存文件、报告和仓库状态)重新引入。在每个回合内,编排器与专业代理一起探索、规划和构建多种备选方案,而任务基础验证器验证工作并提供客观奖励以衡量进展。该奖励被提炼回持久状态,更新下一回合的有效策略。在本技术报告中,我们形式化了这个循环,并描述了其持久状态和验证接口。然后,我们在三个领域展示了其应用,即奥林匹克数学、数据科学和网络安全。在2026年国际数学奥林匹克的六个新问题上,每个有提升空间的模型在AutoFyn下的得分都高于其提供商自身的编码代理。AutoFyn还在Spider 2.0 dbt基准测试中构建了排名第一的代理,并在Next.js、MetaMask、pnpm、Warp、LiteLLM、Langflow和Open WebUI中产生了16个经维护者确认的漏洞公告。
查看缓存全文
缓存时间: 2026/09/10 08:34
# AutoFyn 技术报告:非参数专家迭代的长期智能体
来源:https://arxiv.org/html/2609.05446
Daniel Schaffield11footnotemark:1、Akashnil Dutta、Prentis AITarik、Adnan Moon11footnotemark:1
###### 摘要
我们推出 AutoFyn,一种受专家迭代算法启发的智能体框架,通过更新从验证奖励信号(而非模型权重)获得的持久状态,在多轮交互中适配冻结模型。每一轮都始于全新的模型会话,持久信息仅通过持久化内存文件、报告和代码仓库状态等显式接口重新引入。在单轮内,一个编排器协调专门化的智能体,探索、规划并构建多种备选方案;而一个基于任务的验证器则负责验证工作成果,并提供用于衡量进展的客观奖励。该奖励被蒸馏回持久状态,从而更新下一轮的有效策略。本技术报告形式化了这一循环,并描述了其持久状态与验证接口。随后,我们展示了其在三个领域的应用:奥林匹克数学、数据科学和网络安全。在2026年国际数学奥林匹克竞赛的六道新题上,每个有提升空间的模型在 AutoFyn 下的得分均高于其提供商自身的编程智能体。AutoFyn 还构建了 Spider 2.0 dbt 基准测试中排名第一的智能体,并在 Next.js、MetaMask、pnpm、Warp、LiteLLM、Langflow 和 Open WebUI 中提交了1616条经维护者确认的漏洞公告。代码地址:https://github.com/SignalPilot-Labs/autofyn
## 1 引言
在2026年,智能体系统运行数小时甚至数天以完成跨越数百次模型调用和工具交互的复杂任务已司空见惯。例如,编程智能体需要协调对整个代码仓库的修改以解决现实世界的软件问题(Jimenez 等人,2024 (https://arxiv.org/html/2609.05446#bib.bib7);Yang 等人,2024 (https://arxiv.org/html/2609.05446#bib.bib16)),而像反思这样的迭代机制会在多次尝试中修正自身的输出(Shinn 等人,2023 (https://arxiv.org/html/2609.05446#bib.bib13);Madaan 等人,2023 (https://arxiv.org/html/2609.05446#bib.bib11))。随着操作时间跨度的增长,智能体系统中反复出现两种失效模式。首先,单个智能体的上下文不断累积,导致模型对其注意力分配不均,有效利用率下降(Liu 等人,2024 (https://arxiv.org/html/2609.05446#bib.bib9))。其次,当智能体评估自身工作时,一个错误的结论可能通过该评估并影响后续步骤,因为语言模型在没有外部反馈的情况下不可靠于纠正其自身推理(Huang 等人,2024 (https://arxiv.org/html/2609.05446#bib.bib4)),导致错误在整个运行过程中累积。
AutoFyn 的设计围绕这两种失效模式展开。为了限制上下文,AutoFyn 使用编排器-工作者模型,其中一个编排器将工作分派给子智能体,并将每轮进度记录到磁盘,然后仅基于该记录初始化全新上下文以开始下一轮。为防止错误累积,结束每一轮的信号是外部验证而非智能体自身的评估。只有当该信号确认时,一轮的成果才会被视为进展。AutoFyn 将两者结合应用,使得每轮推进的内容在大小上受限制,并且在智能体之外得到确认。
由此产生的循环类似于专家迭代(Anthony 等人,2017 (https://arxiv.org/html/2609.05446#bib.bib1)),在第3节 (https://arxiv.org/html/2609.05446#S3) 中详述。然而,这种对应关系是结构性的而非算法性的,因为 AutoFyn 是非参数的,适配后的策略并不自动成为一个更好的策略。这使得 AutoFyn 与将冻结模型与更新的经验记忆相结合的方法(Zhang 等人,2023 (https://arxiv.org/html/2609.05446#bib.bib19))归于一类。
在本报告中,我们描述了 AutoFyn 及其在三个领域的表现:奥林匹克数学、数据科学和网络安全。在2026年国际数学奥林匹克竞赛的六道题目上,每个有提升空间的模型在 AutoFyn 下的得分均高于其提供商自身的编程智能体(图1(a) (https://arxiv.org/html/2609.05446#S1.F1.sf1)),并且每次运行的过程轨迹均被完整归档。在用于数据科学任务的 Spider 2.0 dbt 基准测试中,一个由 AutoFyn 构建并优化(无需人类干预)的智能体登上了公开排行榜榜首(图1(b) (https://arxiv.org/html/2609.05446#S1.F1.sf2))。在安全审计方面,该循环已在广泛使用的开源项目中发现了超过150150个独立漏洞,我们已提交了4343份公告,其中1616份迄今已获维护者确认。
GPT-5.6 Sol、Claude Fable 5、Claude Opus 4.8、Claude Sonnet 5、GLM 5.20
77、14、14、21、21、28、28、35、35、42、42
铜牌 (16) 银牌 (23) 金牌 (29) 得分 (满分42)
Web应用 Web应用,部分问题无输出
提供商框架 (例如 Claude Code) AutoFyn
(a) IMO 2026,每个模型在每种框架下的审计得分。柱状图为单元格均值,圆点为单独运行,虚线标记了2026年的奖牌分数线。
USTC-KCIL、Spider-Agent-Extended、Shadowfax-DBT、Databao、SignalPilot
0、20、40、60
39.71、39.71、41.18、60.29、65.60
Spider 2.0 dbt 分数
(b) Spider 2.0 dbt,公开排行榜前五名。SignalPilot Agent(高亮显示)由 AutoFyn 自主构建和优化。分数截至2026年7月31日。
图1:AutoFyn 在奥林匹克数学和数据科学领域的表现。(a) 中的奥林匹克分数是我们配套研究(Hasan 等人,2026 (https://arxiv.org/html/2609.05446#bib.bib2))的审计成绩。
我们的贡献如下:
- • AutoFyn 作为一个系统,一个长期智能体框架,将跨轮次的上下文重置、候选策略搜索、外部验证的奖励门控以及蒸馏的持久状态组合成一个单一循环。
- • 将此循环形式化为非参数专家迭代,其中搜索提议候选方案,外部验证器作为专家标准,而蒸馏到持久状态则是策略更新。
- • 在三个领域的成果:2026年国际数学奥林匹克竞赛的审计研究、Spider 2.0 dbt 基准测试中排名第一的数据科学智能体,以及在广泛使用的开源项目中经维护者确认的漏洞公告。
## 2 相关工作
#### 专家迭代。
AutoFyn 建立在专家迭代(Anthony 等人,2017 (https://arxiv.org/html/2609.05446#bib.bib1))之上,该算法交替进行比当前策略更强的搜索和将搜索结果反馈更新的步骤。自我对弈系统利用树搜索作为专家实现了这一模式(Silver 等人,2018 (https://arxiv.org/html/2609.05446#bib.bib14)),近期的工作将树搜索应用于语言模型推理(Zhou 等人,2024 (https://arxiv.org/html/2609.05446#bib.bib20))。AutoFyn 采用基于验证器的检查和修正循环来扮演专家角色,其更新的是非参数的上下文状态,而非模型参数或搜索树。将冻结模型与更新的经验记忆相结合的方法(Zhang 等人,2023 (https://arxiv.org/html/2609.05446#bib.bib19))也共享这种无权重的适配特性,而反思则在没有外部验证的情况下修正自身输出(Shinn 等人,2023 (https://arxiv.org/html/2609.05446#bib.bib13);Madaan 等人,2023 (https://arxiv.org/html/2609.05446#bib.bib11))。据我们所知,之前没有工作将这种循环框架定义为专家迭代,第3.4节 (https://arxiv.org/html/2609.05446#S3.SS4) 阐述了这种对应关系及其不再成立的节点。
#### 长上下文智能体。
已知长上下文被不均匀地使用(Liu 等人,2024 (https://arxiv.org/html/2609.05446#bib.bib9)),研究人员已研究了管理它们的方法。提出的机制包括分页内存(Packer 等人,2023 (https://arxiv.org/html/2609.05446#bib.bib12))、层次化工作记忆(Hu 等人,2024 (https://arxiv.org/html/2609.05446#bib.bib3))、编程智能体的显式上下文管理(Liu 等人,2025 (https://arxiv.org/html/2609.05446#bib.bib10))以及用于长时间运行 Web 和软件任务的历史折叠(Sun 等人,2025 (https://arxiv.org/html/2609.05446#bib.bib15);Ye 等人,2025 (https://arxiv.org/html/2609.05446#bib.bib18))。与我们最接近的是 Ralph 循环(Huntley, 2025 (https://arxiv.org/html/2609.05446#bib.bib6)),它在相同提示上无限重复调用编程智能体,因此每次迭代都从空上下文开始,状态仅通过代码仓库、计划文件和规范目录得以延续。该 Shell 循环本身不读取退出状态,继续运行依赖于人类对代码仓库的判断。AutoFyn 使用外部验证器对每轮进行评分,编排器仅在该分数优于迄今为止最佳结果时(公式1 (https://arxiv.org/html/2609.05446#S3.E1))才会将工件向前推进。新鲜上下文、摘要和有限记忆都早于我们的工作,AutoFyn 的贡献在于将它们与硬轮次边界、承载溯源信息的状态以及基于验证的接受机制组合起来。
#### 验证。
验证和精炼流程通过将模型与结构化检查进行迭代,在奥林匹克竞赛中取得了优异成绩(Huang 和 Yang, 2025 (https://arxiv.org/html/2609.05446#bib.bib5))。AutoFyn 共享这种验证器驱动的形态,不同之处在于其显式的持久状态和类型化的验证记录。一项检查所能确立的内容也取决于其周围的框架,因为智能体计算机接口的设计会影响软件工程中的智能体行为(Yang 等人,2024 (https://arxiv.org/html/2609.05446#bib.bib16))。近期的工作将框架和模型作为一个整体进行测量,而非仅测量模型本身,通过在不同模型后端上对框架配置进行基准测试(Yao 等人,2026 (https://arxiv.org/html/2609.05446#bib.bib17)),以及将单个优化后的框架迁移到五个留出的模型上解决奥林匹克级别的问题(Lee 等人,2026 (https://arxiv.org/html/2609.05446#bib.bib8))。
## 3 方法
### 3.1 问题设定
令 G 为目标,E 为环境,B 为以挂钟时间和轮次表示的预算。令 R 为角色集合,Θ = {θr: r ∈ R} 为将基础语言模型分配给每个角色的映射。Θ 中的参数在整个回合内保持冻结,因此角色可以对应到不同的模型层级,但分配在运行期间不会改变。如果一个模型服务所有角色,则 Θ 退化为单个冻结的 πθ。令 Mt 为第 t 轮的持久状态,写入磁盘并在每轮重建为全新上下文。令 V 为环境暴露的验证器,它将候选工件 a 映射为类型化记录 y = V(a; E) = (s, e, ℓ, v),其中包含状态或分数 s、证据包 e、保证类别 ℓ 和验证器标识 v。保证类别根据证据强度排序,从模型自我评估、独立上下文审查、可执行检查、独立人工评分,到机器检查的证书。后续轮次读取的是记录而非简单的接受/拒绝,因此它能根据候选失败的原因采取行动。
一轮消耗部分预算 B,并产生一个或多个候选工件以及对状态的蒸馏更新。五个过程执行此操作:上下文构建 K 从目标、状态和交互历史组装会话;编排搜索 S 返回轨迹 τt 和候选集 At;选择 A 根据其记录从这些候选中进行选择;保留 Sinc 跨轮次更新当前最佳方案;蒸馏 U 将该轮折叠进状态。当记录 y 满足环境定义的接受条件时,我们记 accept(y) = 1。回合在第3.9节 (https://arxiv.org/html/2609.05446#S3.SS9) 的控制策略下结束,报告的输出是根据第3.7节 (https://arxiv.org/html/2609.05446#S3.SS7) 的接受规则保留的当前最佳工件。
### 3.2 核心设计原则
#### 基于显式状态的新鲜会话。
每一轮都开始一个全新的模型会话。前一轮的对话不会被重新加载,信息仅通过一组固定的持久接口返回,即持久化内存文件、代码仓库及其引用的工件、请求时获取的先前报告以及用户活动记录。这些接口承载着溯源信息,因此评估结果会附带其背后的证据,而失败的方案会被标记为失败。因此,上下文大小跟踪的是状态而非已过去的运行时间。
#### 候选方案搜索。
编排器不局限于单一攻击路线,而是派遣角色专门的智能体去探索备选方案、产生竞争性的计划或证明策略、构建一个或多个候选方案并对其进行审查,将被拒绝的构建反馈给构建者,将被拒绝的计划反馈给计划者。这种在方案上的分支和修正就是专家迭代的搜索半部分,其结构由角色和阶段而非显式搜索树定义,单轮的搜索宽度由预算设定。
#### 基于验证的接受。
一轮的评判依据来自环境的证据,而非模型对自身输出的评估(第3.6节 (https://arxiv.org/html/2609.05446#S3.SS6))。自我评估可以在一轮内引导搜索,因为模型必须决定下一步尝试什么,但它无法确立目标是否达成。语言模型在没有外部反馈的情况下不可靠于判断自身推理(Huang 等人,2024 (https://arxiv.org/html/2609.05446#bib.bib4)),因此 AutoFyn 不允许智能体自行证明其成功。
### 3.3 AutoFyn 轮次
每一轮由一个编排器驱动。它读取持久状态,决定朝向目标的最高价值步骤,并通过探索、规划、可选的计划审查、构建和构建审查来路由该步骤,每个步骤由一个角色专门的智能体服务。它本身不会探索代码库、设计解决方案或编写代码,除非进行小的修复。两个智能体是否并发运行取决于调度的发布方式,因此生成和比较候选方案即使分支按顺序运行,也属于分支搜索。
循环的控制位于模型之外的一个外围进程中。该进程为每一轮启动一个全新的编排器会话,读取持久元数据、归档内存、用户活动和前一轮的报告索引来构建本轮,轮次结束后记录摘要、提交并推送工作,并决定是否开始新一轮。Git 的保存和推送行为由框架执行而非编排器,并且每轮的报告与内存目录在沙箱外归档,恢复时再进行还原。算法1 (https://arxiv.org/html/2609.05446#alg1) 阐述了该循环。
算法1 AutoFyn 轮次循环
1:输入:目标 G,冻结的角色分配 Θ,编排过程 Π,验证器 V,预算 B
2:从 G 初始化持久状态 M0;当前最佳方案 I0 ← ∅
3:t ← 0
4:while 控制策略允许继续 do
5:Ct ← K(G, Mt, ∅) ▷ 新鲜会话;仅持久状态,无继承的记录
6:(τt, At) ← S(Θ, Π, Ct; Bt) ▷ 编排搜索;轨迹和相似文章
@dair_ai:关于长时程智能体的杰出论文(建议收藏)——类似人类,如何让智能体在困难任务中坚持下去?
AutoLab 是一个新基准测试,针对 36 个由专家精心设计的长时程任务(系统优化、模型开发、CUDA 内核、谜题),对 17 个前沿模型进行评估。研究发现,决定成功的关键因素是持久性——而非初始尝试的质量。Claude-opus-4.6 在所有类别中名列前茅,而大多数其他模型要么过早终止,要么在几乎没有进展的情况下耗尽了预算。
利用专家代理进行自动研究:开发高效且非平凡的训练配方
本文介绍了一种自动研究框架,利用专家代理通过代码执行与反馈的经验闭环,迭代优化训练配方。该系统借助谱系反馈(lineage feedback),无需人工干预,即可在 Parameter Golf 和 NanoChat 等任务上自主提升性能。
AutoLab:前沿模型能否解决长周期自动研究与工程任务?
AutoLab提出了一个基准,用于评估前沿模型在多个领域中的长周期迭代优化能力。结果表明,持续性和时间意识比初始性能更为关键,其中claude-opus-4.6展现了强大的能力,而许多模型过早终止。
超越最终分数:长期AI研发智能体的系统性评估
本文系统评估了七个前沿AI智能体在长期任务上的表现,发现它们更像是工程优化器而非自主研究者,并提出了改进训练和经验管理的建议。
FinanceHarness:自主金融深度研究框架
本文介绍了FinanceHarness,一个由LLM智能体驱动的端到端自动化金融深度研究框架,以及FinanceGym,一个可验证的时间点基准。专家验证显示通过率为82%,而领先模型得分低于40%,FinanceHarness将开源权重基座模型的性能从25.3%提升至32.4%。