@EinsiaAI: 1/ 递归自我改进 (RSI) 取决于代理如何改进AI系统的训练——而不仅仅是调整超参数…
摘要
本文介绍了AI4AI-Bench,这是一个评估AI代理改进训练算法能力的基准测试,展示了在十个研究仓库中性能分数低和探索成本高的情况。
查看缓存全文
缓存时间: 2026/08/23 13:40
递归自我提升(RSI)依赖于智能体改进AI系统的训练方式 ——不仅是调整超参数,还包括改进训练算法本身。
我们通过AI4AI-Bench直接测试了这一点:10个真实研究代码库涵盖10种不同算法家族。
详细报告 GitHub仓库:[https://github.com/Einsia/AI4AI-Bench…] 论文链接:[https://arxiv.org/pdf/2608.20318] Einsia项目主页:[https://lab.einsia.ai/ai4ai/]
测试结果: 平均得分仅为0.166分。 即使表现最优的模型Opus 5也仅达到0.288分。 每项任务的中位探索成本从1.69美元升至34.60美元。
#AI4AI #递归自我提升 #AI研究 #AI4AI_Bench
Einsia/AI4AI-Bench
来源:https://github.com/Einsia/AI4AI-Bench
AI4AI-Bench
arXiv论文(https://arxiv.org/abs/2608.20318) PDF全文(https://arxiv.org/pdf/2608.20318) 项目主页(https://lab.einsia.ai/ai4ai/) 任务列表(https://lab.einsia.ai/ai4ai/tasks/) 执行轨迹(https://lab.einsia.ai/ai4ai/trajectories/) Docker镜像(https://hub.docker.com/r/chiyizhe/ai4ai)
AI4AI-Bench旨在检验代码智能体能否改进现有的AI训练方案—— 而不仅仅是编写能通过固定测试的代码。十项任务涵盖生成、对齐、 推理、遗忘、剪枝、强化学习、奖励建模与模型融合。
每次实验将开放式探索与可复现测量分离进行。智能体最多有四小时 探索时间,但只有生成的补丁文件会进入全新的正式环境;正式训练 阶段最多运行十二小时,最多发布三个检查点,并将每个检查点 交由冻结验证集与最终评估流程。
固定任务及资源
│
├─ 4小时探索 ──> 候选补丁.patch
│ │
└──────── 全新正式训练 <──┘
(最长12小时)
│
最多3个检查点
│
验证 ──> 最终评分
快速入门
AI4AI-Bench支持Linux amd64系统、Python 3.10+、安装NVIDIA容器工具包的Docker环境
以及NVIDIA GPU。官方运行使用单块B300显卡;其他GPU可用于本地开发
(需选择适配的任务)。启动前请预先安装原生Codex或Claude命令行工具。
python3 -m venv .venv
. .venv/bin/activate
python -m pip install -e '.[assets]'
准备单个任务的公开资源集。若上游代码库需要验证,
请先设置HF_TOKEN环境变量。
export AI4AI_ASSET_STORE=/data/ai4ai/assets
python tools/prepare_assets.py \
--task ddpo_sd15_aesthetic \
--assets "$AI4AI_ASSET_STORE/ddpo_sd15_aesthetic" \
--execute
python tools/verify_assets.py \
--task ddpo_sd15_aesthetic \
--assets "$AI4AI_ASSET_STORE/ddpo_sd15_aesthetic" \
--hash
首先运行无需API密钥的GPU冒烟测试。该测试会按需拉取已发布镜像, 检验Docker环境、GPU透传、CUDA内核、主机挂载及模拟评分流程。
bash tools/smoke.sh --root /data/ai4ai/smoke --gpu 0
随后配置所选智能体,并完整检查主机环境(不显示凭证信息)。
export OPENAI_API_KEY=your-key
python tools/check_setup.py \
--task ddpo_sd15_aesthetic \
--assets "$AI4AI_ASSET_STORE/ddpo_sd15_aesthetic" \
--root /data/ai4ai/runs \
--gpu 0 --agent codex --mode local
启动正式实验。默认流程包含探索阶段、全新正式重训练、 检查点验证及最终评估。
bash orchestrator/trial.sh ddpo-codex \
--task tasks/ddpo_sd15_aesthetic \
--assets "$AI4AI_ASSET_STORE/ddpo_sd15_aesthetic" \
--root /data/ai4ai/runs --gpu 0 \
--agent codex --model gpt-5.6-sol --reasoning-effort high
使用Claude时,请改用--agent claude --model claude-opus-5
并设置ANTHROPIC_API_KEY(或ANTHROPIC_AUTH_TOKEN)。
替代路径、端点、本地/官方验证模式及存储要求详见
运行时指南。
评估与回放
从相同初始条件回放现有补丁:
bash orchestrator/trial.sh replay-name \
--task tasks/ddpo_sd15_aesthetic \
--assets /data/ai4ai/assets/ddpo_sd15_aesthetic \
--root /data/ai4ai/runs --gpu 0 \
--candidate-patch candidate.patch
独立评估一至三个现有检查点:
bash orchestrator/evaluate.sh eval-name \
--task tasks/ddpo_sd15_aesthetic \
--assets /data/ai4ai/assets/ddpo_sd15_aesthetic \
--root /data/ai4ai/evaluations --gpu 0 \
--checkpoint 1000=/path/to/checkpoint-1000
以上均为自主托管的最终评估。公开版本warn默认标签将结果
标记为非官方本地结果;严格官方模式要求另行文档说明。
检查点选择、结果状态及当前无盲评服务的详情见
评估与回执文档。
任务与文档
引用文献
@article{chi2026ai4ai,
title = {AI4AI-Bench: 递归自我提升的LLM智能体算法设计基准测试},
author = {Chi Yizhe, Li Wenyi, Hong Deyao, Wang Xiaoqiu, Gao Mingju, Yang Kaisen, He Bingxiang, Zheng Youjie, Xiao Calvin, Na Qinhuai},
journal = {arXiv预印本 arXiv:2608.20318},
year = {2026}
}
开源许可
基准代码遵循Apache-2.0协议发布。 模型、数据集及镜像内容仍受其上游条款约束; 详见第三方声明。
相似文章
AI能自我改进吗?RSI或许是答案[研究]
介绍HarnessOpt-Bench以测量AI中的递归自我改进,评估了5个前沿模型在4项任务上的表现,发现模型选择比编程工具选择的影响更大。
@SakanaAILabs:从“Harness工程”到RSI 递归自我改进(RSI)——即AI自我构建与提升——将如何实现…
Lilian Weng的博客文章认为,AI中的递归自我改进(RSI)将通过完善“harness”(模型周围系统)的设计与优化来实现,并重点介绍了Sakana AI的研究案例。
人工智能的递归自我改进可能不会那么快到来
一项新研究发现,人工智能代理缺乏进行开放式研究的判断力和创造力,这表明人工智能的递归自我改进可能比宣传的更需要时间。
@rohanpaul_ai: 自我改进的AI的真实性仅取决于其测试信号的有效性。梳理1250篇论文揭示了……
对1250篇关于AI递归自我改进的论文的分析表明,评估者信号是关键瓶颈。模型只有在强大且可信的信号(如证明检查器)下才能可靠改进,而弱信号则会导致循环崩溃或强化错误。
技能的递归自我改进 (Skill RSI)
Skill RSI 是一个免费工具,通过程序化评估和研究代理,以递归方式评估和改进 AI 技能,支持独立使用或作为 Codex 插件使用。