@EinsiaAI: 1/ 递归自我改进 (RSI) 取决于代理如何改进AI系统的训练——而不仅仅是调整超参数…

X AI KOLs Timeline 论文

摘要

本文介绍了AI4AI-Bench,这是一个评估AI代理改进训练算法能力的基准测试,展示了在十个研究仓库中性能分数低和探索成本高的情况。

1/ 递归自我改进 (RSI) 取决于代理如何改进AI系统的训练 ——而不仅仅是调整超参数,而是改进训练算法本身。 我们通过AI4AI-Bench直接测试了这一点:10个真实的研究仓库,涵盖10个不同的算法家族。 详细分解 GitHub: [https://github.com/Einsia/AI4AI-Bench…] 论文链接: [https://arxiv.org/pdf/2608.20318] Einsia网站:[https://lab.einsia.ai/ai4ai/] 结果: 平均分仅为0.166。 即使是性能最好的模型Opus 5,也只达到0.288。 每个任务的中位探索成本从$1.69上升到$34.60。 #AI4AI #RecursiveSelfImprovement #AIResearch #AI4AI_Bench
查看原文
查看缓存全文

缓存时间: 2026/08/23 13:40

递归自我提升(RSI)依赖于智能体改进AI系统的训练方式 ——不仅是调整超参数,还包括改进训练算法本身。

我们通过AI4AI-Bench直接测试了这一点:10个真实研究代码库涵盖10种不同算法家族。

详细报告 GitHub仓库:[https://github.com/Einsia/AI4AI-Bench…] 论文链接:[https://arxiv.org/pdf/2608.20318] Einsia项目主页:[https://lab.einsia.ai/ai4ai/]

测试结果: 平均得分仅为0.166分。 即使表现最优的模型Opus 5也仅达到0.288分。 每项任务的中位探索成本从1.69美元升至34.60美元。

#AI4AI #递归自我提升 #AI研究 #AI4AI_Bench


Einsia/AI4AI-Bench

来源:https://github.com/Einsia/AI4AI-Bench

AI4AI-Bench

arXiv论文(https://arxiv.org/abs/2608.20318) PDF全文(https://arxiv.org/pdf/2608.20318) 项目主页(https://lab.einsia.ai/ai4ai/) 任务列表(https://lab.einsia.ai/ai4ai/tasks/) 执行轨迹(https://lab.einsia.ai/ai4ai/trajectories/) Docker镜像(https://hub.docker.com/r/chiyizhe/ai4ai)

AI4AI-Bench旨在检验代码智能体能否改进现有的AI训练方案—— 而不仅仅是编写能通过固定测试的代码。十项任务涵盖生成、对齐、 推理、遗忘、剪枝、强化学习、奖励建模与模型融合。

每次实验将开放式探索与可复现测量分离进行。智能体最多有四小时 探索时间,但只有生成的补丁文件会进入全新的正式环境;正式训练 阶段最多运行十二小时,最多发布三个检查点,并将每个检查点 交由冻结验证集与最终评估流程。

固定任务及资源
        │
        ├─ 4小时探索 ──> 候选补丁.patch
        │                         │
        └──────── 全新正式训练 <──┘
                  (最长12小时)
                         │
             最多3个检查点
                         │
             验证 ──> 最终评分

快速入门

AI4AI-Bench支持Linux amd64系统、Python 3.10+、安装NVIDIA容器工具包的Docker环境 以及NVIDIA GPU。官方运行使用单块B300显卡;其他GPU可用于本地开发 (需选择适配的任务)。启动前请预先安装原生Codex或Claude命令行工具。

python3 -m venv .venv
. .venv/bin/activate
python -m pip install -e '.[assets]'

准备单个任务的公开资源集。若上游代码库需要验证, 请先设置HF_TOKEN环境变量。

export AI4AI_ASSET_STORE=/data/ai4ai/assets
python tools/prepare_assets.py \
  --task ddpo_sd15_aesthetic \
  --assets "$AI4AI_ASSET_STORE/ddpo_sd15_aesthetic" \
  --execute
python tools/verify_assets.py \
  --task ddpo_sd15_aesthetic \
  --assets "$AI4AI_ASSET_STORE/ddpo_sd15_aesthetic" \
  --hash

首先运行无需API密钥的GPU冒烟测试。该测试会按需拉取已发布镜像, 检验Docker环境、GPU透传、CUDA内核、主机挂载及模拟评分流程。

bash tools/smoke.sh --root /data/ai4ai/smoke --gpu 0

随后配置所选智能体,并完整检查主机环境(不显示凭证信息)。

export OPENAI_API_KEY=your-key
python tools/check_setup.py \
  --task ddpo_sd15_aesthetic \
  --assets "$AI4AI_ASSET_STORE/ddpo_sd15_aesthetic" \
  --root /data/ai4ai/runs \
  --gpu 0 --agent codex --mode local

启动正式实验。默认流程包含探索阶段、全新正式重训练、 检查点验证及最终评估。

bash orchestrator/trial.sh ddpo-codex \
  --task tasks/ddpo_sd15_aesthetic \
  --assets "$AI4AI_ASSET_STORE/ddpo_sd15_aesthetic" \
  --root /data/ai4ai/runs --gpu 0 \
  --agent codex --model gpt-5.6-sol --reasoning-effort high

使用Claude时,请改用--agent claude --model claude-opus-5 并设置ANTHROPIC_API_KEY(或ANTHROPIC_AUTH_TOKEN)。 替代路径、端点、本地/官方验证模式及存储要求详见 运行时指南

评估与回放

从相同初始条件回放现有补丁:

bash orchestrator/trial.sh replay-name \
  --task tasks/ddpo_sd15_aesthetic \
  --assets /data/ai4ai/assets/ddpo_sd15_aesthetic \
  --root /data/ai4ai/runs --gpu 0 \
  --candidate-patch candidate.patch

独立评估一至三个现有检查点:

bash orchestrator/evaluate.sh eval-name \
  --task tasks/ddpo_sd15_aesthetic \
  --assets /data/ai4ai/assets/ddpo_sd15_aesthetic \
  --root /data/ai4ai/evaluations --gpu 0 \
  --checkpoint 1000=/path/to/checkpoint-1000

以上均为自主托管的最终评估。公开版本warn默认标签将结果 标记为非官方本地结果;严格官方模式要求另行文档说明。 检查点选择、结果状态及当前无盲评服务的详情见 评估与回执文档

任务与文档

引用文献

@article{chi2026ai4ai,
  title   = {AI4AI-Bench: 递归自我提升的LLM智能体算法设计基准测试},
  author  = {Chi Yizhe, Li Wenyi, Hong Deyao, Wang Xiaoqiu, Gao Mingju, Yang Kaisen, He Bingxiang, Zheng Youjie, Xiao Calvin, Na Qinhuai},
  journal = {arXiv预印本 arXiv:2608.20318},
  year    = {2026}
}

开源许可

基准代码遵循Apache-2.0协议发布。 模型、数据集及镜像内容仍受其上游条款约束; 详见第三方声明

相似文章

AI能自我改进吗?RSI或许是答案[研究]

Reddit r/MachineLearning

介绍HarnessOpt-Bench以测量AI中的递归自我改进,评估了5个前沿模型在4项任务上的表现,发现模型选择比编程工具选择的影响更大。

技能的递归自我改进 (Skill RSI)

Reddit r/AI_Agents

Skill RSI 是一个免费工具,通过程序化评估和研究代理,以递归方式评估和改进 AI 技能,支持独立使用或作为 Codex 插件使用。