@akshay_pachaar: 自进化框架现已推出。(100% 开源) 如今,你选择一个固定框架,每个任务都通过它运行。一个……
摘要
JIT-Agent 是一个开源的 27B 模型,它为 AI 代理动态生成任务特定的框架,通过改进的 token 效率超越手工构建的系统。
查看缓存全文
缓存时间: 2026/09/04 16:24
即时生成的框架已全面开源。今天,你选择一个固定框架,所有任务都通过它运行。深度研究问题和文件重命名任务使用相同的内存策略、相同的规划器和相同的工具暴露方式。JIT-Agent是一个27B的开源模型,它负责编写框架。你将任务和工具注册表交给它,它会生成四个Python文件和一个提示配置文件。这个过程只在任务开始前发生一次。随后,第二个模型——你无需训练或修改的模型——通过逐步调用这些文件中的代码来实际执行任务。它既不编写代码,也不查看代码。每个文件对应一个固定的四模块契约的一部分:→内存决定当前步骤中第二个模型能看到哪些历史信息。→规划将该视图转化为下一步行动的指令。→工具策略决定为该指令暴露哪些工具。→动作整合所有信息生成提示,调用模型,并将回复解释为工具调用或最终答案。由于代码是按任务编写的,相同的生成器会产生结构不同的代理。以下是JIT-Agent论文中的几个任务及各自生成的框架示例:1)对于需要查找联系记录、创建工作簿并发送邮件的任务,它将需求编译成一个依赖图,其中交付依赖于工件验证,并存储中间工件,以便后续节点直接使用完成的结果,而不是从记录中重建。2)对于多跳身份验证问题,固定图会过早锁定一条证据路径,因此它合成了一个委托工具,该工具开启一个具有独立内存和五步预算的私有研究子代理。返回的答案作为普通观察重新进入父循环。3)对于以比较数字和排名结果为主的任务,它将算术运算移出模型。框架通过运行代码计算数字,将结果存储为固定值,并在后续步骤中提供相同的数值,这样模型直接读取数据,而无需从文本中重新计算。在保持工作模型不变、仅改变框架的情况下,JIT-Agent的框架在搜索和指令基准测试中达到或超过了手工构建的运行时性能,同时消耗的令牌不足一半,平均每个案例节省约三分之一。编写框架也需要消耗令牌,这一成本不包含在上述每个案例的数字中。因此,框架设计不再是你必须固定的选择,而是为每个任务重新编写的内容。JIT-Agent还将击败当前最佳方案的框架保存在存档中,并在后续任务相似时从中提取。在此过程中,其自身权重始终保持不变。这项工作完全开源。仓库地址:https://github.com/bingreeky/JIT 论文链接:https://arxiv.org/abs/2608.25593 我之前写过一篇详细文章,介绍模型开始生成框架前框架实际包含的内容。文章引述如下:— # bingreeky/JIT 来源:https://github.com/bingreeky/JIT 通过即时生成框架进化扩展框架智能 GitHub (https://github.com/bingreeky/JIT) arXiv (https://arxiv.org/abs/2608.25593) Hugging Face (https://huggingface.co/JIT-Agent) 许可证 ## 什么是JIT-Agent?JIT-Agent是一个紧凑的元代理,能够动态编写你的代理框架。它不是预先编译一个通用脚手架并期望其转移适用,而是接收任务规范、协议、工具/技能注册表和几个检索到的历史框架,并生成一个可执行的、特定任务的框架,包裹任何现成的代理型大语言模型——模型即框架。JIT-Agent概览。给定一个任务,JIT-Agent通过选择和实例化四个模块来组合一个特定问题的代理框架:内存、规划、动作和能力。不同的任务结构因此引发不同的执行协议和状态组织。每个框架都分解为四个模块——内存、规划、动作、能力编排——基于HarnessFactory中的共享接口实现,因此生成意味着发出结构化代码,而非自由形式的代理程序。随着跟踪和反馈返回,JIT-Agent会修订框架并更新存档:框架在测试时持续改进,而生成器本身保持冻结。****结果。生成的JIT-Agent-27B提升了多种骨干代理在深度研究、日常工作、规划和工作区任务中的表现。> 构建脚手架被证明是代理智能的一个可训练、可转移的维度——与基础模型的扩展正交。 — ## 仓库布局 | 目录 | 包含内容 | |—|—| | jit/ | 元代理:生成/修复提示、最佳N选择 | | scripts/ | 代理内核、工具、模型、评估引擎和两个运行器 | | harness_factory/ | 手工编写的框架实现及其设计文档 | | benchmark/ | 每个基准测试的适配器、配置和评估器 | | dataset/ | 基准测试数据本身 | 每个目录都有自己的README文件,包含详细信息。 ## 设置 1. 克隆仓库 bash git clone https://github.com/bingreeky/JIT.git cd JIT 2. 环境 (Python 3.11) bash conda env create -f environment.yml && conda activate jit 或者,在现有环境中:pip install -r requirements.txt。提供本地元模型(vLLM/SGLang + torch)服务的方式特意未包含在内——流程仅通过HTTP与其通信。 3. 凭证 bash cp .env.example .env # 然后填写 Shell中已导出的任何变量优先于.env,每个模型角色也可以通过命令行参数在每次运行时覆盖。 | 组别 | 键名 | 用途 | |—|—|—| | 执行模型 | OPENAI_API_BASE、OPENAI_API_KEY、EXEC_MODEL | 运行生成的框架的代理循环 | | 评判模型 | JUDGE_MODEL、可选JUDGE_API_* | 评估生成的工件(回退到执行端点) | | 元模型 | META_MODEL、META_API_BASE、META_API_KEY、META_TOKENIZER | 编写框架(仅限JIT流程) | | 工具 | SERPER_API_KEY、JINA_API_KEY | web_search / crawl_page | 4. 数据 小型数据集已包含在仓库中;任何大型数据集都有文档说明下载方式。 bash python scripts/check_datasets.py # 检查每个基准测试的数据集状态:存在/部分缺失/缺失 bash scripts/fetch_datasets.sh travel # 下载一个基准测试("all" ≈ 1 GB) ## 用法 所有模式共享相同的基准测试适配器、执行模型、评判模型和评分路径。元模型编写框架,执行模型运行它,评判模型评估结果。在.env中配置凭证;CLI参数可覆盖它们。 | 目标 | 入口点 | 元模型 | 选择方式 | |—|—|—|—| | 测试固定的HarnessFactory设计 | scripts.run_seed_harness | 无 | 无 | | 使用托管API作为元代理 | scripts.run_jit | OpenAI兼容API | judge | | 评估JIT检查点 | serve_meta_model.sh + scripts.run_jit | 本地JIT-27B | logprob | **1. 测试固定的HarnessFactory设计。**不调用元模型;直接执行选定的框架并评分。 bash python -m scripts.run_seed_harness --bench xbench --list-harnesses python -m scripts.run_seed_harness --bench xbench \ --harness plan_and_execute --max-samples 5 参见HarnessFactory指南了解包含的十一个设计。 **2. 使用托管API模型作为元代理。**托管API通常不暴露prompt_logprobs,因此请显式使用评判选择。META_API_KEY从.env读取。 bash python -m scripts.run_jit --bench xbench \ --meta-model provider-model --meta-base https://api.provider.com/v1 \ --selector judge --rollouts 3 --max-samples 5 **3. 评估JIT检查点。**提供检查点服务,然后使用其分词器进行发布的概率选择器。 bash MODEL=JIT-Agent/jit-27b SERVED_NAME=jit TP=4 \ bash scripts/serve_meta_model.sh bash python -m scripts.run_jit --bench xbench \ --meta-model jit --meta-base http://127.0.0.1:8000/v1 \ --selector logprob --tokenizer JIT-Agent/jit-27b \ --rollouts 3 --meta-temperature 1.0 --max-samples 5 移除--max-samples进行完整运行。MODEL也可以是本地检查点路径;SERVED_NAME必须与--meta-model匹配。Shell包装器bash scripts/run_jit.sh xbench从环境中读取相同的设置。 关键参数 | 参数 | 目的 | |—|—| | --bench、--dataset-path | 选择基准测试并可选覆盖其数据路径。 | | --meta-model/base/key | 配置框架生成模型;仅限JIT运行。 | | --exec-model/base/key | 配置运行框架的模型。 | | --judge-model/base/key | 配置基准测试评估器。 | | --rollouts、--meta-temperature | 控制候选数量和生成多样性。 | | --selector、--tokenizer | 对于托管API使用judge,或对本地分词器使用logprob。 | | --harness-refs {desc,code} | 选择设计描述或采样的源框架作为参考。 | | --max-samples、--cases、--output | 控制冒烟测试、案例选择和输出位置。 | | --workers-gen、--workers-exec | 独立调整生成和执行并发度。 | 支持的基准测试包括xbench、deepsearchqa、agentif、officebench、odyssey、shopping和travel。 **输出和恢复。**JIT分别生成、选择和执行工件:summary.json 摘要指标 + 运行配置方式 generate/ 每个案例的N个候选框架,包含提示和响应 select/ 每个案例的选定框架、产生它的规则、每个候选的分数 execute/ 实际运行的框架、其轨迹和报告的数据 固定框架的运行直接写入summary.json、scores.jsonl和每个案例的报告。重新运行相同的命令会恢复已完成的工作,仅重试基础设施故障;--skip-generate和--skip-select可重用之前的JIT阶段。详细文档:JIT流程 · HarnessFactory · CLI和运行时。运行任一入口点时使用--help查看完整参数列表。 ## 引用 如果你觉得JIT-Agent有用,请引用:bibtex @misc{zhang2026jitagentscalingharnessintelligence, title={JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution}, author={Guibin Zhang and Leo Lu and Fangzhou Xie and Kang Zhu and Junhao Wang and Zhifei Xie and Zhaochen Yu and Zihang Liu and Zhongxiang Sun and Qiankun Li and Yue Liao and Heng Chang and Xiaobin Hu and Qibing Ren and Wangchunshu Zhou and Shuicheng Yan}, year={2026}, eprint={2608.25593}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2608.25593}, } ## 许可证 参见LICENSE。
相似文章
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
JIT-Agent:通过即时框架演化扩展智能
JIT-Agent 是一个可训练模型,用于为现成的LLM合成自适应代理框架,从而在不同模型和任务上提升性能。
HarnessX:可组合、自适应且可演进的智能体夹具工坊
HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。
Adaptive Auto-Harness: 在开放式任务流上实现智能体系统部署的持续自我改进
Adaptive Auto-Harness 是一个框架,用于在开放式任务流上部署的智能体系统的持续自我改进,通过状态性多智能体进化器、harness树和人工引导钩子超越基线。