JIT-Agent:通过即时框架演化扩展智能
摘要
JIT-Agent 是一个可训练模型,用于为现成的LLM合成自适应代理框架,从而在不同模型和任务上提升性能。
查看缓存全文
缓存时间: 2026/08/27 03:16
论文页面 - JIT-Agent:通过即时运行时演化扩展智能体能力
来源:https://huggingface.co/papers/2608.25593 发布于 8月26日
·
由 https://huggingface.co/greeky 提交
gbz (https://huggingface.co/greeky) 于 8月27日
#3 当日论文 (https://huggingface.co/papers/date/2026-08-27) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
JIT-Agent 是一个可训练模型,能为现成的 LLM 综合适配的智能体运行时,在多种模型和任务上提升性能。
智能体的能力并非仅由模型决定。智能体运行时(涵盖内存管理、规划策略、动作协议及工具/技能编排)的贡献可能超过底层基础模型本身。然而,运行时设计目前仍是手动、特定任务且根本无法扩展的。我们提出 JIT-Agent,这是一个运行时智能体模型,旨在为任意现成的智能体 LLM 即时合成任务自适应的智能体运行时。我们将智能体运行时形式化为一个由固定四模块协议控制的、可组合、可机器生成的构件,并训练 JIT-Agent 为当前任务定制运行时、修复运行时以实现稳定可靠的执行,并通过从不断扩展的过往运行时配置库中蒸馏性能信号来自我进化。配备 JIT-Agent 作为运行时助手后,DeepSeek-V4-Flash 在 DeepSearchQA (+9.1) 和 OdysseyBench (+4.3) 上超越了 GPT-5.6,而本身就很强的 GLM-5.2 则获得了高达 +20.2 分的提升。在受控评估中,JIT-Agent 生成的运行时在性能上与成熟的智能体运行时(如 OpenCode 和 Claude Code)具有竞争力,并能持续提升 DeepSeek V4、Mimo-V2.5 和 Qwen3.6 等多尺度模型家族的表现。据我们所知,JIT-Agent 是首个专为即时运行时生成而构建的模型,它确立了运行时智能作为智能体能力中一个可训练、可迁移且可复利的维度,与模型规模扩展正交。
查看 arXiv 页面 (https://arxiv.org/abs/2608.25593) 查看 PDF (https://arxiv.org/pdf/2608.25593) 项目页面 (https://bingreeky.github.io/JIT-site/) GitHub0 (https://github.com/bingreeky/JIT) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.25593)
通过智能体获取此论文:
hf papers read 2608\.25593
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.25593 以从此页面链接它。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.25593 以从此页面链接它。
引用此论文的 Spaces0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.25593 以从此页面链接它。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
@akshay_pachaar: 自进化框架现已推出。(100% 开源) 如今,你选择一个固定框架,每个任务都通过它运行。一个……
JIT-Agent 是一个开源的 27B 模型,它为 AI 代理动态生成任务特定的框架,通过改进的 token 效率超越手工构建的系统。
HarnessForge: 联合执行框架与策略演化用于自适应智能体系统
HarnessForge 提出一种用于演化LLM智能体系统的元自适应框架,通过联合优化执行框架与推理策略,在五个基准测试上对Qwen3骨干模型实现持续改进。
HarnessX:可组合、自适应且可演进的智能体夹具工坊
HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。