@omarsar0: // 适配接口,而非模型 // 我对我的廉价模型加优质harness构建的结果感到着迷…

X AI KOLs Following 论文

摘要

提出了Life-Harness,一种通过适配运行时接口而非模型权重来改进冻结的LLM智能体的方法,在126个设置和18个backbones中实现了平均88.5%的相对改进。

// 适配接口,而非模型 // 我对在我的廉价模型加优质harness构建中获得的结果感到着迷。 这篇新论文也显示了code-as-agent-harness论点的良好迹象。 这个想法非常简单。不要改动模型。相反,修改封装冻结LLM的运行时接口。然后将反复出现的交互失败转化为harness侧可复用的干预措施。 论文报告了在7个确定性环境、126个模型-环境设置和18个backbones中平均相对改进88.5%。 从一个模型轨迹学习到的harness可以泛化到其他17个backbones。这说明harness捕捉的是环境结构,而非模型特定的模式。 如果你在生产环境中部署智能体,你的harness工作比你想象的更具可移植性。 Paper: https://arxiv.org/abs/2605.22166 在我们的学院学习构建有效的AI智能体:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/05/23 16:09

// 适配接口,而非模型 //

我对“廉价模型 + 优质框架”组合所取得的结果深感着迷。

这篇新论文也印证了“代码即智能体框架”这一论点。

其核心理念非常简单:不动模型本身。而是修改包裹着冻结LLM的运行时接口。接着,将反复出现的交互失败,转化为框架侧可复用的干预措施。

论文报告,在7个确定性环境、126个模型-环境设置和18个基础模型上,平均相对改进率达到88.5%。

从一个模型轨迹学到的框架,可泛化到其他17个基础模型。这表明,框架捕捉的是环境结构,而非模型特有的模式。

如果你在生产环境中部署智能体,你的框架工作比你想象的更具可移植性。

论文链接:https://arxiv.org/abs/2605.22166

在我们的学院学习构建有效的AI智能体:https://academy.dair.ai


适配接口,而非模型:确定性LLM智能体的运行时框架自适应

来源:https://arxiv.org/html/2605.22166 Tianshi Xu† Huifeng Wen† Meng Li 北京大学 {tianshixu, wenhuifeng}@stu.pku.edu.cn, [email protected] †同等贡献

摘要

LLM智能体的行为不仅由其语言模型塑造,还受到运行时框架的影响,该框架中介着观测、工具使用、动作执行、反馈解释和轨迹控制。虽然现有的智能体自适应方法主要更新模型参数,但在确定性、规则驱动的领域中,许多失败源于模型与环境接口之间的不匹配。我们提出Life-Harness,一种生命周期感知的运行时框架,它在不改变模型权重或评估环境的情况下改进冻结的LLM智能体。Life-Harness从训练轨迹中演化而来,将反复出现的交互失败转化为跨环境契约、程序化技能、动作实现和轨迹调节的可复用干预措施,并在独立评估期间保持固定。在来自τ-bench、τ²-bench和AgentBench的七个确定性环境上,Life-Harness改进了18个基础模型中的116个模型-环境设置,平均相对改进率为88.5%。仅从Qwen3-4B-Instruct轨迹演化而来的框架可迁移到其他17个模型,表明Life-Harness捕获的是可复用的环境侧结构,而非模型特定的行为。这些结果将运行时接口自适应定位为以模型为中心的智能体训练的一种互补替代方案。代码已在GitHub上提供(https://github.com/Tianshi-Xu/Life-Harness)。

参见图1:适配运行时框架,而非模型。Life-Harness保持LLM权重固定,并从训练轨迹中演化出可复用的接口干预措施,在智能体任务、基准测试和模型基础模型上实现了广泛而显著的提升。 适配接口,而非模型:确定性LLM智能体的运行时框架自适应

Tianshi Xu† Huifeng Wen† Meng Li 北京大学 {tianshixu, wenhuifeng}@stu.pku.edu.cn, [email protected] †同等贡献。

1 引言

参见图2:(a) 智能体不仅仅是LLM:其行为由运行时框架塑造,该框架中介着观测、工具、动作和反馈。(b) 我们适配这个运行时接口,而非模型参数,从而为确定性环境中的冻结智能体生成一个固定且可复用的框架。LLM智能体不仅仅是LLM。如图2(a)所示,它是一个嵌入在有状态交互循环中的模型:环境暴露观测,运行时系统指定可用的工具和动作,模型发出动作或工具调用,执行器将其应用于环境,结果反馈更新下一个决策[Wang等 (2024);Anthropic (2026)]。因此,最终的行为不仅由模型决定,还由运行时框架决定,该框架中介着模型如何观测环境、理解工具、实现动作、解释反馈以及调节多步轨迹。这种系统级视角在软件工程助手[Yang等 (2024b);OpenAI (2026);OpenCode (2026)]、操作系统控制[Xie等 (2024);Liu等 (2024)]、网页导航[Zhou等 (2024)]、数据库操作[Lei等 (2025)]、具身交互[Shridhar等 (2020)]以及使用工具的业务工作流智能体[Yao等 (2024);Barres等 (2025)]中变得越来越重要。

尽管如此,智能体自适应通常仍被理解为模型自适应:扩展基础模型、监督微调、强化学习、偏好优化或蒸馏[Dubey等 (2024);Team (2025);DeepSeek-AI (2026);Prabhakar等 (2026)]。这些方法很强大,但它们隐性地将领域特定行为吸收到模型参数中。在确定性、规则驱动的领域中,许多相关结构反而存在于模型之外:工具模式、可接受的动作空间、API契约、反馈规则、停止条件和恢复策略。这种区别体现在静态能力与交互性能之间的差距上:例如,Qwen3.5-4B在HMMT Feb[哈佛-麻省理工学院数学锦标赛 (2026)](一个竞赛级别的数学推理基准)上得分74.0%,但在ALFWorld[Shridhar等 (2020)](一个确定性具身交互基准)上仅达到43.1%。此类失败通常并非源于潜在推理能力的缺失,而是来自模型-环境边界的错配:观测组织不善、工具契约理解错误、动作不可执行、反馈未转化为恢复信号,或轨迹退化为重复。这表明,适配运行时框架可以揭示模型作用点上稳定的环境结构,而不是将所有领域约束都塞进模型权重。

最近的一系列工作也开始优化冻结LLM智能体周围的支架,包括推理时间计算控制器[Zheng等 (2026)]、交互游戏中的在线工作区自适应[Sarafian等 (2026);Karten等 (2026)]、框架标志优化[Sengupta和Wang (2026)]以及自动化框架代码搜索[Lee等 (2026);Lin等 (2026)]。这些研究确立了框架优化作为模型训练的重要替代方案,但它们大多将框架视为要优化的策略、可变状态或代码制品。我们转而研究确定性智能体领域,其中框架充当模型与规则驱动环境之间的稳定运行时接口。在此设置中,反复出现的失败可以定位到交互生命周期的阶段,从而可以从训练轨迹中演化出针对特定失败的接口干预措施,并在保留任务上评估生成的框架。这引出了我们的核心问题:能否利用训练轨迹演化出一个结构化的运行时接口,从而在未见任务和新模型基础模型上改进冻结的智能体?

我们通过Life-Harness回答了这个问题,这是一种用于确定性LLM智能体的生命周期感知运行时框架。不同于更新模型参数或在无约束的框架代码上搜索[Lee等 (2026)],Life-Harness调整运行时层,该层中介着冻结模型如何观测环境、使用工具、实现动作、解释反馈以及从退化轨迹中恢复。它从训练轨迹中演化而来,通过诊断反复出现的交互失败并将其转化为可复用的干预措施,而生成的框架在保留评估期间保持固定。

Life-Harness将运行时自适应组织成四个生命周期层。环境契约层在交互之前校准工具描述和接口约束,减少通用工具使用先验与环境特定契约之间的不匹配。程序化技能层从训练轨迹中提取可复用的程序,并为当前任务和状态检索它们。动作实现层在执行之前验证和规范化模型生成的动作,挽救明确的接口级错误并阻止确定会失败的动作。轨迹调节层监控执行后的动态,检测退化模式(如重复、停滞、无效重试或预算耗尽),并在需要时触发恢复。

这种轨迹驱动的演化将重复失败转化为可审计的运行时干预措施,而非模型更新。在评估期间,模型权重和环境保持不变;Life-Harness可能使用当前episode历史来执行,但不会从评估失败中创建新的持久干预措施。因此,Life-Harness适配了固定模型发挥其能力的接口,同时保持了框架演化与保留评估之间的清晰界限。

我们在来自τ-bench[Yao等 (2024)]、τ²-bench[Barres等 (2025)]和AgentBench[Liu等 (2024)]的七个确定性智能体环境上评估Life-Harness,涵盖家庭交互、网上购物、操作系统控制、数据库任务和策略引导的业务工作流。在18个基础模型上,包括指令微调、推理和智能体专用模型,Life-Harness改进了126个模型-环境设置中的116个,平均相对改进率为88.5%。这些框架仅从Qwen3-4B-Instruct轨迹演化而来,随后在其他17个基础模型上复用,表明它们捕获的是可复用的环境侧结构,而非模型特定的行为。Life-Harness也与模型训练互补:它使基础模型Qwen2.5-32B-Instruct的性能超越其工具专用衍生模型xLAM-2-32b-fc-r[Prabhakar等 (2026)],同时进一步改进了xLAM本身。

我们的贡献有三方面:我们为确定性LLM智能体提出了基于框架的运行时接口自适应;引入了Life-Harness,一种生命周期感知的框架,它将反复出现的轨迹失败转化为针对环境契约、程序化技能、动作实现和轨迹调节的干预措施;并展示了无需更新模型权重或修改评估环境即可实现的广泛跨模型提升。这些结果共同表明,许多实际智能体失败无需吸收到模型参数中,而是可以通过演化冻结模型与其作用环境之间的可复用运行时接口来解决。

2 相关工作

框架优化。 最近一系列工作开始优化冻结LLM系统周围的支架。AutoTTS[Zheng等 (2026)]搜索推理时间控制器,以在数学推理中分配分支/深度计算。工作区优化[Sarafian等 (2026)]和持续框架[Xiong等 (2026)]研究交互游戏类环境中的在线自适应,智能体从自己的episode历史中修订工作区状态、提示、技能、记忆或可执行制品。HARBOR[Sengupta和Wang (2026)]将框架调优视为对现有特征标志的贝叶斯优化,而Meta-Harness[Lee等 (2026)]搜索完整的框架程序,利用先前的候选代码、分数和执行轨迹。最近,AHE[Lin等 (2026)]通过将可编辑组件暴露为文件、提取轨迹证据并通过预测清单验证编辑,对编码智能体框架进行可观测性驱动的演化。

Life-Harness共享了冻结智能体可以在模型权重之外改进的前提,但针对的是不同的范围和抽象。Meta-Harness和AHE专注于编码智能体的自动化框架工程,而Life-Harness研究编码之外的确定性、规则驱动的智能体领域,包括家庭交互、网上购物、数据库任务和策略引导的工作流。Life-Harness不是将框架视为要搜索或持续编辑的自由形式代码制品,而是将其视为一个结构化的运行时接口,其自适应由智能体交互生命周期组织。反复出现的训练轨迹失败被映射到环境契约、程序化技能、动作实现和轨迹调节的固定干预措施;这些干预措施随后在保留任务上评估并在不同基础模型之间复用。

提示自适应方法。 提示优化通过重写指令、演示或提示模板而非模型权重来适配冻结的LLM系统[Agarwal等 (2024);Fernando等 (2023)]。代表性方法包括自动提示优化、LLM作为优化器的方法(如OPRO[Yang等 (2024a)])、文本梯度方法(如ProTeGi[Pryzant等 (2023)]和TextGrad[Yuksekgonul等 (2024)])以及反射优化器(如GEPA[Agrawal等 (2025)])。这些方法与Life-Harness互补:它们主要优化面向模型的文本,而Life-Harness适配更广泛的运行时接口,包括面向提示的契约以及面向执行的机制,如动作验证、反馈驱动恢复和轨迹调节。

LLM智能体的模型侧自适应。 大多数智能体自适应工作通过指令调优[Team (2024)]、工具使用微调[Prabhakar等 (2026)]、强化学习[Guo等 (2025);Xu等 (2026)]、蒸馏[Lu和Lab (2025)]以及相关的后训练方法[Dubey等 (2024)]来改进模型本身。这些方法虽然强大,但将领域特定行为吸收到模型参数中。相比之下,Life-Harness在模型-环境边界工作,提出通过适配运行时接口来补充模型侧方法。我们的实证结果证实,这两种策略是可叠加的:Life-Harness在已经过工具专用微调的模型(如xLAM)上也能提供一致的增益。// 适配接口,而非模型 //

我对“廉价模型 + 优质框架”组合所取得的结果深感着迷。

这篇新论文也印证了“代码即智能体框架”这一论点。

其核心理念非常简单:不动模型本身。而是修改包裹着冻结LLM的运行时接口。接着,将反复出现的交互失败,转化为框架侧可复用的干预措施。

论文报告,在7个确定性环境、126个模型-环境设置和18个基础模型上,平均相对改进率达到88.5%。

从一个模型轨迹学到的框架,可泛化到其他17个基础模型。这表明,框架捕捉的是环境结构,而非模型特有的模式。

如果你在生产环境中部署智能体,你的框架工作比你想象的更具可移植性。

论文链接:https://arxiv.org/abs/2605.22166

在我们的学院学习构建有效的AI智能体:https://academy.dair.ai


适配接口,而非模型:确定性LLM智能体的运行时框架自适应

来源:https://arxiv.org/html/2605.22166 Tianshi Xu† Huifeng Wen† Meng Li 北京大学 {tianshixu, wenhuifeng}@stu.pku.edu.cn, [email protected] †同等贡献

摘要

LLM智能体的行为不仅由其语言模型塑造,还受到运行时框架的影响,该框架中介着观测、工具使用、动作执行、反馈解释和轨迹控制。虽然现有的智能体自适应方法主要更新模型参数,但在确定性、规则驱动的领域中,许多失败源于模型与环境接口之间的不匹配。我们提出Life-Harness,一种生命周期感知的运行时框架,它在不改变模型权重或评估环境的情况下改进冻结的LLM智能体。Life-Harness从训练轨迹中演化而来,将反复出现的交互失败转化为跨环境契约、程序化技能、动作实现和轨迹调节的可复用干预措施,并在独立评估期间保持固定。在来自τ-bench、τ²-bench和AgentBench的七个确定性环境上,Life-Harness改进了18个基础模型中的116个模型-环境设置,平均相对改进率为88.5%。仅从Qwen3-4B-Instruct轨迹演化而来的框架可迁移到其他17个模型,表明Life-Harness捕获的是可复用的环境侧结构,而非模型特定的行为。这些结果将运行时接口自适应定位为以模型为中心的智能体训练的一种互补替代方案。代码已在GitHub上提供(https://github.com/Tianshi-Xu/Life-Harness)。

参见图1:适配运行时框架,而非模型。Life-Harness保持LLM权重固定,并从训练轨迹中演化出可复用的接口干预措施,在智能体任务、基准测试和模型基础模型上实现了广泛而显著的提升。 适配接口,而非模型:确定性LLM智能体的运行时框架自适应

Tianshi Xu† Huifeng Wen† Meng Li 北京大学 {tianshixu, wenhuifeng}@stu.pku.edu.cn, [email protected] †同等贡献。

1 引言

参见图2:(a) 智能体不仅仅是LLM:其行为由运行时框架塑造,该框架中介着观测、工具、动作和反馈。(b) 我们适配这个运行时接口,而非模型参数,从而为确定性环境中的冻结智能体生成一个固定且可复用的框架。一个LLM智能体不仅仅是LLM。如图2(a)所示,它是一个嵌入在有状态交互循环中的模型:环境暴露观测,运行时系统指定可用的工具和动作,模型发出动作或工具调用,执行器将其应用于环境,结果反馈更新下一个决策[Wang等 (2024);Anthropic (2026)]。因此,最终的行为不仅由模型决定,还由运行时框架决定,该框架中介着模型如何观测环境、理解工具、实现动作、解释反馈以及调节多步轨迹。这种系统级视角在软件工程助手[Yang等 (2024b);OpenAI (2026);OpenCode (2026)]、操作系统控制[Xie等 (2024);Liu等 (2024)]、网页导航[Zhou等 (2024)]、数据库操作[Lei等 (2025)]、具身交互[Shridhar等 (2020)]以及使用工具的业务工作流智能体[Yao等 (2024);Barres等 (2025)]中变得越来越重要。

尽管如此,智能体自适应通常仍被理解为模型自适应:扩展基础模型、监督微调、强化学习、偏好优化或蒸馏[Dubey等 (2024);Team (2025);DeepSeek-AI (2026);Prabhakar等 (2026)]。这些方法很强大,但它们隐性地将领域特定行为吸收到模型参数中。在确定性、规则驱动的领域中,许多相关结构反而存在于模型之外:工具模式、可接受的动作空间、API契约、反馈规则、停止条件和恢复策略。这种区别体现在静态能力与交互性能之间的差距上:例如,Qwen3.5-4B在HMMT Feb[哈佛-麻省理工学院数学锦标赛 (2026)](一个竞赛级别的数学推理基准)上得分74.0%,但在ALFWorld[Shridhar等 (2020)](一个确定性具身交互基准)上仅达到43.1%。此类失败通常并非源于潜在推理能力的缺失,而是来自模型-环境边界的错配:观测组织不善、工具契约理解错误、动作不可执行、反馈未转化为恢复信号,或轨迹退化为重复。这表明,适配运行时框架可以揭示模型作用点上稳定的环境结构,而不是将所有领域约束都塞进模型权重。

最近的一系列工作也开始优化冻结LLM智能体周围的支架,包括推理时间计算控制器[Zheng等 (2026)]、交互游戏中的在线工作区自适应[Sarafian等 (2026);Karten等 (2026)]、框架标志优化[Sengupta和Wang (2026)]以及自动化框架代码搜索[Lee等 (2026);Lin等 (2026)]。这些研究确立了框架优化作为模型训练的重要替代方案,但它们大多将框架视为要优化的策略、可变状态或代码制品。我们转而研究确定性智能体领域,其中框架充当模型与规则驱动环境之间的稳定运行时接口。在此设置中,反复出现的失败可以定位到交互生命周期的阶段,从而可以从训练轨迹中演化出针对特定失败的接口干预措施,并在保留任务上评估生成的框架。这引出了我们的核心问题:能否利用训练轨迹演化出一个结构化的运行时接口,从而在未见任务和新模型基础模型上改进冻结的智能体?

我们通过Life-Harness回答了这个问题,这是一种用于确定性LLM智能体的生命周期感知运行时框架。不同于更新模型参数或在无约束的框架代码上搜索[Lee等 (2026)],Life-Harness调整运行时层,该层中介着冻结模型如何观测环境、使用工具、实现动作、解释反馈以及从退化轨迹中恢复。它从训练轨迹中演化而来,通过诊断反复出现的交互失败并将其转化为可复用的干预措施,而生成的框架在保留评估期间保持固定。

Life-Harness将运行时自适应组织成四个生命周期层。环境契约层在交互之前校准工具描述和接口约束,减少通用工具使用先验与环境特定契约之间的不匹配。程序化技能层从训练轨迹中提取可复用的程序,并为当前任务和状态检索它们。动作实现层在执行之前验证和规范化模型生成的动作,挽救明确的接口级错误并阻止确定会失败的动作。轨迹调节层监控执行后的动态,检测退化模式(如重复、停滞、无效重试或预算耗尽),并在需要时触发恢复。

这种轨迹驱动的演化将重复失败转化为可审计的运行时干预措施,而非模型更新。在评估期间,模型权重和环境保持不变;Life-Harness可能使用当前episode历史来执行,但不会从评估失败中创建新的持久干预措施。因此,Life-Harness适配了固定模型发挥其能力的接口,同时保持了框架演化与保留评估之间的清晰界限。

我们在来自τ-bench[Yao等 (2024)]、τ²-bench[Barres等 (2025)]和AgentBench[Liu等 (2024)]的七个确定性智能体环境上评估Life-Harness,涵盖家庭交互、网上购物、操作系统控制、数据库任务和策略引导的业务工作流。在18个基础模型上,包括指令微调、推理和智能体专用模型,Life-Harness改进了126个模型-环境设置中的116个,平均相对改进率为88.5%。这些框架仅从Qwen3-4B-Instruct轨迹演化而来,随后在其他17个基础模型上复用,表明它们捕获的是可复用的环境侧结构,而非模型特定的行为。Life-Harness也与模型训练互补:它使基础模型Qwen2.5-32B-Instruct的性能超越其工具专用衍生模型xLAM-2-32b-fc-r[Prabhakar等 (2026)],同时进一步改进了xLAM本身。

我们的贡献有三方面:我们为确定性LLM智能体提出了基于框架的运行时接口自适应;引入了Life-Harness,一种生命周期感知的框架,它将反复出现的轨迹失败转化为针对环境契约、程序化技能、动作实现和轨迹调节的干预措施;并展示了无需更新模型权重或修改评估环境即可实现的广泛跨模型提升。这些结果共同表明,许多实际智能体失败无需吸收到模型参数中,而是可以通过演化冻结模型与其作用环境之间的可复用运行时接口来解决。

2 相关工作

框架优化。 最近一系列工作开始优化冻结LLM系统周围的支架。AutoTTS[Zheng等 (2026)]搜索推理时间控制器,以在数学推理中分配分支/深度计算。工作区优化[Sarafian等 (2026)]和持续框架[Xiong等 (2026)]研究交互游戏类环境中的在线自适应,智能体从自己的episode历史中修订工作区状态、提示、技能、记忆或可执行制品。HARBOR[Sengupta和Wang (2026)]将框架调优视为对现有特征标志的贝叶斯优化,而Meta-Harness[Lee等 (2026)]搜索完整的框架程序,利用先前的候选代码、分数和执行轨迹。最近,AHE[Lin等 (2026)]通过将可编辑组件暴露为文件、提取轨迹证据并通过预测清单验证编辑,对编码智能体框架进行可观测性驱动的演化。

Life-Harness共享了冻结智能体可以在模型权重之外改进的前提,但针对的是不同的范围和抽象。Meta-Harness和AHE专注于编码智能体的自动化框架工程,而Life-Harness研究编码之外的确定性、规则驱动的智能体领域,包括家庭交互、网上购物、数据库任务和策略引导的工作流。Life-Harness不是将框架视为要搜索或持续编辑的自由形式代码制品,而是将其视为一个结构化的运行时接口,其自适应由智能体交互生命周期组织。反复出现的训练轨迹失败被映射到环境契约、程序化技能、动作实现和轨迹调节的固定干预措施;这些干预措施随后在保留任务上评估并在不同基础模型之间复用。

提示自适应方法。 提示优化通过重写指令、演示或提示模板而非模型权重来适配冻结的LLM系统[Agarwal等 (2024);Fernando等 (2023)]。代表性方法包括自动提示优化、LLM作为优化器的方法(如OPRO[Yang等 (2024a)])、文本梯度方法(如ProTeGi[Pryzant等 (2023)]和TextGrad[Yuksekgonul等 (2024)])以及反射优化器(如GEPA[Agrawal等 (2025)])。这些方法与Life-Harness互补:它们主要优化面向模型的文本,而Life-Harness适配更广泛的运行时接口,包括面向提示的契约以及面向执行的机制,如动作验证、反馈驱动恢复和轨迹调节。

LLM智能体的模型侧自适应。 大多数智能体自适应工作通过指令调优[Team (2024)]、工具使用微调[Prabhakar等 (2026)]、强化学习[Guo等 (2025);Xu等 (2026)]、蒸馏[Lu和Lab (2025)]以及相关的后训练方法[Dubey等 (2024)]来改进模型本身。这些方法虽然强大,但将领域特定行为吸收到模型参数中。相比之下,Life-Harness在模型-环境边界工作,提出通过适配运行时接口来补充模型侧方法。我们的实证结果证实,这两种策略是可叠加的:Life-Harness在已经过工具专用微调的模型(如xLAM)上也能提供一致的增益。

相似文章

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。

@akshay_pachaar: 不要训练模型,而要进化工具层。

X AI KOLs Following

文章讨论了 Hugging Face 的一个实验:一个自动循环仅重写冻结模型周围的代码(工具层),在不改变模型权重的情况下,将其基准分数从 0% 提升到接近 Sonnet 4.6 的水平,且成本更低。这证明许多基准测试失败源于工具层,而非模型本身。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396

X AI KOLs Timeline

自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。