hip-agent:适配于提示词中的框架(5分钟阅读)

TLDR AI 工具

摘要

hip-agent 是一个极简的代理框架,适配于提示词中,允许AI模型使用简单的工具(如shell命令和现有协议)来读取和调整自己的框架。它被设计为可修复的,并适用于子代理任务。

hip-agent 是一个为代理设计的小型代理框架。配置是环境变量,操作是shell命令,子代理是一个子进程。其余部分由现有协议和格式处理。核心循环大约200行Python代码和一个用于Codex API的模块。
查看原文
查看缓存全文

缓存时间: 2026/09/08 23:54

# hip-agent:可纳入提示词的智能体运行框架 来源:https://jonathanc.net/blog/hip-agent?amp;utm_source=tldrai&v=2 hip\-agent(harness in prompt)是一种专为智能体设计的小型运行框架:模型可直接读取自身框架结构,配置通过环境变量实现,其余部分则沿用现有协议。 两个提线木偶。左侧:一簇X形操控杆由画面外的手握持,木偶悬于其下;右侧:同一木偶立于镜前,镜像中提线末端连接着单独悬挂的X形操控杆,无人操控。 > *注*:本文由 Claude Fable 5\.1 与 GPT 5\.6 sol 协助撰写。源代码:github\.com/changjonathanc/hip\-agent (https://github.com/changjonathanc/hip-agent)\。 ## 设计动机 现有编程框架(如 Claude Code、Codex 等)虽多,但均针对人类用户设计。 它们并非为智能体构建。若要求智能体以`codex exec`作为子智能体调用,它可能需要数个轮次来理解命令行参数并解析输出。若需更定制化的执行循环,智能体可能需深入挖掘 Codex CLI 源码才能掌握所有实现细节。 ## 提示词即运行框架 hip\-agent 是专为智能体设计的运行框架。其核心循环仅约200行 Python 代码,另包含 Codex API 对接模块。设计遵循三大理念: - **运行框架可内嵌于提示词**:循环结构极简,模型仅被赋予`sh`和`view\_image`两个工具,提示词指引其通过阅读源代码理解框架完整功能。 - **操作系统即运行时**:配置通过环境变量管理,操作转化为 Shell 命令,子智能体体现为子进程。 - **其余部分依托现有协议**:插件遵循[智能体插件标准](https://agent-plugins.org/),钩子机制沿用 Claude Code 的 hook 协议,对话过程保存为 Codex CLI 会话文件,可通过`codex resume`直接恢复。 完整配置示例如下: `` # ~/.zshrc P=~/hip-agent/plugins export AGENT_MODEL=gpt-5.6-sol export AGENT_PLUGINS=$P/environment:$P/cwd:$P/agentsmd `` 运行示例: `` codex login ./agent "检查本仓库并解读其结构" `` 基于此设计自然衍生出以下特性: - **子智能体可通过`sh`执行`agent`命令生成**:它继承父进程环境变量并拥有独立会话。父智能体通过环境变量配置子智能体(如`AGENT\_MODEL=\.\.\. agent "\.\.\."`)。默认情况下父智能体仅接收子智能体最终输出,但可通过会话文件读取其状态,更复杂的交互可通过插件实现。 - **框架具备自修复能力**:足够智能的模型在阅读自身框架后,能够绕过或修改其限制。 - **可将 hip\-agent 封装为技能模块**:现有智能体可通过该框架派生子智能体。代码本身即文档。 ## 为何不直接使用原生子智能体? 既然当前模型已通过子智能体训练,为何还需要新框架? 1. **模型在固定框架中未必能发挥最佳性能**,随着模型进化,固定框架可能成为制约。hip\-agent 不是固化框架,而是刻意精简的参考实现,供智能体阅读、修改与适配。 2. **可训练模型使用该框架**:未来模型可采用 hip\-agent 思路,根据任务动态构建与编辑自身的子智能体框架。 ## 实验结果 在 Terminal\-Bench 2 环境中使用 gpt\-5\.6\-luna(最大计算强度)进行了代码迭代:主要优化了 Shell 设计和提示词,新增了 view\_image 工具与命令超时机制。除此之外,代码与提示词改动极小,未进行针对性调优。 最终代码在[DeepSWE](https://github.com/datacurve-ai/deep-swe)基准测试(113项任务)中与 Codex CLI 0\.147\.0 基线进行对比。结果显示 hip\-agent 表现与 Codex CLI 基本持平: hip\-agent | Codex CLI ---|--- 解决任务数 73/113 (64\.6%) | 解决任务数 72/113 (63\.7%) 每任务模型调用次数 187次 | 每任务模型调用次数 208次 单次运行,无误差范围。两次测试在相同CPU但其他硬件配置不同的两台本地机器并行进行。未统计 Token 消耗量(hip\-agent 不记录该数据)。 ## 结论 几乎所有主流模型提供商现在都推出了自家终端界面框架。但无人有精力尝试所有框架。 这也使得模型评估变得困难——基准测试衡量的是模型与框架的综合表现。OpenAI 发现[ARC\-AGI\-3](https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/)测试中,框架导致模型在步骤间推理能力下降;开启 Codex 默认使用的两项设置后,评分提升了三倍。另一方面,面向用户的框架每周都在更新,并非每次改进都有效:Anthropic 的[四月事件报告](https://www.anthropic.com/engineering/april-23-postmortem)记录了框架如何在不改变模型的情况下悄然降低结果质量。因此,面向用户的框架并非评估模型的理想工具。 理想情况下,每个模型构建者都应提供像 hip\-agent 这样的原生轻量级参考框架。原生参考框架如同工具解析器或聊天模板,它定义了模型训练时与世界交互的规范。该框架应独立于模型提供商的用户产品之外。它还能让新模型易于测试:用户可要求现有智能体将新模型作为子智能体运行。

相似文章

什么是Harness?

Hacker News Top

本文通过将AI代理的'Harness'与登山安全带进行比较,来解释其概念,详细介绍了系统提示和工具等组件,这些组件使AI模型能够作为代理运行。

Harness Handbook:使不断演化的智能体Harness可读、可导航、可编辑

arXiv cs.AI

Harness Handbook是一种以行为为中心的表示,通过静态程序分析和LLM辅助从智能体harness代码库中合成,帮助开发者和编码智能体定位实现特定行为的代码。它引入了行为引导的渐进式披露(BGPD),引导智能体从高层描述到相关实现细节,提高了定位准确性和编辑计划质量。

HarnessX:可组合、自适应且可演进的智能体夹具工坊

Hugging Face Daily Papers

HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。