mimeo: 将公共专家语料库编译为代理技能并测试可迁移内容

arXiv cs.AI 论文

摘要

mimeo 是一款开源工具,它将公共专家语料库编译为代理技能,并评估人工智能代理的知识获取、人格识别和判断迁移能力。

arXiv:2609.00453v1 公告类型:新 摘要:为代理提供关于特定专家的文件可以提供难以找到的材料,生成可识别的人格,或改变代理的决策。这些是不同的主张。我们逐一测试。mimeo 是一款开源工具,它查找个人的公开作品,将每个提取的引文与缓存的源文本进行核对,并生成一个代理可以加载的文件。八次记录构建平均调用38次模型;核对过程拒绝了13.2%的提取引文。我们使用一个编码代理框架测试了四个专家文件。知识获取最为明确:mimeo 回答了所有20个晦涩、引文密集的问题;没有闭卷条件回答超过10个。对相同页面进行关键词搜索(BM25)回答了15-17个,这个差距本样本无法解决。基于事实显示出一个明确的好处:基于模型记忆撰写的人格在每个评分者下的20个回答中错误陈述了1-4个有记录的位置;普通代理和 mimeo 从未这样做。每个人格在简短的开放提示下都很容易被发现,添加任务材料使识别度降低了18-23个百分点。mimeo 并不比基于记忆的档案更容易识别。判断迁移仍未解决,因为两项测试都达到了上限:每个条件都发现了工程任务中植入的94-97%的问题,并在16个新应用场景中得分94-100%。一个由AI评判的'听起来像专家'的分数随着评判者而变化:四个评判者中两个偏好基于模型刻板印象的答案,而两个在相同文本上没有发现差异。这是一个警示,反对依赖单一的AI评判者。证据支持 mimeo 作为一个人的紧凑、可检查的参考,而不是其判断的已证实迁移。工具包和专家档案:https://github.com/K-Dense-AI/mimeo
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:03

# 将公开专家语料编译为智能体技能并测试可迁移性
来源:https://arxiv.org/html/2609.00453

###### 摘要
为智能体提供一份关于特定专家的文件,可能提供难以获取的材料、塑造可辨识的人格特征,或改变智能体的决策——这是三种不同的假设。我们对此逐一验证。`mimeo` 是一款开源工具,可检索个人公开作品、将提取的引文与缓存源文本进行校验,并生成智能体可加载的文件。八次记录构建平均调用38次模型;校验过程剔除了13.2%的提取引文。我们使用四个专家文件和一个编码智能体测试环境进行测试。知识获取效果最为显著:`mimeo` 能回答全部20个依赖引文的冷门问题;而所有闭卷条件无一超过10分。对同一批页面进行关键词搜索(BM25)可回答15-17个问题,本样本量尚不足以分析此差异。文本依据显示出明确优势:基于模型记忆撰写的人格描述在所有评分标准下均出现1-4处与文档记载立场不符的回答,而普通智能体与`mimeo`则从未出现此类错误。在简短开放提示词中,每种人格都易于识别,但添加任务材料后识别率降低了18-23个百分点。`mimeo` 的可识别性并不高于基于记忆生成的简介。判断迁移性尚未定论,因为两项测试均触及上限:所有条件在工程任务中都发现了94-97%的预设问题,在16项新应用场景中得分94-100%。AI评判的"专家风格相似度"得分因裁判而异:四名裁判中有两名偏好基于模型刻板印象的答案,而另外两名对相同文本未发现差异。这警示我们不应依赖单一AI裁判。现有证据支持将`mimeo`视为关于某人的紧凑、可检视参考资料,而非已证实的判断力迁移。

工具包与专家简介:https://github.com/K-Dense-AI/mimeo
![[未标注图片]](https://arxiv.org/html/2609.00453v1/figures/mimeo-explainer.png)

## 1引言
假设一家小型AI实验室要求智能体选择下一研究方向。实验室首先提供一份基于理查德·萨顿公开作品编译的多页文件。该文件可能帮助智能体引用萨顿观点、使回答具有可辨识的萨顿风格,或改变其推荐的研究方向。这是三种不同结果:*知识获取*、*可辨识人格*和*判断迁移*。更深层的问题是如何编码专家知识,使智能体在工作中能运用这些知识。公开记录只捕捉专家选择书写或讲述的内容,而非数十年实践所传授的全部。部分专业知识具有隐性特征:人们能使用它却无法完全表述[1 (https://arxiv.org/html/2609.00453#bib.bib1)]。专业知识包含事实、流程以及选择能力:关注什么、值得解决哪个问题、如何推进、何时停止。我们用"品味"指代这种选择能力。基础模型可能存在多种行动路径;专家技能可帮助其做出选择。文本文件能否实现这一点正是本文探讨的判断迁移问题。

智能体产品正越来越多地从`AGENTS.md`和`SKILL.md`等markdown文件中读取项目指令与可复用技能[2 (https://arxiv.org/html/2609.00453#bib.bib2),3 (https://arxiv.org/html/2609.00453#bib.bib3)]。我们推出`mimeo`——一款将姓名与公开网页资源转化为上述文件的开源工具。它通过识别目标人物、检索八类素材、整合重复观点、校验长引文与缓存源文本、并依据编辑清单修订草稿来生成输出。虽然文件包含来源引用,但并非经过验证的人物传记。缓存文本可能只是节选,而文本匹配既不能证明说话者身份,也无法确认引文周围主张的合理性。已发布示例库中还存在指向无效地址的源标识符。在一次未发布的重新运行中,校验过程通过了某段引文,但文件仍将该引文归于错误来源。

我们使用一个编码智能体测试环境、四份原创专家简介及四个LLM裁判(第3节[3 (https://arxiv.org/html/2609.00453#S3)])验证上述三种结果。语料获取显然能提高对冷门表述的记忆召回率,但简单的BM25关键词搜索能恢复大部分收益。文本依据显示出独特优势:当被问及文献记载的冷门观点时,无来源的人格描述会提及文档未记载的立场,而普通智能体与`mimeo`均拒绝回答。在简短开放提示词中,无论简介来自文献还是模型记忆,所有人格都具有可辨识性;任务材料会使所有人格更难识别。判断迁移性仍无定论,因为两项测试均触及上限。测量结果本身也取决于裁判:两名裁判在汇总的"专家风格相似度"评分中偏好基于刻板印象的答案,而另外两名对相同文本未发现差异。

这些结果支持将`mimeo`视为关于某人的紧凑、可检视参考资料。但未能证明其能迁移个人判断力,或在需要时比查阅源材料更有效。

#### 相关工作
手工设计的角色提示有时有效,多数情况下无效[4 (https://arxiv.org/html/2609.00453#bib.bib4),5 (https://arxiv.org/html/2609.00453#bib.bib5),6 (https://arxiv.org/html/2609.00453#bib.bib6),7 (https://arxiv.org/html/2609.00453#bib.bib7),8 (https://arxiv.org/html/2609.00453#bib.bib8)]。成对评估智能体技能的结果同样存在矛盾:一项研究在自动验证任务中显示显著提升[9 (https://arxiv.org/html/2609.00453#bib.bib9)],而其他研究在实际软件工程案例中几乎未发现效果[10 (https://arxiv.org/html/2609.00453#bib.bib10),11 (https://arxiv.org/html/2609.00453#bib.bib11)]。`mimeo`探讨的是另一问题:当文件是带来源引用的多页专家简介(而非角色标签或针对任务分数优化的流程)时,什么能发生迁移。附录A [A1 (https://arxiv.org/html/2609.00453#A1)]提供了完整讨论。

## 2 `mimeo`系统
`mimeo`是Python命令行工具。命令`mimeo "Richard Feynman"`会通过八个缓存阶段创建可直接安装的技能目录。该工具首先识别人物,然后搜索文章、演讲、访谈、播客、框架、书籍、论文和档案。它抓取可用文本,将每条记录转化为标记的观点与引文,整合跨记录的重复观点,最后生成`SKILL.md`、`AGENTS.md`或两者。最终编辑循环依据清单修订文件。每个阶段都采用缓存机制,中断或修改运行时仅重复输入已改变的工作。附录B [A2 (https://arxiv.org/html/2609.00453#A2)]详述完整流程。

输出为带标题章节的文本,智能体像阅读其他指令文件一样读取。以下是为安德烈·卡帕西生成的文件开头:
\#像安德烈·卡帕西那样思考
\#\#核心原则
*从零构建以理解:要真正掌握复杂系统,必须手动实现核心算法,避免依赖自动化工具[……]*
\#\#他们反对的反模式
*盲目追求全自动:信任AI生成大规模未验证输出(如万行代码变更)会造成人类验证瓶颈。*
附录O [A15 (https://arxiv.org/html/2609.00453#A15)]提供了带源引用的更长节选。

引文阶段会将每个引用段落与其标注记录的缓存文本进行校验,剔除不匹配的段落。匹配仅使引文"被证实"而非"被验证":它不能证明说话者身份、引文周围主张的合理性,或记录是否属于正确人物[12 (https://arxiv.org/html/2609.00453#bib.bib12),13 (https://arxiv.org/html/2609.00453#bib.bib13)]。实验E1和E3测试了这些保障措施。

八次记录重新运行平均调用37.8次LLM,耗时7.1分钟,引文匹配从311个提取片段中移除了41个(13.2%)。禁用匹配时,36条引文中有2条为虚构句子,均归属于在世人物;启用匹配后,34条引文中无虚构内容,但有一条匹配引文仍被错误归属。校验能发现实际错误,但无法将输出转化为经验证的传记。附录C [A3 (https://arxiv.org/html/2609.00453#A3)]和D.4 [A4.SS4 (https://arxiv.org/html/2609.00453#A4.SS4)]提供了完整结果。

## 3结果
六项研究分别验证三种假设,另有三个辅助分支测试熟悉度、任务语境和部署情况。E1/E3检验技术产物本身;其余测试行为表现。表1 [3 (https://arxiv.org/html/2609.00453#S3.T1)]将各研究按所验证假设分组。除E4b的熟悉度跟踪外,行为研究使用一个智能体(claude-sonnet-5)和四位原创专家。四种主要条件为:无技能、单行人格描述、基于记忆的简介、`mimeo`。四个模型对结果进行评分。当书面答案固定正确答案时(E4、E6及E2覆盖率评估中的两个模型),我们称其为"评分者";当评分基于自身比较时(识别度与成对质量),则称为"裁判"。仅当所有指定模型达成一致时,我们认为结果成立。

图1 [3 (https://arxiv.org/html/2609.00453#S3.F1)]总结主要结果;附录完整呈现各设计、估计和方案。参照图注:
图1:测量方式决定迁移内容。灰色标记对照组(无技能、单行人格、基于记忆简介);橙色标记BM25检索;蓝色标记`mimeo`。(a)每点代表一个评分者对相同20题的评分。(b)三种任务设置下对加载专家的盲测识别:重复设置答案的工程任务、简短开放提示词、附加证据包的相同提示词。线条为四裁判平均值,小点为单裁判结果,虚线为25%随机概率线。(c)每点代表一个评分者下的单一条件。重复评分单独显示,不作为独立数据处理。

表1:研究概览,按验证假设分组。E1和E3检验技术产物及其保障措施;其余在使用四位专家的单一编码智能体环境中测试行为。附录完整呈现各设计、估计和方案。

### 3.1知识获取:语料有效,但蒸馏效果待验证
技术产物包含可检视的源引用。E1/E3说明了引文校验的重要性(第2节[2 (https://arxiv.org/html/2609.00453#S2)])。在`mimeo`条件下,38条E4引文中有35条的措辞出现在缓存语料中。运行时检索获取了43条中的37条,而闭卷条件为28-50%。匹配仅使引文"被证实"而非"被验证"(第2节)。

E4询问20个广泛流传的问题和20个源自单条记录的问题。所有评分者给`mimeo`在单记录集上打20/20分,而任何闭卷条件均未超过10/20。由于每个问题都基于构建`mimeo`文件的同源材料,`mimeo`的满分源于设计而非测试(附录E.1 [A5.SS1 (https://arxiv.org/html/2609.00453#A5.SS1)])。问题实际测试的是所有非基于答案钥匙构建的条件。因此,语料获取相比凭记忆回答改善了冷门内容的召回率,但尚未确立蒸馏技术的优势。仅给定问题时,对同批缓存记录进行简单BM25搜索可回答15-17个。`mimeo`领先3-5题且无失分,但精确配对测试无法区分两者。样本量太小,无法判断静态简介是否比需要时查阅段落更优。

闭卷条件的失败模式不同。在这20题中,无技能的智能体在所有评分者下从未提供文档记载以外的立场,`mimeo`同样如此;单行人格描述有1-3处错误,基于记忆的简介有3-4处错误,且所有评分者结果一致。无依据的人格文件使智能体从拒绝回答变为错误指出立场。评分者使用的是肯定式答案钥匙,因此该计数包含提供不同合理立场及与钥匙矛盾的答案(附录E.1)。针对20个探针的零错误对比三处错误本身不具备统计显著性。支持该假设的证据是所有评分者在两种人格条件下记录了相同模式。这是文献依据在人格描述中明确优于基于模型记忆撰写的唯一指标。

### 3.2可辨识人格:任务材料削弱所有人格
E5提出六个无附加材料的简短咨询问题。所有人格条件均表现出高于25%随机概率的可识别性,无论是单行提示、基于记忆的简介还是`mimeo`。基于文献的简介相比基于记忆的简介未显示明显优势。E5b保持请求不变,添加6.9-7.1千字符的任务证据。此时单行人格描述识别率下降20点,基于记忆的简介下降18点,`mimeo`下降23点(裁判平均值)。每位裁判均记录了所有人格的识别率下降。将六个任务差异的所有可能符号翻转组合,得到精确p=.031,而每个点估计值仍高于随机概率。人格依然可识别,但任务材料与之竞争。

在E2更丰富的工程任务中识别度更弱。三代测试中,裁判在25-31%的回答中识别出`mimeo`。通过任务均值重采样形成的每个区间均包含25%随机概率线。该测量是在四个随机排列姓名间的强制选择,裁判无法拒绝回答。结果是任务材料塑造的回答中存在微弱、未定论的人格信号。

### 3.3判断迁移:两项测试均触及上限
E2中,四个工程任务设有固定预设问题清单。跨三代测试和两个评分者,所有条件均发现94-97%的清单项目。等效性检验排除了`mimeo`与每个基线在这类任务上存在十个百分点的覆盖率差异。但无技能时的覆盖率已达95-97%,仅剩3-5个百分点的提升空间。E2排除了大规模覆盖率损失的可能性,但无法证明简介是否改变了更艰难的决策。

E6取消引文要求,提出16个需要应用语料原则的新问题。同样,包括无技能和BM25检索在内的所有条件,在所有评分者下得分94-100%。在无技能条件下,智能体几乎总能给出符合钥匙的推荐。因此E6既未提供支持也未提供反驳判断迁移的证据。

成对建议质量和"专家风格相似度"判断同样未能解答问题:附录L [A12 (https://arxiv.org/html/2609.00453#A12)]阐述了统计方法,附录F [A6 (https://arxiv.org/html/2609.00453#A6)]显示这些结果取决于所询问的裁判。

## 4讨论
#### 什么发生了迁移?
语料获取有效:`mimeo`提供了模型常无法回忆的冷门表述。未解决的问题是静态蒸馏文件是否比需要时查阅同等材料更优。人格可识别是独立结果。可识别性不一定特属于基于文献的简介。简短提示词暴露所有人格,基于记忆的简介至少与`mimeo`同样可识别,任务材料削弱所有三种人格。判断迁移仍无定论。工程和应用测试均触及上限。它们排除了E2在这些任务上的大幅覆盖率损失,但留给观察提升的空间很小。简介可以为智能体提供有用材料而不使其按专家方式决策。它也能改变回答的语气而不改善推理。在工程任务中,较弱的人格可能反映了能力限制而非风格选择。

相似文章

mattpocock/skills

GitHub Trending (daily)

该开源仓库提供了一套可组合的 AI 代理技能与提示词,专为 Claude Code 和 Codex 等编程助手打造,旨在提升模型对齐效果、减少冗长输出,并优化整体工作流。