更新:小模型程序性技能迁移测试的首批人工结果
摘要
本文报告了在小AI模型上测试程序性技能迁移实验的首批人工结果,提供了关于技能如何在模型间迁移的见解。
暂无内容
相似文章
从原始经验到技能消费:模型生成智能体技能的系统研究
本文系统评估了语言智能体的模型生成技能,涵盖经验生成、提取和消耗的完整生命周期,发现技能平均有益但存在显著的负迁移,从而引出一种提高技能质量的元技能。
一种无需微调测试小模型技能迁移的盲视范式
提出一种使用Three.js的盲视觉范式,用于测试从大模型提取的过程性脚手架能否在无需微调的情况下提升小模型输出,并由盲评模型验证。
WikiSkill让一个9B模型击败了27B对手,但一个转移的技能使Gemini从50.5%降至18.1%
Google Research的WikiSkill预印本展示了将执行历史编译成技能文件可以让一个9B AI模型在基准测试中超越27B模型,突出了程序记忆和技能转移在代理性能中的作用。
预印本表明,具备进化技能的小模型能超越无此技能的大模型。那么,什么应该持久化?
WikiSkill通过持久化维基来进化和转移技能,显示拥有此类技能的小模型在基准测试中优于无此技能的大模型,引发了关于AI代理中哪些知识应持久化的疑问。
SkillEvolBench:从情景经验到程序技能的进化基准测试
SkillEvolBench 是一个诊断性基准,用于评估大语言模型代理是否能够将情景经验提炼为可重用的程序技能。它包含六个环境中的180个任务,并发现当前代理通常难以形成稳健的可重用技能,原始轨迹重用往往优于提炼后的技能。