@nash_su: 巨硬出的这个东西有点意思 用训练模型的思路优化 skill,每次对skill的MD内容做一些调整,然后跑结果,好了就继续推进,这个思路蛮有意思
摘要
微软发布一个新工具,采用训练模型的迭代方法优化skill,每次调整markdown内容并测试结果,不断推进改进。
查看缓存全文
缓存时间: 2026/06/29 12:27
巨硬出的这个东西有点意思
用训练模型的思路优化 skill,每次对skill的MD内容做一些调整,然后跑结果,好了就继续推进,这个思路蛮有意思
https://t.co/PVs5eGN1Hd
相似文章
@NFTCPS: 微软搞了个东西叫 SkillOpt,思路挺野:把 agent 的技能文档当成神经网络一样来训练,有 epoch、batch、学习率、验证集,但一根模型权重都不碰。 它牛在哪?我给你拆三点: 训练只改一份 skill 文档,新的改动必须在验…
微软推出SkillOpt,一种将智能体技能文档像神经网络一样训练的方法,通过epoch、batch、学习率和验证集来进行优化,但不修改模型权重。在多项基准测试中取得最佳结果,可跨模型和工具迁移。
@FinanceYF5: 2/ SkillOpt:把文档当参数来训练 微软把 SKILL.md 当成可训练的模型参数——不改权重,只优化自然语言文档,validation gate 过滤每次改动。 6 个 Benchmark 52 连胜,GPT-5.5 直聊提升 …
微软提出SkillOpt方法,将文档作为可训练参数,通过优化自然语言文档而不改动权重来提升模型性能,在6个benchmark上取得52连胜,GPT-5.5提升23.5分,Claude Code提升19.1分。
@Xudong07452910: 让模型自己出题、自己解题、自己训练,最怕的就是把错误题目也一起学进去。 Qwen 团队这篇论文提出 Skill Self-Play,给模型的自我进化加入了一套会持续更新的技能库。 训练中有三个角色: Proposer 根据技能生成刚好有挑…
Qwen 团队提出 Skill Self-Play 框架,通过 Proposer、Solver 和动态技能控制器协同自我对弈,在工具调用和推理任务上显著提升模型能力。
@Datou: 微软还是爱惜羽毛的,刻意避开合成数据,只用人类数据训练出一个 base 模型,然后一生三,训练三个不同领域的专家模型,然后自己蒸馏自己,把三种能力蒸回 bese 模型(权重配比很考验经验),再强化学习一轮让蒸馏模型懂得看问题下菜碟灵活运用…
微软发布MAI-Thinking-1训练技术细节:使用纯人类数据训练基座模型,然后训练三个领域专家模型,通过蒸馏将能力合并回基底模型,再经强化学习使模型能灵活运用不同能力。
@BohuTANG: 之前还想跨模型互相做 Review,这个方式对我来说太慢了,现在发现了一个新的方式:/harden ,同一个模型两轮收敛,效果非常好 ,感兴趣的可以试试这个skill
BohuTANG introduces /harden, a method for same-model two-round convergence, and highlights the evot agent engine which completes complex tasks with fewer tokens and lower cost than alternatives like Claude Code.