@KanikaBK: 微软刚刚投下了一枚重磅炸弹。他们让ChatGPT的准确率从41%跃升至80%,却没有动一个参数。这……
摘要
微软的SkillOpt系统通过将AI的技能文档视为一个从自身失败中学习的活模型,使ChatGPT准确率从41%提升至80%,在多个基准测试中取得了显著提升,且推理时零开销。
查看缓存全文
缓存时间: 2026/07/11 07:22
微软刚刚投下了一枚重磅炸弹。
他们让ChatGPT的准确率从41%跃升至80%,却未调整任何参数。
这套系统名为SkillOpt。
我很享受阅读这篇研究论文。
大多数构建者会错过它,因为他们认为更好的提示词=更好的智能体。
他们错了。
微软的方法将AI的技能文档视为一个从自身失败中学习的活模型。
↳ 轨迹采样:智能体记录成功与失败 ↳ 优化模型:分析结果并编辑技能文档 ↳ 验证关卡:只接受能提升性能的变更
这是自然语言的梯度下降算法。
在6个基准测试中的结果:
↳ ALFWorld:准确率从70%提升至85% ↳ 直接对话:准确率提升23个百分点 ↳ 零推理时间开销 ↳ 优于所有人工编写的技能
你只需优化一次。智能体将永远使用那套战术手册。
战术手册通过反馈自我训练。
这就是如何构建无需修改代码就能持续进步的智能体。
相似文章
利用自定义GPT提升开发者生产力
国际游戏公司Paf通过在其100人工程团队中部署ChatGPT Enterprise,并为专业编码任务创建了85多个自定义GPT,取得了显著的开发者生产力提升。该公司报告GPT-4的准确度比竞争对手高25%,并将该技术集成到grit:lab编码学院中,以培养新一代开发者。
OpenAI员工总结ChatGPT即将推出的速度改进
一位OpenAI员工总结了ChatGPT即将推出的速度改进,并强调了预期的性能提升。
我安装了10个“必备”ChatGPT技能。大多数都没用。
对10个被广泛推荐的ChatGPT技能进行的实际评测发现,大多数并非原生适用,需要调整、重建,或依赖编码智能体环境。作者对每个技能进行了排名,并提供了真正有效的使用建议。
GPT-5工作版解析:企业如何使用GPT-5
OpenAI发布了一份综合报告,分析了ChatGPT在工作场所的采用模式,显示28%的受雇成年人在工作中使用ChatGPT(两年前为8%),43%的美国知识工作者使用AI工具,生产力显著提升,且采用率存在人口统计差异。
ChatGPT can now complete tasks on your computer
OpenAI's new ChatGPT feature allows it to directly control browsers and desktop applications, enabling automated tasks like form filling and data entry.