@KanikaBK: 微软刚刚投下了一枚重磅炸弹。他们让ChatGPT的准确率从41%跃升至80%,却没有动一个参数。这……

X AI KOLs Timeline 论文

摘要

微软的SkillOpt系统通过将AI的技能文档视为一个从自身失败中学习的活模型,使ChatGPT准确率从41%提升至80%,在多个基准测试中取得了显著提升,且推理时零开销。

微软刚刚投下了一枚重磅炸弹。 他们让ChatGPT的准确率从41%跃升至80%,却没有动一个参数。 这个系统就是SkillOpt。 我很享受阅读这篇研究论文。 大多数开发者会错过这一点,因为他们认为更好的提示词 = 更好的智能体。 他们错了。 微软的方法将AI的技能文档视为一个从自身失败中学习的活模型。 ↳ 试运行:智能体捕获成功与失败 ↳ 优化模型:分析结果并编辑技能文档 ↳ 验证关卡:只接受能提升性能的更改 这就是自然语言的梯度下降。 在6个基准测试中的结果: ↳ ALFWorld:70% → 85% 准确率 ↳ 直接对话:准确率提升23个百分点 ↳ 推理时零开销 ↳ 超越了所有人工编写的技能 只需优化一次,智能体将永远运行那个行动手册。 行动手册通过反馈自我训练。 这就是如何构建真正无需修改代码就能不断提升的智能体。
查看原文
查看缓存全文

缓存时间: 2026/07/11 07:22

微软刚刚投下了一枚重磅炸弹。

他们让ChatGPT的准确率从41%跃升至80%,却未调整任何参数。

这套系统名为SkillOpt。

我很享受阅读这篇研究论文。

大多数构建者会错过它,因为他们认为更好的提示词=更好的智能体。

他们错了。

微软的方法将AI的技能文档视为一个从自身失败中学习的活模型。

↳ 轨迹采样:智能体记录成功与失败 ↳ 优化模型:分析结果并编辑技能文档 ↳ 验证关卡:只接受能提升性能的变更

这是自然语言的梯度下降算法。

在6个基准测试中的结果:

↳ ALFWorld:准确率从70%提升至85% ↳ 直接对话:准确率提升23个百分点 ↳ 零推理时间开销 ↳ 优于所有人工编写的技能

你只需优化一次。智能体将永远使用那套战术手册。

战术手册通过反馈自我训练。

这就是如何构建无需修改代码就能持续进步的智能体。

相似文章

利用自定义GPT提升开发者生产力

OpenAI Blog

国际游戏公司Paf通过在其100人工程团队中部署ChatGPT Enterprise,并为专业编码任务创建了85多个自定义GPT,取得了显著的开发者生产力提升。该公司报告GPT-4的准确度比竞争对手高25%,并将该技术集成到grit:lab编码学院中,以培养新一代开发者。

GPT-5工作版解析:企业如何使用GPT-5

OpenAI Blog

OpenAI发布了一份综合报告,分析了ChatGPT在工作场所的采用模式,显示28%的受雇成年人在工作中使用ChatGPT(两年前为8%),43%的美国知识工作者使用AI工具,生产力显著提升,且采用率存在人口统计差异。

ChatGPT 数据分析功能改进

OpenAI Blog

# ChatGPT 数据分析功能改进 来源:[https://openai.com/index/improvements-to-data-analysis-in-chatgpt/](https://openai.com/index/improvements-to-data-analysis-in-chatgpt/) 这些改进建立在 ChatGPT 理解数据集并完成自然语言任务的能力之上。首先,上传一个或多个数据文件,ChatGPT 将通过代表您编写和运行 Python 代码来分析您的数据。它可以处理多种数据任务,如合并和清理大型数据集

人们如何使用 ChatGPT

OpenAI Blog

OpenAI 发布了迄今为止规模最大的 ChatGPT 使用情况研究,分析了来自 7 亿周活跃用户的 150 万次对话,揭示采用率已大幅扩大,性别差距缩小,在中低收入国家的使用量增加。该研究表明 75% 的对话集中在信息查询和写作等实际任务上,其中 30% 为工作相关,70% 为个人使用,这证明了 ChatGPT 在两个领域创造经济价值的作用。