GPT-6.1 Sol 成本低廉。我们通过禁止它编写代码将其成本降低了77%
摘要
一项实际测试表明,在AI代理设置中,将GPT-6.1 Sol作为无写入权限的协调器,Qwen 3.8 27B作为工作器,可将成本降低77%,但会增加小任务的执行时间。
Sol 是本周显而易见的新协调器选择,因此对于运行协调器/工作器设置的人们,这是一个真诚的问题,附上我们使用它的第一天的数据。我们采取了严格的禁止策略:协调器读取、规划、委派和审查,它尝试的每次写入或shell调用都被拒绝。工作器是唯一接触文件的。理由是成本和纪律。昂贵的模型不应该花费令牌来输入代码,如果它能自己修复问题,它就会停止委派。
今天尝试了以GPT-6.1 Sol作为协调器,Qwen 3.8 27B在单个RTX 3090上作为工作器,在三个小型3D游戏上进行测试:
游戏 | Sol 全权处理 | 仅 Sol 协调 | 成本降低
--- | --- | --- | ---
Cut Pool | $0.39 | $0.05 | 87%
Bowling | $0.14 | $0.06 | 57%
Foosball | $0.22 | $0.06 | 73%
总计 | $0.75 | $0.17 | 77%
禁止的代价是时间。43分钟对比仅Sol的7分钟不到,因为本地卡设定了速度。在小事情上变得荒谬:如果协调器发现一个字符的拼写错误,它仍然必须将其作为任务发回给工作器。因此我对中间立场感到矛盾。允许协调器在某个大小限制下进行微小编辑?或者这只会再次打开它做所有事情的大门?如果你已经让Sol负责你的代理,你是否给了它写入权限?(免责声明:这是我正在开发的一个开源代理。如果有人需要,我很乐意在评论中分享细节。)
相似文章
GPT-6.1 Sol - 以更低成本在复杂工作中实现接近 Astra 的性能。
OpenAI 发布 GPT-6.1 Sol,这是一款在复杂编码、计算机使用和专业工作中以更低成本提供接近 Astra 性能的 AI 模型,支持多种推理任务。
GPT 6.1 Sol:以五分之一的价格实现接近Astra的智能水平
Simon Willison讨论了GPT 6.1 Sol的发布,这是一款在价格显著降低的同时提供接近Astra智能水平的AI模型。
GPT-6 Sol 在复杂任务上确认弱于 5.6 Sol,但在成本与效率方面胜出
GPT-6 Sol 在复杂任务上被确认弱于 GPT-5.6 Sol,但在成本与效率方面具有优势
@chooi_jeq: 在机器人任务中,GPT-6 Sol的得分是GPT-5.6 Sol的1.6倍,且成本降低47%,但低于帕累托前沿 …
GPT-6 Sol在机器人任务中实现了1.6倍的得分提升和47%的成本降低,但仍低于Opus 5.5的帕累托前沿。
GPT 6.1 Sol:接近Astra的智能,价格仅为五分之一
OpenAI推出GPT-6.1 Sol,这是一款升级的AI模型,以五分之一的价格提供接近GPT-6 Astra的智能,并在编码、专业任务和计算机使用方面有所改进。