28天使用GPT-5.6 Sol在Extra High模式下未达限制:一次受控执行的结果
摘要
作者报告了运行一个AI代理28天未达限制的结果,处理了数百万个令牌,缓存率高,并保持可验证的目标。讨论了上下文工程的挑战,并请求类似执行的比较。
又来了,目前已经运行了28天17小时,以下是我的思考。我试图讨论和比较不同的观点,每天我都看到更多关于限制的帖子。当大多数AI用户因为聊天丢失上下文、在几小时内用尽使用限制,或者看到他们的代理偏离并陷入循环而苦恼时,AutoNodo已经维持了28天在同一工程程序上的受控执行。活跃目标处理了14,212百万个输入令牌,缓存命中率为98.293%,并且采用失败即关闭的架构:如果系统无法通过客观证据证明一个标准已满足,它就不会将工作认证为完成。这不再是测试一个提示或让一个代理漂浮执行。这是大规模上下文系统工程:在数周内保留权威、状态、证据和方向,同时模型在可验证的增量上工作,而不会用更简单的目标替代原目标。问题不再是代理能生成代码多长时间。问题是它能保持有效轨迹多长时间而不丢失目标、降低证据或增加成本。对于那些在真实环境中构建或部署代理的人,我有兴趣比较方法:你们如何防止一个被困数天的代理最终优化指标而不是目标?例如:通过削弱断言、修改测试或缩小范围来制造一个PASS。在超过1,000轮次的执行中,你们如何保持前缀稳定以利用缓存,而不降级上下文、积累矛盾或增加API成本?有人记录过可比较的执行吗:在同一程序上数周、超过1,000轮次、恒定模型、超过98%的输入缓存且未达到Codex Pro的真实限制?
相似文章
GPT 5.6 Sol 基准测试
GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。
GPT-5.6 Sol 现在能以约每秒 750 tokens 的惊人速度运行
GPT-5.6 Sol 现以约每秒 750 tokens 的令人印象深刻的推理速度运行。
5.6 Sol 在通用工作中的潜力被低估(7分钟阅读)
OpenAI 发布了 GPT-5.6 Sol,这是一款旗舰模型,适用于跨应用和企业数据的长时间自主工作,配备超频模式(Ultra mode)及子代理,可实现更快、更强的结果。该模型内部被用于辅助训练 Luna,并在成本和性能上相较此前版本有显著提升。
@OpenAI: 部署后,我们应用了 GPT-5.6 Sol,通过使其自身运行更高效来推进效率前沿。…
OpenAI 部署了 GPT-5.6 Sol,通过改进的 GPU 内核和推测解码,实现了 20% 的服务成本降低和 15% 以上的 token 生成效率提升。
@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…
GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。