28天使用GPT-5.6 Sol在Extra High模式下未达限制:一次受控执行的结果

Reddit r/AI_Agents 新闻

摘要

作者报告了运行一个AI代理28天未达限制的结果,处理了数百万个令牌,缓存率高,并保持可验证的目标。讨论了上下文工程的挑战,并请求类似执行的比较。

又来了,目前已经运行了28天17小时,以下是我的思考。我试图讨论和比较不同的观点,每天我都看到更多关于限制的帖子。当大多数AI用户因为聊天丢失上下文、在几小时内用尽使用限制,或者看到他们的代理偏离并陷入循环而苦恼时,AutoNodo已经维持了28天在同一工程程序上的受控执行。活跃目标处理了14,212百万个输入令牌,缓存命中率为98.293%,并且采用失败即关闭的架构:如果系统无法通过客观证据证明一个标准已满足,它就不会将工作认证为完成。这不再是测试一个提示或让一个代理漂浮执行。这是大规模上下文系统工程:在数周内保留权威、状态、证据和方向,同时模型在可验证的增量上工作,而不会用更简单的目标替代原目标。问题不再是代理能生成代码多长时间。问题是它能保持有效轨迹多长时间而不丢失目标、降低证据或增加成本。对于那些在真实环境中构建或部署代理的人,我有兴趣比较方法:你们如何防止一个被困数天的代理最终优化指标而不是目标?例如:通过削弱断言、修改测试或缩小范围来制造一个PASS。在超过1,000轮次的执行中,你们如何保持前缀稳定以利用缓存,而不降级上下文、积累矛盾或增加API成本?有人记录过可比较的执行吗:在同一程序上数周、超过1,000轮次、恒定模型、超过98%的输入缓存且未达到Codex Pro的真实限制?
查看原文

相似文章

GPT 5.6 Sol 基准测试

Reddit r/singularity

GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。

5.6 Sol 在通用工作中的潜力被低估(7分钟阅读)

TLDR AI

OpenAI 发布了 GPT-5.6 Sol,这是一款旗舰模型,适用于跨应用和企业数据的长时间自主工作,配备超频模式(Ultra mode)及子代理,可实现更快、更强的结果。该模型内部被用于辅助训练 Luna,并在成本和性能上相较此前版本有显著提升。