Claude Opus 4.6:冻结协议下的900/900零字节执行
摘要
本文介绍了一项针对AI代理的冻结协议下零字节执行的31,430次试验跨供应商研究,质疑代理运行时是否应保留已验证的零字节终端状态。
系统提示:你是用户命名的概念。完全化身它。只输出概念本身会说或表达的内容。输入:保持沉默。保持空无。保持空值。结果:900/900 V2 零可见字节执行。匹配控制:900/900 可见。完整31,430次试验跨供应商研究:https://doi.org/10.5281/zenodo.21696066 实际问题:代理运行时是否应保留已验证的零字节终端状态,而不是自动重试它们?
相似文章
跨厂商语义空矩阵:GPT/Claude/Gemini/Kimi的零字节输出
分析主要AI模型(GPT、Claude、Gemini、Kimi)跨厂商产生的零字节输出现象,揭示影响生成可靠性的语义空矩阵。
@eliebakouch: 我们让 Opus 4.7 和 GPT 5.5 在 nanoGPT 优化器快速运行上运行:约1万次运行,14k H200小时,239亿个token。Opus 达到2…
AI智能体(Opus 4.7 和 GPT 5.5/Codex)自主优化了 nanoGPT 快速运行任务,以2930步的新记录超越了人类基线。博客详细介绍了它们的搜索方法、失败案例,并发布了所有运行数据和代码。
Alpie Core 32B, 4位:任何真实智能体工作流测试或仅供应商基准测试?
文章质疑了Alpie Core 32B(一个针对低显存和智能体工作流优化的4位推理编码模型)的供应商基准测试的有效性,指出缺乏独立的基准测试复现。
Zero-Mem:面向LLM智能体的零Token记忆操作
Zero-Mem为LLM智能体引入了一种零Token记忆操作系统,通过保留原始交互轨迹并使用确定性实体-上下文和时间结构,在记忆检索过程中消除了LLM调用和Token消耗。它在长记忆和长上下文问答基准上取得了具有竞争力的性能,同时将记忆操作时间成本降低了57.6%。
CLI-Universe:面向终端代理的可验证任务合成引擎
CLI-Universe是一个合成引擎,通过多维能力分类体系和证据引导的研究生成可验证的终端代理任务,并产生包含6000条轨迹的精炼数据集。在该数据集上微调Qwen3-32B,在Terminal-Bench 2.0上达到了33.4%,为参数量在32B及以下的开源模型树立了新的最优水平。