标签
比较 GPT-5.5 Pro 和 GPT-5.6 Sol 在 MineBench 基准测试上的性能
Atomic Chat的一项物理测试显示,GPT-5.6 Sol Ultra的价格是GPT-5.5的三倍,但在HTML5 canvas物理演示中并无明显优势,突显出尽管成本更高,但在物理模拟方面存在弱点。
该推文描述了一种模式,使用 Meta LOOP,以 Fable 5 作为顾问,GPT-5.5 作为协调者,Gemini 3.5 Flash 作为执行者,并将其转换为可安装的 Agent 技能。
本文对 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5 进行了基准测试,让每个模型根据单一提示构建三个交互式应用(3D 魔方、粒子重力沙箱、打砖块游戏),比较它们的一次性编码能力。
OpenAI 宣布推出 GPT-Live,这是一种全新的全双工语音模型,通过允许同时收听和说话,实现更自然、实时的对话,后端模型为 GPT-5.5。
据报道,Meta名为Watermelon的新AI模型在基准测试中达到了与GPT-5.5相当的性能,标志着语言模型能力的重大进步。
atomic.chat进行了一项对比,显示Claude Sonnet 5在三个物理编码演示中与GPT 5.5表现相当,但成本低6倍,且使用的token数少于其他模型。
OpenAI宣布GPT-5.5 Instant是其使用量最大的模型,但批评者认为使用数据被夸大了,因为免费用户被迫使用该模型。
DukaanBench在资本限制条件下评估LLM对印度杂货店的管理能力,包括库存、营销和易腐品处理;GPT 5.5成功通过测试。
OpenAI 发布了更新版 GPT-5.5 Instant,改进了理解意图、处理复杂约束以及提供更好建议的能力。
OpenAI 宣布推出 GPT-5.5 Instant,在健康相关问题上的表现现已媲美前沿思考模型,对所有免费用户开放,并在识别紧急护理需求和解释不确定性方面有所改进。
OpenAI宣布通过使用GPT-5.5 Instant,在ChatGPT中显著提升了健康相关回答的质量,其准确性与前沿模型相当,并通过医生主导的评估将事实性问题减少了71%。
一个标记为“GPT 5.5”的模型出现在 Cerebras 通过 OpenRouter 的统计中,暗示可能有一个新 GPT 迭代的秘密发布或测试阶段。
作者构建了一个基于GPT-5.5的自主Codex代理循环运行器,用于测试,目前处于公开测试阶段,提供50次免费运行机会。
Kimi K2.7 Code 是一款新AI模型,据称在涉及物理模拟的代码生成任务中,性能达到GPT-5.5级别,但成本仅为其三倍更便宜。
Sentra的Code Memory系统将GPT-5.5在Terminal-Bench 2.1上的性能提升至88.31%,而成本仅为四分之一,超越了Anthropic受限的Mythos 5模型。该记忆层减少了52%的输入Token,成本降低了72.6%,同时提升了任务成功率。
OpenAI 正在准备一款代号为 5.6 的新 AI 模型,据称相比 GPT-5.5 有显著改进,同时该公司的 IPO 时间线可能受到 AI 快速进步和算力需求的影响。
据报道,DeepSeek V4 Pro 在精确度上优于 GPT-5.5 Pro,这标志着模型准确性方面的重大进步。
OpenAI停止了对gpt-5.3-codex模型的支持,影响了OpenClaw用户,他们现在需要通过Codex切换到gpt-5.5模型。
Codex已达500万用户,正准备重置限制,提到了GPT 5.5和快速模式。