arc-agi-3

标签

Cards List
#arc-agi-3

@Saboo_Shubham_: 疯狂的时代。Anthropic: Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6。Tibo: 我改了两个设置,GPT-5.6 Sol 就成为 SoTA 了

X AI KOLs Following · 12小时前 缓存

Anthropic 的 Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6,但 Tibo 声称通过涉及多上下文推理和规范压缩的两个设置更改,GPT-5.6 Sol 成为了 SoTA。

0 人收藏 0 人点赞
#arc-agi-3

@sama: 哥布林级别的博文

X AI KOLs · 13小时前 缓存

声称GPT-5.6 Sol通过使用规范压缩实现跨多个上下文窗口的推理,在ARC-AGI-3上达到了最先进水平。

0 人收藏 0 人点赞
#arc-agi-3

@OpenAI:基准分数既反映模型本身,也反映用于运行模型的测试框架和设置。对于长时间运行的智能体,保留…

X AI KOLs · 14小时前 缓存

OpenAI透露,启用保留推理和上下文压缩使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提升了三倍,凸显了测试框架设置对模型性能测量的显著影响。

0 人收藏 0 人点赞
#arc-agi-3

@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…

X AI KOLs · 14小时前 缓存

GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。

0 人收藏 0 人点赞
#arc-agi-3

启用两项设置使我们的ARC-AGI-3基准测试得分提高了三倍

OpenAI Blog · 23小时前 缓存

OpenAI发现,在API工具中启用保留推理和压缩设置,使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提高了三倍,同时将输出令牌减少了6倍,表明基准测试性能在很大程度上受工具设计影响。

0 人收藏 0 人点赞
#arc-agi-3

Schema Harness 在 ARC-AGI-3 Public 上达到约99%

Hacker News Top · 2026-07-16 缓存

Schema 推出了一种新的 Harness,它使用 Claude Opus 4.8 和 Fable 5 等前沿模型,在 ARC-AGI-3 Public 集上实现了约99%的准确率,通过改进模型周围的流程,而非修改权重。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈