arc-agi-3

标签

Cards List
#arc-agi-3

关于GPT-6 Astra 98.6% ARC AGI-3:不要轻信炒作

Reddit r/LocalLLaMA · 2天前

文章警告不要炒作GPT-6 Astra的ARC AGI-3结果,指出Nvidia使用AVO达到了100%的成就,而OpenAI使用了非标准的测试环境。

0 人收藏 0 人点赞
#arc-agi-3

Astra不仅在ARC-AGI-3上达到饱和,而且使用的操作比普通人类更少

Reddit r/singularity · 3天前 缓存

GPT-6 Astra在ARC-AGI-3基准测试中取得了最先进的分数,使用Provider Adapter接口得到99.9%的分数,并展示了比人类测试员更少的动作。该模型展示了将不熟悉的环境转换为紧凑符号世界模型以实现高效规划的能力。

0 人收藏 0 人点赞
#arc-agi-3

Prime Agent: 一个自我改进的RLM框架

Hugging Face Daily Papers · 2026-08-24 缓存

Prime Agent 是一个开源框架,它使用递归子代理和持久化计算来扩展语言模型在编码和推理任务中的长期能力,显著提高了在ARC-AGI-3等基准测试上的性能。

0 人收藏 0 人点赞
#arc-agi-3

Nvidia刚刚表明,环绕AI模型的系统,而非模型本身,才是真正的英雄

TechCrunch AI · 2026-08-21 缓存

Nvidia的研究表明,围绕AI模型设计精良的系统,而非模型本身,能显著提升长期任务的表现,其中Claude Opus 5在ARC-AGI-3基准测试中获得了满分。

0 人收藏 0 人点赞
#arc-agi-3

NVIDIA的编码代理在ARC-AGI-3交互式推理基准测试中获得满分100%

Reddit r/singularity · 2026-08-21

NVIDIA的编码代理在ARC-AGI-3交互式推理基准测试中取得了100%的满分,展示了先进的AI推理能力。

0 人收藏 0 人点赞
#arc-agi-3

Claude Opus 5 + Claude Code + 1 Skill 在 ARC AGI 3(公共集)上得分 100%

Reddit r/ArtificialInteligence · 2026-08-20

Claude Opus 5,连同 Claude Code 和一个技能,在 ARC AGI 3 基准的公共集上得分 100%,表明该基准可能没有想象中那么具有挑战性。

0 人收藏 0 人点赞
#arc-agi-3

@Saboo_Shubham_: 疯狂的时代。Anthropic: Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6。Tibo: 我改了两个设置,GPT-5.6 Sol 就成为 SoTA 了

X AI KOLs Following · 2026-07-30 缓存

Anthropic 的 Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6,但 Tibo 声称通过涉及多上下文推理和规范压缩的两个设置更改,GPT-5.6 Sol 成为了 SoTA。

0 人收藏 0 人点赞
#arc-agi-3

@sama: 哥布林级别的博文

X AI KOLs · 2026-07-30 缓存

声称GPT-5.6 Sol通过使用规范压缩实现跨多个上下文窗口的推理,在ARC-AGI-3上达到了最先进水平。

0 人收藏 0 人点赞
#arc-agi-3

@OpenAI:基准分数既反映模型本身,也反映用于运行模型的测试框架和设置。对于长时间运行的智能体,保留…

X AI KOLs · 2026-07-29 缓存

OpenAI透露,启用保留推理和上下文压缩使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提升了三倍,凸显了测试框架设置对模型性能测量的显著影响。

0 人收藏 0 人点赞
#arc-agi-3

@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…

X AI KOLs · 2026-07-29 缓存

GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。

0 人收藏 0 人点赞
#arc-agi-3

启用两项设置使我们的ARC-AGI-3基准测试得分提高了三倍

OpenAI Blog · 2026-07-29 缓存

OpenAI发现,在API工具中启用保留推理和压缩设置,使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提高了三倍,同时将输出令牌减少了6倍,表明基准测试性能在很大程度上受工具设计影响。

0 人收藏 0 人点赞
#arc-agi-3

Schema Harness 在 ARC-AGI-3 Public 上达到约99%

Hacker News Top · 2026-07-16 缓存

Schema 推出了一种新的 Harness,它使用 Claude Opus 4.8 和 Fable 5 等前沿模型,在 ARC-AGI-3 Public 集上实现了约99%的准确率,通过改进模型周围的流程,而非修改权重。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈