@AIatMeta:作为对我们推进AI研究前沿进展的检验,今年6月,我们派出了下一代自主……
摘要
Meta的自主AI研究系统AIRA₃在一场由NVIDIA主办的Kaggle竞赛中排名第8(约4000支参赛队伍),赢得金牌。该竞赛旨在对300亿参数的Nemotron模型进行微调,AIRA₃的表现优于拥有相同工具访问权限的人类竞争者。
为检验我们在推进AI研究前沿方面的进展,今年6月,我们派出了下一代自主AI研究系统AIRA₃,参加由NVIDIA主办的一场实时Kaggle竞赛,任务是对300亿参数的Nemotron模型进行微调。这项挑战旨在提升模型的推理能力——所有参赛者都能获取相同的信息,并在一个私有测试集上接受外部评分。AIRA₃在约4000支参赛队伍中获得第8名并赢得金牌,表现优于那些拥有相同前沿工具访问权限的人类参赛者。我们认为,这可靠地表明AIRA₃能够在改进AI模型的特定能力方面达到与人类专家相近的水平。
相似文章
Meta追赶AI的内幕
一份关于Meta在AI领域追赶努力的详细报告,包括招募Alexandr Wang和发布Muse Spark模型,对其进展评价不一。
@METR_Evals: 一家AI公司是否可能失去对其自身代理的控制?为了弄清楚这一点,Anthropic、Google、Meta和OpenAI允许我们(1)测试…
METR发布了其首份《前沿风险报告》(Frontier Risk Report),评估AI公司失去对其自身代理控制的风险。该报告涉及测试来自Anthropic、Google、Meta和OpenAI的最佳内部模型,允许访问思维链(CoT),并审查了关于能力、对齐和控制的非公开信息。
@dair_ai: Meta的新论文:Agentic Discovery of Neural Architectures。这是一个热门的新研究领域!请密切关注。
Meta的新论文介绍了一个智能体系统,它能在24小时的计算预算内自主发现神经架构,在350M、1B和3B规模上超越Llama 3.2。
@rohanpaul_ai: Meta、斯坦福、谷歌等多家顶级实验室的新论文提出了AutoResearchClaw。表明自动化研究改进…
来自Meta、斯坦福和谷歌的一篇新论文提出了AutoResearchClaw,该方法通过整合故障恢复、辩论和选择性人工输入来改进自动化研究。它在ARC-Bench上以54.7%的优势超越了AI Scientist v2,并揭示了当受到过程约束而非无限自由时,自主性会得到增强。
NVIDIA 刚刚宣布发布 Nemotron 3 Ultra(2分钟阅读)
Anthropic 发布了其最智能的模型 Claude Opus 4.5,在 Artificial Analysis Intelligence Index 上获得 70 分,仅次于 Gemini 3 Pro。该模型在编码和智能体任务方面取得了显著进步,同时降低了每个token的价格,并保持了强劲的安全性能。