标签
Harrison Chase宣布了一个用于检测生产环境代理追踪问题的后训练模型,声称其准确性达到SOTA水平,而成本仅为前沿模型的1/10到1/100。
Recursive的自动AI研究系统通过在无需任务特定适配的情况下自动化研究循环,在NanoChat、NanoGPT Speedrun和GPU内核基准测试上达到了最先进的成果,并开源了相关工件以供进一步检验。
Browser Use Beta 在困难的内部网络代理基准测试中取得了先进的结果,使用了 Fable 进行优化和分析。
Fable-5/Mythos 在智能体搜索中达到了新的 SOTA,但自托管成本高昂;而开放权重的 Harness-1 以更少的查询限制提供了更具性价比的替代方案。
Anthropic 宣布推出 Fable 5,这是一款在机械工程任务中达到最先进水平的模型,能够通过单个提示生成复杂的装配体与机构。
Argus-Retriever 是一种新型的延迟交互视觉文档检索器,它根据查询自适应文档表示,在 ViDoRe 基准测试上以更小的索引实现了 SOTA 性能。
Miles Brundage 宣布由同事 Carly 在 Clear AVERI Pronunciation Guide Bench 上实现了最先进(SOTA)分数的提升。
推荐阅读MAI-Thinking-1的技术论文,其中详细介绍了训练SOTA大语言模型的几乎全部细节。
NVIDIA 发布 Cosmos 3(混合 Transformer 模型,参数最高达 64B)、Nemotron 3 Ultra(550B-A55B 大语言模型),并在 Computex 2026 上预览了 RTX Spark 个人超级芯片,在多个开源模型排行榜上达到 SOTA。
Nick Kang 给他的推特基准测试集合新增了一个任务;Claude Opus 4.8 和其他 SOTA 模型通过了,而 Sonnet 4.6 和 Grok 4.3 失败了。Alfin 评论了 Opus 4.8 的危险能力。
Extend 发布了 Parse 2.0,这是一款最先进的文档解析 API,在真实文档上实现了顶尖的准确率,并在开源基准测试 RealDoc-Bench 上超越了竞争对手。
LongCat 发布了一个开源说话头像模型(可能是最先进的),采用 MIT 许可,并提供了 Hugging Face 演示,可应用于 AI 导师、配音、编码智能体等多种场景。
HRM-text 是 Sapient Intelligence 提出的 1B 参数分层推理语言模型,通过内部潜在空间高效思考,以极低训练成本实现超越多数同尺寸模型的性能。
蚂蚁集团发布了 Ring-2.6-1T,这是一个拥有 1 万亿参数的推理模型,专为智能体工作流设计,采用 MIT 许可证、扩展上下文,并使用了异步强化学习 (Async RL) 和 IcePop 训练方法,取得了最先进的成果。
NielsRogge宣布PapersWithCode复兴,该平台按领域提供SOTA、排行榜和方法,并使用AI智能体大规模解析。
Poetiq 宣称使用配备 Gemini 3 Flash 的自优化框架实现了新的最先进编码性能,超越了 Opus 4.7。
Poetiq的Meta-System通过使用标准API和Gemini 3.1 Pro自主构建编码框架,在LiveCodeBench Pro上取得了最先进的结果,无需微调或特殊模型访问。
两款全新的开源小语言模型即将发布:其中一款体积缩小高达 93 倍,精度仍达到 SOTA 水平;另一款则超越了 OpenAI 近期发布的模型。首款模型将于明日发布。
一款名为Memvid的新型开源记忆层宣称超越所有现有RAG系统,在LoCoMo上实现SOTA提升35%,多跳推理提升76%,并打包为单个.mv2文件。