标签
Locus,一个自动化AI研究系统,在PostTrainBench上达到SOTA,并能后训练Qwen3基础模型,使其超越人类后训练的模型。它还在Kaggle竞赛中表现出色。
Kimi K3在新的pmpp-hard基准测试中取得了最先进的结果,在69个GPU内核任务中得分为0.71,并超越了其他前沿模型。
Qwen发布了Qwen-CUA,一个拥有397B-A17B混合专家主干的原生计算机使用智能体,在OSWorld-Verified上取得了最先进的结果,并在WebArena上排名第二。技术报告可在Papers with Code上获取。
Mike Bradley 分享了基准测试结果,声称 DeepSeek V4 Flash 0731 是当前190GB显存系统的最佳(SOTA)选择,在质量上匹敌甚至超过 Unsloth 3-bit Qwen3.5-397B,而运行速度大约快3倍。
宣布推出开源SOTA视频生成模型MiniMax H3,具备商业级生成能力、无与伦比的成本效益以及开放权重。
KAT-Coder-V2.5-Dev 是一个开放权重的 MoE 编码模型,总参数为 35B(3B 激活),通过 SFT 和 RL 训练在代理编码基准测试上取得了最先进的结果。
LLM-as-a-Verifier 是一种简单、廉价、通用的面向智能体任务的自我改进技术,通过细粒度评分和基于 logprob 的排名,在 SWE-Bench Verified 和 Terminal-Bench V2 等多个基准测试中取得了最先进的性能。
今天,我们发布 Le Chaton L∃∀N,即 Leanstral 1.5。它在研究生代数基准测试 FATE-H 和 FATE-X 上实现了 SOTA 性能,并在 PutnamBench 上改进了帕累托前沿(Pareto Frontier),以 x10 更低的预算解决了 587/672 个问题。
Ornith-1.0 已在 Hugging Face 上发布,包含一系列模型,参数范围从 9B 到 397B,涵盖密集和 MoE 架构,声称在各项基准测试中达到 SOTA 性能。
GLM-5.2 在 PostTrainBench 上取得了最先进的结果,超越了 GPT-5.5 和 Opus 4.8。
SAG(SQL-Augmented Generation)是一种基于SQL的检索增强生成新方法,通过将数据块转换为事件和实体,利用SQL连接查询实现多跳推理,在MuSiQue数据集上Recall从65.13%提升至80.04%,支持约5亿条数据的秒级线上检索,已开源。
Harrison Chase宣布了一个用于检测生产环境代理追踪问题的后训练模型,声称其准确性达到SOTA水平,而成本仅为前沿模型的1/10到1/100。
Recursive的自动AI研究系统通过在无需任务特定适配的情况下自动化研究循环,在NanoChat、NanoGPT Speedrun和GPU内核基准测试上达到了最先进的成果,并开源了相关工件以供进一步检验。
Browser Use Beta 在困难的内部网络代理基准测试中取得了先进的结果,使用了 Fable 进行优化和分析。
Fable-5/Mythos 在智能体搜索中达到了新的 SOTA,但自托管成本高昂;而开放权重的 Harness-1 以更少的查询限制提供了更具性价比的替代方案。
Anthropic 宣布推出 Fable 5,这是一款在机械工程任务中达到最先进水平的模型,能够通过单个提示生成复杂的装配体与机构。
Argus-Retriever 是一种新型的延迟交互视觉文档检索器,它根据查询自适应文档表示,在 ViDoRe 基准测试上以更小的索引实现了 SOTA 性能。
Miles Brundage 宣布由同事 Carly 在 Clear AVERI Pronunciation Guide Bench 上实现了最先进(SOTA)分数的提升。
推荐阅读MAI-Thinking-1的技术论文,其中详细介绍了训练SOTA大语言模型的几乎全部细节。
NVIDIA 发布 Cosmos 3(混合 Transformer 模型,参数最高达 64B)、Nemotron 3 Ultra(550B-A55B 大语言模型),并在 Computex 2026 上预览了 RTX Spark 个人超级芯片,在多个开源模型排行榜上达到 SOTA。