标签
TabPFN-3.5 发布,声称在 IID 小数据设置之外为表格数据提供最先进的性能,具有处理分组和时序数据、不确定性校准以及更快推理等功能。
一种名为 'Thinking with Looped Flows' 的新方法,通过局部去噪目标训练循环推理,在循环模型中达到了 ARC-AGI 基准测试的最先进的性能。
GPT-6 Astra 被宣布为代理型 CAD 的新最先进技术,标志着 AI 在机械设计领域的能力取得了重大突破。
DeepSWE v1.1在内部Code Bench上提升了50%,并在Terminal-Bench 3.0和Agents' Last Exam上取得了新的SOTA成绩,同时新兴的网络能力发展超出预期。
文章讨论了 Grok 4.6 的性能,在基准测试中接近 Opus 5 且成本更低,并推测通过在浏览器任务上进行更多强化学习,Grok 4.7 可能成为最先进的。
Gemini 3.7 Flash 被强调为 Gemini 3.6 的升级版,在浏览器使用数据集上得分 67%,而 SOTA 为 83%;同时,Luna 提供了一种成本效益高的替代方案,价格降低了 5 倍。
Elon Musk 宣布 Grok 4.6 登顶 Databricks,Ivan Zhou 报告称,使用 Databricks 的 Genie 测试框架,在 OfficeQA Pro V2 上实现了 SOTA 性能。
Locus,一个自动化AI研究系统,在PostTrainBench上达到SOTA,并能后训练Qwen3基础模型,使其超越人类后训练的模型。它还在Kaggle竞赛中表现出色。
Kimi K3在新的pmpp-hard基准测试中取得了最先进的结果,在69个GPU内核任务中得分为0.71,并超越了其他前沿模型。
Qwen发布了Qwen-CUA,一个拥有397B-A17B混合专家主干的原生计算机使用智能体,在OSWorld-Verified上取得了最先进的结果,并在WebArena上排名第二。技术报告可在Papers with Code上获取。
Mike Bradley 分享了基准测试结果,声称 DeepSeek V4 Flash 0731 是当前190GB显存系统的最佳(SOTA)选择,在质量上匹敌甚至超过 Unsloth 3-bit Qwen3.5-397B,而运行速度大约快3倍。
宣布推出开源SOTA视频生成模型MiniMax H3,具备商业级生成能力、无与伦比的成本效益以及开放权重。
KAT-Coder-V2.5-Dev 是一个开放权重的 MoE 编码模型,总参数为 35B(3B 激活),通过 SFT 和 RL 训练在代理编码基准测试上取得了最先进的结果。
LLM-as-a-Verifier 是一种简单、廉价、通用的面向智能体任务的自我改进技术,通过细粒度评分和基于 logprob 的排名,在 SWE-Bench Verified 和 Terminal-Bench V2 等多个基准测试中取得了最先进的性能。
今天,我们发布 Le Chaton L∃∀N,即 Leanstral 1.5。它在研究生代数基准测试 FATE-H 和 FATE-X 上实现了 SOTA 性能,并在 PutnamBench 上改进了帕累托前沿(Pareto Frontier),以 x10 更低的预算解决了 587/672 个问题。
Ornith-1.0 已在 Hugging Face 上发布,包含一系列模型,参数范围从 9B 到 397B,涵盖密集和 MoE 架构,声称在各项基准测试中达到 SOTA 性能。
GLM-5.2 在 PostTrainBench 上取得了最先进的结果,超越了 GPT-5.5 和 Opus 4.8。
SAG(SQL-Augmented Generation)是一种基于SQL的检索增强生成新方法,通过将数据块转换为事件和实体,利用SQL连接查询实现多跳推理,在MuSiQue数据集上Recall从65.13%提升至80.04%,支持约5亿条数据的秒级线上检索,已开源。
Harrison Chase宣布了一个用于检测生产环境代理追踪问题的后训练模型,声称其准确性达到SOTA水平,而成本仅为前沿模型的1/10到1/100。