标签
Nick Kang 给他的推特基准测试集合新增了一个任务;Claude Opus 4.8 和其他 SOTA 模型通过了,而 Sonnet 4.6 和 Grok 4.3 失败了。Alfin 评论了 Opus 4.8 的危险能力。
Extend 发布了 Parse 2.0,这是一款最先进的文档解析 API,在真实文档上实现了顶尖的准确率,并在开源基准测试 RealDoc-Bench 上超越了竞争对手。
LongCat 发布了一个开源说话头像模型(可能是最先进的),采用 MIT 许可,并提供了 Hugging Face 演示,可应用于 AI 导师、配音、编码智能体等多种场景。
HRM-text 是 Sapient Intelligence 提出的 1B 参数分层推理语言模型,通过内部潜在空间高效思考,以极低训练成本实现超越多数同尺寸模型的性能。
蚂蚁集团发布了 Ring-2.6-1T,这是一个拥有 1 万亿参数的推理模型,专为智能体工作流设计,采用 MIT 许可证、扩展上下文,并使用了异步强化学习 (Async RL) 和 IcePop 训练方法,取得了最先进的成果。
NielsRogge宣布PapersWithCode复兴,该平台按领域提供SOTA、排行榜和方法,并使用AI智能体大规模解析。
Poetiq 宣称使用配备 Gemini 3 Flash 的自优化框架实现了新的最先进编码性能,超越了 Opus 4.7。
Poetiq的Meta-System通过使用标准API和Gemini 3.1 Pro自主构建编码框架,在LiveCodeBench Pro上取得了最先进的结果,无需微调或特殊模型访问。
两款全新的开源小语言模型即将发布:其中一款体积缩小高达 93 倍,精度仍达到 SOTA 水平;另一款则超越了 OpenAI 近期发布的模型。首款模型将于明日发布。
一款名为Memvid的新型开源记忆层宣称超越所有现有RAG系统,在LoCoMo上实现SOTA提升35%,多跳推理提升76%,并打包为单个.mv2文件。
Moonshot开源发布了Kimi K2.6模型,支持单次会话4000次工具调用与300个子代理并行,在SWE-Bench Pro等多项基准上取得SOTA,并声称性能打平Claude Opus 4.6和GPT-5.4。
LongCoT 推出两块智能体新榜(受限/开放基准),其中 GPT 5.2 RLM 以 25.12% 的得分领跑开放基准。