sota

标签

Cards List
#sota

@nick_kango: 再加一个任务到我的推特基准测试集合里:) 对了,Opus 4.8 和所有 SOTA 模型都通过了,但我试的时候 Sonnet 4.6 和 Grok 4.3 没有通过…

X AI KOLs Timeline · 2026-05-30 缓存

Nick Kang 给他的推特基准测试集合新增了一个任务;Claude Opus 4.8 和其他 SOTA 模型通过了,而 Sonnet 4.6 和 Grok 4.3 失败了。Alfin 评论了 Opus 4.8 的危险能力。

0 人收藏 0 人点赞
#sota

@kushalbyatnal: 每天创建的PDF文件超过10亿份,但你的智能体仍然无法可靠地读取它们。今天,我们发布了Parse…

X AI KOLs Following · 2026-05-26 缓存

Extend 发布了 Parse 2.0,这是一款最先进的文档解析 API,在真实文档上实现了顶尖的准确率,并在开源基准测试 RealDoc-Bench 上超越了竞争对手。

0 人收藏 0 人点赞
#sota

@victormustar: 新消息:LongCat 刚刚发布了一个优秀的开源说话头像模型(可能是 SOTA)+ MIT 许可,制作了一个 Hugging F…

X AI KOLs Following · 2026-05-24 缓存

LongCat 发布了一个开源说话头像模型(可能是最先进的),采用 MIT 许可,并提供了 Hugging Face 演示,可应用于 AI 导师、配音、编码智能体等多种场景。

0 人收藏 0 人点赞
#sota

New SOTA 1B model? HRM-text

Reddit r/LocalLLaMA · 2026-05-19 缓存

HRM-text 是 Sapient Intelligence 提出的 1B 参数分层推理语言模型,通过内部潜在空间高效思考,以极低训练成本实现超越多数同尺寸模型的性能。

0 人收藏 0 人点赞
#sota

Ring-2.6-1T 在真实世界智能体任务中达到 SOTA 水平

Reddit r/ArtificialInteligence · 2026-05-18

蚂蚁集团发布了 Ring-2.6-1T,这是一个拥有 1 万亿参数的推理模型,专为智能体工作流设计,采用 MIT 许可证、扩展上下文,并使用了异步强化学习 (Async RL) 和 IcePop 训练方法,取得了最先进的成果。

0 人收藏 0 人点赞
#sota

@NielsRogge:宣布PapersWithCode复兴!正如@ilyasut所说,我们回到了“研究时代”。因此,重要的是要……

X AI KOLs Following · 2026-05-18 缓存

NielsRogge宣布PapersWithCode复兴,该平台按领域提供SOTA、排行榜和方法,并使用AI智能体大规模解析。

0 人收藏 0 人点赞
#sota

新 SOTA:Poetiq 使用自优化框架以 Gemini 3 Flash 超越 Opus 4.7 等模型

Reddit r/singularity · 2026-05-15

Poetiq 宣称使用配备 Gemini 3 Flash 的自优化框架实现了新的最先进编码性能,超越了 Opus 4.7。

0 人收藏 0 人点赞
#sota

@poetiq_ai: Poetiq的Meta-System从零构建了自己的编码框架。它在LiveCodeBench Pro上达到了SOTA。无需微调,无需特殊…

X AI KOLs Following · 2026-05-14 缓存

Poetiq的Meta-System通过使用标准API和Gemini 3.1 Pro自主构建编码框架,在LiveCodeBench Pro上取得了最先进的结果,无需微调或特殊模型访问。

0 人收藏 0 人点赞
#sota

@ash_csx:本周我们将发布两款开源 SLM。1. 其中一款体积缩小高达 93 倍,精度仍媲美 SOTA。2. 另一款……

X AI KOLs Following · 2026-05-11 缓存

两款全新的开源小语言模型即将发布:其中一款体积缩小高达 93 倍,精度仍达到 SOTA 水平;另一款则超越了 OpenAI 近期发布的模型。首款模型将于明日发布。

0 人收藏 0 人点赞
#sota

@oliviscusAI:有人开源了一个记忆层,在性能上击败了全球所有的RAG系统,名为Memvid。在LoCoMo上SOTA提升35%……

X AI KOLs Timeline · 2026-05-11 缓存

一款名为Memvid的新型开源记忆层宣称超越所有现有RAG系统,在LoCoMo上实现SOTA提升35%,多跳推理提升76%,并打包为单个.mv2文件。

0 人收藏 0 人点赞
#sota

小米发布SOTA模型MiMo-V2.5-Pro

Reddit r/singularity · 2026-04-22

小米推出MiMo-V2.5-Pro,宣称实现最先进性能

0 人收藏 0 人点赞
#sota

@KKaWSB: Moonshot刚刚开源了Kimi K2.6——单次会话跑4000次工具调用连续12小时,300个子代理并行搭完整代码库。 SWE-Bench Pro、BrowseComp、HLE等多项基准SOTA,打平Claude Opus 4.6和G…

X AI KOLs Timeline · 2026-04-20 缓存

Moonshot开源发布了Kimi K2.6模型,支持单次会话4000次工具调用与300个子代理并行,在SWE-Bench Pro等多项基准上取得SOTA,并声称性能打平Claude Opus 4.6和GPT-5.4。

0 人收藏 0 人点赞
#sota

Kimi K2.6

Product Hunt · 2026-04-20

Kimi K2.6 作为开源模型发布,在长程编码与智能体集群基准测试中达到 SOTA 性能。

0 人收藏 0 人点赞
#sota

@sumeetrm:LongCoT 新增两块排行榜!鉴于大家对智能体(尤其是 RLM)的关注,我们新增「受限基准」和「开放基准」双榜。

X AI KOLs Following · 2026-04-19 缓存

LongCoT 推出两块智能体新榜(受限/开放基准),其中 GPT 5.2 RLM 以 25.12% 的得分领跑开放基准。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈