sota

标签

Cards List
#sota

@FrankRHutter: 数据科学革命持续进行。TabPFN-3.5 已上线,声称在原始 IID 小数据设置之外达到 SOTA,并且……

X AI KOLs Timeline · 2026-09-15 缓存

TabPFN-3.5 发布,声称在 IID 小数据设置之外为表格数据提供最先进的性能,具有处理分组和时序数据、不确定性校准以及更快推理等功能。

0 人收藏 0 人点赞
#sota

@ayhozade: 神经网络能通过去噪学习思考吗?很高兴分享 Thinking with Looped Flows!我们训练循环推理……

X AI KOLs Timeline · 2026-09-11

一种名为 'Thinking with Looped Flows' 的新方法,通过局部去噪目标训练循环推理,在循环模型中达到了 ARC-AGI 基准测试的最先进的性能。

0 人收藏 0 人点赞
#sota

@adamdotnew: GPT-6 Astra 是代理型 CAD 的新 SOTA。在机械设计中,AI 能力的一次真正飞跃。

X AI KOLs Following · 2026-09-05 缓存

GPT-6 Astra 被宣布为代理型 CAD 的新最先进技术,标志着 AI 在机械设计领域的能力取得了重大突破。

0 人收藏 0 人点赞
#sota

@ArizePhoenix: 结果:在内部Code Bench上相比5.2提升了50%,Terminal-Bench 3.0从4.6提升到28.3,DeepSWE v1.1 从…

X AI KOLs Following · 2026-09-03

DeepSWE v1.1在内部Code Bench上提升了50%,并在Terminal-Bench 3.0和Agents' Last Exam上取得了新的SOTA成绩,同时新兴的网络能力发展超出预期。

0 人收藏 0 人点赞
#sota

Runway发布视频展示当前最先进图像生成模型与工具所能实现的功能

Reddit r/singularity · 2026-08-28

Runway发布视频突出展示当前最先进图像生成模型和工具的能力

0 人收藏 0 人点赞
#sota

@browser_use: Grok 4.7 会成为 SOTA 吗?

X AI KOLs Timeline · 2026-08-14 缓存

文章讨论了 Grok 4.6 的性能,在基准测试中接近 Opus 5 且成本更低,并推测通过在浏览器任务上进行更多强化学习,Grok 4.7 可能成为最先进的。

0 人收藏 0 人点赞
#sota

@browser_use:Gemini 3.7 flash 明显优于 3.6!

X AI KOLs Following · 2026-08-13 缓存

Gemini 3.7 Flash 被强调为 Gemini 3.6 的升级版,在浏览器使用数据集上得分 67%,而 SOTA 为 83%;同时,Luna 提供了一种成本效益高的替代方案,价格降低了 5 倍。

0 人收藏 0 人点赞
#sota

@elonmusk: Grok 4.6 登顶 @databricks

X AI KOLs Timeline · 2026-08-12 缓存

Elon Musk 宣布 Grok 4.6 登顶 Databricks,Ivan Zhou 报告称,使用 Databricks 的 Genie 测试框架,在 OfficeQA Pro V2 上实现了 SOTA 性能。

0 人收藏 0 人点赞
#sota

@intology:模型正在改进模型。Locus,我们的自动化AI研究系统,在PostTrainBench上达到SOTA,并能后训练……

X AI KOLs Following · 2026-08-03 缓存

Locus,一个自动化AI研究系统,在PostTrainBench上达到SOTA,并能后训练Qwen3基础模型,使其超越人类后训练的模型。它还在Kaggle竞赛中表现出色。

0 人收藏 0 人点赞
#sota

@TheAhmadOsman: 又一项Kimi K3达到SoTA并超越前沿的事情

X AI KOLs Following · 2026-08-03 缓存

Kimi K3在新的pmpp-hard基准测试中取得了最先进的结果,在69个GPU内核任务中得分为0.71,并超越了其他前沿模型。

0 人收藏 0 人点赞
#sota

@NielsRogge:Qwen发布了带有技术报告的SOTA计算机使用智能体。它不在@arxiv上,但在Papers with Code上。你…

X AI KOLs Timeline · 2026-08-03 缓存

Qwen发布了Qwen-CUA,一个拥有397B-A17B混合专家主干的原生计算机使用智能体,在OSWorld-Verified上取得了最先进的结果,并在WebArena上排名第二。技术报告可在Papers with Code上获取。

0 人收藏 0 人点赞
#sota

@MikeBradleyAI:关于 @deepseek_ai 0731 V4 Flash 的 TLDR。对于190GB显存或统一内存系统,它妥妥是目前的最优(SOTA)。……

X AI KOLs Following · 2026-08-02 缓存

Mike Bradley 分享了基准测试结果,声称 DeepSeek V4 Flash 0731 是当前190GB显存系统的最佳(SOTA)选择,在质量上匹敌甚至超过 Unsloth 3-bit Qwen3.5-397B,而运行速度大约快3倍。

0 人收藏 0 人点赞
#sota

@VoidAsuka:很长一段时间没有好的开源视频生成模型了,所以我们做了一个。这是一个SOTA视频生成模型…

X AI KOLs Following · 2026-07-31 缓存

宣布推出开源SOTA视频生成模型MiniMax H3,具备商业级生成能力、无与伦比的成本效益以及开放权重。

0 人收藏 0 人点赞
#sota

Kwaipilot/KAT-Coder-V2.5-Dev

Hugging Face Models Trending · 2026-07-23 缓存

KAT-Coder-V2.5-Dev 是一个开放权重的 MoE 编码模型,总参数为 35B(3B 激活),通过 SFT 和 RL 训练在代理编码基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#sota

@Azaliamirh: 了解 LLM-as-a-Verifier:一种简单、廉价且通用的自我改进技术,可提升“…”的性能

X AI KOLs Timeline · 2026-07-10 缓存

LLM-as-a-Verifier 是一种简单、廉价、通用的面向智能体任务的自我改进技术,通过细粒度评分和基于 logprob 的排名,在 SWE-Bench Verified 和 Terminal-Bench V2 等多个基准测试中取得了最先进的性能。

0 人收藏 0 人点赞
#sota

@mertunsal2020: 今天,我们发布 Le Chaton L∃∀N,即 Leanstral 1.5。它在研究生代数基准测试上实现了 SOTA 性能……

X AI KOLs Following · 2026-07-03 缓存

今天,我们发布 Le Chaton L∃∀N,即 Leanstral 1.5。它在研究生代数基准测试 FATE-H 和 FATE-X 上实现了 SOTA 性能,并在 PutnamBench 上改进了帕累托前沿(Pareto Frontier),以 x10 更低的预算解决了 587/672 个问题。

0 人收藏 0 人点赞
#sota

Ornith-1.0 在 Hugging Face 上发布

Reddit r/LocalLLaMA · 2026-06-25

Ornith-1.0 已在 Hugging Face 上发布,包含一系列模型,参数范围从 9B 到 397B,涵盖密集和 MoE 架构,声称在各项基准测试中达到 SOTA 性能。

0 人收藏 0 人点赞
#sota

@NielsRogge: GLM-5.2 是 PostTrainBench 上名副其实的 SOTA,击败了 GPT-5.5 和 Opus 4.8。了解更多:https://paperswithcode.co/be…

X AI KOLs Following · 2026-06-20

GLM-5.2 在 PostTrainBench 上取得了最先进的结果,超越了 GPT-5.5 和 Opus 4.8。

0 人收藏 0 人点赞
#sota

@teach_fireworks: https://x.com/teach_fireworks/status/2067243590447952212

X AI KOLs Timeline · 2026-06-17 缓存

SAG(SQL-Augmented Generation)是一种基于SQL的检索增强生成新方法,通过将数据块转换为事件和实体,利用SQL连接查询实现多跳推理,在MuSiQue数据集上Recall从65.13%提升至80.04%,支持约5亿条数据的秒级线上检索,已开源。

0 人收藏 0 人点赞
#sota

@hwchase17:检测生产环境代理追踪中的问题很困难。你必须低成本地进行(因为数据量大),同时也要准确(否则噪音太多)……

X AI KOLs Following · 2026-06-15

Harrison Chase宣布了一个用于检测生产环境代理追踪问题的后训练模型,声称其准确性达到SOTA水平,而成本仅为前沿模型的1/10到1/100。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈