@rohanpaul_ai:今天这期通讯刚刚发出。 https://rohan-paul.com/p/spacexai-launches-grok-46-beating… SpaceXAI 发…

X AI KOLs Timeline 新闻

摘要

Rohan Paul 的每日 AI 通讯摘要,涵盖 SpaceXAI 的 Grok 4.6 发布、Soniox TTS v2、NVIDIA Nemotron 3.5 Lightning、OpenAI 的 ChatGPT Linux 应用以及多篇研究论文。

今天这期通讯刚刚发出。 https://rohan-paul.com/p/spacexai-launches-grok-46-beating… SpaceXAI 发布 Grok 4.6,击败 Kimi K3,并与 GPT-5.6 Sol 并列在 Artificial Analysis 上排名第三。 Soniox 发布了 TTS v2,一款文本转语音模型,以极低的价格(每生成小时 0.70 美元)提供非常优质的语音。 NVIDIA 发布了用于长时间运行智能体执行的 Nemotron 3.5 Lightning。 从专有 LLM API 窃取推理轨迹 “反对用生成进行检索:判别式语言模型作为有效的检索器” OpenAI 终于推出了适用于 Linux 的 ChatGPT 桌面应用。 PROMPTS:通过多智能体规划实现 LLM 训练与服务的性能优化 SpaceXAI 发布了 Grok Bot。 Claude 如何标记 AI 生成的内容 “ScientistOne:通过证据链迈向人类水平的自主研究”
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:30

今天的新一期新闻通讯刚刚发布。

https://rohan-paul.com/p/spacexai-launches-grok-46-beating…

SpaceXAI发布Grok 4.6,击败Kimi K3,并在Artificial Analysis上与GPT-5.6 Sol并列第三

Soniox发布TTS v2,一款文本转语音模型,语音质量非常高端,但价格大幅降低(每生成小时0.70美元)

NVIDIA发布Nemotron 3.5 Lightning,用于长时间运行的智能体执行

从专有LLM API中窃取推理轨迹

“反对生成式检索:判别式语言模型作为高效检索器”

OpenAI终于发布了ChatGPT Linux桌面应用

PROMPTS:通过多智能体规划优化LLM训练与服务的性能

SpaceXAI发布Grok Bot

Claude如何标记AI生成的内容

“ScientistOne:通过证据链实现人类级自主研究”


🗞️ SpaceXAI发布Grok 4.6,击败Kimi K3,并在Artificial Analysis上与GPT-5.6 Sol并列第三

来源:https://www.rohan-paul.com/p/spacexai-launches-grok-46-beating 图片(https://substackcdn.com/image/fetch/$s_!CsCW!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F37acb306-96a9-49ea-9ddf-9c7614901d65_1241x741.jpeg) 阅读时间:10分钟

📚 在这里浏览往期内容(https://rohanpaul.substack.com/s/daily-ai-newsletter/archive?sort=new)。

(https://x.com/rohanpaul_ai我每日发布这份新闻通讯(https://x.com/rohanpaul_ai)。只包含无噪音、可操作的应用型AI动态。

  • 🗞️ SpaceXAI发布Grok 4.6,击败Kimi K3,并在Artificial Analysis上与GPT-5.6 Sol并列第三
  • 🗞️ Soniox发布TTS v2(https://soniox.com/platform),一款文本转语音模型,语音质量非常高端,但价格大幅降低(每生成小时0.70美元)
  • 🗞️ NVIDIA发布Nemotron 3.5 Lightning,用于长时间运行的智能体执行
  • 🗞️ 从专有LLM API中窃取推理轨迹
  • 🗞️ “**反对生成式检索:**判别式语言模型作为高效检索器”
  • 🗞️ OpenAI终于发布了ChatGPT Linux桌面应用
  • **🗞️ PROMPTS:**通过多智能体规划优化LLM训练与服务的性能
  • 🗞️ SpaceXAI发布Grok Bot
  • 🗞️ Claude如何标记AI生成的内容
  • 🗞️ “**ScientistOne:**通过证据链实现人类级自主研究”

在X(Twitter)上与我联系(https://x.com/rohanpaul_ai)

图片(https://substackcdn.com/image/fetch/$s_!FDwC!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ff3964a29-f8eb-4ea2-bec5-bb6f40797b09_1920x1712.png) **Grok 4.6以远低于Fable 5的API价格,达到了Fable 5智能指数得分的98.4%。(https://x.ai/news/grok-4-6)**https://x.ai/news/grok-4-6

输入token比Fable 5便宜5倍,输出token便宜8倍。

从智能/美元的性价比来看,显然是最强的。

Grok 4.6得分61,而Claude Fable 5 Max为62,在综合得分上仅有1分(1.6%)的相对差距,而Grok的输入token成本低80%(2美元对10美元/百万),输出token成本低88%(6美元对50美元/百万)。

其最明显的优势是专业智能体工作,在GDPVal-AA v2和AA-Briefcase上领先于GPT Sol Max和Fable 5 Max。

  • 在Artificial Analysis上以61分追平GPT-5.6 Sol Max,同时每百万输入/输出token仅收费2/6美元。
  • GDPVal-AA v2得分1753,AA-Briefcase得分1577,均超过Sol Max和Fable 5 Max。

这些基准测试衡量的是真实世界的智能体任务和智能体知识工作,比孤立的问答更接近研究、分析和多文件交付。

在编程方面,CursorBench v3.2上的69.9%超过了Sol的67.2%,而在DeepSWE和Terminal-Bench上,Grok落后于Sol和Fable。

SpaceXAI将这一跃升归因于更长的训练周期、重新生成的SFT轨迹、基于模型的轨迹过滤,以及跨编程、Web开发、CAD和内核优化的智能体强化学习。

该公司还报告称,模型在长轨迹上进行了更多自我测试,在继续之前检查自己的工作,直接针对多步骤智能体中错误累积的问题。

[](https://substackcdn.com/image/fetch/$s_!TKBS!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F09ce9daa-f7b6-41e9-8fad-8fe14440a1fe_1401x755.png) 我没料到Soniox TTS v2(一款文本转语音模型)听起来会如此自然。(https://soniox.com/platform)

他们刚刚发布了这款TTS v2

  • 以大幅降低的价格(每生成小时0.70美元)提供真正高端的语音质量。同时同一模型仍然适用于实时智能体、多语言语音、表现力控制和克隆。
  • Soniox TTS v2专为实时智能体打造,而语音智能体需要的不仅仅是听起来自然的音频。语音必须快速开始,与对话保持同步,在用户打断

相似文章