@rohanpaul_ai:今天这期通讯刚刚发出。 https://rohan-paul.com/p/spacexai-launches-grok-46-beating… SpaceXAI 发…
摘要
Rohan Paul 的每日 AI 通讯摘要,涵盖 SpaceXAI 的 Grok 4.6 发布、Soniox TTS v2、NVIDIA Nemotron 3.5 Lightning、OpenAI 的 ChatGPT Linux 应用以及多篇研究论文。
查看缓存全文
缓存时间: 2026/08/13 15:30
今天的新一期新闻通讯刚刚发布。
https://rohan-paul.com/p/spacexai-launches-grok-46-beating…
SpaceXAI发布Grok 4.6,击败Kimi K3,并在Artificial Analysis上与GPT-5.6 Sol并列第三
Soniox发布TTS v2,一款文本转语音模型,语音质量非常高端,但价格大幅降低(每生成小时0.70美元)
NVIDIA发布Nemotron 3.5 Lightning,用于长时间运行的智能体执行
从专有LLM API中窃取推理轨迹
“反对生成式检索:判别式语言模型作为高效检索器”
OpenAI终于发布了ChatGPT Linux桌面应用
PROMPTS:通过多智能体规划优化LLM训练与服务的性能
SpaceXAI发布Grok Bot
Claude如何标记AI生成的内容
“ScientistOne:通过证据链实现人类级自主研究”
🗞️ SpaceXAI发布Grok 4.6,击败Kimi K3,并在Artificial Analysis上与GPT-5.6 Sol并列第三
来源:https://www.rohan-paul.com/p/spacexai-launches-grok-46-beating 图片(https://substackcdn.com/image/fetch/$s_!CsCW!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F37acb306-96a9-49ea-9ddf-9c7614901d65_1241x741.jpeg) 阅读时间:10分钟
📚 在这里浏览往期内容(https://rohanpaul.substack.com/s/daily-ai-newsletter/archive?sort=new)。
(https://x.com/rohanpaul_ai我每日发布这份新闻通讯(https://x.com/rohanpaul_ai)。只包含无噪音、可操作的应用型AI动态。
- 🗞️ SpaceXAI发布Grok 4.6,击败Kimi K3,并在Artificial Analysis上与GPT-5.6 Sol并列第三
- 🗞️ Soniox发布TTS v2(https://soniox.com/platform),一款文本转语音模型,语音质量非常高端,但价格大幅降低(每生成小时0.70美元)
- 🗞️ NVIDIA发布Nemotron 3.5 Lightning,用于长时间运行的智能体执行
- 🗞️ 从专有LLM API中窃取推理轨迹
- 🗞️ “**反对生成式检索:**判别式语言模型作为高效检索器”
- 🗞️ OpenAI终于发布了ChatGPT Linux桌面应用
- **🗞️ PROMPTS:**通过多智能体规划优化LLM训练与服务的性能
- 🗞️ SpaceXAI发布Grok Bot
- 🗞️ Claude如何标记AI生成的内容
- 🗞️ “**ScientistOne:**通过证据链实现人类级自主研究”
在X(Twitter)上与我联系(https://x.com/rohanpaul_ai)
图片(https://substackcdn.com/image/fetch/$s_!FDwC!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ff3964a29-f8eb-4ea2-bec5-bb6f40797b09_1920x1712.png) **Grok 4.6以远低于Fable 5的API价格,达到了Fable 5智能指数得分的98.4%。(https://x.ai/news/grok-4-6)**https://x.ai/news/grok-4-6
输入token比Fable 5便宜5倍,输出token便宜8倍。
从智能/美元的性价比来看,显然是最强的。
Grok 4.6得分61,而Claude Fable 5 Max为62,在综合得分上仅有1分(1.6%)的相对差距,而Grok的输入token成本低80%(2美元对10美元/百万),输出token成本低88%(6美元对50美元/百万)。
其最明显的优势是专业智能体工作,在GDPVal-AA v2和AA-Briefcase上领先于GPT Sol Max和Fable 5 Max。
- 在Artificial Analysis上以61分追平GPT-5.6 Sol Max,同时每百万输入/输出token仅收费2/6美元。
- GDPVal-AA v2得分1753,AA-Briefcase得分1577,均超过Sol Max和Fable 5 Max。
这些基准测试衡量的是真实世界的智能体任务和智能体知识工作,比孤立的问答更接近研究、分析和多文件交付。
在编程方面,CursorBench v3.2上的69.9%超过了Sol的67.2%,而在DeepSWE和Terminal-Bench上,Grok落后于Sol和Fable。
SpaceXAI将这一跃升归因于更长的训练周期、重新生成的SFT轨迹、基于模型的轨迹过滤,以及跨编程、Web开发、CAD和内核优化的智能体强化学习。
该公司还报告称,模型在长轨迹上进行了更多自我测试,在继续之前检查自己的工作,直接针对多步骤智能体中错误累积的问题。
[](https://substackcdn.com/image/fetch/$s_!TKBS!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F09ce9daa-f7b6-41e9-8fad-8fe14440a1fe_1401x755.png) 我没料到Soniox TTS v2(一款文本转语音模型)听起来会如此自然。(https://soniox.com/platform)
他们刚刚发布了这款TTS v2
- 以大幅降低的价格(每生成小时0.70美元)提供真正高端的语音质量。同时同一模型仍然适用于实时智能体、多语言语音、表现力控制和克隆。
- Soniox TTS v2专为实时智能体打造,而语音智能体需要的不仅仅是听起来自然的音频。语音必须快速开始,与对话保持同步,在用户打断
相似文章
@rohanpaul_ai:今天的新闻简报刚刚发布。https://rohan-paul.com/p/gpt-56-beats-fable-5-by-on-deepswe… GPT 5.6 Be…
一份涵盖多项人工智能发展的新闻简报:GPT-5.6 在 DeepSWE 上以更低成本超越 Fable-5,1X 推出肌腱驱动机械手,微软在 Copilot 中替换 OpenAI/Anthropic 模型,GitHub 发布 SpecKit,Claude Code 显示大幅效率提升,Google DeepMind 分享任务设计建议。
@rohanpaul_ai: 我的时事通讯最新一期已发布。https://rohan-paul.com/p/openai-stops-reinforcement-learning… OpenAI st…
总结关键AI发展的时事通讯,包括OpenAI在因Astra的网络安全担忧后停止强化学习训练,Synthefy推出结构化数值数据平台,以及关于收入、漏洞和集成的更新。
@rohanpaul_ai:我的通讯稿最新一期刚刚发布。https://rohan-paul.com/p/meta-released-muse-glimmer-a-30b… Meta Superin…
每日 AI 通讯汇总,涵盖 Meta 发布的 Muse Glimmer(30B 参数的本地智能体模型)、扎克伯格对 AI 的愿景、伯尼·桑德斯呼吁暂停,以及其他 AI 发展动态。
@rohanpaul_ai: 我的新闻通讯今日版已发布。https://rohan-paul.com/p/study-finds-1-in-3-web-pages-published… 每3个网页中有1个…
本期新闻通讯涵盖关键AI和科技新闻,包括一项Pew研究显示,自ChatGPT发布以来发布的三分之一网页显示出AI撰写的迹象,同时涉及企业竞争更新和代理安全研究。
@rohanpaul_ai:我的通讯今日更新已发布。https://rohan-paul.com/p/wall-street-heavyweights-pour-500… 华尔街…
本期通讯涵盖AI行业重大发展动态,包括华尔街机构向英伟达AI基础设施投资5000亿美元、Anthropic即将进行的IPO计划,以及近期关于AI推理机制与智能体故障的前沿研究论文综述。