标签
新版 DS v4 flash 0731 以低价承诺大幅改进,在自制测试中表现优于 GLM 5.1,尽管这些基准测试结果令人怀疑。
DeepSeek-V4-Flash-High 以 1586 分的成绩在 Frontend Code Arena 中位居榜首,以每百万 token 仅 $0.14/$0.28 的价格提供最佳性能价格比。
DeepSeek 宣布推出 V4 Flash GA,声称其在 DeepSWE 基准测试上与 Sonnet 5 和 Grok 4.5 相当,但该说法尚未得到验证。
DeepSeek 宣布推出 DeepSeek-V4-Flash-0731,这是一款以 Flash 级别定价提供先进能力的前沿智能体模型。
DeepSeek 的新 V4-Flash-0731 模型在基准测试中的表现现已远远优于 V4-Pro-Preview,标志着该模型系列取得了显著进步。
对 DeepSeek V4 Flash 0731 的分析,涵盖其智能、性能以及与其他 AI 模型的定价对比。
DeepSeek的新V4-Flash模型在ArtificalAnalysis Index上得分为50,仅比GLM-5.2和GPT-5.6 Luna低1分。
据报道,DeepSeek-V4-Flash-0731 性能优于 GLM 5.2,同时成本与前代保持一致,引发了对其再次造成市场扰动的猜测。
Mage-VL 被介绍为一款多模态 AI 模型,它在一个模型中处理图像、文本和视频理解,从而支持更丰富的交互式应用。
DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。
据报道,GPT-5.6 Sol 找到了 Maxwell 猜想的一个反例,这是一个有100多年历史的问题,人类数学家已对这一结果进行沟通。
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
Midjourney V8.2 已发布,标志着这款流行的 AI 图像生成模型迎来了新版本。
一条推文报告称,Opus 5 AI 模型使用多智能体循环在 Ultracode 上运行了大约 12 小时,并引用了 pallet-town-3d 项目。
一条推文强调Luna是一款能力超强且低成本的AI模型,指出它目前是每美元token效率最高的模型,并且在OpenRouter上还可享受额外折扣。
AntLing 3.0 flash、MiniMax M2.7 和 Step 3.7 flash 模型之间的比较,可能评估性能并识别真正的“flash”模型。
xAI 推出了 Grok Voice Think Fast 2.0,这是一个改进的语音到语音模型,具有更高的转录准确性和更低的延迟,在基准测试中优于竞争对手。