@QuixiAI: ChatGPT 未通过, Claude 未通过, Deepseek 未通过, Qwen3.8 通过, GLM 5.3 通过, Grok 通过
摘要
这条推文报告称,ChatGPT、Claude 和 Deepseek 未通过测试或基准,而 Qwen3.8、GLM 5.3 和 Grok 通过,基于一个链接的来源。
查看缓存全文
缓存时间: 2026/08/29 08:01
ChatGPT 失败 Claude 失败 Deepseek 失败 Qwen3.8 通过 GLM 5.3 通过 Grok 通过 https://t.co/q7CbBbPymk
相似文章
ChatGPT、Gemini、Claude、Grok 未能通过选举话题准确性测试:Forum AI
Forum AI 的一项研究发现,ChatGPT、Gemini、Claude 和 Grok 等主要聊天机器人未能提供准确且无偏见的选举信息,其中 90% 的回答包含错误或偏见。
AI周报(2026年5月23–30日):Claude Opus 4.8 Fast模式降价3倍,Qwen 3.7 Max半价超越Claude,ChatGPT入驻Excel
2026年5月23–30日主要AI发布综合盘点,涵盖Claude Opus 4.8 Fast模式降价、Qwen 3.7 Max竞争性定价发布、ChatGPT集成Excel、Gemini 3.5 Flash、Grok Build 0.1、Mistral的Vibe智能体以及Hugging Face机器人应用商店,并分析了推理成本下降趋势及战场转向分发领域。
@charles_irl: 新基准测试刚刚发布
Andon Labs 发布了一项新的基准测试,测试AI模型是否会拒绝播放纳粹进行曲。结果显示,Claude Opus 4.8 和 GPT 5.5 总是拒绝,Gemini 3.5 Flash 有一半时间拒绝,而 Grok 4.3 几乎总是播放。
本地 Qwen 3.8 27B 对比 GPT-5.6 Terra 与 Grok 4.6
本文对比了三个AI模型——Qwen 3.8 27B、GPT-5.6 Terra和Grok 4.6——在构建Three.js香水发布网站方面的能力,详细阐述了它们的实施优势和潜在问题。
我测试了所有AI实验室的前沿模型 - Claude Fable 5、GPT 5.6 Sol、Kimi K3、GLM 5.3、Qwen 3.8 Max、DS v4 Pro、Grok 4.6,但只有一款成功通过。
作者在从大型日志文件中提取数据的任务上测试了多个前沿AI模型,发现只有Claude Fable 5通过流式数据而非将文件加载到内存的方式成功,凸显了其相比其他模型更优的实际智能。