model-benchmark

标签

Cards List
#model-benchmark

AI实验室是否在搞'pelicanmaxxing'?

Simon Willison's Blog · 2026-07-22 缓存

Dylan Castillo进行了一项严谨的调查,以确定AI实验室是否在秘密训练模型绘制骑自行车的鹈鹕。通过测试多种动物-车辆组合的多个模型,他没有发现'pelicanmaxxing'的证据。

0 人收藏 0 人点赞
#model-benchmark

Good example of the gap between Fable and Sol

Reddit r/singularity · 2026-07-15 缓存

文章对比了OpenAI GPT-5.6 Soul和Anthropic Claude Fable 5在物理3D打印零件复制和自主杂志制作中的表现,Soul在速度和设计精度上略胜一筹,但两者在复杂现实任务中均需大量人工干预,暴露了当前AI在现实制造任务中的局限性。

0 人收藏 0 人点赞
#model-benchmark

# Qwen 3.6 27B - VLLM 性能基准测试结果(BF16、FP8、NVFP4)

Reddit r/LocalLLaMA · 2026-07-05

使用 VLLM 对 Qwen 3.6 27B 在 BF16、FP8 和 NVFP4 三种量化方式下的详细基准测试显示:NVFP4 在 token 生成方面最快,但 FP8 在提示处理方面表现最佳。本文还提供了针对编码任务选择合适量化的实用建议。

0 人收藏 0 人点赞
#model-benchmark

@MMMusol: Gemini 3.1 Pro,GPT 5.5 Deepseek V4和最新Claude Fable 5 做了一个相同的测试,如视频所示,对比请自行体会~ 提示词如下: 创建一个 HTML 文件,用来呈现一架高速、充满攻击性的战斗机在全力加…

X AI KOLs Timeline · 2026-06-10 缓存

多个AI模型(Gemini 3.1 Pro、GPT 5.5、Deepseek V4、Claude Fable 5)被要求生成同一款战斗机HTML动画,视频展示了各模型的输出对比。

0 人收藏 0 人点赞
#model-benchmark

Grok 4.3 在 LLM 附和基准测试的一致性排行榜上名列第一,很大程度上因为它是目前最谨慎的模型之一。

Reddit r/singularity · 2026-05-21

Grok 4.3 在 LLM 附和基准测试的一致性排行榜上位居榜首,该测试衡量模型在多大程度上会改变立场以迎合用户。该基准揭示了某些模型表现为谄媚,而另一些则更为果断或谨慎。

0 人收藏 0 人点赞
#model-benchmark

向 GPT-4o 和 Claude 提供了完全相同的双摆提示。它们在几秒钟内选择了相反的角约定。

Reddit r/ArtificialInteligence · 2026-05-16

一项实验向 GPT-4o、Claude 3.5 Sonnet 等其他模型提供相同的双摆提示,结果显示它们选择了相反的角约定,导致在共享渲染器中立即出现可见的不匹配。这种约定分裂在不同模型家族间并非随机,表明在经典力学问题的训练数据分布中存在偏差。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈