model-benchmark

标签

Cards List
#model-benchmark

Bonsai 的文档揭示其标题的精选程度

Reddit r/LocalLLaMA · 21小时前

文章揭示 Bonsai 的标题经过精选,显示 Ternary Bonsai 2 27B 在 Terminal-Bench 和 SWE-bench 基准测试中,与 Qwen 模型相比,保留了约75%的全精度性能。

0 人收藏 0 人点赞
#model-benchmark

@MTSlive: 检测到情况:Periodic Labs使用了1,300个H200,加上数月自己的实验数据,来训练和强化学习一个开放权重模型…

X AI KOLs Timeline · 3天前

Periodic Labs训练了一个开放权重AI模型,使用1,300个NVIDIA H200 GPU和内部实验室数据,在其内部基准测试中超越了GPT-6 Astra。

0 人收藏 0 人点赞
#model-benchmark

@Youssofal_: Qwen 3.8 27B 对比 Fable、Kimi K3、GPT 5.6 Sol Pro 在 Flappy Bird 上。提示:“制作终极可爱、漂亮和美丽的……

X AI KOLs Timeline · 2026-08-25 缓存

本文比较了各种 AI 模型的性能,包括 Qwen 3.8 27B、Fable、Kimi K3 和 GPT 5.6 Sol Pro,在生成 HTML 版 Flappy Bird 游戏时的表现,重点突出了执行时间和质量的差异。

0 人收藏 0 人点赞
#model-benchmark

我让Qwen 3.8 27B执行一个逆向工程任务,它仅用30分钟就完成了

Hacker News Top · 2026-08-23 缓存

对Qwen 3.8 27B模型在复杂逆向工程任务上的测试表明,作为本地模型,它展现了令人印象深刻的性能,不仅超出预期,甚至还能检测到越狱尝试。

0 人收藏 0 人点赞
#model-benchmark

AI实验室是否在搞'pelicanmaxxing'?

Simon Willison's Blog · 2026-07-22 缓存

Dylan Castillo进行了一项严谨的调查,以确定AI实验室是否在秘密训练模型绘制骑自行车的鹈鹕。通过测试多种动物-车辆组合的多个模型,他没有发现'pelicanmaxxing'的证据。

0 人收藏 0 人点赞
#model-benchmark

Good example of the gap between Fable and Sol

Reddit r/singularity · 2026-07-15 缓存

文章对比了OpenAI GPT-5.6 Soul和Anthropic Claude Fable 5在物理3D打印零件复制和自主杂志制作中的表现,Soul在速度和设计精度上略胜一筹,但两者在复杂现实任务中均需大量人工干预,暴露了当前AI在现实制造任务中的局限性。

0 人收藏 0 人点赞
#model-benchmark

# Qwen 3.6 27B - VLLM 性能基准测试结果(BF16、FP8、NVFP4)

Reddit r/LocalLLaMA · 2026-07-05

使用 VLLM 对 Qwen 3.6 27B 在 BF16、FP8 和 NVFP4 三种量化方式下的详细基准测试显示:NVFP4 在 token 生成方面最快,但 FP8 在提示处理方面表现最佳。本文还提供了针对编码任务选择合适量化的实用建议。

0 人收藏 0 人点赞
#model-benchmark

@MMMusol: Gemini 3.1 Pro,GPT 5.5 Deepseek V4和最新Claude Fable 5 做了一个相同的测试,如视频所示,对比请自行体会~ 提示词如下: 创建一个 HTML 文件,用来呈现一架高速、充满攻击性的战斗机在全力加…

X AI KOLs Timeline · 2026-06-10 缓存

多个AI模型(Gemini 3.1 Pro、GPT 5.5、Deepseek V4、Claude Fable 5)被要求生成同一款战斗机HTML动画,视频展示了各模型的输出对比。

0 人收藏 0 人点赞
#model-benchmark

Grok 4.3 在 LLM 附和基准测试的一致性排行榜上名列第一,很大程度上因为它是目前最谨慎的模型之一。

Reddit r/singularity · 2026-05-21

Grok 4.3 在 LLM 附和基准测试的一致性排行榜上位居榜首,该测试衡量模型在多大程度上会改变立场以迎合用户。该基准揭示了某些模型表现为谄媚,而另一些则更为果断或谨慎。

0 人收藏 0 人点赞
#model-benchmark

向 GPT-4o 和 Claude 提供了完全相同的双摆提示。它们在几秒钟内选择了相反的角约定。

Reddit r/ArtificialInteligence · 2026-05-16

一项实验向 GPT-4o、Claude 3.5 Sonnet 等其他模型提供相同的双摆提示,结果显示它们选择了相反的角约定,导致在共享渲染器中立即出现可见的不匹配。这种约定分裂在不同模型家族间并非随机,表明在经典力学问题的训练数据分布中存在偏差。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈