model-performance

标签

Cards List
#model-performance

@FinanceYF5: 前几天还在刷屏的Kimi K3,现在被反超了——Claude Opus 5(Max推理)杀进Frontend Code Arena和Text Arena,双双拿下第一。 默认high推理版本也不差,Code Arena排第3仅次于Kimi…

X AI KOLs Following · 2026-07-28 缓存

Claude Opus 5(Max推理)在Frontend Code Arena和Text Arena中超越Kimi K3,双双拿下第一,默认high推理版本也表现不俗。

0 人收藏 0 人点赞
#model-performance

Opus 5 的努力档位并非单调递增。在“高”档以上,编程得分反而下降,Anthropic 自家的迁移指南也这么说。

Reddit r/artificial · 2026-07-25

Anthropic 的 Opus 5 在编程任务上表现出非单调性能;由于不必要的重构,“高”努力档位的表现优于“最大”档。该模型的幻觉率也比 Opus 4.8 高出 6%,并且安全分类器可能会静默回退到旧模型。

0 人收藏 0 人点赞
#model-performance

@elonmusk: Grok 4.5 在现实工作中表现卓越

X AI KOLs Timeline · 2026-07-24 缓存

Elon Musk 推荐 Grok 4.5 用于实际任务,引用 Ramp 测试:Grok 在 15 万张商业发票上实现了最高的完美抽取率。

0 人收藏 0 人点赞
#model-performance

Opus 5 在 Simple Bench 上获得第二名

Reddit r/singularity · 2026-07-24

Opus 5 在 Simple Bench 基准测试中取得第二名,凸显了其在 AI 模型中的竞争力。

0 人收藏 0 人点赞
#model-performance

荒谬的说法:蒸馏模型性能超越原始模型

Reddit r/LocalLLaMA · 2026-07-23

有说法认为,蒸馏AI模型可以超越其规模更大的原始模型,这有悖常理。

0 人收藏 0 人点赞
#model-performance

Kimi K3 会改变关于蒸馏的争论吗?

Reddit r/singularity · 2026-07-19

Kimi K3 近期的排名挑战了那种认为中国 AI 模型严重依赖从美国模型蒸馏的观点,因为它在 Fable 5 和 GPT-5.6 发布后不久就发布了。文章认为,Kimi K3 体现了中国的大量创新。

0 人收藏 0 人点赞
#model-performance

@LiorOnAI:超过2000万开发者的心情如今取决于Anthropic和OpenAI的模型当天的表现如何。

X AI KOLs Timeline · 2026-07-15

一条推文指出,超过2000万开发者的心情取决于Anthropic和OpenAI的AI模型每天的表现。

0 人收藏 0 人点赞
#model-performance

@elonmusk: Grok Build

X AI KOLs Timeline · 2026-07-10 缓存

Grok 4.5 配合 Grok Build 在 SWE-Atlas-QnA 基准测试中以 84 分获得第一名,与 GPT-5.6 Codex 持平,并超越其他编码设置。

0 人收藏 0 人点赞
#model-performance

NVIDIA Puzzle-75B-A9B 在3×3090上使用NVFP4达到132 t/s——为何这个尺寸类别在其他方面是一片荒漠?

Reddit r/LocalLLaMA · 2026-07-09

NVIDIA的Puzzle-75B-A9B模型在三块RTX 3090 GPU上使用NVFP4量化达到每秒132个token,引发了对该模型尺寸类别缺乏竞争的讨论。

0 人收藏 0 人点赞
#model-performance

@danshipper: 这不对,这是同一个模型。但它会稍微更多地回退到 Opud 4.8,所以基准测试测量的是...

X AI KOLs Following · 2026-07-03 缓存

Dan Shipper 认为 Fable 5 模型并没有被削弱,而是更频繁地回退到 Opus 4.8,导致基准测试结果混杂,这与声称严重退化的说法相反。

0 人收藏 0 人点赞
#model-performance

@jun_song: GPT-5.6 似乎非常令人失望。并不比 GLM-5.2 好。

X AI KOLs Following · 2026-06-23 缓存

一位用户表达了对GPT-5.6的失望,声称它并不比GLM-5.2好。

0 人收藏 0 人点赞
#model-performance

@haider1: GLM 5.2 感觉像是开放权重模型的 opus 4.5 时刻,真正让我印象深刻的是在长时间、多步骤的…

X AI KOLs Following · 2026-06-17 缓存

GLM 5.2 标志着开放权重模型的一个重要里程碑,展示了在长多步骤任务中强大的上下文保留能力以及更可靠的工具调用。

0 人收藏 0 人点赞
#model-performance

Humanity's Last Exam 当前基准测试成绩思考?

Reddit r/singularity · 2026-06-15

讨论近期AI模型在'Humanity's Last Exam'基准测试中的得分,指出从2024年5月GPT-4o的2.7%提升至2026年6月左右45%,并对该考试的难度提出疑问。

0 人收藏 0 人点赞
#model-performance

Opus 4.8 Thinking 在 LMArena 的 Hard Prompts English 基准测试中持续下滑(再次)

Reddit r/singularity · 2026-06-07

Opus 4.8 Thinking 在 LMArena 的 Hard Prompts English 基准测试中持续下滑,得分比保持榜首的 Opus 4.6 Thinking 低 23 分。

0 人收藏 0 人点赞
#model-performance

将大型模型卸载到系统内存时的性能表现?

Reddit r/LocalLLaMA · 2026-05-24

讨论了将大型AI模型权重从GPU显存卸载到系统内存时的性能权衡,比较了不同GPU配置(如RTX 5090与RTX6000)在运行DeepSeek V4 Pro等模型时的表现。

0 人收藏 0 人点赞
#model-performance

@swyx: 非常迟了,但回想起来,我认为@sama那个传说中的“建立一个随着模型变好而变得更好的业务”基本上就是我这里所说的Agent Labs。

X AI KOLs Following · 2026-05-20 缓存

swyx 回顾了Sam Altman关于构建随着AI模型改进而改进的企业的想法,将其与新出现的Agent Labs概念联系起来,并指出与2025年第四季度收入激增有明显的相关性。

0 人收藏 0 人点赞
#model-performance

Gemini 3.5 Flash 基准测试

Reddit r/singularity · 2026-05-19

讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。

0 人收藏 0 人点赞
#model-performance

如果显存允许,尽量跑更大的量化模型

Reddit r/LocalLLaMA · 2026-04-22

有用户反馈,把高度压缩的 IQ4_XS 换成更大的 IQ4_NL_XL 后,Qwen 3.6 的 Agent 编程准确率大幅提升;虽然 tok/s 下降,但只要 VRAM 够,强烈建议优先选更大的量化。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈