Kimi-K3 的所有单次生成,看起来比 opus4.8 更好。

Reddit r/LocalLLaMA 模型

摘要

一位用户使用 34 个一次性提示词运行了 Kimi K3,发现它在 HTML/截图/GIF 生成评估中优于 Opus 4.8,同时成本低得多。

我使用 34 个一次性提示词运行了 Kimi-k3,并使用 sonnet 4.6 评估了生成的 HTML、截图和 GIF。从评估结果来看,它优于 opus4.8。Kimi K3: https://oneshotlm.com/model/moonshotai-kimi-k3/ Opus 4.8: https://oneshotlm.com/model/anthropic-claude-opus-4-8/ 另外,opus 完成全部 34 个提示词花费了 7.16 美元,而 kimi k3 仅需 0.44 美元,因此它的 token 效率也很高。更多评估即将推出。
查看原文

相似文章

Kimi K2.6 是真正的 Opus 4.7 替代品

Reddit r/LocalLLaMA

经过实测并结合部分客户反馈,这是目前首款让我有底气向客户推荐用于替代 Opus 4.7 的模型。虽然它在单项能力上并未明显超越 Opus 4.7,但能以可接受的质量完成 Opus 约 85% 的任务,同时还配备了视觉理解和强大的浏览器操作能力。我最近一直在逐步将部分个人工作流迁移至 Kimi K2.6,表现令人惊喜,尤其在长周期任务中尤为出色。尽管该模型体积庞大,

我成功运行了Kimi-k3......

Reddit r/LocalLLaMA

用户成功使用llama.cpp在高端硬件上运行Kimi-k3模型,实现了较低的每秒token数(提示评估0.41,生成0.23)。