Kimi-K3 的所有单次生成,看起来比 opus4.8 更好。
摘要
一位用户使用 34 个一次性提示词运行了 Kimi K3,发现它在 HTML/截图/GIF 生成评估中优于 Opus 4.8,同时成本低得多。
我使用 34 个一次性提示词运行了 Kimi-k3,并使用 sonnet 4.6 评估了生成的 HTML、截图和 GIF。从评估结果来看,它优于 opus4.8。Kimi K3: https://oneshotlm.com/model/moonshotai-kimi-k3/ Opus 4.8: https://oneshotlm.com/model/anthropic-claude-opus-4-8/ 另外,opus 完成全部 34 个提示词花费了 7.16 美元,而 kimi k3 仅需 0.44 美元,因此它的 token 效率也很高。更多评估即将推出。
相似文章
Kimi K2.6 是真正的 Opus 4.7 替代品
经过实测并结合部分客户反馈,这是目前首款让我有底气向客户推荐用于替代 Opus 4.7 的模型。虽然它在单项能力上并未明显超越 Opus 4.7,但能以可接受的质量完成 Opus 约 85% 的任务,同时还配备了视觉理解和强大的浏览器操作能力。我最近一直在逐步将部分个人工作流迁移至 Kimi K2.6,表现令人惊喜,尤其在长周期任务中尤为出色。尽管该模型体积庞大,
@eliebakouch:Kimi K2.6 对比 K2.5、Mythos、Opus 4.7 以及基于 K2.5 的 Cursor Composer 2——我跑遍了能找到的所有基准测试,一句话总结:……
Kimi K2.6 在多项基准测试中较 K2.5 及 Mythos、Opus 4.7 等对手均有显著性能提升。
我们实测了DeepSeek V4 Pro和Flash与Claude Opus 4.7和Kimi K2.6的对比(11分钟阅读)
DeepSeek于2026年4月24日以MIT许可证发布了V4 Pro和V4 Flash。在与Claude Opus 4.7和Kimi K2.6的基准测试中,V4 Pro得分77/100,价格为2.25美元,性能介于Opus 4.7(91分)和Kimi K2.6(68分)之间;而V4 Flash得分60/100,价格为0.02美元,是本次对比中最便宜的,并且到5月31日前购买V4 Pro可享受75%的折扣。
@nutlope: https://x.com/nutlope/status/2067281915887943890
一项对比实验表明,Kimi K2.7 Code生成落地页的成本比Claude Fable 5低约94%,且质量相近,尤其是在通过MCP服务器提供设计上下文的情况下。
我成功运行了Kimi-k3......
用户成功使用llama.cpp在高端硬件上运行Kimi-k3模型,实现了较低的每秒token数(提示评估0.41,生成0.23)。