Kimi 供应商验证器 — 验证推理服务提供商的准确性

Hacker News Top 工具

摘要

## 重建「信任链」:Kimi 供应商验证器 来源:[https://www.kimi.com/blog/kimi-vendor-verifier](https://www.kimi.com/blog/kimi-vendor-verifier) [研究](https://www.kimi.com/blog/)## 重建“信任链”:Kimi 供应商验证器[![GitHub](https://img.shields.io/badge/GitHub-181717?style=flat&logo=github&logoColor=white)](https://github.com/MoonshotAI/Kimi-Vendor-Verifier)[​](https://www.kimi.com/blog/kimi-vendor-verifier#rebuilding-the-chain-of-trust-kimi-vendor-verifier) 随着

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/04/21 04:48

# Kimi Vendor Verifier 来源:https://www.kimi.com/blog/kimi-vendor-verifier 研究 (https://www.kimi.com/blog/)## 重塑"信任链":Kimi Vendor VerifierGitHub (https://github.com/MoonshotAI/Kimi-Vendor-Verifier) (https://www.kimi.com/blog/kimi-vendor-verifier#rebuilding-the-chain-of-trust-kimi-vendor-verifier) 伴随着 Kimi K2\.6 模型的发布,我们开源了 Kimi Vendor Verifier(KVV)项目,旨在帮助开源模型的用户验证其推理实现的准确性。 这并非事后补救,而是因为我们深刻认识到:开源模型只是万里长征的第一步,确保它在各种环境下正确运行才是另一半战场。 ## 官方评测结果 (https://www.kimi.com/blog/kimi-vendor-verifier#official-evaluation-results) 您可以点击此处 (https://statics.moonshot.cn/k2vv/kimi-k2.6_t0.6_m8192_nothink.zip) 获取 Kimi API K2VV 评估结果,用于计算 F1 分数。 ## 为什么我们要构建 KVV (https://www.kimi.com/blog/kimi-vendor-verifier#why-we-built-kvv) **从个案到系统性问题** 自 K2 Thinking 发布以来,我们频繁收到社区关于基准测试分数异常的反馈。经调查确认,这些问题中有相当一部分源于解码参数的使用不当。为快速解决这一问题,我们在 API 层面构建了第一道防线:强制在 Thinking 模式下设置 Temperature=1\.0 和 TopP=0\.95,并要求必须正确返回思考内容。 然而,更隐蔽的异常现象很快引起了我们的警觉。在对 LiveBenchmark (https://www.reddit.com/r/LocalLLaMA/comments/1osglws/kimi_k2_thinking_scores_lower_than_gemini_25/?rdt=41412) 的一次专项评测中,我们观察到第三方 API 与官方 API 之间存在显著差异。经过对多个基础设施提供商的广泛测试,我们发现这种差异普遍存在。 这暴露了开源模型生态系统中一个更深层的问题:权重越开放,部署渠道越多样,质量就越难把控。 如果用户无法区分"模型能力缺陷"和"工程实现偏差",那么对开源生态的信任将会不可避免地崩塌。 ## 我们的解决方案 (https://www.kimi.com/blog/kimi-vendor-verifier#our-solution) **六项关键基准测试**(选用于暴露特定基础设施问题): 1. 预检验 (https://github.com/MoonshotAI/Kimi-Vendor-Verifier?tab=readme-ov-file#3-pre-flight-check):验证 API 参数约束(temperature、top\_p 等)是否正确执行。所有测试通过后方可进入基准测试评估阶段。 2. OCRBench (https://github.com/MoonshotAI/Kimi-Vendor-Verifier?tab=readme-ov-file#ocrbench-quick-validation):5 分钟多模态流水线冒烟测试。 3. MMMU Pro (https://github.com/MoonshotAI/Kimi-Vendor-Verifier?tab=readme-ov-file#mmmu-pro-vision):通过测试多样化的视觉输入来验证视觉预处理。 4. AIME2025 (https://github.com/MoonshotAI/Kimi-Vendor-Verifier?tab=readme-ov-file#aime-2025):长输出压力测试。可捕获 KV 缓存 bug 和量化精度下降(这些问题在短测试中往往被隐藏)。 5. K2VV ToolCall (https://github.com/MoonshotAI/K2-Vendor-Verifier):衡量触发一致性(F1)和 JSON Schema 准确性。工具错误会在 agent 中累积,我们力求尽早发现。 6. SWE-Bench:完整代理编程测试。(因依赖沙盒环境,暂不开源) **上游修复**:我们与 vLLM/SGLang/KTransformers 社区紧密合作,从根源解决问题,而非仅仅检测症状。 **发布前验证**:我们不等到用户投诉后才行动,而是提供早期测试访问权限。这让基础设施提供商能够在用户遇到问题之前验证其部署环境。 **持续基准测试**:我们将维护供应商结果的公开排行榜。这种透明度促使供应商重视准确性。 ## 测试成本估算 (https://www.kimi.com/blog/kimi-vendor-verifier#testing-cost-estimation) 我们在两台 NVIDIA H20 8-GPU 服务器上完成了完整评估流程验证,顺序执行约需 15 小时。为提升评估效率,脚本已针对长时间运行推理场景进行优化,包括流式推理、自动重试和检查点恢复机制。 ## 公开邀请 (https://www.kimi.com/blog/kimi-vendor-verifier#an-open-invitation) **权重开放了,正确运行它的知识也应当开放。** 我们正在扩展供应商覆盖范围,并寻求更轻量的代理测试方案。**联系我们:[contact-kvv@kimi\.com](mailto:[email protected])**

相似文章

Kimi-K3 在 HuggingFace 上发布

Reddit r/artificial

Moonshot AI 发布了 Kimi-K3,这是一个拥有 2.8 万亿参数的混合专家模型,支持 100 万 tokens 的上下文窗口。该模型已在 HuggingFace 上以具有商业限制的宽松许可证提供。

moonshotai/Kimi-K2.7-Code · Hugging Face

Reddit r/LocalLLaMA

Moonshot AI 发布了 Kimi K2.7 Code,这是一个专注于编码和智能体任务的 1T 参数混合专家模型,具有改进的 token 效率,并在与 GPT-5.5 和 Claude Opus 4.8 的对比中取得了强劲的基准测试结果。

K3 部署的推理引擎指南(10 分钟阅读)

TLDR AI

Kimi K3 是一个 2.8 万亿参数的多模态 MoE 模型,具有 100 万 token 的上下文窗口,现已获得 vLLM 的 day-0 支持。本指南详细介绍了 vLLM 如何服务于 K3 的新颖架构,包括 Kimi Delta Attention、Attention Residuals 以及推测解码,最高可达 370 tok/s。

Kimi K3,以及我们还能从pelican基准测试中学到什么

Simon Willison's Blog

中国AI实验室Moonshot AI发布了Kimi K3,一个2.8万亿参数的开源权重模型,声称这是首个开源的3T级模型,并在多个基准测试中击败了多个领先模型。文章还讨论了该模型的定价以及一个有趣的pelican SVG基准测试。