# Kimi Vendor Verifier
来源:https://www.kimi.com/blog/kimi-vendor-verifier
研究 (https://www.kimi.com/blog/)## 重塑"信任链":Kimi Vendor VerifierGitHub (https://github.com/MoonshotAI/Kimi-Vendor-Verifier) (https://www.kimi.com/blog/kimi-vendor-verifier#rebuilding-the-chain-of-trust-kimi-vendor-verifier)
伴随着 Kimi K2\.6 模型的发布,我们开源了 Kimi Vendor Verifier(KVV)项目,旨在帮助开源模型的用户验证其推理实现的准确性。
这并非事后补救,而是因为我们深刻认识到:开源模型只是万里长征的第一步,确保它在各种环境下正确运行才是另一半战场。
## 官方评测结果 (https://www.kimi.com/blog/kimi-vendor-verifier#official-evaluation-results)
您可以点击此处 (https://statics.moonshot.cn/k2vv/kimi-k2.6_t0.6_m8192_nothink.zip) 获取 Kimi API K2VV 评估结果,用于计算 F1 分数。
## 为什么我们要构建 KVV (https://www.kimi.com/blog/kimi-vendor-verifier#why-we-built-kvv)
**从个案到系统性问题**
自 K2 Thinking 发布以来,我们频繁收到社区关于基准测试分数异常的反馈。经调查确认,这些问题中有相当一部分源于解码参数的使用不当。为快速解决这一问题,我们在 API 层面构建了第一道防线:强制在 Thinking 模式下设置 Temperature=1\.0 和 TopP=0\.95,并要求必须正确返回思考内容。
然而,更隐蔽的异常现象很快引起了我们的警觉。在对 LiveBenchmark (https://www.reddit.com/r/LocalLLaMA/comments/1osglws/kimi_k2_thinking_scores_lower_than_gemini_25/?rdt=41412) 的一次专项评测中,我们观察到第三方 API 与官方 API 之间存在显著差异。经过对多个基础设施提供商的广泛测试,我们发现这种差异普遍存在。
这暴露了开源模型生态系统中一个更深层的问题:权重越开放,部署渠道越多样,质量就越难把控。
如果用户无法区分"模型能力缺陷"和"工程实现偏差",那么对开源生态的信任将会不可避免地崩塌。
## 我们的解决方案 (https://www.kimi.com/blog/kimi-vendor-verifier#our-solution)
**六项关键基准测试**(选用于暴露特定基础设施问题):
1. 预检验 (https://github.com/MoonshotAI/Kimi-Vendor-Verifier?tab=readme-ov-file#3-pre-flight-check):验证 API 参数约束(temperature、top\_p 等)是否正确执行。所有测试通过后方可进入基准测试评估阶段。
2. OCRBench (https://github.com/MoonshotAI/Kimi-Vendor-Verifier?tab=readme-ov-file#ocrbench-quick-validation):5 分钟多模态流水线冒烟测试。
3. MMMU Pro (https://github.com/MoonshotAI/Kimi-Vendor-Verifier?tab=readme-ov-file#mmmu-pro-vision):通过测试多样化的视觉输入来验证视觉预处理。
4. AIME2025 (https://github.com/MoonshotAI/Kimi-Vendor-Verifier?tab=readme-ov-file#aime-2025):长输出压力测试。可捕获 KV 缓存 bug 和量化精度下降(这些问题在短测试中往往被隐藏)。
5. K2VV ToolCall (https://github.com/MoonshotAI/K2-Vendor-Verifier):衡量触发一致性(F1)和 JSON Schema 准确性。工具错误会在 agent 中累积,我们力求尽早发现。
6. SWE-Bench:完整代理编程测试。(因依赖沙盒环境,暂不开源)
**上游修复**:我们与 vLLM/SGLang/KTransformers 社区紧密合作,从根源解决问题,而非仅仅检测症状。
**发布前验证**:我们不等到用户投诉后才行动,而是提供早期测试访问权限。这让基础设施提供商能够在用户遇到问题之前验证其部署环境。
**持续基准测试**:我们将维护供应商结果的公开排行榜。这种透明度促使供应商重视准确性。
## 测试成本估算 (https://www.kimi.com/blog/kimi-vendor-verifier#testing-cost-estimation)
我们在两台 NVIDIA H20 8-GPU 服务器上完成了完整评估流程验证,顺序执行约需 15 小时。为提升评估效率,脚本已针对长时间运行推理场景进行优化,包括流式推理、自动重试和检查点恢复机制。
## 公开邀请 (https://www.kimi.com/blog/kimi-vendor-verifier#an-open-invitation)
**权重开放了,正确运行它的知识也应当开放。**
我们正在扩展供应商覆盖范围,并寻求更轻量的代理测试方案。**联系我们:[contact-kvv@kimi\.com](mailto:
[email protected])**