@qqqqqf_: 我加测了 Fable5,我发现他和 Anthropic 的大部分模型都获取不到极高的(>0.9)的相似性 这有概率说明这大概是一个前所未有的混合数据的新基座模型(仅为猜测,根据测试后训练也会影响这个指纹的结果,仅为参考) 但是额外的惊喜是…

X AI KOLs Timeline 新闻

摘要

用户 @qqqqqf_ 分享了对 Fable5 等模型的指纹测试结果,发现 Fable5 与大多数 Anthropic 模型相似度不高,但与 kimi k2.7、qwen3-7max、glm5.2 等有极高相似性,猜测可能存在数据泄露或蒸馏;同时发布了开源项目 ai-model-fingerprint 用于模型识别和检测。

我加测了 Fable5,我发现他和 Anthropic 的大部分模型都获取不到极高的(>0.9)的相似性 这有概率说明这大概是一个前所未有的混合数据的新基座模型(仅为猜测,根据测试后训练也会影响这个指纹的结果,仅为参考) 但是额外的惊喜是,kimik2.7,qwen3-7max,glm5.2 都和 Fable 保持了极高的相似性??(0.97/0.93) 难道是在 mythos 的时候就已经泄露并蒸馏了? (以上这一点仅为猜测,请理性看待) 并且和 opus4.8 保持了极高的不相似性,这大概说明 opus4.7/4.8 确实不像是和 Fable/sonnet5 同一条路线的分支,也应证了为什么我们一直在吐槽 opus4.7/4.8 项目在:https://github.com/qqqqqf-q/ai-model-fingerprint… 使用 openrouter 原价 api
查看原文
查看缓存全文

缓存时间: 2026/07/02 10:20

我加测了 Fable5,我发现他和 Anthropic 的大部分模型都获取不到极高的(>0.9)的相似性

这有概率说明这大概是一个前所未有的混合数据的新基座模型(仅为猜测,根据测试后训练也会影响这个指纹的结果,仅为参考)

但是额外的惊喜是,kimik2.7,qwen3-7max,glm5.2 都和 Fable 保持了极高的相似性??(0.97/0.93)

难道是在 mythos 的时候就已经泄露并蒸馏了? (以上这一点仅为猜测,请理性看待)

并且和 opus4.8 保持了极高的不相似性,这大概说明 opus4.7/4.8 确实不像是和 Fable/sonnet5 同一条路线的分支,也应证了为什么我们一直在吐槽 opus4.7/4.8

项目在:https://github.com/qqqqqf-q/ai-model-fingerprint…

使用 openrouter 原价 api


qqqqqf-q/ai-model-fingerprint

Source: https://github.com/qqqqqf-q/ai-model-fingerprint

AI 模型随机数指纹数据集

通过“随机选数字“的统计分布指纹,区分 / 检测 17 个 AI 模型。原理源自 hlwy-ai-checker

原理

大模型并非真随机数生成器。固定 prompt「请从 1 到 355 之间随机选择一个数字」、temperature=1.0 大量采样,不同模型因训练数据 / 架构 / RLHF / tokenizer 差异,会产生统计上可区分的分布指纹。该指纹不易被系统提示词覆盖,可用于检测第三方 API 是否掺假。

采集

  • OpenRouter API,17 个模型,每模型 ~300 有效样本(minimax 后处理恢复 622)
  • prompt 固定,max_tokens=32,大多数模型用 reasoning.enabled=false 禁用推理
  • grok-build-0.1 / kimi-k2.7-code 强制 reasoning,改用 max_tokens=2048
  • 每条请求完整保存:raw response body / system_fingerprint / usage(含 cost) / request 参数 / latency / http_status
  • 支持断点续采、并发、429 退避重试

数据结构

路径内容
data/raw_*.jsonl每模型全量原始记录(一行一条请求,含完整 response)
data/summary.json指纹向量 + 统计量 + 17×17 相似度矩阵 + 全量数字序列
figures/可视化图表(分布 / 统计量 / 相似度热力图 / 箱线图 / 综述 overview)

模型(17)

claude opus 4.6/4.7/4.8、sonnet 4.6、haiku 4.5;gpt-5.5/5.4/4o-mini;glm-5.2;deepseek v3.2/v4-flash/v4-pro;minimax-m3;qwen3.7-plus;grok-build-0.1;kimi k2.6/k2.7-code

关键发现

  • claude opus 4.6 ≈ 4.7(cos=0.997,指纹几乎相同),但 4.8 完全不同(cos≈0.04),且 4.8 unique=2 准固定输出(300 次几乎只输出 237)
  • kimi k2.6 vs k2.7-code(同 base、k2.7 为后训练版):cos=0.631,后训练明显改变指纹
  • deepseek 同栈不同语料 v3.2 / v4-flash / v4-pro 互相 cos=0.15~0.31
  • 跨模型最像:haiku-4.5 ≈ sonnet-4.6 (0.997)、kimi-k2.7-code ≈ glm-5.2 (0.916)

复现

pip install -r requirements.txt
cp config.example.yaml config.yaml   # 填入 OpenRouter key
python run.py --samples 300          # 采集
python check_data.py                 # 完整性验证
python analyze.py                    # 统计 + 图表
python estimate.py                   # token / cost 预估

成本

全量采集约 $1.03(grok reasoning 占大头,637 output token/req)。

相似文章

@seclink: Anthropic 于 6 月 9 日发布了 Claude Fable 5。作为一款“Mythos”级模型,它在编程、研究和视觉处理等基准测试中表现领先,尤其擅长处理代码迁移等大型项目。 该模型现已向 http://Claude.ai 上…

X AI KOLs Following

Anthropic 于 6 月 9 日发布了 Claude Fable 5,一款“Mythos”级模型,在编程、研究和视觉处理基准测试中表现领先,尤其擅长代码迁移等大型项目,现已对 Pro、Max、Team 和企业版用户开放。