@qqqqqf_: 我加测了 Fable5,我发现他和 Anthropic 的大部分模型都获取不到极高的(>0.9)的相似性 这有概率说明这大概是一个前所未有的混合数据的新基座模型(仅为猜测,根据测试后训练也会影响这个指纹的结果,仅为参考) 但是额外的惊喜是…
摘要
用户 @qqqqqf_ 分享了对 Fable5 等模型的指纹测试结果,发现 Fable5 与大多数 Anthropic 模型相似度不高,但与 kimi k2.7、qwen3-7max、glm5.2 等有极高相似性,猜测可能存在数据泄露或蒸馏;同时发布了开源项目 ai-model-fingerprint 用于模型识别和检测。
查看缓存全文
缓存时间: 2026/07/02 10:20
我加测了 Fable5,我发现他和 Anthropic 的大部分模型都获取不到极高的(>0.9)的相似性
这有概率说明这大概是一个前所未有的混合数据的新基座模型(仅为猜测,根据测试后训练也会影响这个指纹的结果,仅为参考)
但是额外的惊喜是,kimik2.7,qwen3-7max,glm5.2 都和 Fable 保持了极高的相似性??(0.97/0.93)
难道是在 mythos 的时候就已经泄露并蒸馏了? (以上这一点仅为猜测,请理性看待)
并且和 opus4.8 保持了极高的不相似性,这大概说明 opus4.7/4.8 确实不像是和 Fable/sonnet5 同一条路线的分支,也应证了为什么我们一直在吐槽 opus4.7/4.8
项目在:https://github.com/qqqqqf-q/ai-model-fingerprint…
使用 openrouter 原价 api
qqqqqf-q/ai-model-fingerprint
Source: https://github.com/qqqqqf-q/ai-model-fingerprint
AI 模型随机数指纹数据集
通过“随机选数字“的统计分布指纹,区分 / 检测 17 个 AI 模型。原理源自 hlwy-ai-checker。
原理
大模型并非真随机数生成器。固定 prompt「请从 1 到 355 之间随机选择一个数字」、temperature=1.0 大量采样,不同模型因训练数据 / 架构 / RLHF / tokenizer 差异,会产生统计上可区分的分布指纹。该指纹不易被系统提示词覆盖,可用于检测第三方 API 是否掺假。
采集
- OpenRouter API,17 个模型,每模型 ~300 有效样本(minimax 后处理恢复 622)
- prompt 固定,
max_tokens=32,大多数模型用reasoning.enabled=false禁用推理 grok-build-0.1/kimi-k2.7-code强制 reasoning,改用max_tokens=2048- 每条请求完整保存:raw response body /
system_fingerprint/usage(含 cost) / request 参数 / latency / http_status - 支持断点续采、并发、429 退避重试
数据结构
| 路径 | 内容 |
|---|---|
data/raw_*.jsonl | 每模型全量原始记录(一行一条请求,含完整 response) |
data/summary.json | 指纹向量 + 统计量 + 17×17 相似度矩阵 + 全量数字序列 |
figures/ | 可视化图表(分布 / 统计量 / 相似度热力图 / 箱线图 / 综述 overview) |
模型(17)
claude opus 4.6/4.7/4.8、sonnet 4.6、haiku 4.5;gpt-5.5/5.4/4o-mini;glm-5.2;deepseek v3.2/v4-flash/v4-pro;minimax-m3;qwen3.7-plus;grok-build-0.1;kimi k2.6/k2.7-code
关键发现
- claude opus 4.6 ≈ 4.7(cos=0.997,指纹几乎相同),但 4.8 完全不同(cos≈0.04),且 4.8
unique=2准固定输出(300 次几乎只输出 237) - kimi k2.6 vs k2.7-code(同 base、k2.7 为后训练版):cos=0.631,后训练明显改变指纹
- deepseek 同栈不同语料 v3.2 / v4-flash / v4-pro 互相 cos=0.15~0.31
- 跨模型最像:haiku-4.5 ≈ sonnet-4.6 (0.997)、kimi-k2.7-code ≈ glm-5.2 (0.916)
复现
pip install -r requirements.txt
cp config.example.yaml config.yaml # 填入 OpenRouter key
python run.py --samples 300 # 采集
python check_data.py # 完整性验证
python analyze.py # 统计 + 图表
python estimate.py # token / cost 预估
成本
全量采集约 $1.03(grok reasoning 占大头,637 output token/req)。
相似文章
@FinanceYF5: 据说,zAI 的“某个新模型”在网络安全相关能力上至少和 Fable 5 一样强。 Chubby做了一些研究,但只找到一篇《华尔街日报》的文章。 不过那篇文章并没有提到一个全新的模型,而是把 GLM 5.2 作为近期发布的相对较新的模型来…
据传闻,zAI 的某个新模型在网络安全能力上至少与 Fable 5 一样强,但信息有限,仅引用了讨论 GLM 5.2 的华尔街日报文章。
@FinanceYF5: Anthropic 的情况看起来不太乐观:Fable 5 正在被价格更低的开源模型抢走市场。 据《金融时报》报道,在 Ramp 统计的企业 AI 支出中,Anthropic 最强模型 Fable 5 的占比仅为 11%。 原因很简单:Fa…
据《金融时报》报道,Anthropic 的最强模型 Fable 5 在企业 AI 支出中占比仅为 11%,正因价格过高而被更便宜的开源模型抢占市场。
@AlchainHust: https://x.com/AlchainHust/status/2064676532212097418
本文详细评测了Anthropic新发布的Claude Fable 5模型,并展示了作者用其一天内开发Mac App'翻箱'的过程。模型在代码生成和稳定性上有显著提升。
@seclink: Anthropic 于 6 月 9 日发布了 Claude Fable 5。作为一款“Mythos”级模型,它在编程、研究和视觉处理等基准测试中表现领先,尤其擅长处理代码迁移等大型项目。 该模型现已向 http://Claude.ai 上…
Anthropic 于 6 月 9 日发布了 Claude Fable 5,一款“Mythos”级模型,在编程、研究和视觉处理基准测试中表现领先,尤其擅长代码迁移等大型项目,现已对 Pro、Max、Team 和企业版用户开放。
@FinanceYF5: 所以,要么 GLM 5.2 比外界想象得更强,要么现在流传的消息有误导性。 根据 WSJ 的说法,智谱 AI 的 GLM-5.2 在某些漏洞发现场景中可以匹配美国顶级模型; 而中国的 360 Security 表示,其新的 Tulongf…
根据WSJ报道,智谱AI的GLM-5.2在漏洞发现场景中可匹配美国顶级模型;360 Security的新工具Tulongfeng也与Anthropic的Mythos相媲美。