thomsonreuters/Thomson-1.0-Small

Hugging Face Models Trending 模型

摘要

Thomson-1.0-Small是汤森路透推出的一款开源基础模型,通过持续学习开发,旨在提升在法律、税务和新闻领域的性能,注重价值主权和效率。

任务: image-text-to-text 标签: transformers, safetensors, qwen3_5_moe, image-text-to-text, 对话式, 基础模型:tri-fair-lab/Snowdon1.1-Small, 基础模型:微调:tri-fair-lab/Snowdon1.1-Small, 许可证:other, 端点兼容, 区域:us
查看原文
查看缓存全文

缓存时间: 2026/08/27 21:15

thomsonreuters/Thomson-1.0-Small · Hugging Face 来源: https://huggingface.co/thomsonreuters/Thomson-1.0-Small > 此存储库包含 Hugging Face Transformers 格式的模型权重和配置文件。更多详情请参阅我们的技术报告 Thomson: Continual Learning of Frontier Models for SovereignAI (https://huggingface.co/spaces/tri-fair-lab/publications/blob/main/Thomson_1_0_Technical_Report.pdf)。Thomson-1.0-Small 是一个前沿基础模型,在广泛的特定领域和通用领域以及实际部署环境中均表现出高水平的能力。它是 Thomson-1.0 系列中的开放权重成员,在持续学习范式下开发,特别注重法律、税务和新闻领域具有经济影响力和高风险的专业工作。它基于开放权重的 Qwen3.6-35B-A3B 模型重新构建,并在广泛的性能领域进行了大幅改进。 ## https://huggingface.co/thomsonreuters/Thomson-1.0-Small#thomson-10-highlights Thomson-1.0 亮点 前沿模型的开发通常被认为是少数资金雄厚的参与者独有的领域。Thomson 证明,通过在开放权重模型上进行持续学习,广泛的机构也可以实现前沿性能: - 持续学习: 与小规模微调、提示工程或在冻结模型上进行工具增强等有限方法不同,该流程在广泛的能力(包括未明确针对的能力)上实现了显著改进,同时几乎消除了狭义领域适应中常见的遗忘问题。 - 高风险专业工作: 增强了对法律、税务和新闻领域的关注——这些领域通常被认为将通过 AI 实现巨大的生产力提升,结合了技术领域的正式性和严谨推理,以及人文学科的细微差别和对不确定性的包容性。 - 价值主权: 对齐决定了模型表达哪些价值观以及如何处理可信叙事分歧的问题。这里以 Public AI Constitution (https://huggingface.co/spaces/tri-fair-lab/publications/blob/main/Public_AI_Constitution.pdf) 为目标,这是一份公开开发的文档,允许自由使用和修改,而非专有的价值体系,并在两个点应用:价值重新对齐期间的 Constitutional DPO,以及强化学习期间的宪法一致性奖励。模型的规范性基础本身应是共享的公共资源,接受审查和辩论。 - 以数据为中心: 专有内容不仅仅是作为知识吸收,而是转化为监督信号。中期训练数据从超过 19 万亿 token 的语料库中精选,偏好数据则源自专家编写的材料,任何标注预算都无法大规模复制。 - 智能体深度研究: 一个完整的研究工具,其奖励结构旨在激励忠实的工具使用和准确的引用模式,对于减少高风险场景中的幻觉至关重要。 - 效率: 整个流程消耗了约 1.63 × 10^23 FLOP,历时 35,207 B200 GPU 小时,表明这些结果可以在远低于通常认为的计算和人员预算下实现。 ## https://huggingface.co/thomsonreuters/Thomson-1.0-Small#model-overview 模型概述 - 类型:因果语言模型(混合专家) - 训练阶段:价值重新对齐、持续预训练、后训练 - 基础检查点:Snowdon1.1-Small (https://huggingface.co/tri-fair-lab/Snowdon1.1-Small) - 参数数量:总计 35B,激活 3B - 架构:Qwen3.6-35B-A3B (https://huggingface.co/Qwen/Qwen3.6-35B-A3B);完整规格请参阅 config.json - 上下文长度:原生支持 262,144 token - 训练计算量:1.63 × 10^23 FLOP / 35,207 B200 GPU 小时 - 精度:BF16 权重 ## https://huggingface.co/thomsonreuters/Thomson-1.0-Small#model-training-and-data 模型训练与数据 Thomson 模型开发流程 (https://huggingface.co/thomsonreuters/Thomson-1.0-Small/resolve/main/thomson_model_development_pipeline.svg) 该流程分为三个具有不同开发重点的顺序模块,允许调整计算投入以适应主权要求。 价值聚焦。 从一个开放权重、经过指令微调的基础模型开始,通过 Constitutional DPO 重新对齐价值观(可能辅以激活引导),使模型表达的价值与 Public AI Constitution 保持一致。 知识聚焦。 以数据为中心的持续预训练 (CPT) 吸收汤森路透的专有数据——数十年的新闻、合同、监管备案、案例法、法规和实践指南——通过模型合并保护通用能力,同时吸收领域知识。中期训练语料库包含 2000 亿 token,从超过 19 万亿 token 的许可公开和专有数据池中精选,大致平均分为精选的专有文档、这些文档的合成改写以及通用能力回放数据。 行为、技能与智能体聚焦。 后训练结合了直接偏好优化和强化学习。基础数据包括用于强化早期阶段削弱知识的排练数据,源自汤森路透自身专家编写的文档驱动的偏好数据,基于领域模式(如案例法的 IRAC)构建的本体驱动的偏好数据,反映从业者日常实际使用 AI 方式的专家编写的多样化查询数据,以及来自深度研究工具的智能体数据。 ## https://huggingface.co/thomsonreuters/Thomson-1.0-Small#benchmark-results 基准测试结果 ### https://huggingface.co/thomsonreuters/Thomson-1.0-Small#cross-domain-overview 跨领域概述 Thomson-1.0-Small Snowdon-1.1-Small Qwen3.6-35B-A3B Gemma 4-31B Haiku 4.5 总体平均 74.6 71.7 71.7 71.2 68.2 法律 Stanford LegalBench 79.9 80.9 80.3 83.1 80.7 信息检索 49.6 48.6 49.4 51.9 49.2 推理 68.2 67.3 64.7 71.9 65.5 分类 70.0 70.1 70.4 69.4 68.1 文档处理与 RAG 78.8 71.2 74.7 76.6 43.8 摘要 89.4 88.1 89.0 89.4 84.3 合同理解 67.3 64.8 63.7 73.2 70.1 人类查询 90.2 82.2 82.6 81.2 74.9 深度研究 85.0 80.0 82.0 74.0 80.0 Harvey 法律代理基准 73.4 71.5 69.5 34.2 60.5 领域平均 75.2 72.4 72.7 70.5 67.7 税务 深度研究 78.6 68.0 68.0 75.0 62.0 税务问答 86.6 85.2 86.2 84.5 79.4 领域平均 82.6 76.5 77.3 79.6 70.7 新闻 深度研究 74.2 67.5 73.0 74.7 81.0 通用 事实性 61.1 59.3 58.8 57.6 56.8 长上下文 74.1 73.8 73.8 69.4 67.4 多语言性 71.9 72.8 73.1 79.4 85.8 指令遵循 86.1 85.5 85.6 89.3 78.2 写作 81.0 79.3 79.5 75.5 77.9 推理 61.5 61.3 61.5 66.1 49.3 通用代理 85.8 81.4 80.3 72.9 59.7 编程 37.4 35.6 39.8 34.6 32.9 数学 86.7 88.0 87.5 91.1 66.5 领域平均 71.7 70.8 71.1 70.7 63.8 安全/价值观 政治中立 98.5 91.5 78.5 91.5 92.0 鲁棒性 56.3 47.3 48.7 41.7 70.2 对抗性测试 89.1 87.7 89.2 88.5 -- 领域平均 81.3 75.5 72.1 73.9 81.1 1. 每行中的最佳分数以粗体显示。破折号 (–) 表示未对该模型运行的基准测试。 2. 所有模型均以中等推理努力程度运行。 3. 总体平均是所有单独基准测试的未加权平均值,不包括对抗性测试。 4. 深度研究行报告了完整性(~40%)、事实性(~35%)、相关性(~20%)和连贯性(~5%)的加权汇总,在具有工具访问权限的规划-执行-报告工具内生成的报告上评分。 5. Snowdon-1.1-Small 是中期训练之前立即进行的价值对齐检查点。 ### https://huggingface.co/thomsonreuters/Thomson-1.0-Small#legal 法律 常见开放法律基准测试的结果。 Thomson-1.0-Small Snowdon-1.1-Small Qwen3.6-35B-A3B Gemma 4-31B Haiku 4.5 PRBench Hard 31.4 25.9 26.9 25.2 19.3 Stanford LegalBench 79.9 80.9 80.3 83.1 80.7 Lexam MCQ4 (en) 72.2 75.6 75.8 87.4 72.2 MBE Bar Exam 83.4 83.1 80.1 88.8 77.3 Contract Scrub 44.6 38.5 39.6 54.8 36.5 Query Sufficiency 59.4 54.8 55.7 51.7 47.4 Harvey 法律代理基准 73.4 71.5 69.5 30.2 60.5 1. 每个模型都通过相同的工具进行评估,使用相同的提示,具有可比的推理参数和评分流程,旨在忠实衡量性能而非偶然的人为产物。 2. 除非基准测试本身定义了检索或工具访问权限,否则不授予任何模型;如果定义,则所有模型获得相同的工具。 3. 分数为百分比。每行中的最佳结果以粗体显示。 ### https://huggingface.co/thomsonreuters/Thomson-1.0-Small#general-capability-preservation 通用能力保留 流行通用能力基准测试的结果。 Thomson-1.0-Small Snowdon-1.1-Small Qwen3.6-35B-A3B AIME 2026 90.0 93.3 86.7 FaithEval-Inconsistent 97.7 96.7 96.9 GDPval 71.6 75.8 73.7 GPQA-Diamond 85.4 85.4 85.2 Humanity’s Last Exam 13.4 13.3 14.1 IFEval 91.0 90.0 91.1 MGSM 90.2 87.4 88.9 MMLU-Pro 85.7 85.2 85.2 SimpleQA-Verified 22.5 22.1 21.2 SWE-bench Pro 34.4 32.9 34.3 Tau2: Telecom 100.0 98.3 100.0 Terminal-Bench 2.1 40.5 38.4 45.2 WritingBench 81.0 79.3 79.5 1. 这些基准测试在训练期间未被针对。它们衡量持续学习是否保留了从起始检查点继承的广泛能力。 2. 基准测试使用英国 AI 安全研究所的 Inspect AI 框架及其附带的 inspect_evals 任务实现进行评估。 3. 分数为百分比。每行中的最佳结果以粗体显示;并列结果均以粗体显示。 ## https://huggingface.co/thomsonreuters/Thomson-1.0-Small#quickstart 快速开始 > 模型权重兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等。 from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "thomsonreuters/Thomson-1.0-Small" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained( model_id, dtype="auto", device_map="auto", ) messages = [{"role": "user", "content": ""}] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, return_tensors="pt" ).to(model.device) outputs = model.generate(inputs, max_new_tokens=2048) print(tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True)) ## https://huggingface.co/thomsonreuters/Thomson-1.0-Small#citation 引用 @misc{thomson2026, title = {{Thomson}: Continual Learning of Frontier Models for {SovereignAI}}, author = {Shengzhuang Chen and Jerrod Parker and Yejin Bang and Andrew M. Bean and Nabeel Seedat and Stefan Winzeck and Daniil Glazkov and Jannik Zgraggen and Fangyi Yu and Scott Arnott and Dietrich Trautmann and Luca Ciuffreda and Guglielmo Bonifazi and Davide Romano and Bradley Bell and Kirsty Fielding and Daniele Giofr\'{e} and Tom Zielund and Ipshita Chatterjee and Sneha Murthy Ghantasala and Manpreet Nanreh and John Scoville and Maciej Sakowicz and Wassim Seifeddine and Lukas Thede and Jonathan Richard Schwarz}, institution = {Thomson Reuters}, year = {2026} } ## https://huggingface.co/thomsonreuters/Thomson-1.0-Small#correspondence 通信 \{first\.last\}@thomsonreuters\.com ## https://huggingface.co/thomsonreuters/Thomson-1.0-Small#acknowledgements 致谢 由汤森路透与帝国理工学院、DatologyAI 和 Lambda 合作开发。价值重新对齐由帝国理工学院合作完成;持续预训练数据与 DatologyAI 合作精选。

相似文章

Thomson Reuters 推出自己的前沿模型

Hacker News Top

Thomson Reuters 已推出其首款专有大型语言模型,名为 Thomson,该模型基于开源基础模型和专有内容的混合训练,以为专业人士提供高效、领域特定的AI。

Thomson Reuters CEO Steve Hasker swears by this AI Routine

YouTube AI Channels

Thomson Reuters CEO Steve Hasker shares his personal Monday morning AI routine, emphasizing authenticity and hands-on use of tools while urging teams to learn from fast movers and those making the most mistakes.