OraclePhys:结构力学中LLM微调的系统框架
摘要
OraclePhys 提出一个用于结构力学大语言模型微调的系统框架,包含有限元基准和数据集,以研究训练目标如何因果性地决定模型的内部化过程。
查看缓存全文
缓存时间: 2026/08/19 10:22
# 面向结构力学的大语言模型微调系统性框架 来源:https://arxiv.org/html/2608.17162 郭睿 宋Affiliation:休斯顿大学、清华大学 通讯作者:[mli52@cougarnet\.uh\.edu](mailto:[email protected]) 林婧 Affiliation:休斯顿大学、清华大学 通讯作者:[mli52@cougarnet\.uh\.edu](mailto:[email protected]) 王昊谦 Affiliation:休斯顿大学、清华大学 通讯作者:[mli52@cougarnet\.uh\.edu](mailto:[email protected]) #### 摘要 语言模型从微调中内化的知识通常只能事后诊断。我们将其转化为一个可操控的实验变量。 OraclePhys是一个包含三个组成部分的系统性微调框架:OraclePhys-Bench是一个具有精确分级结构力学基准,其有限元预言机可对每个答案和反事实编辑进行评分——无需人工标注,也无需LLM评判;OraclePhys-30K是一个监督数据集,包含基于逐字节相同结构描述的七种答案形式;以及一个在七种形式和三种验证器角色下进行的受控训练研究。该研究得出两个发现。首先,标签的答案形式——而非其比特数——因果性地决定了微调所教授的内容:排序目标会安装一个分布外的前向模型,其中未经训练的基线模型处于猜测先验位置,标量目标至多安装一个部分模型,布尔目标则无可检测的改进;向量-标量鸿沟在第二个物理领域、第二个模型家族和改写评估环境中依然存在。其次,书面或经分数筛选的答案能够实现安装,而优势加权分数(GRPO)虽能提升奖励,但在所测试的方案和预算内,其模型在未见物理数据上与起始状态在统计上等价——仅够用于路由。训练得到的8B模型——首个处理空间结构响应的LLM——达到了该任务的数据精度前沿:在零样本和32样本设置下均超越前沿LLM,性能达到专家水平。 *标签对目标计算的描述决定了微调所教授的内容;你训练什么就路由什么。* ## 1 引言 训练目标通常因其可分级性而被选择:标量损失、通过/失败检查、偏好分数。语言模型在特定目标下*内化*的内容通常只能通过事后探测或基准测试来诊断——这是一个充满惊人负面结果的研究领域(Vafa等,2024;Wang等,2024),它观察但不干预。目标本身是否因果性地决定了*内化*什么,而其他所有条件保持不变,尚未被分离为一个实验变量。 图1:框架:以自然语言描述的钢结构;有限元预言机对每个答案和反事实编辑进行评分;旋钮是目标暴露其空间答案的程度(公式2)。底部:四个实验。 我们使用OraclePhys-Bench(§2)来分离这一变量:有限元求解器返回任意钢框架的精确逐层侧向响应;空间目标在输入文本中是非局部的,干预探测则验证答案。该测试平台是一个关于训练问题的*模型生物体*,而非工程实践的基准。标签的答案形式是否决定微调内容,这一问题在该领域之外同样具有现实意义(Kung和Peng,2023;Webson和Pavlick,2022;Zhou等,2023)。 要在这些解读之间做出决策,需要逐字节相同的输入、具有受控信息内容的标签,以及一个能评分每个反事实的评判器——自然语料库不具备这些特性,而该领域通过构建提供(Li等,2023)。代价——单一训练模板——已在局限性部分说明;收获则是:每个对比都是受控的,而非相关性的。 实验在OraclePhys-30K上训练,保持基础模型、训练结构和输入文本逐字节相同,仅改变目标所要求的答案形式:完整的逐层排序(P)、峰值标量(A)或通过/失败布尔值(O)。排序目标安装了一个前向模型(0.86–0.91 分布外定位 vs. 0.19–0.25 未训练模型),标量目标至多安装一个部分模型,布尔目标则无可检测的改进(§3);向量-标量鸿沟在第二个物理领域、第二个模型家族和改写评估环境中均可复现。相同的预言机随后分离了验证器进入训练的不同方式(§4–5):书面或经分数筛选的答案能实现安装;优势加权分数使模型与起始状态在统计上等价,同时奖励提升——但足以弥合-0.15-0.15的动作接口差距;显式推理通道除了安装成本外没有增加任何内容。 上限分析(§6)定位了这些结果:前沿模型接近一个30行的公式,专家GNN与训练后的8B相当,六个学习器收敛到一个由数据精度而非任务难度设定的带内。 **贡献** - •我们构建了OraclePhys-Bench,一个用于结构力学的精确分级测试平台,具有经过验证的表面线索移除、干预探测和一个同构的第二个领域——一个受控的工具,而非排行榜。 - •我们发布了OraclePhys-30K,一个包含基于逐字节相同结构描述的七种答案形式的监督数据集。 - •我们通过受控研究——七种监督形式、三种验证器角色、一个精确预言机——展示了首个在*逐层结构响应*上训练的LLM(先前系统包装求解器或处理标量梁静力学;§7),训练一个8B模型达到任务的数据精度前沿:在零样本和32样本设置下超越Claude Opus 4.8,达到专家GNN的水平。 - •我们确立了两个发现:监督标签的答案形式,而非其比特数,决定了微调所教授的内容;在所测试的方案中,书面或经分数筛选的答案能教授优势加权分数所不能教授的内容——分数仅够用于路由,而非安装。 ## 2 用于空间前向模型的预言机分级测试平台 ### 2.1 任务与预言机 主题领域是二维钢框架的侧向响应(图1):多层、多跨,具有逐层截面、连接类型、可选支撑、损伤事件以及垂直分布变化的侧向荷载。OpenSees有限元模型返回任何结构的*逐层层间漂移比* δk=uk−uk−1hk,k∗=argmaxkδk,\\delta\_{k}\;=\;\frac{u\_{k}\-u\_{k\-1}}{h\_{k}},\qquad k^{\*}\;=\;\arg\max\_{k}\,\delta\_{k}, (1) 其中uku\_{k}是第kk层(底层u0=0u\_{0}\{=\}0)的侧向位移,hkh\_{k}是层高;*控制层*k∗k^{\*}是控制设计的层。较软或受损的层漂移更大,支撑会使其所在层变刚。有限元解*定义*了该任务的真相,对其进行分级是确定性和精确的,因此训练或评估中无需人工标注或基于模型的评判。模型仅看到*自然语言描述*(几何、逐层截面、连接、支撑、损伤、荷载),并必须按JSON格式对所有层进行漂移排序。主要指标:控制层的*top-1定位*和完整排序的Spearmanρ\rho,在未见结构上评估(每个轴n=150n\{=\}150;80用于外推)。 该测试平台之所以具有诊断性而非仅仅是困难,有两个特性:结构弱点是*空间非局部*的(描述的任何单句都无法揭示控制层),且每个声称的能力都可以通过*干预进行探测*——预言机对反事实进行评分,因此“加强一层;弱点移动到哪里?”有验证过的答案。 在整个论文中,“安装一个前向模型”(我们在此领域对世界模型的操作化定义)是一个*行为*主张——关于§2.2中干预探测轴的性能——而非关于内部表征的主张。并非没有尝试:线性探测器在每个设置中都能同样好地解码控制层——*包括行为上无用的O设置*——在表面基线水平;基于探测的测量在此对两到六倍的行为差异不敏感(局限性)。 ### 2.2 评估轴 所有轴使用确定性实例流(§2.4)和相同的解析器;解析失败计为未命中。 - 前向定位/排序:对未见结构的层进行排序(OOD结构有5-6层,而训练中为3-4层,因此每个测试排序都比训练中见过的任何排序长)。 - 干预后前向:加强控制层;从编辑后的描述中定位*新的*控制层——根据构建,与编辑前答案负相关(编辑后族在训练中存在;局限性)。 - 两步视野:两个顺序编辑——误差累积。 - 外推:在最高结构上的前向定位。 - 动作接口:*原始*结构加上一句动作(“在第3层添加支撑”),在内部应用;配对的控制将相同的转换重写为完整的编辑后描述,因此动作描述差距隔离了动作应用(§5)。 - 不变性(健全性):加强一层不应使其相对变弱。 ### 2.3 两个难度层级,以及杀死表面 - 1级(真实)结构遵循设计实践,留下可利用的规律性;2级(硬化)随机化它们(截面抖动、组合弱化、变化的荷载形状)。硬化是*经验证的*:词袋探测器从0.63降至0.26(机会0.18),结构特征探测器从0.76降至0.57,仅几何探测器保持接近1级(附录B)——没有能通过一级公式的词汇捷径存活。 - 非学习参考是一个30行的一级公式(层剪力除以刚度代理)。它对我们*有偏*——它直接从设计对象读取数值截面属性——其2级得分(0.45/0.47)远高于随机:任何物理主张都必须超过这一行。 ### 2.4 划分、确定性和统计 训练结构有3-4层;OOD池在保留几何条件下有5-6层。所有流都从固定种子确定性生成:每次运行——跨模型、检查点、月份——在每轴上回答*相同的*150个问题。这带来了三件事。 (i) 在贪心解码和固定批处理下的*比特精确可重现性*。 (ii) 配对统计:每个实例的正确性数组存储在每个结果文件中,所有模型比较都是精确的McNemar检验(McNemar 1947),对不一致对使用配对自举置信区间。本文报告约50次配对检验;阶梯式主张依赖于p<10−4p<10^{\-4}效应,该效应在任何标准多重性校正后仍然成立;答案-分数分离依赖于安装效应(p≤0.005p\leq 0.005)和在新的n=600n\{=\}600流上的功率直接终点对比(n=1800n\{=\}1800在不相交轴上合并,p<10−12p<10^{\-12};表8);我们将p∈[0.01,0.05]p\in[0.01,0.05]且未通过表5 FDR检验的结果视为次要、佐证证据。 (iii) 机器可检查的来源:一个脚本从存档的每实例文件重新生成每个数字,配对进行指纹检查;导出的流、评分器和参考行构成了OraclePhys-Bench,新流按需生成以防御污染。 ## 3 目标形状阶梯 ### 3.1 一个旋钮:目标携带答案的多少 三个训练臂共享基础模型(Qwen3-8B + LoRA)、更新预算、约4k训练结构和*逐字节相同的输入文本*(在构建时通过令牌级泄漏审计断言),仅在问题-答案后缀上不同。 设δ\boldsymbol{\delta}来自公式1,漂移限值为τ\tau,三个标签为 yP y\_{\mathrm{P}}=argsort↓δ,yA=maxkδk, =\operatorname{argsort}\_{\downarrow}\,\boldsymbol{\delta},\qquad y\_{\mathrm{A}}=\max\_{k}\delta\_{k}, (2) yO y\_{\mathrm{O}}=\[maxkδk≤τ\], =\mathbf{1}\!\left\[\max\_{k}\delta\_{k}\leq\tau\right\], 对于nsn\_{s}层结构,携带约log2(ns\!)≈2.6\sim\log\_{2}(n\_{s}\!)\approx 2.6–4.6比特(P,排序),约1–2有效比特(A,标量;没有层*命名*,尽管标量是最大值的函数),和≤1比特(O,布尔合规性)。 臂A不是稻草人:它模拟了本测试平台旨在检测的聚合正确但定位错误的失败模式;其校准确分数证实了真实(尽管部分)结构(§3.3)。 旋钮不是任务难度,而是*目标暴露预言机空间答案的程度*。在七种答案形式臂(约3.8k行,基于相同结构)、硬化第二轮课程和动作接口对中,OraclePhys-30K总计约3万预言机分级样本(术语和构成:附录C)。 ### 3.2 向量-标量鸿沟,三次 图2:目标形状闸在三个设置中的表现(框架/Qwen,3个种子;热/Qwen;框架/Llama):向量-标量鸿沟在所有三个设置中复现;完整排序在主要设置中成立。条形:OOD定位;虚线:随机。 图2显示了框架/Qwen(3个种子)、热/Qwen和框架/Llama的OOD控制层定位:P在所有三个设置中都达到0.86–0.91,而A和O仅在主要设置中清晰地与基础模型分离(热:O0.33≈A0.29,均接近基础;Llama上未运行O;完整表格见附录F)。 该鸿沟在第二个物理领域——二维稳态热传导,一个结构同构(行↔层,冷却↔支撑)及其自身的表面线索审计——和第二个具有相同数据和方案的模型家族上复现。标量臂的部分出现是例外,而非规则(框架/Qwen上为0.56;热原始为0.29;Llama校准后与基础相当,对比原始0.11);向量-标量鸿沟是不变量,完整排序在配对检验下在主要设置中成立(§3.3)。 这两个领域没有可利用的表面:在框架上训练的P零样本迁移到热后坍缩到机会水平定位(0.133 vs. 热排序上的均匀分布0.187;热群体先验为0.25),而其输出格式保持完整——每次安装都是领域特定的。 ### 3.3 格式校准控制:知识,而非输出格式 A和O在训练中从未产生过排序,因此原始阶梯混淆了缺失知识和格式错误——由两个低于基础异常标出,这是测量伪影的标志。因此,我们用两个前置的工作示例(*fmt2*)重新运行每个臂(§3.3–3.4全程使用1级流):每个臂相同的提示,使格式...
相似文章
基于不同微调策略和模型规模的LLM归因分析在自动代码合规性检查中的应用
本文使用基于扰动的归因分析方法,分析了不同微调策略(全量微调、LoRA、量化LoRA)和模型规模对LLM在自动代码合规性任务中解释行为的影响。研究发现全量微调产生的归因模式比参数高效方法更集中,而较大的模型会形成特定的解释策略,但性能收益在超过7B参数后出现递减。
@_rohit_tiwari_: 这本115页的书揭示了LLM微调的秘密。https://drive.google.com/file/d/1cS5sWZw9XUDRI4uRh02-28Xq4-P…
一本全面介绍大语言模型微调的115页指南,涵盖理论与实践。
Omega-S: A Functional Resilience Index for LLM Fine-Tuning
This paper introduces Omega-S, a lightweight, data-free regularization penalty for low-rank fine-tuning that improves retention of original model capabilities by penalizing variance in weight-matrix node degrees. Experiments on Llama-3-8B with LoRA show it retains more original capability than no regularization or tuned baselines.
训练利润最优LLM的理论
本文提出了一种经济模型,结合缩放定律与微观经济学理论,分析大语言模型在利润最优情况下的训练策略,权衡模型质量、训练成本与硬件效率等因素。
测试前沿大语言模型在平行物理世界中的物理素养
本文介绍了一种四阶段诊断法,用于测试大语言模型能否在不熟悉的物理框架中进行推理。研究发现,前沿模型的通过率较低,并表现出定性分析与定量分析之间的不对称性。