OraclePhys:结构力学中LLM微调的系统框架

arXiv cs.LG 论文

摘要

OraclePhys 提出一个用于结构力学大语言模型微调的系统框架,包含有限元基准和数据集,以研究训练目标如何因果性地决定模型的内部化过程。

arXiv:2608.17162v1 Announce Type: new Abstract: 语言模型从微调中内部化的内容通常是在事后诊断的。我们将其设为实验变量。OraclePhys 是一个系统微调框架,包含三个组件:OraclePhys-Bench,一个精确分级的结构力学基准,其有限元神谕为每个答案和反事实编辑评分——无需人工标签,无需LLM评判;OraclePhys-30K,一个监督数据集,包含七种答案形式,基于字节相同的结构描述;以及一个跨七种形式和三种验证器角色的控制训练研究。该研究得出两个发现。首先,标签的答案形式——而非其比特数——因果性地决定了微调所教的内容:排名目标安装了一个分布外前向模型,其中未经训练的基础模型位于猜测先验,标量目标最多是部分模型,布尔目标则无可检测;向量-标量鸿沟在第二个物理领域、第二个模型家族和改写的评估表面上得以幸存。其次,书面或分数过滤的答案安装了这种能力,而优势加权分数(GRPO)提高了奖励,但在测试的配方和预算内,使模型在保留的物理数据上与起始状态统计等效——仅够用于路由。训练后的8B模型——首个处理空间结构响应的LLM——达到了任务的数据精度前沿:在零次和32次射击下,超过前沿LLM,达到专家水平。标签明确指出的目标计算就是微调所教的内容;你在什么上训练,就路由什么。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:22

# 面向结构力学的大语言模型微调系统性框架  
来源:https://arxiv.org/html/2608.17162  
郭睿 宋Affiliation:休斯顿大学、清华大学  
通讯作者:[mli52@cougarnet\.uh\.edu](mailto:[email protected])  
林婧 Affiliation:休斯顿大学、清华大学  
通讯作者:[mli52@cougarnet\.uh\.edu](mailto:[email protected])  
王昊谦 Affiliation:休斯顿大学、清华大学  
通讯作者:[mli52@cougarnet\.uh\.edu](mailto:[email protected])  

#### 摘要  
语言模型从微调中内化的知识通常只能事后诊断。我们将其转化为一个可操控的实验变量。  
OraclePhys是一个包含三个组成部分的系统性微调框架:OraclePhys-Bench是一个具有精确分级结构力学基准,其有限元预言机可对每个答案和反事实编辑进行评分——无需人工标注,也无需LLM评判;OraclePhys-30K是一个监督数据集,包含基于逐字节相同结构描述的七种答案形式;以及一个在七种形式和三种验证器角色下进行的受控训练研究。该研究得出两个发现。首先,标签的答案形式——而非其比特数——因果性地决定了微调所教授的内容:排序目标会安装一个分布外的前向模型,其中未经训练的基线模型处于猜测先验位置,标量目标至多安装一个部分模型,布尔目标则无可检测的改进;向量-标量鸿沟在第二个物理领域、第二个模型家族和改写评估环境中依然存在。其次,书面或经分数筛选的答案能够实现安装,而优势加权分数(GRPO)虽能提升奖励,但在所测试的方案和预算内,其模型在未见物理数据上与起始状态在统计上等价——仅够用于路由。训练得到的8B模型——首个处理空间结构响应的LLM——达到了该任务的数据精度前沿:在零样本和32样本设置下均超越前沿LLM,性能达到专家水平。  
*标签对目标计算的描述决定了微调所教授的内容;你训练什么就路由什么。*  

## 1 引言  
训练目标通常因其可分级性而被选择:标量损失、通过/失败检查、偏好分数。语言模型在特定目标下*内化*的内容通常只能通过事后探测或基准测试来诊断——这是一个充满惊人负面结果的研究领域(Vafa等,2024;Wang等,2024),它观察但不干预。目标本身是否因果性地决定了*内化*什么,而其他所有条件保持不变,尚未被分离为一个实验变量。  
图1:框架:以自然语言描述的钢结构;有限元预言机对每个答案和反事实编辑进行评分;旋钮是目标暴露其空间答案的程度(公式2)。底部:四个实验。  
我们使用OraclePhys-Bench(§2)来分离这一变量:有限元求解器返回任意钢框架的精确逐层侧向响应;空间目标在输入文本中是非局部的,干预探测则验证答案。该测试平台是一个关于训练问题的*模型生物体*,而非工程实践的基准。标签的答案形式是否决定微调内容,这一问题在该领域之外同样具有现实意义(Kung和Peng,2023;Webson和Pavlick,2022;Zhou等,2023)。  
要在这些解读之间做出决策,需要逐字节相同的输入、具有受控信息内容的标签,以及一个能评分每个反事实的评判器——自然语料库不具备这些特性,而该领域通过构建提供(Li等,2023)。代价——单一训练模板——已在局限性部分说明;收获则是:每个对比都是受控的,而非相关性的。  
实验在OraclePhys-30K上训练,保持基础模型、训练结构和输入文本逐字节相同,仅改变目标所要求的答案形式:完整的逐层排序(P)、峰值标量(A)或通过/失败布尔值(O)。排序目标安装了一个前向模型(0.86–0.91 分布外定位 vs. 0.19–0.25 未训练模型),标量目标至多安装一个部分模型,布尔目标则无可检测的改进(§3);向量-标量鸿沟在第二个物理领域、第二个模型家族和改写评估环境中均可复现。相同的预言机随后分离了验证器进入训练的不同方式(§4–5):书面或经分数筛选的答案能实现安装;优势加权分数使模型与起始状态在统计上等价,同时奖励提升——但足以弥合-0.15-0.15的动作接口差距;显式推理通道除了安装成本外没有增加任何内容。  
上限分析(§6)定位了这些结果:前沿模型接近一个30行的公式,专家GNN与训练后的8B相当,六个学习器收敛到一个由数据精度而非任务难度设定的带内。  
**贡献**  
- •我们构建了OraclePhys-Bench,一个用于结构力学的精确分级测试平台,具有经过验证的表面线索移除、干预探测和一个同构的第二个领域——一个受控的工具,而非排行榜。  
- •我们发布了OraclePhys-30K,一个包含基于逐字节相同结构描述的七种答案形式的监督数据集。  
- •我们通过受控研究——七种监督形式、三种验证器角色、一个精确预言机——展示了首个在*逐层结构响应*上训练的LLM(先前系统包装求解器或处理标量梁静力学;§7),训练一个8B模型达到任务的数据精度前沿:在零样本和32样本设置下超越Claude Opus 4.8,达到专家GNN的水平。  
- •我们确立了两个发现:监督标签的答案形式,而非其比特数,决定了微调所教授的内容;在所测试的方案中,书面或经分数筛选的答案能教授优势加权分数所不能教授的内容——分数仅够用于路由,而非安装。  

## 2 用于空间前向模型的预言机分级测试平台  
### 2.1 任务与预言机  
主题领域是二维钢框架的侧向响应(图1):多层、多跨,具有逐层截面、连接类型、可选支撑、损伤事件以及垂直分布变化的侧向荷载。OpenSees有限元模型返回任何结构的*逐层层间漂移比* δk=uk−uk−1hk,k∗=arg⁡maxk⁡δk,\\delta\_{k}\;=\;\frac{u\_{k}\-u\_{k\-1}}{h\_{k}},\qquad k^{\*}\;=\;\arg\max\_{k}\,\delta\_{k}, (1) 其中uku\_{k}是第kk层(底层u0=0u\_{0}\{=\}0)的侧向位移,hkh\_{k}是层高;*控制层*k∗k^{\*}是控制设计的层。较软或受损的层漂移更大,支撑会使其所在层变刚。有限元解*定义*了该任务的真相,对其进行分级是确定性和精确的,因此训练或评估中无需人工标注或基于模型的评判。模型仅看到*自然语言描述*(几何、逐层截面、连接、支撑、损伤、荷载),并必须按JSON格式对所有层进行漂移排序。主要指标:控制层的*top-1定位*和完整排序的Spearmanρ\rho,在未见结构上评估(每个轴n=150n\{=\}150;80用于外推)。  
该测试平台之所以具有诊断性而非仅仅是困难,有两个特性:结构弱点是*空间非局部*的(描述的任何单句都无法揭示控制层),且每个声称的能力都可以通过*干预进行探测*——预言机对反事实进行评分,因此“加强一层;弱点移动到哪里?”有验证过的答案。  
在整个论文中,“安装一个前向模型”(我们在此领域对世界模型的操作化定义)是一个*行为*主张——关于§2.2中干预探测轴的性能——而非关于内部表征的主张。并非没有尝试:线性探测器在每个设置中都能同样好地解码控制层——*包括行为上无用的O设置*——在表面基线水平;基于探测的测量在此对两到六倍的行为差异不敏感(局限性)。  

### 2.2 评估轴  
所有轴使用确定性实例流(§2.4)和相同的解析器;解析失败计为未命中。  
- 前向定位/排序:对未见结构的层进行排序(OOD结构有5-6层,而训练中为3-4层,因此每个测试排序都比训练中见过的任何排序长)。  
- 干预后前向:加强控制层;从编辑后的描述中定位*新的*控制层——根据构建,与编辑前答案负相关(编辑后族在训练中存在;局限性)。  
- 两步视野:两个顺序编辑——误差累积。  
- 外推:在最高结构上的前向定位。  
- 动作接口:*原始*结构加上一句动作(“在第3层添加支撑”),在内部应用;配对的控制将相同的转换重写为完整的编辑后描述,因此动作描述差距隔离了动作应用(§5)。  
- 不变性(健全性):加强一层不应使其相对变弱。  

### 2.3 两个难度层级,以及杀死表面  
- 1级(真实)结构遵循设计实践,留下可利用的规律性;2级(硬化)随机化它们(截面抖动、组合弱化、变化的荷载形状)。硬化是*经验证的*:词袋探测器从0.63降至0.26(机会0.18),结构特征探测器从0.76降至0.57,仅几何探测器保持接近1级(附录B)——没有能通过一级公式的词汇捷径存活。  
- 非学习参考是一个30行的一级公式(层剪力除以刚度代理)。它对我们*有偏*——它直接从设计对象读取数值截面属性——其2级得分(0.45/0.47)远高于随机:任何物理主张都必须超过这一行。  

### 2.4 划分、确定性和统计  
训练结构有3-4层;OOD池在保留几何条件下有5-6层。所有流都从固定种子确定性生成:每次运行——跨模型、检查点、月份——在每轴上回答*相同的*150个问题。这带来了三件事。  
(i) 在贪心解码和固定批处理下的*比特精确可重现性*。  
(ii) 配对统计:每个实例的正确性数组存储在每个结果文件中,所有模型比较都是精确的McNemar检验(McNemar 1947),对不一致对使用配对自举置信区间。本文报告约50次配对检验;阶梯式主张依赖于p<10−4p<10^{\-4}效应,该效应在任何标准多重性校正后仍然成立;答案-分数分离依赖于安装效应(p≤0.005p\leq 0.005)和在新的n=600n\{=\}600流上的功率直接终点对比(n=1800n\{=\}1800在不相交轴上合并,p<10−12p<10^{\-12};表8);我们将p∈[0.01,0.05]p\in[0.01,0.05]且未通过表5 FDR检验的结果视为次要、佐证证据。  
(iii) 机器可检查的来源:一个脚本从存档的每实例文件重新生成每个数字,配对进行指纹检查;导出的流、评分器和参考行构成了OraclePhys-Bench,新流按需生成以防御污染。  

## 3 目标形状阶梯  
### 3.1 一个旋钮:目标携带答案的多少  
三个训练臂共享基础模型(Qwen3-8B + LoRA)、更新预算、约4k训练结构和*逐字节相同的输入文本*(在构建时通过令牌级泄漏审计断言),仅在问题-答案后缀上不同。  
设δ\boldsymbol{\delta}来自公式1,漂移限值为τ\tau,三个标签为 yP y\_{\mathrm{P}}=argsort↓δ,yA=maxkδk, =\operatorname{argsort}\_{\downarrow}\,\boldsymbol{\delta},\qquad y\_{\mathrm{A}}=\max\_{k}\delta\_{k}, (2) yO y\_{\mathrm{O}}=\[maxkδk≤τ\], =\mathbf{1}\!\left\[\max\_{k}\delta\_{k}\leq\tau\right\], 对于nsn\_{s}层结构,携带约log2⁡(ns\!)≈2.6\sim\log\_{2}(n\_{s}\!)\approx 2.6–4.6比特(P,排序),约1–2有效比特(A,标量;没有层*命名*,尽管标量是最大值的函数),和≤1比特(O,布尔合规性)。  
臂A不是稻草人:它模拟了本测试平台旨在检测的聚合正确但定位错误的失败模式;其校准确分数证实了真实(尽管部分)结构(§3.3)。  
旋钮不是任务难度,而是*目标暴露预言机空间答案的程度*。在七种答案形式臂(约3.8k行,基于相同结构)、硬化第二轮课程和动作接口对中,OraclePhys-30K总计约3万预言机分级样本(术语和构成:附录C)。  

### 3.2 向量-标量鸿沟,三次  
图2:目标形状闸在三个设置中的表现(框架/Qwen,3个种子;热/Qwen;框架/Llama):向量-标量鸿沟在所有三个设置中复现;完整排序在主要设置中成立。条形:OOD定位;虚线:随机。  
图2显示了框架/Qwen(3个种子)、热/Qwen和框架/Llama的OOD控制层定位:P在所有三个设置中都达到0.86–0.91,而A和O仅在主要设置中清晰地与基础模型分离(热:O0.33≈A0.29,均接近基础;Llama上未运行O;完整表格见附录F)。  
该鸿沟在第二个物理领域——二维稳态热传导,一个结构同构(行↔层,冷却↔支撑)及其自身的表面线索审计——和第二个具有相同数据和方案的模型家族上复现。标量臂的部分出现是例外,而非规则(框架/Qwen上为0.56;热原始为0.29;Llama校准后与基础相当,对比原始0.11);向量-标量鸿沟是不变量,完整排序在配对检验下在主要设置中成立(§3.3)。  
这两个领域没有可利用的表面:在框架上训练的P零样本迁移到热后坍缩到机会水平定位(0.133 vs. 热排序上的均匀分布0.187;热群体先验为0.25),而其输出格式保持完整——每次安装都是领域特定的。  

### 3.3 格式校准控制:知识,而非输出格式  
A和O在训练中从未产生过排序,因此原始阶梯混淆了缺失知识和格式错误——由两个低于基础异常标出,这是测量伪影的标志。因此,我们用两个前置的工作示例(*fmt2*)重新运行每个臂(§3.3–3.4全程使用1级流):每个臂相同的提示,使格式...

相似文章

Omega-S: A Functional Resilience Index for LLM Fine-Tuning

Hugging Face Daily Papers

This paper introduces Omega-S, a lightweight, data-free regularization penalty for low-rank fine-tuning that improves retention of original model capabilities by penalizing variance in weight-matrix node degrees. Experiments on Llama-3-8B with LoRA show it retains more original capability than no regularization or tuned baselines.

训练利润最优LLM的理论

arXiv cs.LG

本文提出了一种经济模型,结合缩放定律与微观经济学理论,分析大语言模型在利润最优情况下的训练策略,权衡模型质量、训练成本与硬件效率等因素。