TRACE:用于多目标材料发现的过渡感知残差控制
摘要
论文提出了TRACE,一个用于多目标材料发现的过渡感知残差控制框架,利用LLM代理,相比最先进的基线提高了命中率。
arXiv:2608.23631v1 公告类型:新
摘要:多目标材料发现使用LLM代理时,往往不仅受限于能提出多少候选材料,还受限于每次昂贵的性质评估能多有效地指导下一步搜索。现有代理主要存储已评估的候选材料及其分数,因此知道哪些材料成功了,但不知道哪些可执行编辑导致了有用的性质变化。当目标相互竞争时,这使得局部优化变得困难,因为改进一个性质的编辑可能损害另一个。我们提出了TRACE,一个过渡感知残差控制框架,将已评估的编辑作为反馈的基本单位。TRACE将每次局部优化记录为父-编辑-子过渡,附带观察到的性质变化,聚合过渡证据以估计可重用的编辑效果,并根据预测能力对未来编辑进行排序,以减少当前候选材料的剩余约束违反,同时避免对已满足目标的损害。在受控的同骨架比较中,TRACE优于最先进的LLM代理基线LLEMA,将宏平均命中率从18.13%提高到25.96%。
查看缓存全文
缓存时间: 2026/08/26 09:09
# TRACE:面向多目标材料发现的转换感知残差控制框架
来源:https://arxiv.org/html/2608.23631
康周1、童雨嘉1footnotemark:1(致谢:通讯作者,单位:武汉理工大学,邮箱:\{tyjjjj, yjl\}@whut.edu.cn)
陶勇(单位:武汉理工大学,邮箱:\{tyjjjj, yjl\}@whut.edu.cn)
袁静玲22footnotemark:2(单位:武汉理工大学,邮箱:\{tyjjjj, yjl\}@whut.edu.cn)
###### 摘要
大语言模型代理驱动的多目标材料发现不仅受限于候选方案的生成数量,更受限于每次昂贵的属性评估如何有效指导后续搜索。现有代理主要存储已评估候选物及其评分,因而知晓哪些材料表现成功,却无法识别哪些可执行编辑引发了有益的属性变化。这使得在目标冲突(即改善某一属性的编辑可能损害另一属性)时难以进行局部优化。我们提出TRACE框架——一种转换感知的残差控制机制,它将评估过的编辑作为反馈的基本单元。TRACE将每次局部优化记录为“父节点-编辑-子节点”的转换链并捕获观测到的属性变化量,通过聚合转换证据估算可复用编辑效果,并依据编辑对“减少当前候选物剩余约束违规度”与“避免破坏已达标目标”的预测能力进行排序。在相同基础架构的对照实验中,TRACE相较当前最优的大语言模型代理基线LLEMA,将宏平均命中率从18.13%提升至25.96%。
## 1 引言
在日益严苛的科学与工程应用中,多目标材料发现对于识别同时满足多项(常相互竞争)性能要求的可行材料至关重要¹³²⁶³。近期大语言模型代理的进展已能将领域知识与属性评估工具集成到迭代搜索流程中,使代理能更高效地提出、评估与优化候选材料³⁵²⁴。尽管如此,现有大语言模型材料发现代理主要依赖候选物层面的反馈,仅保留评估过的结构、属性值或成功/失败的文字摘要¹⁷³⁰¹。此类反馈仅告知代理某个候选物表现优劣,却未明确揭示具体可执行修改与观测到的属性变化之间的关联,导致难以确定下一步应如何改进候选物。这一局限在多目标发现中尤为关键——改善某一属性的修改可能损害另一属性¹⁵⁹,而修改的效用取决于当前候选物哪些约束尚未满足³⁸。图1清晰阐明了这一区别。
将每次评估视为一次转换,能为特定修改可能达成的效果提供可复用证据。先前观察到的“编辑-属性”关系可帮助识别符合当前候选物剩余未达标目标的修改。核心问题在于:如何将这些证据转化为具体的下一步编辑决策?基于此洞见,我们提出TRACE框架——一种转换感知的残差控制机制,旨在将此类转换反馈应用于多目标材料发现。TRACE记录每次评估过的“父节点-编辑-子节点”转换及其引发的属性变化,使代理能从累积搜索经验中估算可执行编辑对任务相关属性的可能影响。随后根据当前候选物的剩余约束违规情况选择编辑,优先选择能解决未达标目标且避免损害已达标属性的修改。通过结合这种反馈驱动的局部编辑与大语言模型的全局探索,TRACE既能利用已观察到的编辑效果,又保持对材料空间新区域的探索能力。
[图1]
*图1:研究动机。候选物层面的反馈记录哪些材料表现良好,而转换感知的反馈则捕捉可执行编辑如何改变材料属性,并利用此类证据指导后续搜索。*
我们在LLEMABench的14个多目标材料发现任务上评估TRACE,对比了多种生成式与代理式基线,并在属性评估次数相近条件下与LLEMA进行对照实验。在相同基础架构和近似匹配属性评估次数的条件下,TRACE相较LLEMA将Qwen的宏平均命中率从18.13%提升至25.96%。结果表明,显式重用转换级反馈能转化为更有效的多目标材料搜索。
我们的主要贡献总结如下:
- • **转换级反馈建模**:将材料搜索反馈构建为可复用的“父节点-编辑-子节点”转换经验,明确关联可执行编辑与观测到的属性变化,而非仅依赖候选物层面结果。
- • **转换感知残差控制**:开发TRACE框架,集成转换记忆、轻量级编辑效果估算与残差感知编辑选择机制。依据当前约束残差优先选择历史编辑效果,并通过全局大语言模型探索保持对可执行编辑空间之外区域的搜索。
- • **全面的实证评估**:在受控属性评估预算下,对TRACE在14个多目标LLEMABench任务上进行评估,通过组件消融实验、探索资源分配研究及转换级分析,验证其发现性能与转换反馈机制的有效性。
## 2 问题定义
### 2.1 受预言机限制的多目标材料发现
令 \(x \in \mathcal{X}\) 表示候选材料,预言机 \(\mathcal{O}\) 返回其任务相关属性向量:
\[
\mathbf{y}(x) = \mathcal{O}(x) = [y_1(x), \ldots, y_m(x)].
\]
预言机可以是模拟器、学习到的代理模型或实验测量²³¹,仅需能查询其输出。任务指定一组属性约束 \(\mathcal{C} = \{c_j\}_{j=1}^m\)。每个约束 \(c_j\) 定义一个可行集 \(\mathcal{F}_j \subseteq \mathbb{R}\),例如下界形式 \([t_j, \infty)\)、上界形式 \((-\infty, t_j]\) 或区间形式 \([l_j, u_j]\)。我们定义其归一化违规度为:
\[
d_j(x) = \frac{\operatorname{dist}\bigl(y_j(x), \mathcal{F}_j\bigr)}{s_j},
\]
其中 \(\operatorname{dist}(y, \mathcal{F}) = \inf_{z \in \mathcal{F}} \|y - z\|\),\(s_j > 0\) 用于将不同属性置于可比尺度。总约束残差为:
\[
D(x; \mathcal{C}) = \sum_{j=1}^m d_j(x).
\]
符号 \(D(\mathbf{y}; \mathcal{C})\) 表示直接对属性向量进行相同计算。任务特定的有效性检查处理非数值组成与安全要求。当 \(x\) 通过所有检查及属性约束时,设 \(h(x; \mathcal{C}) = 1\),否则 \(h(x; \mathcal{C}) = 0\)。在有限预言机评估下,目标是发现满足 \(h(x; \mathcal{C}) = 1\) 的候选物。
### 2.2 可执行编辑与转换反馈
搜索代理可全局生成新候选物,或对已评估的父节点 \(x\) 应用可执行编辑 \(e \in \mathcal{E}(x)\)。编辑算子确定性地构造子节点:
\[
x' = \mathcal{G}(x, e),
\]
并由同一预言机评估。编辑必须是可枚举、可执行且与材料表示兼容。一次完成的编辑产生转换:
\[
\tau = (x, e, x', \mathbf{y}(x), \mathbf{y}(x'), \Delta\mathbf{y}), \quad \Delta\mathbf{y} = \mathbf{y}(x') - \mathbf{y}(x).
\]
其实现残差增益为:
\[
g_D(\tau) = D(x; \mathcal{C}) - D(x'; \mathcal{C}),
\]
其中 \(g_D > 0\) 表示向可行域移动。候选物层面反馈保留 \((x', \mathbf{y}(x'))\),而转换反馈还将观测到的属性差异与执行的编辑关联起来。仅当子节点被成功构建并评估后,编辑才贡献转换证据。
## 3 TRACE:转换感知残差控制
TRACE在由大语言模型引导的进化搜索循环中,增强转换级反馈与残差感知局部控制。如图2所示,TRACE始于由大语言模型在任务约束下初始化的可编辑父节点池。转换记忆 \(\mathcal{T}\) 随后累积来自已评估父节点的局部编辑所产生的“父节点-编辑-子节点”转换,并为可复用编辑效果估算提供证据。搜索过程中,这些编辑效果与当前约束残差匹配以排列局部Delta编辑,而全局大语言模型路径通过任务引导提案维持更广泛的探索。
[图2]
*图2:TRACE概览。全局大语言模型提案支持广泛探索,局部Delta编辑根据当前约束残差优化已评估父节点。已评估的“父节点-编辑-子节点”转换更新转换记忆,其累积的属性变化指导后续编辑选择。*
### 3.1 转换记忆
转换记忆从执行的局部编辑中在线构建。在迭代 \(t\) 后,它包含:
\[
\mathcal{T}_t = \{\tau_i\}_{i=1}^{n_t} = \{\tau_i : \mathbf{y}(x'_i) \text{ is observed}\},
\]
其中每个 \(\tau_i\) 遵循式(5)。仅完成的编辑进入 \(\mathcal{T}_t\),因为 \(\Delta\mathbf{y}_i\) 需要观测到的子节点属性向量。未成功的执行留在辅助尝试日志中,但不提供属性差异监督。我们针对当前任务条件化所有转换集,并省略任务索引。每次完成的转换标注有父节点与子节点的约束状态。令 \(q(x) = \sum_{j=1}^m \mathbb{I}[d_j(x) = 0]\) 表示满足的数值约束数,\(v(x) = \mathbb{I}[D(x; \mathcal{C}) = 0]\) 表示数值可行性。不同于第2节的 \(h(x; \mathcal{C})\),\(v(x)\) 不包括非数值有效性检查。TRACE记录残差增益 \(g_D(\tau_i)\) 并赋予转换级效用:
\[
u_i = \lambda_v b_i + \lambda_q \bigl(q(x'_i) - q(x_i)\bigr) + \lambda_D g_D(\tau_i),
\]
其中 \(b_i\) 对进入或保持数值可行性进行奖励,对离开进行惩罚。通过非负权重,\(u_i\) 结合了边界行为、满足约束的变化与连续残差进展。因此它分离了编辑的观测属性变化与其对当前约束状态的价值。
### 3.2 可复用编辑效果估算
TRACE使用轻量级经验估算器而非完整的父节点条件动态模型。令 \(k(e)\) 表示精确编辑签名,\(o(e)\) 表示其算子类别。对于转换子集 \(A\),令 \(\bm{\mu}_{\Delta}(A)\) 和 \(\mu_u(A)\) 分别表示其平均属性变化量与转换效用。我们从具有相同精确签名的转换构造 \(\mathcal{T}_{k(e)}\),从具有相同算子的转换构造 \(\mathcal{T}_{o(e)}\)。预测编辑效果采用分层回退策略:
\[
\widehat{\Delta\mathbf{y}}_t(e) = \begin{cases}
\bm{\mu}_{\Delta}(\mathcal{T}_{k(e)}), & |\mathcal{T}_{k(e)}| \geq n_{\min}, \\
\bm{\mu}_{\Delta}(\mathcal{T}_{o(e)}), & |\mathcal{T}_{k(e)}| < n_{\min} \text{ and } |\mathcal{T}_{o(e)}| > 0, \\
\bm{\mu}_{\Delta}(\mathcal{T}_t), & \text{otherwise}.
\end{cases}
\]
历史效用 \(\widehat{u}_t(e)\) 使用相同的精确编辑、算子和全局回退进行估算。该结构在精确替换罕见时汇聚证据,而在有足够观测时保留编辑特定统计。当 \(\mathcal{T}_t\) 为空时,估算不可用,局部路径使用随机选择。对于已评估的父节点 \(x\),编辑诱导预测属性:
\[
\widehat{\mathbf{y}}(x, e) = \mathbf{y}(x) + \widehat{\Delta\mathbf{y}}_t(e),
\]
与预测残差进展:
\[
\widehat{g}_D(x, e) = D(x; \mathcal{C}) - D(\widehat{\mathbf{y}}(x, e); \mathcal{C}).
\]
估算值随转换累积而更新。在足够证据可用前,TRACE随机选择可执行编辑。在所有情况下,预测仅用于排序:预言机结果(而非预测)被写回转换记忆。
### 3.3 状态与残差感知的编辑选择
#### 父节点状态评估。
TRACE将“何处编辑”与“执行哪个编辑”分离。它通过 \(\mathbf{s}(x) = (v(x), q(x), D(x; \mathcal{C}))\) 表征父节点,并将已评估候选物分为数值可行、近可行、部分满足与遥远状态。可编辑的数值可行与近可行父节点获得更高优先级,其他状态保持探索访问,多次无效的父节点被降权。
#### 残差感知的编辑排序。
对于选定的父节点,TRACE枚举未见过的可执行编辑 \(\mathcal{E}(x)\)。对于数值可行、部分满足和遥远的父节点,它使用通用质量分数评估每个编辑:
\[
S_{\mathrm{qual}}(x, e) = \widehat{u}_t(e) + \lambda_g \widehat{g}_D(x, e) + \lambda_n N(x, e),
\]
这里 \(\widehat{u}_t(e)\) 总结历史转换效用,\(\widehat{g}_D(x, e)\) 衡量父节点特定的残差进展,\(N(x, e)\) 对未探索的子节点组成或模式进行奖励。在可行性边界附近,仅考虑总残差减少可能掩盖一个关键问题:某个编辑可能修复最后一个违规目标,同时破坏一个已满足的目标。因此我们将约束分为 \(M(x)\)相似文章
基于智能体工具规划的分子先导优化
TRACE是一种轨迹感知的LLM智能体,用于分子先导优化,通过对分子优化工具进行顺序决策,在保持分子相似性的同时改善ADMET性质。
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。
TeamTR:多智能体LLM协调的信任域微调
本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。
TRACE:面向长周期智能体安全的轨迹风险感知压缩方法
本文提出 TRACE,一种面向长周期 LLM 智能体的轨迹级安全检测方法,通过将完整轨迹证据压缩为潜在状态,更好地聚合分散的风险信号,在多个基准上达到最先进的准确率。
TRACE:一种用于高效智能体强化学习的统一展开预算分配框架
TRACE是一个统一的展开预算分配框架,通过基于前缀信息性在树状展开中动态分配资源,增强多轮智能体强化学习中的奖励对比。它在Multi-Hop QA等智能体基准测试上提升了效率和准确性。