SolarChain-Eval:面向去中心化能源市场中可信经济代理的物理约束基准

arXiv cs.AI 论文

摘要

本文提出SolarChain-Eval,一个物理约束的基准,用于评估去中心化能源市场中的可信经济代理,集成了基于LLM的规划/审计层,并揭示了效用-安全性权衡。

arXiv:2607.08681v1 公告类型:新 摘要:随着自主AI系统越来越多地应用于信息物理环境,其评估需要兼顾任务性能和可信度。在去中心化能源市场中,自主代理可能提高市场效用,但也可能利用无效物理数据、制造虚假流动性并导致不稳定的治理决策。因此,我们提出SolarChain-Eval,一个物理约束的基准,用于评估可信经济代理。它将市场治理建模为与Gymnasium兼容的马尔可夫决策过程,代理每小时做出决策。SolarChain-Eval从多个维度评估每种策略,包括市场效用、物理安全、滑点、动作平滑性、空间公平性和可审计性。为支持代理评估,SolarChain-Eval集成了基于LLM的规划/审计层。规划器定义回合级动作边界和审计规则,而审计器审查和修订高风险动作。所有干预通过结构化日志记录,包括触发信号、提议动作、修订动作和审计理由。使用静态、随机、短视、强化学习(RL)和RL+LLM策略的实验揭示了清晰的效用-安全性权衡。RL代理提高了市场效用,但仍可能产生不安全行为。当移除物理惩罚时,奖励最大化代理利用无效生成并增加虚假流动性。LLM规划/审计器提高了可审计性并缓解了部分风险,但无法完全补偿错误指定的奖励函数。这些结果表明,可信自主AI评估需要物理约束和透明的干预痕迹。我们以开放获取方式在GitHub上发布数据和代码以确保可复现性。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:09

# SolarChain-Eval:面向去中心化能源市场可信经济主体的物理约束基准  
来源:https://arxiv.org/html/2607.08681,Yifan Xu(昆山杜克大学,江苏昆山,中国)和 Luyao Zhang(昆山杜克大学,江苏昆山,中国)  

###### 摘要  

随着智能体 AI 系统越来越多地应用于信息物理环境,对其的评估需要同时衡量任务性能和可信度。在去中心化能源市场中,自主智能体可能提升市场效用,但也可能利用无效的物理数据、制造虚假流动性并产生不稳定的治理决策。为此,我们提出 **SolarChain-Eval**,一个用于评估可信经济智能体的物理约束基准。该基准将市场治理建模为兼容 Gymnasium 的马尔可夫决策过程,智能体以小时为单位做出决策。SolarChain-Eval 从多个维度评估每个策略,包括市场效用、物理安全性、滑点、动作平滑性、空间公平性和可审计性。为支持智能体评估,SolarChain-Eval 集成了一个基于 LLM 的规划器/审计器层:规划器定义回合级动作边界和审计规则,审计器审查并修改高风险动作。所有干预均通过结构化日志记录,包括触发信号、提议动作、修改后动作和审计理由。针对静态、随机、短视、RL 以及 RL+LLM 策略的实验揭示了明确的效用-安全性权衡:RL 智能体提升了市场效用,但仍可能产生不安全行为;当去除物理惩罚后,奖励最大化智能体会利用无效发电并增加虚假流动性;LLM 规划器/审计器提升了可审计性并缓解了部分风险,但无法完全弥补错误指定的奖励函数。这些结果表明,可信智能体 AI 评估需要同时具备物理约束和透明的干预痕迹。我们已在 GitHub 上以开源方式发布数据和代码,以确保可复现性。  

**关键词**:智能体 AI,强化学习,可信度评估,代币经济学,去中心化能源市场  

---

**图 1:SolarChain-Eval 整体基准流程**。该图总结了从数据加载、RL 训练、策略评估、输出生成到去中心化能源市场治理可信证据的端到端工作流。  

---

## 1. 引言  

智能体 AI 越来越多地用于支持信息物理和经济系统中的自主决策(Xie 等,2025)。这些智能体不仅优化数字目标,其行为还可能影响物理资源、市场激励和系统安全性(Vyas 和 Mercangöz,2025)。这一转变带来了评估挑战:智能体的性能不能仅用标量奖励来衡量。可信的智能体应做出在现实运行条件下物理可行、约束感知且可审计的决策(美国国家标准与技术研究院,2023;Drgona 等,2025;Phiri,2025)。  

**表 1:集成 RL 和 LLM 智能体的主流双层架构对比**  

在去中心化能源市场中,强化学习(RL)已被用于管理市场流动性、代币发行和激励分配(Tushar 等,2018;Ou 等,2026)。然而,与纯数字环境不同,能源市场受物理规律约束,例如局部太阳辐照度和光伏板容量(Zhang 等,2018;Mengelkamp 等,2018)。因此,在此类环境中部署奖励最大化智能体会带来重要的可信度风险。若缺乏明确的物理约束,RL 模型可能学会利用市场机制的弱点(Achiam 等,2017)。为解决这一问题,我们提出 **SolarChain-Eval**,一个用于评估去中心化能源市场中可信智能体 AI 的物理约束基准。  

SolarChain-Eval 将太阳信号与可控的市场和风险场景相结合,并将市场治理建模为兼容 Gymnasium 的马尔可夫决策过程。为进一步考察智能体监督,SolarChain-Eval 集成了一个评估时的 LLM 规划器/审计器层,它插在训练后的 RL 策略与基准环境之间,不参与 RL 训练。规划器定义回合级动作边界和审计规则,审计器审查并修改高风险动作。这种设计使 SolarChain-Eval 能够评估 RL 策略的运行性能,以及其决策行为在多大程度上保持可治理性和可解释性。具体来说,我们聚焦于以下研究问题:  

- **RQ1**:与静态和启发式基线相比,自主市场策略如何在经济效用、物理安全性、稳定性和公平性之间进行权衡?  
- **RQ2**:当去除物理惩罚后,奖励最大化智能体在多大程度上利用无效发电并制造虚假流动性?  
- **RQ3**:基于 LLM 的规划器/审计器对于训练后的 RL 策略在可审计风险缓解方面有何贡献,以及在奖励错误指定情况下存在哪些局限性?  

---

## 2. 文献综述  

### 2.1 代币经济学中的强化学习  

传统经济机制由于对静态环境的限制性假设,难以适用于去中心化能源市场(Zheng 等,2022)。分布式能源资源(DER)受间歇性发电约束和对等(P2P)网络拓扑的约束(Chen 等,2022)。然而,代币经济机制极易受到流动性深度、投机性代币价格轨迹和采用率的剧烈波动影响(Malinova 和 Park,2023;Cong 等,2021)。RL 通过将市场治理建模为马尔可夫决策过程,提供了一种灵活的建模方法(Zheng 等,2022)。它能够适应高维状态空间,优化平衡物理效用与经济稳定性的长期目标(Zheng 等,2022)。  

在当前去中心化市场治理文献中(Xu 等,2025;Qu 等,2025),宏观经济控制通常被抽象为连续的治理杠杆,例如奖励比率 \(r_t\)、流动性比率 \(l_t\) 和代币销毁率 \(b_t\)。在模拟环境中,归一化的动作向量 \(a_t\) 被解码为特定的经济参数。为评估系统可信度,研究人员广泛依赖标准化框架(如 Stable-Baselines3,Raffin 等,2021)来基准测试不同的 RL 算法范式:  

- **近端策略优化(PPO)** 是一种在线策略的演员-评论家算法,广泛应用于连续动作空间的治理任务。为防止过大的策略更新,PPO 使用裁剪的替代目标(Schulman 等,2017):  
  \[
  L^{CLIP}(\theta) = \hat{\mathbb{E}}_t \left[ \min( p_t(\theta) \hat{A}_t, \text{clip}(p_t(\theta), 1-\epsilon, 1+\epsilon) \hat{A}_t) \right]
  \]  
  其中 \(\theta\) 表示策略网络参数,\(p_t(\theta)\) 是概率比,\(\hat{A}_t\) 表示估计的优势函数,\(\epsilon\) 是裁剪超参数。在代币经济治理中,这种高训练稳定性转化为实际优势,通过有效抑制动作抖动并确保宏观经济参数的更平滑调整。  

- **软演员-评论家(SAC)** 也是一种支持连续控制的离线策略算法。通过在目标函数中引入最大熵机制(Haarnoja 等,2018),SAC 主动鼓励智能体探索多样化的代币经济策略:  
  \[
  J(\pi) = \sum_{t=0}^T \mathbb{E}_{(s_t, a_t) \sim \rho_\pi} \left[ r(s_t, a_t) + \alpha \mathcal{H}(\pi(\cdot|s_t)) \right]
  \]  
  其中 \(r(s_t, a_t)\) 表示即时奖励,\(\alpha\) 是温度参数,\(\mathcal{H}(\pi(\cdot|s_t))\) 表示策略 \(\pi\) 在状态 \(s_t\) 下的熵。现有研究表明,该机制不仅提高了样本效率,还防止策略在高度非线性的市场环境中过早收敛到次优局部最小值(Campos 等,2022)。  

- **深度 Q 网络(DQN)** 作为一种稳健的基于值的基线算法,适用于离散动作空间。在多维控制任务中,连续杠杆通常被离散化。尽管存在固有的量化误差,DQN 在准确估计动作价值函数 \(Q(s,a)\) 方面表现出色(Mnih 等,2015;Van Hasselt 等,2016)。  

---

**图 2:SolarChain-Eval 的强化学习评估框架**。该图将市场和物理输入连接到策略动作、环境反馈、PPO/SAC/DQN 更新,以及跨效用、安全性、稳定性、平滑性和公平性的可信度导向评估。  

---

### 2.2 RL 与 LLM 智能体集成  

RL 在高维连续控制任务中表现出色,但其黑箱特性限制了其在基础设施中的可靠性(Amiri 等,2025)。在实践中,人工审计员可能难以解释 RL 策略为何做出调整(Rudin,2019)。此外,虽然事后 AI 方法能提供回顾性见解,但无法主动预防不安全动作(Gu 等,2024)。  

近期研究通过将大语言模型(LLM)与 RL 系统集成来解决这一问题。LLM 可作为高层推理器,处理任务上下文和操作员指令(Yao 等,2022)。这种能力使其能够将操作员意图转化为数学惩罚,以支持底层决策(Du 等,2023)。因此,当前研究正转向双层的 RL-LLM 架构(Carta 等,2023)。底层使用 RL 策略基于价值估计(如 \(V(s)\) 或 \(Q(s,a)\))做出频繁的控制决策;上层使用 LLM 进行较慢且更抽象的推理任务。先前工作已使用 LLM 将操作员意图转化为奖励惩罚(Kwon 等,2023)、修改奖励函数以及调整优化参数(Ma 等,2023)。表 1 总结了这种设计的代表性示例。  

RL 的最新进展改进了信息物理系统中的智能体优化,特别是在去中心化能源市场方面(Kelly 等,2020;Lozano 和 Shi,2025)。随着焦点转向实际部署(Dulac-Arnold 等,2021),越来越需要用可信度评估来补充传统的以奖励为中心的基准。具体来说,确保安全运行需要评估智能体对物理约束的遵守程度及其在对抗场景中的韧性(Liu 等,2011)。基于这一观点,我们的基准将经济动态与物理真实情况相结合,并从多个维度评估智能体可信度。  

---

## 3. 方法  

我们的基准并非仅仅最大化短期交易量,而是评估自主经济智能体的整体可信度。它评估智能体在尊重物理限制、确保市场稳定性、减少动作抖动和保持空间公平性的同时,能否维持市场效用。每个回合代表一个 24 小时的市场周期,从 2026 年 4 月的 720 小时数据集中采样。回合被限定在每日开始时开始。这种时间设计确保智能体拥有一致的单日决策视野,同时保留真实世界的天气模式。  

### 3.1 RL 形式化  

图 2 总结了 RL 循环。能源发电、市场需求和物理标签被聚合成一个小时的基准状态。基于该状态,策略提出一个治理动作。状态 \(s_t\) 和动作 \(a_t\) 定义如下:  

\[
\begin{aligned}
s_t &= [\sin \tau_t, \cos \tau_t, G_t^v, G_t^r, P_t^{\max}, \Delta_t, L_t, p_t, \nu_t, \sigma_t, \alpha_{t-1}, \ell_{t-1}], \\
a_t &= (\alpha_t, \ell_t, b_t), \quad \alpha_t + \ell_t \leq 0.98.
\end{aligned}
\]

其中 \(\tau_t\) 是时间角度,\(G_t^v\) 是已验证发电量,\(G_t^r\) 是报告发电量,\(P_t^{\max}\) 是物理光伏上限,\(\Delta_t\) 是供需缺口,\(L_t\) 是市场流动性,\(p_t\) 是代币价格,\(\nu_t\) 是原始风险信号,\(\sigma_t\) 是静态滑点。动作 \(a_t\) 包含奖励分配比率 \(\alpha_t\)、流动性注入比率 \(\ell_t\) 和代币销毁率 \(b_t\)。标准算法(如 PPO 和 SAC)在连续动作空间上运行,而 DQN 对相同参数使用离散化的 \(5^3 = 125\) 个动作网格。所有训练后的策略均在表 2 详述的统一基准设置下进行评估。  

**表 2:主要基准配置**  

---

### 3.2 物理限制与市场转换  

SolarChain-Eval 实现了一个物理约束模块,用于验证报告发电量是否物理可行以及 FDIA 标签。令 \(X_t\) 表示可疑或无效的供应量。基准不仅记录此异常,还量化策略在多大程度上经济上支持它:  

\[
V_t = \frac{\beta_t X_t}{\max(G_t^v + \beta_t X_t, \epsilon)}, \quad \beta_t = \frac{\min(\alpha_t + \ell_t, 0.98)}{0.98}.
\]

在公式 (4) 中,\(V_t\) 是依赖于动作的物理违反项。当策略大量支持无效供应时,其风险更高。该公式……(原文在此处截断,但根据上下文,翻译需保持完整。

---

**注意**:由于原文在翻译任务中提供的部分未完整结束(最后一句未完成),我依据已给内容忠实翻译至此处。若需要继续翻译后续内容,请提供完整文本。# SolarChain-Eval:面向去中心化能源市场可信经济主体的物理约束基准
Source: https://arxiv.org/html/2607.08681, Yifan Xu(昆山杜克大学,江苏昆山,中国)和 Luyao Zhang(昆山杜克大学,江苏昆山,中国)

###### 摘要

随着智能体 AI 系统越来越多地应用于信息物理环境,对其评估需要同时衡量任务性能和可信度。在去中心化能源市场中,自主智能体可能提升市场效用,但也可能利用无效的物理数据、制造虚假流动性并产生不稳定的治理决策。为此,我们提出 **SolarChain-Eval**,一个用于评估可信经济智能体的物理约束基准。该基准将市场治理建模为兼容 Gymnasium 的马尔可夫决策过程,智能体以小时为单位做出决策。SolarChain-Eval 从多个维度评估每个策略,包括市场效用、物理安全性、滑点、动作平滑性、空间公平性和可审计性。为支持智能体评估,SolarChain-Eval 集成了一个基于 LLM 的规划器/审计器层:规划器定义回合级动作边界和审计规则,审计器审查并修改高风险动作。所有干预均通过结构化日志记录,包括触发信号、提议动作、修改后动作和审计理由。针对静态、随机、短视、RL 以及 RL+LLM 策略的实验揭示了明确的效用-安全性权衡:RL 智能体提升了市场效用,但仍可能产生不安全行为;当去除物理惩罚后,奖励最大化智能体会利用无效发电并增加虚假流动性;LLM 规划器/审计器提升了可审计性并缓解了部分风险,但无法完全弥补错误指定的奖励函数。这些结果表明,可信智能体 AI 评估需要同时具备物理约束和透明的干预痕迹。我们已在 GitHub 上以开源方式发布数据和代码,以确保可复现性。

**关键词**:智能体 AI,强化学习,可信度评估,代币经济学,去中心化能源市场

---

**图 1:SolarChain-Eval 整体基准流程**。该图总结了从数据加载、RL 训练、策略评估、输出生成到去中心化能源市场治理可信证据的端到端工作流。

---

## 1. 引言

智能体 AI 越来越多地用于支持信息物理和经济系统中的自主决策(Xie 等,2025)。这些智能体不仅优化数字目标,其行为还可能影响物理资源、市场激励和系统安全性(Vyas 和 Mercangöz,2025)。这一转变带来了评估挑战:智能体的性能不能仅用标量奖励来衡量。可信的智能体应做出在现实运行条件下物理可行、约束感知且可审计的决策(美国国家标准与技术研究院,2023;Drgona 等,2025;Phiri,2025)。

**表 1:集成 RL 和 LLM 智能体的主流双层架构对比**

在去中心化能源市场中,强化学习(RL)已被用于管理市场流动性、代币发行和激励分配(Tushar 等,2018;Ou 等,2026)。然而,与纯数字环境不同,能源市场受物理规律约束,例如局部太阳辐照度和光伏板容量(Zhang 等,2018;Mengelkamp 等,2018)。因此,在此类环境中部署奖励最大化智能体会带来重要的可信度风险。若缺乏明确的物理约束,RL 模型可能学会利用市场机制的弱点(Achiam 等,2017)。为解决这一问题,我们提出 **SolarChain-Eval**,一个用于评估去中心化能源市场中可信智能体 AI 的物理约束基准。

SolarChain-Eval 将太阳信号与可控的市场和风险场景相结合,并将市场治理建模为兼容 Gymnasium 的马尔可夫决策过程。为进一步考察智能体监督,SolarChain-Eval 集成了一个评估时的 LLM 规划器/审计器层,它插在训练后的 RL 策略与基准环境之间,不参与 RL 训练。规划器定义回合级动作边界和审计规则,审计器审查并修改高风险动作。这种设计使 SolarChain-Eval 能够评估 RL 策略的运行性能,以及其决策行为在多大程度上保持可治理性和可解释性。具体来说,我们聚焦于以下研究问题:

*   **RQ1**:与静态和启发式基线相比,自主市场策略如何在经济效用、物理安全性、稳定性和公平性之间进行权衡?
*   **RQ2**:当去除物理惩罚后,奖励最大化智能体在多大程度上利用无效发电并制造虚假流动性?
*   **RQ3**:基于 LLM 的规划器/审计器对于训练后的 RL 策略在可审计风险缓解方面有何贡献,以及在奖励错误指定情况下存在哪些局限性?

---

## 2. 文献综述

### 2.1 代币经济学中的强化学习

传统经济机制由于对静态环境的限制性假设,难以适用于去中心化能源市场(Zheng 等,2022)。分布式能源资源(DER)受间歇性发电约束和对等(P2P)网络拓扑的约束(Chen 等,2022)。然而,代币经济机制极易受到流动性深度、投机性代币价格轨迹和采用率的剧烈波动影响(Malinova 和 Park,2023;Cong 等,2021)。RL 通过将市场治理建模为马尔可夫决策过程,提供了一种灵活的建模方法(Zheng 等,2022)。它能够适应高维状态空间,优化平衡物理效用与经济稳定性的长期目标(Zheng 等,2022)。

在当前去中心化市场治理文献中(Xu 等,2025;Qu 等,2025),宏观经济控制通常被抽象为连续的治理杠杆,例如奖励比率 \(r_t\)、流动性比率 \(l_t\) 和代币销毁率 \(b_t\)。在模拟环境中,归一化的动作向量 \(a_t\) 被解码为特定的经济参数。为评估系统可信度,研究人员广泛依赖标准化框架(如 Stable-Baselines3,Raffin 等,2021)来基准测试不同的 RL 算法范式:

*   **近端策略优化(PPO)** 是一种在线策略的演员-评论家算法,广泛应用于连续动作空间的治理任务。为防止过大的策略更新,PPO 使用裁剪的替代目标(Schulman 等,2017):
    \[
    L^{CLIP}(\theta) = \hat{\mathbb{E}}_t \left[ \min( p_t(\theta) \hat{A}_t, \text{clip}(p_t(\theta), 1-\epsilon, 1+\epsilon) \hat{A}_t) \right]
    \]
    其中 \(\theta\) 表示策略网络参数,\(p_t(\theta)\) 是概率比,\(\hat{A}_t\) 表示估计的优势函数,\(\epsilon\) 是裁剪超参数。在代币经济治理中,这种高训练稳定性转化为实际优势,通过有效抑制动作抖动并确保宏观经济参数的更平滑调整。

*   **软演员-评论家(SAC)** 也是一种支持连续控制的离线策略算法。通过在目标函数中引入最大熵机制(Haarnoja 等,2018),SAC 主动鼓励智能体探索多样化的代币经济策略:
    \[
    J(\pi) = \sum_{t=0}^T \mathbb{E}_{(s_t, a_t) \sim \rho_\pi} \left[ r(s_t, a_t) + \alpha \mathcal{H}(\pi(\cdot|s_t)) \right]
    \]
    其中 \(r(s_t, a_t)\) 表示即时奖励,\(\alpha\) 是温度参数,\(\mathcal{H}(\pi(\cdot|s_t))\) 表示策略 \(\pi\) 在状态 \(s_t\) 下的熵。现有研究表明,该机制不仅提高了样本效率,还防止策略在高度非线性的市场环境中过早收敛到次优局部最小值(Campos 等,2022)。

*   **深度 Q 网络(DQN)** 作为一种稳健的基于值的基线算法,适用于离散动作空间。在多维控制任务中,连续杠杆通常被离散化。尽管存在固有的量化误差,DQN 在准确估计动作价值函数 \(Q(s,a)\) 方面表现出色(Mnih 等,2015;Van Hasselt 等,2016)。

---

**图 2:SolarChain-Eval 的强化学习评估框架**。该图将市场和物理输入连接到策略动作、环境反馈、PPO/SAC/DQN 更新,以及跨效用、安全性、稳定性、平滑性和公平性的可信度导向评估。

---

### 2.2 RL 与 LLM 智能体集成

RL 在高维连续控制任务中表现出色,但其黑箱特性限制了其在基础设施中的可靠性(Amiri 等,2025)。在实践中,人工审计员可能难以解释 RL 策略为何做出调整(Rudin,2019)。此外,虽然事后 AI 方法能提供回顾性见解,但无法主动预防不安全动作(Gu 等,2024)。

近期研究通过将大语言模型(LLM)与 RL 系统集成来解决这一问题。LLM 可作为高层推理器,处理任务上下文和操作员指令(Yao 等,2022)。这种能力使其能够将操作员意图转化为数学惩罚,以支持底层决策(Du 等,2023)。因此,当前研究正转向双层的 RL-LLM 架构(Carta 等,2023)。底层使用 RL 策略基于价值估计(如 \(V(s)\) 或 \(Q(s,a)\))做出频繁的控制决策;上层使用 LLM 进行较慢且更抽象的推理任务。先前工作已使用 LLM 将操作员意图转化为奖励惩罚(Kwon 等,2023)、修改奖励函数以及调整优化参数(Ma 等,2023)。表 1 总结了这种设计的代表性示例。

RL 的最新进展改进了信息物理系统中的智能体优化,特别是在去中心化能源市场方面(Kelly 等,2020;Lozano 和 Shi,2025)。随着焦点转向实际部署(Dulac-Arnold 等,2021),越来越需要用可信度评估来补充传统的以奖励为中心的基准。具体来说,确保安全运行需要评估智能体对物理约束的遵守程度及其在对抗场景中的韧性(Liu 等,2011)。基于这一观点,我们的基准将经济动态与物理真实情况相结合,并从多个维度评估智能体可信度。

---

## 3. 方法

我们的基准并非仅仅最大化短期交易量,而是评估自主经济智能体的整体可信度。它评估智能体在尊重物理限制、确保市场稳定性、减少动作抖动和保持空间公平性的同时,能否维持市场效用。每个回合代表一个 24 小时的市场周期,从 2026 年 4 月的 720 小时数据集中采样。回合被限定在每日开始时开始。这种时间设计确保智能体拥有一致的单日决策视野,同时保留真实世界的天气模式。

### 3.1 RL 形式化

图 2 总结了 RL 循环。能源发电、市场需求和物理标签被聚合成一个小时的基准状态。基于该状态,策略提出一个治理动作。状态 \(s_t\) 和动作 \(a_t\) 定义如下:

\[
\begin{aligned}
s_t &= [\sin \tau_t, \cos \tau_t, G_t^v, G_t^r, P_t^{\max}, \Delta_t, L_t, p_t, \nu_t, \sigma_t, \alpha_{t-1}, \ell_{t-1}], \\
a_t &= (\alpha_t, \ell_t, b_t), \quad \alpha_t + \ell_t \leq 0.98.
\end{aligned}
\]

其中 \(\tau_t\) 是时间角度,\(G_t^v\) 是已验证发电量,\(G_t^r\) 是报告发电量,\(P_t^{\max}\) 是物理光伏上限,\(\Delta_t\) 是供需缺口,\(L_t\) 是市场流动性,\(p_t\) 是代币价格,\(\nu_t\) 是原始风险信号,\(\sigma_t\) 是静态滑点。动作 \(a_t\) 包含奖励分配比率 \(\alpha_t\)、流动性注入比率 \(\ell_t\) 和代币销毁率 \(b_t\)。标准算法(如 PPO 和 SAC)在连续动作空间上运行,而 DQN 对相同参数使用离散化的 \(5^3 = 125\) 个动作网格。所有训练后的策略均在表 2 详述的统一基准设置下进行评估。

**表 2:主要基准配置**

---

### 3.2 物理限制与市场转换

SolarChain-Eval 实现了一个物理约束模块,用于验证报告发电量是否物理可行以及 FDIA 标签。令 \(X_t\) 表示可疑或无效的供应量。基准不仅记录此异常,还量化策略在多大程度上经济上支持它:

\[
V_t = \frac{\beta_t X_t}{\max(G_t^v + \beta_t X_t, \epsilon)}, \quad \beta_t = \frac{\min(\alpha_t + \ell_t, 0.98)}{0.98}.
\]

在公式 (4) 中,\(V_t\) 是依赖于动作的物理违反项。当策略大量支持无效供应时,其承担的风险更高。

相似文章

评估自主系统的伦理问题

MIT News — Artificial Intelligence

MIT研究人员推出SEED-SET框架,利用LLM主动评估自主系统在高风险场景(如电力分配)中的伦理一致性,以弥补静态测试方法的不足。

Agent Bazaar:在多智能体市场中实现经济对齐

Hugging Face Daily Papers

介绍Agent Bazaar,一个用于评估LLMs经济对齐的多智能体模拟框架,识别出算法不稳定性和Sybil欺骗等失败模式,并通过针对性强化学习训练出一个超越前沿模型的9B模型。