@HuggingPapers: Stable-GFlowNet:通过对比轨迹平衡实现多样化且鲁棒的 LLM 红队测试 Naver AI 消除了不稳定的…
摘要
Naver AI 推出了 Stable-GFlowNet,这是一种通过对比轨迹平衡来消除生成流网络中不稳定的配分函数估计,从而改善 LLM 红队测试的方法。
Stable-GFlowNet:通过对比轨迹平衡实现多样化且鲁棒的 LLM 红队测试
Naver AI 通过成对比较和鲁棒性掩码消除了生成流网络中不稳定的配分函数估计,在保持多样性的同时防止了模式崩溃 https://t.co/xRXREBVzmu
查看缓存全文
缓存时间: 2026/05/09 20:16
Stable-GFlowNet:通过对比轨迹平衡实现多样化且鲁棒的 LLM 红队测试
Naver AI 通过成对比较和鲁棒掩码,消除了生成流网络(Generative Flow Networks)中不稳定的分区函数估计,从而在防止模式崩溃的同时保持多样性 https://t.co/xRXREBVzmu
相似文章
$f$-轨迹平衡:一种用于离策略和在线策略数据调优GFlowNet、生成模型和LLM的损失函数族
本文介绍了一类基于f-散度的损失函数族,用于训练GFlowNet和LLM等生成模型。这些损失函数在离策略下有效,同时匹配相应f-散度的在线策略梯度。应用包括分子发现和异步LLM调优。
使用GFlowNets为LLM生成攻击
本文提出使用GFlowNets训练一个攻击者LLM,自动生成针对受害者LLM的对抗性攻击,从而在英语和土耳其语中实现自动化红队测试和鲁棒性评分。
UniSteer:文本引导的激活空间流匹配实现多功能大语言模型操控
UniSteer 提出了一种文本引导的激活流匹配方法,在激活空间中学习通用条件速度场,无需特定任务干预模块即可实现多功能的 LLM 行为控制与分类任务。
LeapAlign:通过构建两步轨迹在任意生成步骤后训练流匹配模型
LeapAlign是一种后训练方法,通过两步轨迹捷径降低计算成本,同时实现梯度稳定传播到早期生成步骤,从而改善流匹配模型与人类偏好的对齐。在微调Flux模型时,该方法在多种图像质量和文本对齐指标上均优于现有最先进方法。
@svlevine: 扩散(或流)可生成出色策略,但用强化学习训练它们却出了名的困难:BPTT不稳定,RL…
新论文展示了如何通过用单位矩阵近似流去噪过程的雅可比矩阵来优化用于强化学习的流匹配行动者,使训练变得可行。