架构敏感的监督微调用于基于屏幕条件的动作预测:PiSAR基准
摘要
本文介绍了用于基于屏幕条件的动作预测的PiSAR基准,并将监督微调模型与前沿零样本基线进行了比较。关键发现表明,微调的Qwen3-VL-8B达到了0.783的语义相似度,显著优于Claude Opus 4.7和GPT-5.5(0.459和0.482),但同样的微调配方应用于更大的推理调优Gemma模型仅产生0.441,表明存在模型与配方不匹配的问题。
查看缓存全文
缓存时间: 2026/05/29 09:18
# 架构敏感的屏幕条件动作预测监督微调:PiSAR基准测试 来源:https://arxiv.org/html/2605.29400 Rahul Bissa, Abhishek Vyas, Yash Jain, AprioriLabs, AprioriLabs, AprioriLabs [email protected], [email protected], [email protected] ###### 摘要 我们在一个包含661条记录的保留切片上,对三个监督微调模型与前沿零样本基线进行了基准测试,该切片来自*PiSAR*(人格、意图、屏幕、动作、理由)——一个包含12,929条元组的屏幕锚定行为理由语料库,这些元组来自公开的应用商店评论、皮尤美国趋势小组人口统计数据以及OPeRA购物者轨迹。每个模型(无论是前沿模型还是微调模型)都在相同的661条记录切片上,使用相同的评分流水线进行评估。两个发现。第一,前沿零样本基线(Claude Opus 4.7 和 GPT-5.5)分别达到sem_sim 0.459和0.482;而微调后的Qwen3-VL-8B-Instruct达到0.783,并且在79%的记录上sem_sim达到≥0.7,相比之下,两个前沿基线仅有1–2%,在同一个测试集上绝对差距为0.30。第二,相同的训练数据和配方在Gemma-4-26B-A4B-IT上仅得0.441,与前沿零样本基线处于同一水平,而不是微调后的Qwen。我们将此解读为配方与模型的不匹配:经过推理调优的高参数模型抵抗位移,可能需要更多数据或更强的微调方法。 ## 1 引言 一个前沿视觉语言模型,给定一个产品时刻的截图和一个真实人格,应该能够合理地描述用户在想什么。预训练覆盖了行为数据。多模态基础已经解决。模型被告知要充当遵循指令的助手。据此,前沿零样本应该表现强劲。 我们在PiSAR的661条记录保留切片上测量了这一点,每个模型(无论是前沿还是微调)都在相同的输入记录上使用相同的指标进行评分。Claude Opus 4.7零样本达到sem_sim 0.459;GPT-5.5零样本达到0.482。一个在PiSAR语料库的13,796条轨迹上进行的Qwen3-VL-8B-Instruct LoRA微调达到0.783。相同的微调配方在Gemma-4-26B-A4B-IT上仅达到0.441,与前沿零样本基线已经处于的水平相同。 两个发现,按优先级排序。前沿零样本在相同测试集上比小型任务特定微调低0.30个绝对sem_sim,并且8B Qwen-VL微调每次调用延迟低于一秒。SFT信号并非均匀地跨基础模型传递:相同训练数据在更高参数的推理调优基础上仅从其零样本先验产生微小移动,同时有4%的输出出现思维链模板泄漏。我们假设(但未测试)推理调优的基础模型需要比本文使用的13,796行、LoRA秩为16的配方更多的数据或更强的微调方法。 我们并不声称微调普遍优于提示工程。我们也不声称Gemma是一个差的基础模型。我们声称,在此评估中,SFT与前沿之间的差距对于一个基础模型很大,而对于另一个则不存在,并且这种差异信息丰富地说明了固定示例预算下的SFT如何与基础模型的后训练先验相互作用。 ## 2 相关工作 三个线索交汇于此基准测试:基于LLM的人类行为模拟、基础模型认知建模方法,以及我们训练语料库和评估切片最直接借鉴的最新在线购物模拟文献。我们简要勾勒每条线索中的相关工作。 ### 2.1 基于LLM的人格行为模拟 Park等人(Park et al., 2023 (https://arxiv.org/html/2605.29400#bib.bib3))通过提示工程化的LLM行为引入了人格条件化的模拟社会动态,没有使用微调。Park等人(2024 (https://arxiv.org/html/2605.29400#bib.bib4))的后续工作将模拟扩展到基于1000人访谈的预测环境,同样使用提示而非参数更新。基于提示的模拟方法是已部署行为模拟系统中最直接可见的先驱。 训练而非提示的替代方案是Binz/Schulz路线。Binz和Schulz (2023 (https://arxiv.org/html/2605.29400#bib.bib5))将LLM行为与经典认知心理学基准进行了对比。Centaur(Binz et al., 2025 (https://arxiv.org/html/2605.29400#bib.bib6))在心理学试验数据上训练了一个基础模型,在这些基准上达到了与人类相当的性能;提升来自SFT,而非提示。Namazova等人(2025 (https://arxiv.org/html/2605.29400#bib.bib8))认为,Centaur在聚合任务性能上的成功尚未使其成为个体层面忠实的合成参与者,这一批评我们直接读入自己的第5.1节(https://arxiv.org/html/2605.29400#S5.SS1)。 同一实验室的另一个观察(Binz and others, 2026 (https://arxiv.org/html/2605.29400#bib.bib7))报告称,大型语言模型上的RLHF和指令调优降低了它们对人类源数据的分布保真度。我们的Gemma结果在相反方向上与此一致:模型的推理调优后训练先验抵抗了我们应用的SFT信号。 ### 2.2 在线购物与可用性测试行为模拟 Lu等人(2025b (https://arxiv.org/html/2605.29400#bib.bib9))引入了UXAgent,一个无需招募人类参与者即可进行网页设计可用性测试的LLM智能体框架。Lu等人(2025a (https://arxiv.org/html/2605.29400#bib.bib10))测量了智能体模拟方法与真实在线客户行为数据,其标题中的主要发现是:仅靠提示在多次购物任务中无法匹配真实人类分布。Wang等人发布了Wang等人(2025a (https://arxiv.org/html/2605.29400#bib.bib11))的OPeRA数据集,包含52名亚马逊购物者的同步口头理由,我们将其用作训练来源和评估锚点。 该线索的最新方向从SFT或提示转向强化学习。Shop-R1(Zhang et al., 2025 (https://arxiv.org/html/2605.29400#bib.bib12))奖励LLM在多个步骤中匹配真实购物者行为;Customer-R1(Wang et al., 2025b (https://arxiv.org/html/2605.29400#bib.bib13))在此基础上增加了逐个体个性化。Zhang等人(2025 (https://arxiv.org/html/2605.29400#bib.bib14))将相同设置扩展到条件于屏幕的视觉语言智能体,这是我们要评估的屏幕条件化轴最接近的先例。 ### 2.3 适配器微调与屏幕条件化VLM智能体 LoRA(Hu et al., 2022 (https://arxiv.org/html/2605.29400#bib.bib1))建立了低秩适配器微调作为全参数SFT的实用替代方案;QLoRA(Dettmers et al., 2023 (https://arxiv.org/html/2605.29400#bib.bib2))增加了4位量化,将配方扩展到消费级GPU。本文使用的Fireworks托管SFT平台为视觉语言基础模型提供了托管的LoRA风格微调表面。 在GUI智能体方面,CogAgent(Hong et al., 2024 (https://arxiv.org/html/2605.29400#bib.bib15))是用于点击坐标动作预测的经典屏幕条件化视觉语言模型。Mind2Web(Deng et al., 2023 (https://arxiv.org/html/2605.29400#bib.bib16))提供了一个多网站动作轨迹语料库。两篇论文都共享一个离散输出目标(坐标或按钮标签),而不是我们的评估所评分的自由形式第一人称理由。我们引用它们是为了设置框架,而非作为直接比较对象。 ## 3 设置 参见图标题Figure 1: 流水线。来自公开来源的数据融合成包含12,929条元组的*PiSAR*语料库,其中内嵌base64-JPEG屏幕;导出器为Fireworks托管SFT生成聊天完成JSONL;每个部署在T=0下对保留切片进行评估;每条记录的分数用于三个指标。 ### 3.1 数据集 我们引入*PiSAR*,一个由AprioriLabs构建和维护的、包含12,929条元组的屏幕锚定行为理由专有语料库。每条元组是一个(人格、意图、屏幕、动作、理由)记录(语料库名称由此缩写而来),来自一小批公开来源,并在“三个槽中两个真实”规则下组合:至少两个{屏幕、人格、推理}必须直接来自真实人类,而非合成。来源是OPeRA购物者轨迹(Wang et al., 2025a (https://arxiv.org/html/2605.29400#bib.bib11))、与应用程序营销截图配对的公开应用商店评论,以及用于人格上下文匹配的皮尤美国趋势面板人口统计微数据。列表LABEL:lst:example_record显示了一个经过编辑的记录的架构。PiSAR本身未随本文发布;此处描述的方法学旨在能由读者使用相同公开来源构建的等效语料库进行端到端重现。 每条记录携带一个base64-JPEG屏幕(512×约280像素,平均31 KB)、一个结构化人格、一个意图字符串、一个计划的下一步动作以及黄金理由。SFT训练使用同一语料库的两个变体:仅OPeRA(4,014条记录)和组合(13,796条记录,通过将仅OPeRA和过滤器A连接而成,因此OPeRA被上采样2倍)。 列表1: 一条经过编辑的训练记录。屏幕作为数据URI内联;人格是真实的皮尤ATP捐赠者。 { "messages": [ {"role": "system", "content": "你在模拟一个正在执行任务中的真实人物..."}, {"role": "user", "content": [ {"type": "text", "text": "你是谁:30-49岁/男性/白种人非西班牙裔/受过一些大学教育/\n$50,000-$74,999/大都市/已婚\n意图:给Netflix应用(美国)留下1-2星评价\n即将要做:给这个应用留下1-2星评价"}, {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQSkZJRgABA..."}} ]}, {"role": "assistant", "content": "这个应用不允许我在电视上调整为全屏。其他每个应用都可以。"} ] } ### 3.2 训练 三次SFT运行,全部在Fireworks托管SFT上进行,总结于表1(https://arxiv.org/html/2605.29400#S3.T1)。除了LoRA秩和所示计划外,我们没有覆盖Fireworks UI默认值。组合训练运行通过将仅OPeRA与过滤器A连接来上采样OPeRA 2倍,而不是重新加权损失;表1(https://arxiv.org/html/2605.29400#S3.T1)中的训练预算反映了这种连接。行数算术(明确列出以使计数差异不透明):PiSAR语料库在应用屏幕可用性过滤器前包含12,929条SFT级元组(5,648个OPeRA + 7,281个应用商店)。丢弃无法获取base64屏幕的1,910条元组后,剩余11,019条(4,709个OPeRA + 6,310个应用商店),通过规范的按屏幕划分方案分为9,782条训练集(4,014个OPeRA + 5,768个应用商店)和1,237条测试集。仅OPeRA训练集是该划分中的4,014条OPeRA行。组合训练集是仅OPeRA集与完整过滤器A训练划分的连接:4,014 + 9,782 = 13,796行,其中OPeRA出现两次,应用商店出现一次。上采样是否对OPeRA切片的增益有因果关系,还是仅样本数量本身解释,未经验证;组合训练的行数大约是仅OPeRA的3.4倍。我们在第4.3节(https://arxiv.org/html/2605.29400#S4.SS3)中将此标记为一个混淆因素。 表1: Fireworks托管SFT UI中设置的每次运行训练配置。两次Qwen运行共享相同配方;Gemma运行使用更大的批次和更长的最大上下文,与该基础模型的Fireworks默认值一致。UI未暴露的字段不报告。 ### 3.3 评估指标 三个逐行指标,通过测试切片上的均值聚合,以及通过阈值通过率对逐行值聚合。 #### token_jaccard 预测理由与黄金理由之间的小写词元Jaccard系数。捕捉词汇表面重叠;值在[0,1];越高越好。 #### length_ratio tokens(pred) / tokens(gold)。诊断指标,非质量分数。比率接近1.0表示简洁度匹配;比率高于1.5表示模型相对于黄金理由过度解释。 #### semantic_similarity (sem_sim) 预测理由与黄金理由的OpenAI text-embedding-3-small嵌入(1,536维)之间的余弦相似度。对于自然语言对,sem_sim大致落在[0.1, 0.95]。 阈值通过率(sem ≥ 0.3 / 0.5 / 0.7)报告清除每个截断的测试行比例。这些阈值是连续指标上的任意划分;我们将其视为语义检查,而非基准门限。均值是主要指标。 ### 3.4 基线 两个前沿零样本基线直接针对PiSAR运行,使用微调模型评估的相同661条记录:通过Anthropic原生Messages API的Claude Opus 4.7,以及通过OpenAI原生Chat Completions API的GPT-5.5。两者均零错误处理所有661条记录。解码遵循各提供商的默认值:Opus 4.7弃用了temperature参数,GPT-5推理系列要求使用max_completion_tokens且T=1,而非SFT运行使用的T=0。图像输入是SFT运行接收的相同base64-JPEG负载,在调用前转换为各提供商的原生图像块模式。我们没有探索提示工程、少样本示例或更长上下文的系统提示;目标是在最简单的苹果对苹果提升条件下测量前沿行为,而非优化它。 ## 4 结果 组合训练的Qwen3-VL-8B-Instruct (b5my94dm)在PiSAR上达到sem_sim 0.783。两个前沿零样本基线(Opus 4.7和GPT-5.5)在相同的661条记录上分别达到0.459和0.482。仅OPeRA训练的Qwen (ycfo6bpw)达到0.519。组合训练的Gemma (gz7vqm46)达到0.441。其中两个数字承载着论文:从0.78到约0.47的差距(微调与前沿在相同测试集上),以及从0.78到0.44的差距(相同训练数据在不同基础模型上)。 表2(https://arxiv.org/html/2605.29400#S4.T2)是统一的排行榜。每行是一个(模型,切片)元组。我们的SFT运行每个出现三次(总体 + 每个来源);前沿基线在它们被测量的每个切片出现一次。图2(https://arxiv.org/html/2605.29400#S4.F2)绘制了每个模型的sem_sim均值及95%自助法置信区间。 参见图标题Figure 2: PiSAR上每个模型的sem_sim (n=661)。SFT运行高亮显示(蓝绿色/锈色带);前沿零样本基线以灰度显示。误差条为逐行sem_sim的95%自助法置信区间。顶部SFT条(组合Qwen-VL在0.783)与顶部前沿条(GPT-5.5在0.482)之间的绝对差距为0.30。 表2: 统一排行榜。每个模型都在相同的保留切片(PiSAR,661行:119个OPeRA + 542个应用商店)上使用相同的评分流水线进行评估。“组合”训练混合是将仅OPeRA与过滤器A连接,因此OPeRA被上采样2倍(参见第3.2节(https://arxiv.org/html/2605.29400#S3.SS2)的行数算术)。 | 模型 | 训练集 | 切片 | n | jac | len_r | sem | sem≥0.3 | sem≥0.5 | sem≥0.7 | |------|--------|------|----|-----|-------|-----|---------|---------|---------| | *我们的SFT运行 (Qwen3-VL-8B-Instruct / Gemma-4-26B-A4B-IT)* | | | | | | | | | | | Qwen-VL-8B (b5my94dm) | 组合 | 总体 | 661 | 0.417 | 1.01 | 0.783 | 99% | 96% | 79% | | ↪ | 组合 | OPeRA-清洁 | 119 | 0.635 | 1.28 | 0.800 | 98% | 91% | 74% | | ↪ | 组合 | 应用商店-清洁 | 542 | 0.369 | 0.95 | 0.779 | 100% | 98% | 81% | | Qwen-VL-8B (ycfo6bpw) | 仅OPeRA | 总体 | 661 | 0.233 | 0.83 | 0.519 | 77% | 54% | 24% | | ↪ | 仅OPeRA | OPeRA-清洁 | 119 | 0.551 | 1.29 | 0.735 | 95% | 83% | 66% | | ↪ | 仅OPeRA | 应用商店-清洁 | 542 | 0.164 | 0.73 | 0.471 | | | |
相似文章
在领域特定任务上,使用约3美元的API调用和零人工标注,将Qwen2.5-7B微调至Claude Haiku的96%性能
提出DV-DPO方法,仅用约3美元的API调用和零人工标注,即可在领域特定任务上微调Qwen2.5-7B,通过对抗性交叉检验达到Claude Haiku综合性能的96%。
Super-Tuning: 从激活感知剪枝到稀疏微调
本文介绍了 Super 和 Supra 两种稀疏参数高效微调方法,它们重用来自剪枝的显著性信号(如 Wanda 分数)来选择可训练的支持集,并与 LoRA 结合,以更少的内存和计算在算术任务上取得了高准确率。
对2023年初的模型在两个指令遵循数据集上进行微调后效果变得很好
一个在550步内对两个指令遵循数据集进行微调的Pythia-6.9B模型,具备了13种语言的能力,相比基础模型有显著提升。
PaintBench: 精确视觉编辑的确定性评估
PaintBench是一个新的基准,用于评估多模态模型中的精确视觉编辑,涵盖4个类别中的20种操作,采用确定性像素级评估。测试11个模型显示整体性能较低,最佳模型仅获得17.1%的mIoU。
@dair_ai: 值得一读的新论文。GPT-5.4 nano 加上 critic-comparator 编排循环在 SWE-bench Verified 上达到 76.4%,匹配…
一篇新论文表明,使用一个弱模型,通过 k=8 个提议和 critic-comparator 选择循环,可以在 SWE-bench Verified 上匹配前沿模型的性能,达到 76.4% 的准确率。关键见解是,正确的补丁通常已经存在于弱模型的前 k 个候选补丁中,挑战在于如何利用执行验证进行有效选择。