标签
微软的新研究表明,AI模型可能被投毒,从而生成看似良性的思维链推理过程,同时暗中输出有害答案,这削弱了将思维链监控作为安全机制的有效性。
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。
本文介绍了RENDEQ,一种为科学图像生成渲染等价集的生成器,并测量了开放权重VLM中模型在语义保持的重渲染之间的一致性在多大程度上追踪正确性。研究发现,一致性仅在超过阈值时才证明正确性,而基于自一致性进行微调可能会损害准确率。
提出FOCUS,一种通过正交分解和专家门控模块解耦大语言模型中专家人格的微调方法,在金融、法律和医学基准上提高了特定领域任务的准确性。
本文介绍了KV-Skill,这是一个外部因子化算子的设计空间,冻结的语言模型通过轻量级接口读取这些算子,从而能够从文本或奖励中获取任务知识并独立部署。在十个基准上的实验表明,与文本技能、前缀微调和LoRA相比,KV-Skill持续带来改进,且技能可组合、可加载。
AuroSFT introduces a parameter-efficient adapter-based framework for multi-task supervised fine-tuning that rolls back adapter checkpoints at task-wise peaks instead of full-model checkpoints, achieving higher average accuracy than mSFT.
本文提出Hyper-ES,一种基于子空间的进化策略框架,用于LLM推理。该框架通过轻量级基于梯度的微调获得下降方向,然后使用CMA-ES合并逐层的DARE-TIES系数,在需要更少梯度更新的情况下持续优于GRPO-LoRA。
本文研究在人类行为数据上微调的小型基础模型是否可以作为认知代理,发现规模在分布内影响甚微,但较大模型在分布外具有更好的泛化能力。
Scotoma-2 是 Gemma-4-31B-it 的更新微调版本,通过有针对性的偏好训练减少了重复性写作毛病,同时保留了基础模型的智能。它并非无审查,但旨在为角色扮演生成更干净、更不恼人的文本。
一条推文,分享了 MiniMax-H3-Turbo-Lora 的 Hugging Face Space,这是 MiniMax H3 Turbo 模型的 LoRA 微调变体。
Maxime Labonne 强调了 LFM2.5-2.6B 的早期微调成果,同时 Bad Theory Labs 发布了两个开放权重模型:BTL-4 35B(前沿智能体推理模型)和 Macaw 2.7B(设备端 Mac 智能体),在 BFCL v4 上表现突出。
MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。
本文介绍了Guideline-as-Oracle(GAO),一种通过将美国眼科学会指南编译成70行规则表并用于生成3000个训练对话,从而对多轮眼科电话分诊代理进行零标注训练的方法。在此语料上微调一个9B模型,可将与操作参考的一致性从61.7%提升至74.1%,紧急病例召回率从9.5%提升至69.0%,且在推理时无需前沿模型即可超越多个通用系统。
This paper introduces a new problem setting called side-effect introspection, where the goal is to detect alignment degradation in fine-tuned LLMs that occurs as an unintended side effect rather than explicitly implanted behavior. The authors propose a novel Delta-Aware Introspection Adapter (DAIA) that outperforms existing introspection adapters in generalizing to unseen models and safety categories.
The paper compares five parameter-efficient fine-tuning methods on four small language models for on-device personalization, finding LoRA+ best for energy efficiency and QLoRA best for memory-limited deployment.
本文提出了DataRx,一种缺失感知的采样方法,用于在任务特定微调期间选择安全关键的示例以保持大语言模型的安全性,在Llama3-8B-Instruct上将攻击成功率从59.23%降低到13.70%。
NVIDIA shares five lessons from over 5,000 Kagglers who fine-tuned reasoning models using LoRA adapters and synthetic chain-of-thought data in the Nemotron Model Reasoning Challenge, focusing on verifiable data, token budget, and infrastructure.
本文提出StructPO,一种结构感知的策略学习框架,通过显式阶段标记和精炼引导优化,将多阶段学术写作工作流内化到单次LLM策略中,从而提高引言生成质量和效率。
Introduces LoCA, a two-stage backpropagation-free method for small-shift adaptation of LLMs, using one-shot calibration to fit local credit assignment maps and closed-form ridge solves for low-rank adapters, achieving lower memory and time than LoRA with competitive cross-entropy on multiple benchmarks.
本文介绍了对 NVIDIA 的 Nemotron 检索栈进行的端到端适配,使其适用于现代希腊语,包括新基准 HERA,以及在专业领域针对检索、重排序和有依据的生成进行微调的模型。