标签
AlphaDiverse是一个框架,用于通过使用训练后的本地代理来自动化量化研究中的Alpha因子挖掘,以确保多样化探索并维护数据保密性。
本文采用因果中介框架审计混合推理模型中的思考泄漏,揭示了NoThink模式下的后训练增益在很大程度上依赖于调用现有的Think行为,泄漏率介于42%至79%之间。
Pistis 技术报告介绍了一系列多模态大语言模型(270亿和90亿参数),通过一种结合了蒸馏与强化学习的新型后训练框架开发而成,并包含针对深度推理和智能体任务的专用变体。
本文提出了主动无任务蒸馏(ATD),这是一种仅通过单一词汇回复对与任务无关的提示进行提示,从而将能力从教师模型转移到学生模型的方法,旨在探究后训练的行为痕迹。
本文提出了一种名为SRCF的攻击方法,该方法通过反向对齐少样本对话来引导大型推理模型(LRMs)产生不安全或拒绝行为,并提出了一种名为ARCF的后训练防御机制,该机制在不降低效用的情况下增强了安全性和有用性。
本文介绍了 FakeContext-bench,用于评估大型语言模型区分上下文信息和事实知识的能力,并提出了 Jurisdiction In-Context Learning (J-ICL) 以增强上下文学习性能和对误导性上下文的抵抗力。
Google 的 Gemini 4 Pro AI 模型即将发布预览版,早期后训练版本预计能超越竞争对手 Astra,可能在十月公开发布。
ViRDM是一种使用表示分布匹配的少步因果视频生成方法,通过在单GPU或多GPU上高效训练,取得了比基于DMD的基线更好的结果。
文章认为,机器人技术需要类似语言模型的后训练以实现高可靠性,并探讨了机器人系统中通用后训练面临的挑战和潜在方法。
本文介绍了一个用于评估LLM智能体作为现场部署工程师在训练后交付中的基准测试,重点指出了关键的'训练但不学习'失败模式,即模型优化但并未真正学习。
TelecomGPT-R1是一系列用于统一电信推理的开源模型,通过监督微调和强化学习训练,在基准测试中超越GPT-5等专有模型。
本文利用奇异值分解分析LLM的后训练权重更新,识别出驱动性能提升的几何成分,表明重塑奇异值不如旋转和路由变化关键。
一位用户质疑使用 Tinker 满足所有机器学习后训练需求的障碍,询问关于速度、成本、可扩展性、正确性和灵活性等因素。
本文介绍了ACLArena,这是一个用于评估多阶段后训练中智能体持续学习的框架,分析了遗忘和泛化机制,并提出了使用离线重放和LoRA专家的改进ACL方案。
该推文讨论了有效的AI归属方法:推理中使用Shapley值,后训练中使用LoRA,预训练中使用层次方法,并提出了路由通用智能的未来。
本文提出一个依赖图框架以形式化语言模型中的组合推理,并评估强化学习后训练的影响,发现了一种不对称性:组合技能训练向分解任务的迁移比反向更为容易。
本文介绍了MoDA,一种在线后训练强化学习算法,它共同提升大型语言模型的质量和多样性,以缓解模式崩溃,无需手工制作的人设或架构修改。
该论文提出了一种轮级多尺度密度比率估计(tlm-DRE)的后训练方法,该方法为不同轮次分配不同权重,并使用非对称的令牌级训练来增强LLM智能体在多轮推理任务中的性能,在基准测试中显示出具有竞争力的结果。
ReDraft 是一种参考驱动修订方法,用于大型视觉语言模型的持续后训练,平衡新任务的学习和旧任务的保留,比SFT等标准方法实现更高的准确性和更少的遗忘。
本文研究了用于代码生成LLMs后训练的离线强化学习,表明通过使用现有数据集,无需在线采样,就能提升零样本代码生成的性能。