post-training

标签

Cards List
#post-training

AlphaDiverse:用于Alpha因子挖掘多样化探索的训练后本地量化研究代理

arXiv cs.AI ↗ · 8小时前 缓存

AlphaDiverse是一个框架,用于通过使用训练后的本地代理来自动化量化研究中的Alpha因子挖掘,以确保多样化探索并维护数据保密性。

0 人收藏 0 人点赞
#post-training

思考泄漏:混合推理模型中NoThink后训练的因果审计

arXiv cs.LG ↗ · 8小时前 缓存

本文采用因果中介框架审计混合推理模型中的思考泄漏,揭示了NoThink模式下的后训练增益在很大程度上依赖于调用现有的Think行为,泄漏率介于42%至79%之间。

0 人收藏 0 人点赞
#post-training

Pistis 技术报告

arXiv cs.AI ↗ · 8小时前 缓存

Pistis 技术报告介绍了一系列多模态大语言模型(270亿和90亿参数),通过一种结合了蒸馏与强化学习的新型后训练框架开发而成,并包含针对深度推理和智能体任务的专用变体。

0 人收藏 0 人点赞
#post-training

后训练在不相关决策上留下行为痕迹

arXiv cs.CL ↗ · 8小时前 缓存

本文提出了主动无任务蒸馏(ATD),这是一种仅通过单一词汇回复对与任务无关的提示进行提示,从而将能力从教师模型转移到学生模型的方法,旨在探究后训练的行为痕迹。

0 人收藏 0 人点赞
#post-training

LRMs的对齐:通过反向对齐少样本对话暴露

arXiv cs.AI ↗ · 昨天 缓存

本文提出了一种名为SRCF的攻击方法,该方法通过反向对齐少样本对话来引导大型推理模型(LRMs)产生不安全或拒绝行为,并提出了一种名为ARCF的后训练防御机制,该机制在不降低效用的情况下增强了安全性和有用性。

0 人收藏 0 人点赞
#post-training

当上下文误导时:大型语言模型中的 Jurisdiction 上下文学习

arXiv cs.CL ↗ · 昨天 缓存

本文介绍了 FakeContext-bench,用于评估大型语言模型区分上下文信息和事实知识的能力,并提出了 Jurisdiction In-Context Learning (J-ICL) 以增强上下文学习性能和对误导性上下文的抵抗力。

0 人收藏 0 人点赞
#post-training

Gemini 4 Pro 接近预览发布。(是的,又一个预览版)

Reddit r/singularity ↗ · 昨天

Google 的 Gemini 4 Pro AI 模型即将发布预览版,早期后训练版本预计能超越竞争对手 Astra,可能在十月公开发布。

0 人收藏 0 人点赞
#post-training

ViRDM:优化表示分布匹配用于少步因果视频生成

Hugging Face Daily Papers ↗ · 昨天 缓存

ViRDM是一种使用表示分布匹配的少步因果视频生成方法,通过在单GPU或多GPU上高效训练,取得了比基于DMD的基线更好的结果。

0 人收藏 0 人点赞
#post-training

迈向机器人技术的通用后训练(18分钟阅读)

TLDR AI ↗ · 昨天 缓存

文章认为,机器人技术需要类似语言模型的后训练以实现高可靠性,并探讨了机器人系统中通用后训练面临的挑战和潜在方法。

0 人收藏 0 人点赞
#post-training

训练而不学习:针对LLM智能体作为现场部署工程师的训练后交付基准测试

arXiv cs.LG ↗ · 2天前 缓存

本文介绍了一个用于评估LLM智能体作为现场部署工程师在训练后交付中的基准测试,重点指出了关键的'训练但不学习'失败模式,即模型优化但并未真正学习。

0 人收藏 0 人点赞
#post-training

TelecomGPT-R1: 用于异构电信任务推理的统一后训练

arXiv cs.CL ↗ · 2天前 缓存

TelecomGPT-R1是一系列用于统一电信推理的开源模型,通过监督微调和强化学习训练,在基准测试中超越GPT-5等专有模型。

0 人收藏 0 人点赞
#post-training

GRRR:解码器LLM后训练中的重塑、旋转与路由几何

arXiv cs.LG ↗ · 3天前 缓存

本文利用奇异值分解分析LLM的后训练权重更新,识别出驱动性能提升的几何成分,表明重塑奇异值不如旋转和路由变化关键。

0 人收藏 0 人点赞
#post-training

@cHHillee: 对于 Tinker 的一个期望是它能够处理所有机器学习后训练所需的基础设施,适用于几乎所有人。所以,很好奇,……

X AI KOLs Timeline ↗ · 3天前

一位用户质疑使用 Tinker 满足所有机器学习后训练需求的障碍,询问关于速度、成本、可扩展性、正确性和灵活性等因素。

0 人收藏 0 人点赞
#post-training

ACLArena:多阶段后训练中的智能体持续学习

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了ACLArena,这是一个用于评估多阶段后训练中智能体持续学习的框架,分析了遗忘和泛化机制,并提出了使用离线重放和LoRA专家的改进ACL方案。

0 人收藏 0 人点赞
#post-training

@iamtrask: AI归属比你想象的要好。推理用Shapley,后训练用LoRA,预训练用层次结构……

X AI KOLs Timeline ↗ · 6天前 缓存

该推文讨论了有效的AI归属方法:推理中使用Shapley值,后训练中使用LoRA,预训练中使用层次方法,并提出了路由通用智能的未来。

0 人收藏 0 人点赞
#post-training

基于强化学习后训练的语言模型组合推理

arXiv cs.AI ↗ · 2026-09-18 缓存

本文提出一个依赖图框架以形式化语言模型中的组合推理,并评估强化学习后训练的影响,发现了一种不对称性:组合技能训练向分解任务的迁移比反向更为容易。

0 人收藏 0 人点赞
#post-training

@HEI: 蓝色四十度:通过模式条件强化学习实现质量-多样性对齐 Jiayi Yuan, Hangoo Kang, …

X AI KOLs Following ↗ · 2026-09-18 缓存

本文介绍了MoDA,一种在线后训练强化学习算法,它共同提升大型语言模型的质量和多样性,以缓解模式崩溃,无需手工制作的人设或架构修改。

0 人收藏 0 人点赞
#post-training

LLM智能体的轮级多尺度密度比率估计

arXiv cs.AI ↗ · 2026-09-16 缓存

该论文提出了一种轮级多尺度密度比率估计(tlm-DRE)的后训练方法,该方法为不同轮次分配不同权重,并使用非对称的令牌级训练来增强LLM智能体在多轮推理任务中的性能,在基准测试中显示出具有竞争力的结果。

0 人收藏 0 人点赞
#post-training

ReDraft,不要只蒸馏:用于持续VLLM后训练的参考驱动修订

arXiv cs.AI ↗ · 2026-09-16 缓存

ReDraft 是一种参考驱动修订方法,用于大型视觉语言模型的持续后训练,平衡新任务的学习和旧任务的保留,比SFT等标准方法实现更高的准确性和更少的遗忘。

0 人收藏 0 人点赞
#post-training

性能、效率与崩溃——代码LLMs离线后训练的优势与挑战

arXiv cs.LG ↗ · 2026-09-14 缓存

本文研究了用于代码生成LLMs后训练的离线强化学习,表明通过使用现有数据集,无需在线采样,就能提升零样本代码生成的性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈