dpo

标签

Cards List
#dpo

@akshay_pachaar: 人工智能研究实验室的操作系统。TransformerLab 可在任何云端编排 GPU,并运行任何训练或评估流程…

X AI KOLs Following · 2026-05-20 缓存

TransformerLab 是一个开源平台,可在各云端编排 GPU,并提供预构建模板,用于 LoRA、DPO 和 MMLU 等 AI 训练与评估工作流。

0 人收藏 0 人点赞
#dpo

@anyscalecompute: LLM 后训练是新的基线。选择错误的方法或 GPU 配置会导致浪费 36 小时的运行。推出…

X AI KOLs Following · 2026-05-15 缓存

Anyscale 推出了一款新的 LLM 后训练 Agent Skill,可自动选择最优的微调方法(SFT、DPO、GRPO 等)并生成可随时启动的配置,帮助避免 GPU 运行浪费。

0 人收藏 0 人点赞
#dpo

通过偏好对齐优化增强多语言反事实生成

arXiv cs.CL · 2026-05-13 缓存

本文介绍了 Macro,一种使用 DPO 进行偏好对齐的框架,旨在提高跨多种语言自我生成反事实解释的有效性和最小性。

0 人收藏 0 人点赞
#dpo

talkie-lm/talkie-1930-13b-it

Hugging Face Models Trending · 2026-04-20 缓存

Talkie-1930-13b-it 是一个拥有 130 亿参数的指令微调语言模型,基于 1931 年前的文本进行训练,并使用 DPO 强化学习进行微调。

0 人收藏 0 人点赞
#dpo

输出多样性在后训练中的崩溃发生在哪里?

arXiv cs.CL · 2026-04-20 缓存

本文研究了语言模型后训练期间输出多样性崩溃的位置和原因,分析了三个 OLMo 3 训练线(Think、Instruct、RL-Zero)在多个任务和指标上的表现。研究发现多样性崩溃主要由训练数据组成决定,并在训练期间嵌入到模型权重中,仅通过推理时调整无法解决。

0 人收藏 0 人点赞
#dpo

GroupDPO:内存高效的分组直接偏好优化

arXiv cs.CL · 2026-04-20 缓存

GroupDPO 引入了一种内存高效的分组直接偏好优化算法,该算法利用每个提示的多个候选响应,通过解耦反向传播来减少峰值内存使用。该方法在离线和在线对齐设置中均展现出相比标准 DPO 的持续改进。

0 人收藏 0 人点赞
#dpo

DeepSeek LLM:以长期主义扩展开源语言模型

Papers with Code Trending · 2024-01-05 缓存

DeepSeek LLM是一个开源语言模型项目,它开发了一个大规模数据集,并采用SFT和DPO,在各种基准测试和开放式评估中实现了超越LLaMA-2 70B和GPT-3.5的性能。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈