training-framework

标签

Cards List
#training-framework

MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers · 2026-08-02 缓存

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。

0 人收藏 0 人点赞
#training-framework

Molt:一个可扩展的、基于PyTorch原生的智能体强化学习训练框架

Hugging Face Daily Papers · 2026-07-22 缓存

Molt是一个基于PyTorch原生的智能体强化学习训练框架,设计简洁紧凑,易于修改,同时实现了与基于Megatron的框架相当的性能。

0 人收藏 0 人点赞
#training-framework

训练一个用于模型无关和任务环境无关的能力改进的harness,基于类似PyTorch的框架 [P]

Reddit r/MachineLearning · 2026-07-20

介绍了一个训练框架,以模型无关和任务环境无关的方式提升任务型LLM的能力,并在Terminal Bench和SWE-Bench上展示了结果。

0 人收藏 0 人点赞
#training-framework

@samsja19: https://x.com/samsja19/status/2076846033922035818

X AI KOLs Following · 2026-07-14 缓存

PRIME-RL是一个用于大规模异步强化学习的框架,设计上易于定制,可扩展至1000+块GPU,并支持多种模型和环境。

0 人收藏 0 人点赞
#training-framework

搜索、失败、恢复:一种面向纠错感知推理的训练框架

arXiv cs.AI · 2026-07-09 缓存

介绍了Pyligent,一种利用任务验证器标记失败并在推理中教导大语言模型回溯的训练框架,提高了隐藏图、数独和积木世界的求解率。

0 人收藏 0 人点赞
#training-framework

DeepSeek 开源推理优化,生成速度提升 60–85% [pdf]

Hacker News Top · 2026-06-27 缓存

DeepSeek 开源了 DeepSpec,这是一个用于训练和评估推测解码草稿模型的全栈代码库,可实现 60-85% 的生成速度提升。它包含数据准备、训练和评估脚本,支持多种草稿模型算法(DSpark、DFlash、Eagle3)。

0 人收藏 0 人点赞
#training-framework

面向多模态情感-原因配对提取的鲁棒配对置信度学习

arXiv cs.CL · 2026-06-18 缓存

本文介绍了RPCL,一种仅用于训练阶段的鲁棒配对置信度学习框架,用于多模态情感-原因配对提取。该框架改进了黄金配对与困难负例之间的判别性分离,并在三个数据集上的Pair F1和AUPRC指标上取得了显著提升。

0 人收藏 0 人点赞
#training-framework

开源权重不够:我们需要开源训练框架来推动研究和更好的算法 [P]

Reddit r/MachineLearning · 2026-06-15

呼吁在AI研究中采用开源训练框架,介绍FeynRL——一个模块化且显式的框架,用于LLM、VLM和智能体的强化学习后训练,旨在让训练过程可见且可修改。

0 人收藏 0 人点赞
#training-framework

面向LLM智能体训练的回顾性进度感知自我精炼

arXiv cs.CL · 2026-06-15 缓存

本文介绍了RePro,一个通过“先执行再反思”的展开范式训练LLM智能体自我生成进度信号的框架,在WebShop、ALFWorld和Sokoban基准测试上实现了高达12%的绝对成功率提升。

0 人收藏 0 人点赞
#training-framework

Orchard:一个开源的智能体建模框架

Hugging Face Daily Papers · 2026-05-14 缓存

Orchard是一个用于可扩展智能体建模的开源框架,能够训练多样化的自主智能体,在编程、GUI导航和个人辅助任务上取得了最先进的结果。

0 人收藏 0 人点赞
#training-framework

EasyVideoR1:让视频理解的强化学习更简单

Hugging Face Daily Papers · 2026-04-18 缓存

# 论文页面 - EasyVideoR1:让视频理解的强化学习更简单 来源:[https://huggingface.co/papers/2604.16893](https://huggingface.co/papers/2604.16893) ## 摘要 EasyVideoR1 提出了一个高效的视频理解强化学习框架,可提升训练吞吐量,支持多种视频任务,并实现图像-视频联合训练,在多个基准测试上进行全面评估。[可验证奖励强化学习](https://huggingface.co/papers

0 人收藏 0 人点赞
#training-framework

收集人类反馈

OpenAI Blog · 2017-08-03 缓存

OpenAI 发布了 RL-Teacher,这是一个开源工具,可以通过人类反馈而不是手工设计的奖励函数来训练 AI 系统,应用于安全 AI 开发和复杂强化学习问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈