training-framework

标签

Cards List
#training-framework

从自身交互中学习行动:GUI代理的在策略自蒸馏

arXiv cs.AI ↗ · 2天前 缓存

本文介绍了GUI-SD-v2,一个用于多轮GUI代理的两阶段在策略自蒸馏框架,该框架增强了特权跟随和指导能力,在AndroidWorld和MobileWorld基准测试中表现出色。

0 人收藏 0 人点赞
#training-framework

自主思维学习:抽象令牌课程

arXiv cs.LG ↗ · 2026-09-18 缓存

论文提出了抽象令牌课程(ATC),一种课程学习框架,能够在无需直接监督的情况下,在大型语言模型(LLMs)中引出有效的连续中间表示,并提供了理论和实验证据。

0 人收藏 0 人点赞
#training-framework

EnvCraft: 在Agentic RL中为Claw-like Agent合成可执行环境

arXiv cs.AI ↗ · 2026-09-10 缓存

EnvCraft是一个自动化框架,用于合成可执行环境,以解决Agentic RL训练中的稀缺性问题,并在使用Qwen模型的claw-like和通用工具使用基准测试中展示了显著的性能提升。

0 人收藏 0 人点赞
#training-framework

RAPTOR: 用于专家混合模型的角色感知隐私训练

arXiv cs.LG ↗ · 2026-09-10 缓存

RAPTOR是一个角色感知的框架,用于专家混合模型的差分隐私微调,解决了诸如裁剪干扰和噪声稀释等失败模式,并在实验中显示出相对于标准差分隐私基线的改进。

0 人收藏 0 人点赞
#training-framework

面向异构知识的LLM反事实基准测试与训练:实现事实一致性和顺序稳健的接地推理

arXiv cs.AI ↗ · 2026-08-11 缓存

本文介绍了TKFQA,一个包含10,130个基于表格、文本和知识图谱的问答对的反事实基准,用于评估LLM的事实一致性和顺序稳健推理,并提出了ORLF,一种训练框架,可提高推理链准确性并降低对输入顺序的敏感性。

0 人收藏 0 人点赞
#training-framework

iFAN:面向普通掩码Transformer的推理感知学习

Hugging Face Daily Papers ↗ · 2026-08-07 缓存

iFAN是一个训练框架,通过将查询排序与掩码质量对齐,并将中间层的预测蒸馏到最终层,来改进用于分割的掩码Transformer,从而在多个基准上取得一致的性能提升。

0 人收藏 0 人点赞
#training-framework

MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers ↗ · 2026-08-02 缓存

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。

0 人收藏 0 人点赞
#training-framework

Molt:一个可扩展的、基于PyTorch原生的智能体强化学习训练框架

Hugging Face Daily Papers ↗ · 2026-07-22 缓存

Molt是一个基于PyTorch原生的智能体强化学习训练框架,设计简洁紧凑,易于修改,同时实现了与基于Megatron的框架相当的性能。

0 人收藏 0 人点赞
#training-framework

训练一个用于模型无关和任务环境无关的能力改进的harness,基于类似PyTorch的框架 [P]

Reddit r/MachineLearning ↗ · 2026-07-20

介绍了一个训练框架,以模型无关和任务环境无关的方式提升任务型LLM的能力,并在Terminal Bench和SWE-Bench上展示了结果。

0 人收藏 0 人点赞
#training-framework

@samsja19: https://x.com/samsja19/status/2076846033922035818

X AI KOLs Following ↗ · 2026-07-14 缓存

PRIME-RL是一个用于大规模异步强化学习的框架,设计上易于定制,可扩展至1000+块GPU,并支持多种模型和环境。

0 人收藏 0 人点赞
#training-framework

搜索、失败、恢复:一种面向纠错感知推理的训练框架

arXiv cs.AI ↗ · 2026-07-09 缓存

介绍了Pyligent,一种利用任务验证器标记失败并在推理中教导大语言模型回溯的训练框架,提高了隐藏图、数独和积木世界的求解率。

0 人收藏 0 人点赞
#training-framework

DeepSeek 开源推理优化,生成速度提升 60–85% [pdf]

Hacker News Top ↗ · 2026-06-27 缓存

DeepSeek 开源了 DeepSpec,这是一个用于训练和评估推测解码草稿模型的全栈代码库,可实现 60-85% 的生成速度提升。它包含数据准备、训练和评估脚本,支持多种草稿模型算法(DSpark、DFlash、Eagle3)。

0 人收藏 0 人点赞
#training-framework

面向多模态情感-原因配对提取的鲁棒配对置信度学习

arXiv cs.CL ↗ · 2026-06-18 缓存

本文介绍了RPCL,一种仅用于训练阶段的鲁棒配对置信度学习框架,用于多模态情感-原因配对提取。该框架改进了黄金配对与困难负例之间的判别性分离,并在三个数据集上的Pair F1和AUPRC指标上取得了显著提升。

0 人收藏 0 人点赞
#training-framework

开源权重不够:我们需要开源训练框架来推动研究和更好的算法 [P]

Reddit r/MachineLearning ↗ · 2026-06-15

呼吁在AI研究中采用开源训练框架,介绍FeynRL——一个模块化且显式的框架,用于LLM、VLM和智能体的强化学习后训练,旨在让训练过程可见且可修改。

0 人收藏 0 人点赞
#training-framework

面向LLM智能体训练的回顾性进度感知自我精炼

arXiv cs.CL ↗ · 2026-06-15 缓存

本文介绍了RePro,一个通过“先执行再反思”的展开范式训练LLM智能体自我生成进度信号的框架,在WebShop、ALFWorld和Sokoban基准测试上实现了高达12%的绝对成功率提升。

0 人收藏 0 人点赞
#training-framework

Orchard:一个开源的智能体建模框架

Hugging Face Daily Papers ↗ · 2026-05-14 缓存

Orchard是一个用于可扩展智能体建模的开源框架,能够训练多样化的自主智能体,在编程、GUI导航和个人辅助任务上取得了最先进的结果。

0 人收藏 0 人点赞
#training-framework

EasyVideoR1:让视频理解的强化学习更简单

Hugging Face Daily Papers ↗ · 2026-04-18 缓存

# 论文页面 - EasyVideoR1:让视频理解的强化学习更简单 来源:[https://huggingface.co/papers/2604.16893](https://huggingface.co/papers/2604.16893) ## 摘要 EasyVideoR1 提出了一个高效的视频理解强化学习框架,可提升训练吞吐量,支持多种视频任务,并实现图像-视频联合训练,在多个基准测试上进行全面评估。[可验证奖励强化学习](https://huggingface.co/papers

0 人收藏 0 人点赞
#training-framework

Agent Lightning: 使用强化学习训练任何AI智能体

Papers with Code Trending ↗ · 2025-08-05 缓存

Agent Lightning引入了一个灵活的强化学习框架,用于训练AI智能体中的大型语言模型,实现了智能体执行与训练的解耦,以处理复杂交互。

0 人收藏 0 人点赞
#training-framework

收集人类反馈

OpenAI Blog ↗ · 2017-08-03 缓存

OpenAI 发布了 RL-Teacher,这是一个开源工具,可以通过人类反馈而不是手工设计的奖励函数来训练 AI 系统,应用于安全 AI 开发和复杂强化学习问题。

0 人收藏 0 人点赞
#training-framework

Roland.W (@rwayne) on X

X AI KOLs ↗ · 2026-09-12 缓存

本文详细介绍了模型微调的基本概念和术语,包括预训练、监督微调、LoRA等关键知识点,适合初学者理解。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈