开源权重不够:我们需要开源训练框架来推动研究和更好的算法 [P]

Reddit r/MachineLearning 工具

摘要

呼吁在AI研究中采用开源训练框架,介绍FeynRL——一个模块化且显式的框架,用于LLM、VLM和智能体的强化学习后训练,旨在让训练过程可见且可修改。

开放权重重要且关键,但它们本身还不够。如果我们希望开放机器学习和AI研究取得进展,我们就还需要开源训练框架:不仅仅是运行任务的代码库。它们应该使训练过程可见、可理解且可修改,让研究人员、工程师和实践者能够构建新算法,而不是与隐藏的系统作斗争。正是这种动机催生了FeynRL(读作“FineRL”),一个我为LLM、VLM和智能体构建的用于RL后训练的框架。RL本身就很难奏效。对于LLM、VLM和智能体,情况变得更加混乱:展开引擎、奖励计算、分布式训练、权重同步、信用分配问题、长周期行为,以及许多可能悄悄破坏一切的微小实现细节。FeynRL背后的核心理念很简单:***算法应该保持为算法,系统应该保持为系统***,而且研究人员/工程师/实践者应该能够端到端地理解完整的训练循环,而无需花费数天或数周的时间。GitHub:[https://github.com/FeynRL-project/FeynRL](https://github.com/FeynRL-project/FeynRL) 该框架设计为保持框架的显式性:从数据加载和展开生成到奖励计算、损失构建、优化和评估。目标是让开发新算法、训练食谱、奖励设计、展开策略和优化方法变得更加容易,而不必经历复杂隐蔽的系统。该框架目前包含针对vllm和llm的SFT、DPO和RL风格后训练的示例,支持单GPU、多GPU和集群设置。欢迎提供反馈、问题和建议。同时,也想听听大家认为RL后训练基础设施中哪些部分仍然过于隐蔽、难以调试或难以修改。
查看原文

相似文章

开放权重模型的权衡(9分钟阅读)

TLDR AI

对开放权重AI辩论的分析:支持者认为它使AI民主化,而批评者则指出滥用风险;多家大型科技公司签署了支持开放权重的公开信,而Anthropic和特朗普政府的部分成员仍保持谨慎。

开源权重模型并非通过抄袭来追赶闭源模型,它们之所以胜出,是因为整个AI堆栈正在悄然模块化

Reddit r/singularity

本文认为,开源权重AI模型追赶闭源模型并非通过蒸馏技术,而是得益于AI堆栈的模块化——稳定的接口(Transformer架构、兼容OpenAI的推理API、智能体框架)使得创新能在整个生态系统中迅速扩散,在缩小能力差距的同时保持巨大的价格优势,最终可能导致前沿AI的商品化。