training

标签

Cards List
#training

@adithya_s_k: 你现在可以直接用 TRL 对模型在智能体轨迹上进行微调:Claude Code 轨迹、Codex 轨迹、OpenClaw 轨迹、Pi 轨迹……

X AI KOLs Following ↗ · 2026-06-04 缓存

TRL 现在支持对来自各种来源(如 Claude Code、Codex、OpenClaw 和 Pi)的智能体轨迹进行模型微调,这正朝着训练智能体模型的标准化栈迈进。

0 人收藏 0 人点赞
#training

@loganthorneloe:阅读此文,开始学习机器学习基础设施。这是对机器学习中重要考虑因素的极好高层概述……

X AI KOLs Timeline ↗ · 2026-06-03 缓存

卡内基梅隆大学软件工程研究所发布了一篇机器学习训练基础设施概述,涵盖了硬件考量(如GPU与CPU)以及内存需求等。

0 人收藏 0 人点赞
#training

@FinanceYF5: Anthropic 正在雇佣 1000 名自由职业软件工程师来训练 Claude Code。 单任务报酬 280 美元。 他们负责编写提示词、比对代码输出、测试模型的追问响应,并且教会 Claude 真实开发者的工作方式。 这简直是在亲手…

X AI KOLs Following ↗ · 2026-06-03 缓存

Anthropic is hiring 1000 freelance software engineers to train Claude Code, with each task paying $280. The engineers will write prompts, compare code outputs, test model responses, and teach Claude how real developers work.

0 人收藏 0 人点赞
#training

@FeitengLi: 异步、稀疏,和小数点后第五位:Cursor 训练 Composer 2 的工程细节 https://lattifai.com/zh/podcasts/SequoiaCapital/UDTr9yUnLUI…

X AI KOLs Timeline ↗ · 2026-06-03 缓存

本文深入探讨Cursor训练Composer 2模型采用的异步、稀疏等技术细节,并介绍了RL基础设施的全解析。

0 人收藏 0 人点赞
#training

@DanKornas:不要通过零散的教程学习 LLM。LLM from Scratch 是一个面向开发者的实践性 PyTorch 课程,适合那些想要……

X AI KOLs Timeline ↗ · 2026-06-02 缓存

一个实践性 PyTorch 课程,教授从 Transformer 基础到微调和对齐的 LLM 训练,包括 RLHF 和 GRPO。

0 人收藏 0 人点赞
#training

@_djdumpling:非常令人兴奋的工作,很高兴今年夏天能在 @modal 从事强化学习工作!

X AI KOLs Timeline ↗ · 2026-06-01 缓存

用户对在 Modal 从事强化学习工作表示兴奋,并提及 Modal 发布了开源库以及在扩展强化学习训练中学到的经验。

0 人收藏 0 人点赞
#training

@yibie: 训练小模型:2026 年最被低估的 AI 技能 2026 年 5 月 11 日,一个叫 CJ Zafir 的人发了一条推文。他想教普通人 fine-tune 开源模型。 2538 个赞,316 次转发,178,000 次观看。这条推文炸了…

X AI KOLs Timeline ↗ · 2026-06-01 缓存

2026年5月,CJ Zafir 一条教普通人微调开源模型的推文获得广泛关注,展示了训练小模型作为2026年最被低估AI技能的趋势。

0 人收藏 0 人点赞
#training

基于低秩进化策略的脉冲神经网络无梯度训练

arXiv cs.AI ↗ · 2026-06-01 缓存

介绍了一种名为 Eggroll 的低秩进化策略,用于脉冲神经网络的无梯度训练,在 N-MNIST 上减少内存和时间开销,同时达到有竞争力的准确率。

0 人收藏 0 人点赞
#training

Agentic RL: Token-In, Token-Out Done Right (16 minute read)

TLDR AI ↗ · 2026-06-01 缓存

This article explains the 'Token-In, Token-Out' (TITO) invariant in reinforcement learning for LLMs, highlighting a common error when training multi-turn agents with tool calls. It presents two solutions: using per-model renderers or designing training to avoid re-encoding decoded tokens, emphasizing prefix-preserving chat templates.

0 人收藏 0 人点赞
#training

@charles_irl: 为何要用很多字节,少量也能搞定?

X AI KOLs Following ↗ · 2026-05-30 缓存

Modal 的 Nan Jiang 宣布他们正在开发开源 RL 框架以支持前沿的开放权重模型,重点介绍了增量压缩以及在权重同步和跨集群训练方面依然存在的挑战。

0 人收藏 0 人点赞
#training

@ivanfioravanti: 有一点是肯定的:在Nvidia上做本地AI一切更容易——推理、训练、玩现有项目。…

X AI KOLs Following ↗ · 2026-05-30 缓存

开发者反思在Nvidia上轻松进行本地AI任务,与在Apple Silicon上成功让一切运转的满足感对比,倡导‘保持饥饿,保持愚蠢’的心态。

0 人收藏 0 人点赞
#training

偏差累积,方差抵消

Hacker News Top ↗ · 2026-05-29 缓存

本文证明,对BF16优化器状态使用随机舍入可以匹配FP32性能,因为无偏误差随时间抵消,而四舍五入则因累积偏差而停滞。一项使用MLP的实验表明,BF16+SR在减少内存使用的同时达到了与FP32相似的损失。

0 人收藏 0 人点赞
#training

从零开始在8GB显存上训练LLM。我开心

Reddit r/LocalLLaMA ↗ · 2026-05-29

构建了一个仓库,用于在8GB显存上从零训练一个微型语言模型(25M参数),支持MTP,但指出mHC和BitNet的局限性。

0 人收藏 0 人点赞
#training

十多年来,我们一直认为端到端反向传播是训练深度网络的唯一方法(1分钟阅读)

TLDR AI ↗ · 2026-05-29 缓存

Sakana AI 提出了 DiffusionBlocks,一种通过将前向传播解释为扩散去噪来分块训练神经网络的方法,与传统端到端反向传播相比,显著降低了内存需求。

0 人收藏 0 人点赞
#training

@FrancoisChauba1: 如果你在(未排序列表、冒泡排序过程、已排序列表)的轨迹上进行训练,你永远无法通过测试时计算(TTC)达到…

X AI KOLs Following ↗ · 2026-05-26 缓存

一篇批评文章指出,在人类生成的数据上训练LLM限制了它们通过测试时计算发现新颖解决方案的能力,而真正的AGI需要模型能够像AlphaZero那样更广泛地探索假设空间。

0 人收藏 0 人点赞
#training

@ShaokunZhang1: 想用你自己的模型训练你自己的Claude Code/Codex代理吗?我们很高兴推出ProRL Agent V2: Polar。A…

X AI KOLs Timeline ↗ · 2026-05-26 缓存

NVIDIA发布了Polar,一个用于黑盒智能体强化学习的开源基础设施,支持使用任何智能体工具或框架训练如Claude Code或Codex等编码智能体。

0 人收藏 0 人点赞
#training

大家都在推销AI代理,但几乎没人推销让它们发挥作用的工作流程。

Reddit r/AI_Agents ↗ · 2026-05-26

文章认为,虽然很多人正在构建和销售AI代理,但真正的价值在于让它们发挥作用的工作流程和训练,而不是底层技术。

0 人收藏 0 人点赞
#training

Found in Conversation: LLMs 自我学习以缩小多轮对话差距

arXiv cs.CL ↗ · 2026-05-26 缓存

本文介绍了 Found in Conversation (FiC),一个使用视图非对称自蒸馏(View-Asymmetric Self-Distillation)的训练框架,旨在缩小 LLMs 中的多轮对话性能差距。该方法教会模型从欠详细的多轮提示中恢复单轮能力,在多种模型系列和规模上实现了 92-100% 的恢复率。

0 人收藏 0 人点赞
#training

输入凸神经网络训练的一种提升方法

arXiv cs.LG ↗ · 2026-05-26 缓存

提出了一种用于训练输入凸神经网络(ICNN)的“提升”方法,该方法使用无约束的超网络生成非负的层间权重,从而软化损失景观并避免梯度衰减,相比投影梯度下降和softplus重参数化,实现了更低的测试损失。

0 人收藏 0 人点赞
#training

体积微小,效果显著:大语言模型中的缩放向量研究

Hugging Face Daily Papers ↗ · 2026-05-26 缓存

本文系统地研究了LLM归一化层中的缩放向量,揭示了它们通过自放大预条件效应优化训练,并提出了三种轻量级改进方案,在几乎不增加开销的情况下提升性能和扩展行为。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈