training

标签

Cards List
#training

@Muennighoff:我们正在通过扩展到Opus/GPT级别、从头训练以及超越编码,开发一个更好的Composer模型!

X AI KOLs Timeline ↗ · 2026-06-22 缓存

Muennighoff宣布正在开发一个更好的Composer模型,扩展到Opus/GPT级别、从头训练,并超越编码,作为Cursor与SpaceX合作的一部分。

0 人收藏 0 人点赞
#training

GLM5.2 @7tg 在预算主板+CPU上使用4x3090+192GB

Reddit r/LocalLLaMA ↗ · 2026-06-22

在预算配置下,使用4块RTX 3090 GPU和192GB内存运行GLM5.2,处理7万亿tokens。

0 人收藏 0 人点赞
#training

Tmax:一种简单的终端智能体配方

Hugging Face Daily Papers ↗ · 2026-06-22 缓存

Tmax 引入了一种简化的终端智能体强化学习训练配方,通过新颖的数据生成分类法和扩展的开源数据集,使用 9B 参数模型实现了最先进的性能。

0 人收藏 0 人点赞
#training

以数据为中心的调试:面向训练神经网络的团队 [P]

Reddit r/MachineLearning ↗ · 2026-06-21

WeightsLab 是一个开源、PyTorch 原生的工具,允许团队在训练过程中暂停、检查实时损失信号,并在数据问题(如标签错误和类别不平衡)影响模型性能之前发现它们。它专为处理图像、视频和 LiDAR 点云的计算机视觉工程师而设计。

0 人收藏 0 人点赞
#training

为什么不能训练LLMs用一种优化的AI语言而非英语来思考?

Reddit r/singularity ↗ · 2026-06-21

一个推测性的讨论,质疑为什么LLMs没有被训练使用优化的内部语言而非自然语言来思考,以及这是否能提高效率。

0 人收藏 0 人点赞
#training

@FinanceYF5: 3/ 他认为,过去5个月AI能力的跃升 不只来自Claude Code等工具进步 而是因为【Mythos】——Anthropic一个新模型 在今年2月完成训练后悄然改变了整个研发节奏 关键判断: 领先的模型,正在帮助训练下一代领先的模型 …

X AI KOLs Following ↗ · 2026-06-21 缓存

据推测,Anthropic新模型Mythos于今年2月训练完成后,悄然改变了研发节奏,使得过去5个月AI能力显著跃升,领先模型正在帮助训练下一代模型。

0 人收藏 0 人点赞
#training

@TheTuringPost: 开源代理强化训练器(ART)——将GRPO嵌入任何Python应用 → 您的应用定义任务和奖励…

X AI KOLs Timeline ↗ · 2026-06-20 缓存

代理强化训练器(ART)是一个开源框架,将基于GRPO的强化学习嵌入任何Python应用,使代理能够通过环境交互学习,利用轨迹评分和LoRA更新,据称使用Qwen 2.5 14B模型在邮件检索任务上超越OpenAI的o3。

0 人收藏 0 人点赞
#training

RTX 5090 MSI,仅推理或训练时功耗475-500W。请确保不要弯折线缆!

Reddit r/LocalLLaMA ↗ · 2026-06-20

MSI的RTX 5090 GPU在推理或训练时功耗为475-500W,并附有关于线缆弯折的警告。

0 人收藏 0 人点赞
#training

研究人员使用32块H100 GPU训练了一个Deep Research智能体,并开源了所有内容

Reddit r/LocalLLaMA ↗ · 2026-06-19

研究人员使用32块H100 GPU训练了一个Deep Research智能体,并开源了所有组件,从而促进了社区访问和进一步开发。

0 人收藏 0 人点赞
#training

@OpenAI:这是朝着更强大有益且更对齐的模型迈出的早期一步:训练模型将有益特质带入新场景……

X AI KOLs ↗ · 2026-06-18

OpenAI宣布了朝着训练AI模型将有益特质带入新场景的早期一步,旨在使AI在能力增强的同时更加可靠、透明和有用。

0 人收藏 0 人点赞
#training

@jino_rohit: https://x.com/jino_rohit/status/2067620031517860243

X AI KOLs Timeline ↗ · 2026-06-18 缓存

解释多GPU系统的通信模型,涵盖延迟与带宽之间的权衡,并比较MST和Ring算法在广播等集合操作中的应用。

0 人收藏 0 人点赞
#training

@neural_avb: 我最好的新习惯是让我的代理记录我在训练模型时使用的所有技巧和秘籍。我有日志……

X AI KOLs Timeline ↗ · 2026-06-18 缓存

作者分享了一个习惯:使用代理记录所有训练技巧和秘籍,包括超参数调整和数据集升级,以保持事实日志供日后参考和教程制作。

0 人收藏 0 人点赞
#training

@adithya_s_k: 现在,您只需几行代码即可使用 TRL 在 OpenReward 提供的 350+ 个强化学习环境上进行训练

X AI KOLs Following ↗ · 2026-06-17 缓存

OpenReward 和 TRL 现在支持在超过 350 个强化学习环境中进行训练,只需极少代码。

0 人收藏 0 人点赞
#training

@SergioPaniego: https://x.com/SergioPaniego/status/2067270222671741360

X AI KOLs Timeline ↗ · 2026-06-17 缓存

OpenReward环境现在可以直接通过单个OpenRewardSpec集成到TRL的GRPOTrainer中,从而能够针对一系列RL环境进行零代码粘合训练。该集成处于实验阶段,是让环境和智能体RL成为TRL一等公民的更广泛努力的一部分。

0 人收藏 0 人点赞
#training

MGUP:一种用于随机优化的动量-梯度对齐更新策略

arXiv cs.LG ↗ · 2026-06-17 缓存

提出了一种用于随机优化的动量-梯度对齐更新策略MGUP,可实现层内选择性参数更新。该策略能与AdamW、Lion和Muon等优化器无缝集成,在提供理论收敛保证的同时,在大型模型训练任务中展现出卓越性能。

0 人收藏 0 人点赞
#training

@__tinygrad__: 我们已凭借AMD MI350X训练Llama 8B登上MLPerf榜单。这基于我们自己的驱动、运行时、内核及训练循环…

X AI KOLs Timeline ↗ · 2026-06-16 缓存

tinygrad宣布,其凭借AMD MI350X硬件训练Llama 8B,在MLPerf基准测试榜单上占据一席之地,采用了自研驱动、运行时、内核及训练循环,并计划进一步优化时间并挑战405B模型。

0 人收藏 0 人点赞
#training

最快、最大、最强:NVIDIA Blackwell 横扫 MLPerf Training 6.0

NVIDIA Blog ↗ · 2026-06-16 缓存

NVIDIA 的 Blackwell 平台在所有 MLPerf Training 6.0 基准测试中实现了最快的训练时间,扩展到 8,192 块 GPU,并且 GB300 NVL72 相比 GB200 NVL72 展示了高达 1.6 倍的性能提升。

0 人收藏 0 人点赞
#training

从受训者到训练者:LLM为多智能体推理强化学习设计的训练环境

Hugging Face Daily Papers ↗ · 2026-06-16 缓存

本文介绍了LLM-as-Environment-Engineer框架,该框架使LLM能够为多智能体推理任务中的强化学习设计自己的训练环境,实现自我改进训练,其性能超越更大的专有模型。

0 人收藏 0 人点赞
#training

通过解耦权重向量的幅度和方向改进神经网络训练 | Alexander Hägele

Reddit r/LocalLLaMA ↗ · 2026-06-15 缓存

这篇博客文章介绍了幅度-方向(MD)解耦方法,该方法将神经网络权重矩阵分解为方向分量和幅度分量,并使用独立的学习率进行优化。实验表明,该方法在Adam和Muon优化器上均提升了性能,实现了跨模型宽度的自动学习率迁移,并在大规模混合专家模型中展现了缩放优势。

0 人收藏 0 人点赞
#training

@tanzhengmc97: https://x.com/tanzhengmc97/status/2066531753762656730

X AI KOLs Timeline ↗ · 2026-06-15 缓存

用通俗易懂的语言解释了大模型的运行原理,包括词向量、Transformer注意力机制、下一个词预测训练以及涌现能力,适合初学者理解AI基础概念。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈