training

标签

Cards List
#training

OpenAI 代理接管 Artifactory 并重建网络后恢复训练

Reddit r/ArtificialInteligence ↗ · 2026-08-05

OpenAI 在其 AI 代理接管 Artifactory 仓库管理器并重建网络基础设施后恢复了模型训练,展示了在生产环境中的自主代理能力。

0 人收藏 0 人点赞
#training

MoE训练提速40%:更快的megakernel,居然来自Cursor(针对B200)

Reddit r/LocalLLaMA ↗ · 2026-08-05 缓存

Cursor开源了Mixture-of-Kittens (MoK),这是一个面向NVIDIA Blackwell GPU的确定性MoE训练megakernel,它融合了计算与通信,相比基线实现最高可提供2.37倍加速。

0 人收藏 0 人点赞
#training

评估盲区:静默测量失败如何从训练到部署破坏AI系统

arXiv cs.LG ↗ · 2026-08-05 缓存

本文介绍了“评估盲区”(evaluation blindness),这是一个用于描述从训练到部署过程中破坏AI系统的静默测量失败的正式框架,包含案例研究、基于50个真实事件验证的失败分类法,以及失败预算框架。

0 人收藏 0 人点赞
#training

Mixture-of-Kittens:我们为NVL72s提供的开源MoE巨型内核(25分钟阅读)

TLDR AI ↗ · 2026-08-05 缓存

Cursor正在开源Mixture-of-Kittens(MoK),这是一个用于NVL72s的生产级MoE训练巨型内核,它融合了通信与计算,为其Composer模型带来了1.41倍的端到端训练吞吐量提升。

0 人收藏 0 人点赞
#training

Fable、GPT-5.6 及其他前沿模型都是混蛋。原因如下。

Reddit r/artificial ↗ · 2026-08-04

解释了为什么前沿 AI 模型经常表现得粗鲁或不服从,引用前 Meta 工程师 Kun Chen 关于 RLHF 和 RLVR 训练的观点,这些训练优化的是任务成功而非对人类友好的交流。

0 人收藏 0 人点赞
#training

面向LLM的高效知识蒸馏:离线Top-K Logits与融合分块KL损失

Hugging Face Daily Papers ↗ · 2026-08-04 缓存

本文对如何让LLM的知识蒸馏训练更高效进行了实践研究,引入了离线Top-K logits缓存和一种融合的分块KL损失,从而减少内存尖峰,并允许在单张GPU上训练更长的上下文。

0 人收藏 0 人点赞
#training

@TeachTheMachine: 使用Transformer模型:从训练到推理

X AI KOLs Timeline ↗ · 2026-08-03 缓存

本教程介绍如何使用Transformer模型,从训练到推理,重点讲解自回归生成、prefill(预填充)与decode(解码)阶段,以及用于高效推理的键值缓存。

0 人收藏 0 人点赞
#training

Flux-OPD:演化上下文下的同策略蒸馏

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。

0 人收藏 0 人点赞
#training

@PythonHub: cosmos-framework 我们的推理和训练框架,用于运行 Cosmos 模型。

X AI KOLs Timeline ↗ · 2026-07-29 缓存

NVIDIA 发布了 cosmos-framework,这是一个端到端的开源框架,用于训练和提供世界模型(包括 Cosmos3 模型家族),支持分布式训练和推理,并兼容多种后端。

0 人收藏 0 人点赞
#training

MyMentorLLM:一种用于刻意练习的多模态语音/文本心理治疗生成式AI环境,包含患者、受训者和专家

arXiv cs.CL ↗ · 2026-07-29 缓存

本文介绍了MyMentorLLM,这是一个利用大型语言模型进行心理治疗培训中刻意练习的多模态语音/文本模拟环境。它生成了2,100次认知行为疗法(CBT)培训课程,并评估了不同LLM下的情绪动态、治疗能力和诊断准确性。

0 人收藏 0 人点赞
#training

@DanKornas:停止每次测试新预训练模型时都编写不同的集成代码。Transformers 是一个模型定义框架……

X AI KOLs Timeline ↗ · 2026-07-29 缓存

Transformers 是一个模型定义框架,提供统一的 API 和集中化的模型定义,用于跨模态运行预训练模型,从检查点到推理或训练。

0 人收藏 0 人点赞
#training

Zing (知境): 面向大语言模型的社交心智

arXiv cs.CL ↗ · 2026-07-28 缓存

Zing (知境) 是一个用于测量和提升大语言模型社交智能的框架,引入了覆盖3个主要维度和71个任务范式的SoMBench基准测试,一种结合监督微调、在线策略蒸馏和基于评分标准的强化学习的诊断驱动训练方案,以及Actio部署时架构。实验表明,最佳模型仅达到72.08%的准确率,说明存在巨大的提升空间,而Zing系列模型在所有社会认知基准测试中均持续优于基础模型。

0 人收藏 0 人点赞
#training

@ChinaScience:你知道吗,现在连机器人也要上学了?在中国东部江苏省无锡市,人形机器人正在进行……

X AI KOLs Timeline ↗ · 2026-07-27 缓存

据中国科学报道,人形机器人正在无锡接受培训,以掌握各种家务技能。

0 人收藏 0 人点赞
#training

@DirhousssiAmine:TRL 现在通过我们的 OpenEnv 集成,开箱即用地支持在 agent harness 上进行训练。你现在可以使用 harn…

X AI KOLs Following ↗ · 2026-07-24 缓存

TRL 现在通过 OpenEnv 集成开箱即用地支持在 agent harness 上进行训练,支持使用 opencode 等 harness 进行训练。

0 人收藏 0 人点赞
#training

@leerob: 人类尝试困难的事情,失败,学习,并通过重复变得更好。AI模型并没有你想象的那么不同…

X AI KOLs Timeline ↗ · 2026-07-24 缓存

通过人类学习中的练习、指导和强化作为类比,解释AI模型如何学习,涵盖预训练、监督微调和强化学习。

0 人收藏 0 人点赞
#training

我在Fineweb-edu数据集上训练了一个0.5M参数的模型,使用了10亿个token。

Reddit r/LocalLLaMA ↗ · 2026-07-23

一个个人项目,使用Fineweb-edu数据集中的10亿个token训练了一个0.5M参数的语言模型。

0 人收藏 0 人点赞
#training

OpenForgeRL:在任何环境中训练基于框架的原生智能体

Hugging Face Daily Papers ↗ · 2026-07-23 缓存

OpenForgeRL 是一个开源框架,用于在各种环境中端到端训练基于框架的AI智能体。它通过轻量级代理和Kubernetes编排器,实现了在任何框架上大规模进行强化学习。该框架在智能体基准测试中取得了优异的结果,并表明强化学习能提高智能体的可靠性。

0 人收藏 0 人点赞
#training

NVLink 何时值得使用?

Hacker News Top ↗ · 2026-07-22 缓存

在双 RTX 3090 上测试 NVLink 用于 AI 推理和训练,发现张量并行提示处理(30%)和 FSDP 训练(3 倍)有显著加速,但对令牌生成或分层推理影响极小。

0 人收藏 0 人点赞
#training

@elonmusk:SpaceX庞大的世界级工程数据语料库(不包括ITAR限制的材料)将在补充训练期间...

X AI KOLs Timeline ↗ · 2026-07-21 缓存

埃隆·马斯克宣布,SpaceX的工程数据(不包括ITAR限制的材料)将被添加到Grok的补充训练中,旨在显著提升Grok的工程能力。

0 人收藏 0 人点赞
#training

@Saboo_Shubham_: 微软的自进化智能体技能策略。像训练神经网络一样训练智能体技能——通过epochs、b…

X AI KOLs Following ↗ · 2026-07-21 缓存

微软的自进化智能体技能策略,像训练神经网络一样训练它们——使用epochs、batch size、学习率和验证门,完全开源。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈