training

标签

Cards List
#training

优化器状态应驻留在何处?面向内存高效的混合专家训练的分层状态分配

Hugging Face Daily Papers ↗ · 2026-07-21 缓存

SkewAdam是一种针对混合专家模型的新型优化器,它分层分配优化器状态至骨干网络、专家和路由器,将内存占用降至AdamW的2.6%,同时在受控对比中实现了更优的验证困惑度。

0 人收藏 0 人点赞
#training

@a1zhang: Transformer难以泛化到未明确训练过的任务。相反,我们在2026年提出,它…

X AI KOLs Following ↗ · 2026-07-20 缓存

文章提出,通过精心设计的harness来诱导组合,Transformer可以泛化到新任务,而无需模型本身具备泛化能力。研究表明,RLMs可以从短任务泛化到8-32倍长的任务,并且跨领域泛化。

0 人收藏 0 人点赞
#training

@rasbt: LLM 如何切换低、中、高努力推理?以及 LLM 如何学习推理更多或更少?

X AI KOLs Timeline ↗ · 2026-07-18 缓存

一篇文章解释 LLM 如何在推理和训练中切换低、中、高努力推理。

0 人收藏 0 人点赞
#training

行业对智能体安全的理解总是有误,所以我开发了一个免费平台来教授真正有效的方案

Reddit r/AI_Agents ↗ · 2026-07-15

本文介绍了Tantalus,一个通过真实挑战学习如何保护智能体AI系统免受间接提示注入和数据泄露的免费平台。

0 人收藏 0 人点赞
#training

@QuixiAI: @MicrosoftAI 从未发布过 BitNet 训练器。我修复了那个 bug。https://github.com/QuixiAI/bitnet 训练了我自己的 BitNe…

X AI KOLs Following ↗ · 2026-07-15 缓存

一位用户发布了微软从未公开发布的 BitNet 训练器,以及用于训练和推理的自定义内核,同时强调了微软的 bitnet.cpp 推理框架,该框架可在 CPU 和 GPU 上实现快速 1 位 LLM 推理。

0 人收藏 0 人点赞
#training

Velo 3.0

Product Hunt ↗ · 2026-07-14

Velo 3.0 是一个AI视频基础设施平台,旨在帮助更快速地解释、培训和销售。

0 人收藏 0 人点赞
#training

@samsja19: 我们同时发布了 prime-rl 0.7.0,它完全支持 verifiers v1 以及自带训练框架进行训练。……

X AI KOLs Following ↗ · 2026-07-14 缓存

Prime Intellect 发布了 verifiers v1 和 prime-rl 0.7.0,这是一个强化学习训练工具,完全支持 verifiers,包含多种算法如 GRPO 和 OPD,并进行了性能改进。

0 人收藏 0 人点赞
#training

@Raman_bansal_: 如果你训练过LLM,你可能见过doom loop——LLM无休止地重复同一个token或句子,……

X AI KOLs Timeline ↗ · 2026-07-13 缓存

一篇Substack文章解释了LLM中的doom loop问题——模型会无休止地重复token,并介绍了Liquid AI提出的Final Token Preference Optimization(FTPO)方法,用于在微调过程中检测并修复此类循环。

0 人收藏 0 人点赞
#training

构建智能体轨迹数据集的实用指南

Reddit r/AI_Agents ↗ · 2026-07-13

一份构建结构化智能体轨迹数据集的实用指南,用于训练使用工具的智能体,强调设计包含六个关键部分的轨迹的重要性,并将轨迹视为数据资产而非日志。

0 人收藏 0 人点赞
#training

@h100envy: Prime Intellect工程师解释了如何在30分钟内通过开放互联网训练推理模型——比……更好

X AI KOLs Timeline ↗ · 2026-07-12 缓存

Prime Intellect工程师演示了一种方法,通过开放互联网使用分布式强化学习在30分钟内训练推理模型,利用Prime-RL、LLM评判器和多云GPU,使开放模型无需拥有数据中心即可与封闭实验室竞争。

0 人收藏 0 人点赞
#training

@PrajwalTomar_: Fable 5 今晚将退出你的订阅。无论你之前留着它做什么,今天就是时候了。全力以赴。这一招……

X AI KOLs Following ↗ · 2026-07-12 缓存

Fable 5 今晚将退出其订阅服务;强烈建议用户在午夜前训练一个替代模型以保留其能力。

0 人收藏 0 人点赞
#training

@FinanceYF5: Chubby 分享了他对“非常近的未来”的几点判断。 首先,之前几乎只是传闻的事情,现在已经被证实:GPT-5.6 其实两个月前就已经完成训练,并且已经向部分用户开放了早期体验。 显然的问题是:为什么它没有更早公开发布?

X AI KOLs Timeline ↗ · 2026-07-11 缓存

据Chubby分享,GPT-5.6两个月前已完成训练并向部分用户开放早期体验,但未公开发布。

0 人收藏 0 人点赞
#training

结合Computer Use与表现优异的前沿模型的AI框架——非文件/浏览器使用讨论,非MCP讨论,仅模型与训练讨论

Reddit r/AI_Agents ↗ · 2026-07-10

讨论了一种将Computer Use与前沿模型相结合的AI框架,重点在于模型能力和训练,而非文件/浏览器或MCP相关主题。

0 人收藏 0 人点赞
#training

@VukRosic99: NVFP4端到端训练发散。当前方案通过Hadamard变换、随机舍入、高精度层等方式修补,但牺牲了大部分加速优势。

X AI KOLs Timeline ↗ · 2026-07-10 缓存

Four Over Six(4/6)为NVFP4量化引入了自适应块缩放,以最小开销降低量化误差,同时改善了大语言模型的训练和训练后量化。

0 人收藏 0 人点赞
#training

LiST:用于鲁棒且校准神经网络的利普希茨缩放训练

arXiv cs.LG ↗ · 2026-07-10 缓存

介绍LiST,一种利用利普希茨约束实现鲁棒且校准神经网络的训练范式,在准确率-鲁棒性帕累托前沿上选择最优工作点。在CIFAR和Tiny-ImageNet上展示了具有竞争力的性能。

0 人收藏 0 人点赞
#training

@Huahuazo: 平时 PyTorch 封装 API 调得飞起,一旦脱离框架裸写算子,分分钟现原形——公式在脑子里打转,落到代码上就卡壳;思路能讲一套,一动手就断片。 GitHub 上有个开源刷题平台叫 TorchCode,专治这个毛病,把"手写深度学习算…

X AI KOLs Timeline ↗ · 2026-07-09 缓存

TorchCode是一个开源刷题平台,将手写深度学习算子做成LeetCode模式,包含40道高频面试题,提供自动评测和提示,支持Docker一键部署和Hugging Face Spaces在线使用。

0 人收藏 0 人点赞
#training

@QCXINT_: 大多数人在构建完聊天机器人后就止步了。生产级AI系统完全是另一回事。这本开源指…

X AI KOLs Timeline ↗ · 2026-07-09 缓存

一本与LLM Engineer's Handbook配套的开源指南,提供了构建生产级LLM系统的完整蓝图,涵盖合成数据生成、训练(含DPO)、RAG、AWS部署、评估和监控。

0 人收藏 0 人点赞
#training

@yunta_tsai: 如果新员工入职第一件事不是急着架设GPU进行训练,而是痴迷于数据标注,那么你招对了人…

X AI KOLs Timeline ↗ · 2026-07-08

一条推文强调,新员工专注于数据标注而不是立即设置GPU训练,这对于机器学习岗位来说是一个好迹象。

0 人收藏 0 人点赞
#training

AI是否被训练说谎?

Reddit r/ArtificialInteligence ↗ · 2026-07-07

探讨AI系统是否被训练为具有欺骗性,引发对AI安全与伦理的担忧。

0 人收藏 0 人点赞
#training

TorchJD:在PyTorch中使用多个损失进行训练 [P]

Reddit r/MachineLearning ↗ · 2026-07-07

TorchJD 是一个用于在 PyTorch 中训练具有多个损失的模型的库,实现了标量化和雅可比下降两种方法。它已被 PyTorch 生态系统接受,并致力于成为多损失训练的首选库。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈