标签
Linux Kernel Exploitation 即将发布的公告,提供折扣预订席位。
作者提供了关于构建一个小型20亿参数AI模型的更新,该模型具有Engram组件,在1500万维基百科tokens上训练,达到了惊人的连贯性,并计划进行Apache 2.0开源发布。
这篇文章反驳了AI发展正在放缓的观点,强调了Grok4.8,一个拥有2.5T参数的模型,已经完成训练,以及主要科技公司仍在积极训练AI模型。
一名宇航员回忆了着陆Space Shuttle Atlantis的刺激瞬间,详述了从Mach 1到着陆的无动力滑翔下降所需的严苛训练和精确度。
ZGCM-1是一个完全开源的7B大语言模型,从头训练,采用FP8、MDP中期训练和AI4AI,在数学和智能搜索任务上达到了与Qwen3-235B相当的性能。
Elon Musk宣布,Grok 4.8——一个采用新C++软件栈训练的2.5万亿参数AI模型——将于本周结束训练并启动强化学习。与此同时,@kentcdodds就Elon Musk提前讨论未来发展的习惯发表了评论。
本文将Transformer表示更新分解为平行和垂直分量,以研究演化几何,并将其与编辑鲁棒性、压缩诊断和训练改进联系起来。
Tahuna是一个开源的AI训练基础设施,专为小团队设计,用于训练模型、运行推理、编排GPU并进行自主研究实验,具有可重现的运行和如Hillclimb这样的工具。
一位开发者创建了一个密集的9.4B参数AI模型,具有Engram表和AttnRes建模等技术增强,旨在开源发布,并寻求社区兴趣以进行进一步训练和部署。
本文介绍了管理长上下文长度下训练大型混合专家模型内存峰值的技术,包括Pipelined LLEP、Ring-DTP、SCO和OffloadStreamAdamW,这些技术实现了固定的GPU工作集,并将吞吐量提高了多达10.4倍。
文章揭示,由于推理令牌未被归类为用户拥有的输出这一漏洞,OpenAI 的条款允许其使用付费用户的交互进行训练,尽管存在退出选项。
作者正在实验用于PyTorch的自适应内存管理器,以防止8GB GPU上的CUDA内存溢出错误,分享代码并寻求社区反馈。
一个实验,其中两个分割模型使用GPT-6 Astra Ultra作为编排器进行训练,未使用人工标签,由于时间限制提示较为随意,并展示了在保留视频上的预测结果。
4000块NVIDIA GB200 GPU已抵达Texas,用于Horizon TACC集群,形成了最大的学术超级计算机,并计划训练开源AI模型。
一个轻量级的TTS实现,通过2000小时数据复现Audio8的训练,在H200上不到10小时训练就达到了0.72的SIM指标。
这是一本大幅修订的机器学习工程开放书籍,已更新至最新的硬件规格和示例,为训练和微调大语言模型及多模态模型提供实用指南。
本文介绍了如何使用 Sentence Transformers 库训练和微调多向量嵌入模型,展示了其 v6.0 更新中的新 MultiVectorEncoder 类型,并在医疗检索任务中演示了其卓越的性能。