标签
Marin团队正在训练最大的完全开放模型,拥有535B参数,通过实时跟踪和开放数据日志提供前所未有的透明度。
腾讯发布了 Hy4 Preview,这是一款开源纯文本大语言模型,总参数 7700 亿,活跃参数 490 亿,上下文窗口达百万 token,具有 'high' 和 'no_think' 努力级别的推理能力。
推荐安装 Office CLI,配合大模型和 PPT、数据分析类 Skill 可以大幅提升办公效率。
Alatkins宣布在拉斯维加斯的AI4大会上发表一场临时演讲,内容涵盖Trinity Large演讲的更新版本,并预告了关于训练一个400B MoE模型至17T tokens而无损失尖峰的内容。
阿里巴巴发布了其最大的模型 Qwen3.8-Max,参数规模达 2.4T,在 Terminal-Bench 上的成绩比 Fable 5 高出 2%,开放权重将于下周发布。
Moonshot 发布了 Kimi K3,这是一个极其庞大的 AI 模型,即便在配备多块 RTX 6000 Blackwell GPU 的本地工作站上也无法原生运行,促使作者尝试通过破解或蒸馏的方式让它跑起来。
菲尔兹奖得主Jacob Tsimerman宣布离开学术界,加入OpenAI的安全团队;同时,NVIDIA正在探讨为一座数据中心提供大规模融资,而开源模型Kimi K3(2.8万亿参数)也已发布。
Kimi K3是Moonshot AI推出的2.8T参数开放模型,基准测试表现强劲,但可能过度优化,且落后顶级闭源模型数月。它从Claude蒸馏而来,其发布可能先于IPO。
曾因恶意攻击大模型被字节跳动开除并赔付800万的实习生田柯宇,现已获得上亿融资,实现了柳暗花明的转变。
清华大学NLP实验室毕业生去向统计显示,大模型方向博士年薪可达600万以上,硕士百万以上,引发对自媒体歪曲报道的批评。
MiMo-V2.5-Pro-UltraSpeed 是一个用于可视化大模型注意力机制差异的工具,主打超快速度。
MiMo-V2.5-Pro-UltraSpeed 是一个超快的大模型训练 pipeline 管线。
Meta即将推出新模型Muse Spark,据Alexandr Wang称,该模型在编码和代理能力方面有重大改进,旨在与其他领先模型竞争,且模型规模非常大。
宣布一款服务器配置,搭载4块Nvidia V100 GPU和128GB Tesla内存,面向AI大模型工作负载。
蚂蚁集团近期发布了大量涉及大模型和健康领域的招聘岗位,包括校园招聘和社会招聘,为求职者提供了机会。
总结了当前多模态大模型创业的几个主要落地方向,包括游戏AI NPC、企业级多模态Agent、内容生成、具身智能和视觉代码助手等。
Garry Tan发推文称,他使用Thinking Machines在几个小时内微调了自己的Qwen3.5-397B模型,称赞其速度和可用性,用于多模态个人AI。
一条关于AI大模型行业人才流动的观察:许多前CTO和快手早期员工加入相关公司,以及创业者卖公司后实习转正组团队的现象。