标签
Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。
CADENCE 使用稀疏自编码器将心电图基础模型表示分解为可解释的生理概念,显著改善了与临床表型和波形形态的一致性。
微软推出了Mage-VL,这是一个编解码器原生的流式多模态基础模型,用于图像和视频理解。通过采用受视频编解码器启发的稀疏模式,该模型实现了高达3.5倍的推理加速,同时将视觉令牌减少了超过75%。
Modus是一个仅解码器模型,能够从其他模态的任意组合预测任意模态,无需特定模态的头部或损失函数,就在多个基准测试上取得了强劲的性能。
Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。
介绍了N_0-VTLA,一种面向高接触操作的视觉-触觉-语言-动作基础模型,具备大规模触觉预训练和基于优势的离线策略改进功能,在真实机器人和仿真基准测试中表现优异。
Induction Labs 推出了想象模型(imagination models),这是一种新的基础模型架构,从互联网规模的视频中学习。他们的第一个模型 Photon-1 通过观看 18 年的屏幕录像(无动作标签)学习使用计算机,以比 Gemini 3.1 Flash 低 30 倍的预训练成本取得了更好的结果。
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,能够共同从图像、视频和音频中学习,实现跨模态的统一生成和理解,现已开放早期访问。
MKB 是一个统一的科学多模态基础模型,使用共享的 Transformer 主干和针对模态定制的组件,处理六个科学分支(DNA、RNA、蛋白质、小分子、地球科学、医学图像),在跨领域的理解和生成方面达到有竞争力的水平。
Oxygen-TryOn 是一个统一的面向任意单品虚拟试穿的基础模型,通过专用数据引擎和三阶段训练流程,在单件和多件试穿任务上实现了最先进的一致性及逼真度。
Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。
Delineate Anything v2 是一个全球可扩展的农田地块边界映射基础模型,在 [email protected] 上相对提升 103.3%,超越现有最佳水平。该模型使用了涵盖 61 个国家、7300 万实例的多分辨率数据集,并建立了一个手工筛选的 100 国评估基准。
Inertia-1是一个研究项目,系统性地探索运动模型的完整生命周期——数据、感知、目标和规模——以产生一种统一的表示,该表示无需重新训练即可跨身体位置、设备和任务迁移,利用了在1800万小时加速度计数据上的自监督预训练。
Soofi 推出了 Soofi S,这是一个拥有300亿参数的混合专家开源基础模型,在27万亿个token上训练,面向德语和英语的工业AI应用。该模型是欧洲主权AI计划的一部分。
小米机器人基础模型 Xiaomi Robotics-1 已在 Hugging Face 发布。该模型基于10万小时真实世界操作数据进行训练,能够自主完成叠衣服、装洗衣机、洗碗等家务。
小米展示了Robotics-1,这是一个通过无实体预训练在10万小时数据上训练的机器人策略模型,展现出清晰的扩展行为和对真实世界任务的强大泛化能力。
RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。
本文采访了Moonshot AI创始人杨植麟,讨论了构建基础模型和AI助手Kimi的挑战与愿景,并反思了过去一年的发展。
Applied Computing 是一家总部位于伦敦的初创公司,为其Orbital项目筹集了2000万美元。Orbital是一个用于石油、天然气和石化工厂的基础AI模型,结合了时间序列、物理学和语言模型,用于分析传感器数据并模拟操作,旨在帮助运营商更有效地利用数据。