foundation-model

标签

Cards List
#foundation-model

Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体

Hugging Face Daily Papers · 2026-07-30 缓存

Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。

0 人收藏 0 人点赞
#foundation-model

CADENCE:一种用于从心电图基础模型中可解释性神经概念提取的心脏原子词典

arXiv cs.AI · 2026-07-29 缓存

CADENCE 使用稀疏自编码器将心电图基础模型表示分解为可解释的生理概念,显著改善了与临床表型和波形形态的一致性。

0 人收藏 0 人点赞
#foundation-model

microsoft/Mage-VL · Hugging Face - 一个高效的编解码器原生流式多模态基础模型

Reddit r/LocalLLaMA · 2026-07-28 缓存

微软推出了Mage-VL,这是一个编解码器原生的流式多模态基础模型,用于图像和视频理解。通过采用受视频编解码器启发的稀疏模式,该模型实现了高达3.5倍的推理加速,同时将视觉令牌减少了超过75%。

0 人收藏 0 人点赞
#foundation-model

MODUS: 仅解码器的任意到任意多模态建模

Hugging Face Daily Papers · 2026-07-28 缓存

Modus是一个仅解码器模型,能够从其他模态的任意组合预测任意模态,无需特定模态的头部或损失函数,就在多个基准测试上取得了强劲的性能。

0 人收藏 0 人点赞
#foundation-model

Mage-VL:一种高效的编解码原生流式多模态基础模型

Hugging Face Daily Papers · 2026-07-27 缓存

Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。

0 人收藏 0 人点赞
#foundation-model

N_0-VTLA:利用潜在触觉标记扩展视觉-触觉-语言-动作模型

Hugging Face Daily Papers · 2026-07-26 缓存

介绍了N_0-VTLA,一种面向高接触操作的视觉-触觉-语言-动作基础模型,具备大规模触觉预训练和基于优势的离线策略改进功能,在真实机器人和仿真基准测试中表现优异。

0 人收藏 0 人点赞
#foundation-model

@HaiyuWu1: 首先在潜空间中从互联网视频学习因果关系,然后使用强化学习教基础模型如何行动…

X AI KOLs Following · 2026-07-24 缓存

Induction Labs 推出了想象模型(imagination models),这是一种新的基础模型架构,从互联网规模的视频中学习。他们的第一个模型 Photon-1 通过观看 18 年的屏幕录像(无动作标签)学习使用计算机,以比 Gemini 3.1 Flash 低 30 倍的预训练成本取得了更好的结果。

0 人收藏 0 人点赞
#foundation-model

Flux 3 X Mimic:新一代视频-动作模型

Hacker News Top · 2026-07-24 缓存

Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。

0 人收藏 0 人点赞
#foundation-model

Flux 3

Hacker News Top · 2026-07-24 缓存

Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,能够共同从图像、视频和音频中学习,实现跨模态的统一生成和理解,现已开放早期访问。

0 人收藏 0 人点赞
#foundation-model

Monkey King Bang: A Unified Scientific Multimodal Foundation Model

arXiv cs.LG · 2026-07-24 缓存

MKB 是一个统一的科学多模态基础模型,使用共享的 Transformer 主干和针对模态定制的组件,处理六个科学分支(DNA、RNA、蛋白质、小分子、地球科学、医学图像),在跨领域的理解和生成方面达到有竞争力的水平。

0 人收藏 0 人点赞
#foundation-model

Oxygen-TryOn:面向任意单品虚拟试穿的时尚原生基础模型

Hugging Face Daily Papers · 2026-07-23 缓存

Oxygen-TryOn 是一个统一的面向任意单品虚拟试穿的基础模型,通过专用数据引擎和三阶段训练流程,在单件和多件试穿任务上实现了最先进的一致性及逼真度。

0 人收藏 0 人点赞
#foundation-model

microsoft/Mage-Flow

Hugging Face Models Trending · 2026-07-21 缓存

Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。

0 人收藏 0 人点赞
#foundation-model

Delineate Anything v2: 一个用于农田地块分割的全球基础模型

Hugging Face Daily Papers · 2026-07-21 缓存

Delineate Anything v2 是一个全球可扩展的农田地块边界映射基础模型,在 [email protected] 上相对提升 103.3%,超越现有最佳水平。该模型使用了涵盖 61 个国家、7300 万实例的多分辨率数据集,并建立了一个手工筛选的 100 国评估基准。

0 人收藏 0 人点赞
#foundation-model

Inertia-1:对统一运动基础模型的开放探索

Hacker News Top · 2026-07-20 缓存

Inertia-1是一个研究项目,系统性地探索运动模型的完整生命周期——数据、感知、目标和规模——以产生一种统一的表示,该表示无需重新训练即可跨身体位置、设备和任务迁移,利用了在1800万小时加速度计数据上的自监督预训练。

0 人收藏 0 人点赞
#foundation-model

Soofi – 主权开源基础模型

Hacker News Top · 2026-07-20 缓存

Soofi 推出了 Soofi S,这是一个拥有300亿参数的混合专家开源基础模型,在27万亿个token上训练,面向德语和英语的工业AI应用。该模型是欧洲主权AI计划的一部分。

0 人收藏 0 人点赞
#foundation-model

@victormustar: Xiaomi-Robotics-1 刚刚在 Hugging Face 上发布——一个基于10万小时真实操作数据训练而成的机器人基础模型。

X AI KOLs Timeline · 2026-07-20 缓存

小米机器人基础模型 Xiaomi Robotics-1 已在 Hugging Face 发布。该模型基于10万小时真实世界操作数据进行训练,能够自主完成叠衣服、装洗衣机、洗碗等家务。

0 人收藏 0 人点赞
#foundation-model

Xiaomi-Robotics-1

Hacker News Top · 2026-07-20 缓存

小米展示了Robotics-1,这是一个通过无实体预训练在10万小时数据上训练的机器人策略模型,展现出清晰的扩展行为和对真实世界任务的强大泛化能力。

0 人收藏 0 人点赞
#foundation-model

RynnBrain 1.1:迈向更强大、更具泛化能力的具身基础模型

Hugging Face Daily Papers · 2026-07-20 缓存

RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。

0 人收藏 0 人点赞
#foundation-model

@zhang_benita: https://x.com/zhang_benita/status/2078716535548600458

X AI KOLs Timeline · 2026-07-19 缓存

本文采访了Moonshot AI创始人杨植麟,讨论了构建基础模型和AI助手Kimi的挑战与愿景,并反思了过去一年的发展。

0 人收藏 0 人点赞
#foundation-model

Applied Computing 希望为石油和天然气运营商提供整个工厂的AI模型

TechCrunch AI · 2026-07-16 缓存

Applied Computing 是一家总部位于伦敦的初创公司,为其Orbital项目筹集了2000万美元。Orbital是一个用于石油、天然气和石化工厂的基础AI模型,结合了时间序列、物理学和语言模型,用于分析传感器数据并模拟操作,旨在帮助运营商更有效地利用数据。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈