标签
PhysForge 是一个两阶段框架,能够生成具备物理基础和运动学参数的交互式 3D 资产,解决了虚拟世界中静态几何模型带来的瓶颈问题。
Pixal3D是由TencentARC和微软开发的高保真单图转3D模型,通过反向投影显式地将像素特征提升到3D,实现接近重建级别的几何结构和PBR纹理。该模型已被SIGGRAPH 2026接收,并提供推理代码和演示。
在MineBench的3D Minecraft结构任务中,Kimi K2.6相比K2.5质量提升显著,同时每次运行仅2.35美元,性价比极高。
Hunyuan3D-2 是一款开源 AI 模型,可将 2D 图片即时转换为完整 3D 资产,无需复杂建模软件。
LaviGen是一个框架,它重用3D生成模型进行自回归3D布局生成,使用改进的3D扩散模型和dual-guidance self-rollout蒸馏机制,在LayoutVLM基准上实现了比最先进方法高19%的物理合理性和快65%的计算速度。
本文识别并解决了文本到三维生成模型中的“潜在汇陷阱”问题,即模型对文本提示变得不敏感。我们提出了一个框架,将几何表示与语言敏感性解耦,从而实现对分布外形状的稳健文本驱动三维形状编辑。
HY-World 2.0 是腾讯开源的跨模态3D世界模型,能够从文本、图像和视频中重建和生成3D世界,生成可编辑的3D资产(网格/高斯泼溅),效果与闭源方法相当。
Lyra 2.0 是 NVIDIA 的框架,用于从单张图像生成持久、可探索的 3D 世界,结合了长程视频合成与显式三维重建,并通过新颖的训练技术解决了空间遗忘和时间漂移问题。
Realiz3D 引入了域感知学习,以在三维一致性图像生成中将视觉域与控制信号解耦,通过残差适配器和层级特定去噪,从合成渲染生成照片级真实感的输出。
Andrew Ng讨论了企业如何从渐进式AI效率提升转向变革性的工作流程重构,并以贷款处理为例。该通讯还涵盖了自动驾驶推理模型、ChatGPT广告、苹果与谷歌的交易以及3D生成等主题。
本文介绍了O-Voxel,一种用于3D生成建模的新型稀疏体素表示方法,能够高效处理复杂拓扑和外观,并训练了包含4B参数的大规模流匹配模型,实现了最先进的生成质量。
Hunyuan3D 2.0 是一个可扩展的基于流的扩散变换器系统,用于生成高分辨率纹理3D资产,性能优于当前最先进的模型,并已公开发布代码和权重。
Google DeepMind 宣布在 NeurIPS 2024 上展示 100 多篇论文,涵盖自适应 AI 智能体、3D 场景生成和大语言模型训练安全,包括具有影响力的基础工作时间检验奖以及 Gemma Scope 等应用的现场演示。
OpenAI推出Point-E,一个通过结合文本到图像和图像到3D的扩散模型,能在单个GPU上在1-2分钟内从文本提示生成3D点云的系统。该方法相比现有方法实现了显著的速度提升,同时发布了预训练模型和代码。
Anthropic、阿里巴巴、谷歌等巨头集中发布重磅模型——Claude Opus 4.7、Qwen 3.6、情感丰富的Google TTS,还有仅1.58-bit的手机LLM与实时3D世界生成器,同时开放视频、VR及角色创作工具。