@reczko_konrad: TypeGPU中的深度感知光注入 我将一个448x448的单目深度模型在M4 Pro上优化到约8毫秒,跨约250次调度…
摘要
一位开发者通过使用TypeGPU优化448x448模型在M4 Pro上以约8毫秒的速度运行,实现了实时单目深度估计,从而允许深度感知照明无缝集成到GPU中。
查看缓存全文
缓存时间: 2026/08/18 14:36
TypeGPU 中的深度感知光照注入
我在 M4 Pro 上将 448x448 单目深度模型优化到约 8 毫秒(约 250 次调度),这个速度足以用于实时场景 :D
由于推理过程是直接在 TypeGPU 中编写的,我可以将深度缓冲直接输入光照通道。数据无需离开 GPU 或进行任何额外的同步/交互步骤
推理、光照和绘制都通过同一个命令编码器完成。
相似文章
@yoheinakajima: 这东西太酷了
Marc在VisionCamera中演示了利用DINOv2和Apple Vision框架的深度感知光注入,并通过react-native-webgpu实现了实时渲染。
chenxwh/depth-anything-v2
Depth Anything V2 是一种单目深度估计模型,在细节丰富度和鲁棒性方面显著优于 V1,同时提供比基于 SD 的模型更快的推理速度和更高的准确性。它在 Replicate 上以不同许可证提供。
@Snixtp: DeepSeek V4 Flash 能否在单张 RTX Pro 6000 上运行?
antirez 已发布 DeepSeek V4 Flash 的 GGUF 量化版本,使该模型能够在单张 GPU(如 RTX Pro 6000)以及 128GB 以上内存的 Mac 上运行。量化文件已上传至 Hugging Face,并附有 DS4 推理引擎的使用说明。
在本地用4张老款RTX 2080 Ti运行DeepSeek-V4(2000美元预算配置)。自定义图灵内核、W8A8量化,以及255个预填充token/秒!
一位开发者成功在四张RTX 2080 Ti GPU上以2500美元预算本地运行DeepSeek-V4-Flash(总计284B,激活13B),通过自定义图灵CUDA内核、W8A8量化和异构推理实现了255个预填充token/秒。该实现已开源。
DeepSeek-V4-Flash W4A16+FP8 结合 MTP 自推测:在 2 张 RTX PRO 6000 Max-Q 上以 524K 上下文长度实现 85 tok/s
这篇文章详细介绍了一个经过定制并量化的 DeepSeek-V4-Flash 模型版本,启用了 MTP 自推测功能。通过修改后的 vLLM 设置,在双 RTX PRO 6000 Max-Q GPU 上实现了显著的速度提升。