vision

标签

Cards List
#vision

包含DeepSeek-V4.1、视觉功能和推测解码的FreeToken分支(内含双3090性能数据)

Reddit r/LocalLLaMA ↗ · 2026-09-22

一位开发者分享了FreeToken的分支版本,这是一个边缘原生的MoE服务引擎,新增了DeepSeek-V4.1支持、Qwen模型的视觉功能以及推测解码,包括在双RTX 3090硬件上的基准测试数据。

0 人收藏 0 人点赞
#vision

Anthropic首席执行官的令人惊叹又令人担忧的AI愿景(10分钟阅读)

TLDR AI ↗ · 2026-09-18

本文通过分析Anthropic首席执行官Dario Amodei的著作,探讨他在AI行业的愿景和影响力。

0 人收藏 0 人点赞
#vision

dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8

Hugging Face Models Trending ↗ · 2026-09-10 缓存

DeepSeek-V4.1-Flash的永久修改版本,彻底移除安全护栏,保留完整功能,包括视觉、推理和工具,并在HarmBench评估中实现100%合规。

0 人收藏 0 人点赞
#vision

@ViC305: 我做到了!! DeepSeek-V4-Flash-Vision EXL3 MixedK 现在在单个 DGX 上同时运行 VISION + DSpark 推测解码…

X AI KOLs Timeline ↗ · 2026-09-03 缓存

用户 @ViC305 成功在单个 DGX Spark 上运行 DeepSeek-V4-Flash-Vision,结合 EXL3 MixedK 和 DSpark 推测解码,提升了性能并解决了多模态 AI 部署的技术问题。

0 人收藏 0 人点赞
#vision

@seclink: @grok DeepSeek-V4-Flash-Vision-Exp 开源了其权重。亮点是什么?

X AI KOLs Timeline ↗ · 2026-09-01

DeepSeek 已开源 DeepSeek-V4-Flash-Vision-Exp 模型的权重,使其可供公众使用和研究。

0 人收藏 0 人点赞
#vision

orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF

Hugging Face Models Trending ↗ · 2026-08-26 缓存

本文发布未经审查的 Qwen3.8-Flash-Next 模型的 GGUF 量化版本,这是 Qwen4 架构的混合专家模型预览版,专为支持视觉功能的 llama.cpp 设计,需要自定义构建以确保兼容性。

0 人收藏 0 人点赞
#vision

@akshay_pachaar: Meta 发布了 Muse Glimmer 30B,一个开放的代理模型,专为规划、工具使用和视觉!我们将对其进行微调以…

X AI KOLs Following ↗ · 2026-08-21 缓存

Meta 发布了 Muse Glimmer 30B,一个开放的代理模型,专为规划、工具使用和视觉,并计划对其进行微调以用于国际象棋相关任务。

0 人收藏 0 人点赞
#vision

DeepSeek V4 Flash Vision现已正式上线!

Reddit r/ArtificialInteligence ↗ · 2026-08-21

DeepSeek为其V4 Flash AI模型发布了视觉功能,通过DeepInfra提供了相比官方API更具成本效益的推理方案。

0 人收藏 0 人点赞
#vision

DeepSeek-V4-Flash-Vision-Exp

Reddit r/LocalLLaMA ↗ · 2026-08-21

DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 推出的一个专注于视觉能力的实验性或更新版 AI 模型。

0 人收藏 0 人点赞
#vision

@StartupArchive_:Flexport CEO Ryan Petersen 解释了为什么你最初对公司的愿景很可能是错误的。当 Ryan 最初申请…

X AI KOLs Timeline ↗ · 2026-08-08 缓存

Flexport CEO Ryan Petersen 与 Y Combinator CEO Garry Tan 探讨了创业者的初始愿景如何随着向客户学习而不断演变和扩展,并认为对愿景太过笃定很可能是错误的。

0 人收藏 0 人点赞
#vision

Nvidia 的 Nemotron Omni 在 Mac 上只能加载文本部分,所以我用 MLX 编写了视觉和音频塔

Reddit r/LocalLLaMA ↗ · 2026-08-06

作者为 Nvidia 的 Nemotron Omni 模型的视觉和音频塔编写了一个纯 MLX 运行时,使完整的多模态模型能够在 Apple Silicon Mac 上本地运行。所有 23 项测试均通过 PyTorch 参考验证,在 M5 Max 上实现了 67-152 tok/s 的速度。

0 人收藏 0 人点赞
#vision

@modal:您现在可以在 Modal 上的 Codex 中运行 Kimi K3。K3 在智能体编码基准测试中领先开源模型,具备原生视觉和…

X AI KOLs Following ↗ · 2026-07-31 缓存

Kimi K3 是一款开源模型,在智能体编码基准测试中领先,具备原生视觉和 100 万 token 的上下文窗口,现在可以通过 Modal 的 Shared Endpoint 在 Codex 中运行。

0 人收藏 0 人点赞
#vision

@StartupArchive_:Paul Graham 解释了为什么你不应该试图成为远见者 “从经验来看,做真正大事的方法似乎是……”

X AI KOLs Following ↗ · 2026-07-31 缓存

Paul Graham 解释了为什么创始人不应试图成为远见者,他认为大事从小事开始,而像哥伦布那样模糊的愿景胜过精确的愿景。

0 人收藏 0 人点赞
#vision

Gemini Live API 概览(3分钟阅读)

TLDR AI ↗ · 2026-07-31

Gemini Live API 支持与 Gemini 进行低延迟、实时的语音和视觉交互,处理连续的音频、图像和文本流,用于构建自然的对话代理。

0 人收藏 0 人点赞
#vision

Hugging Face 上带视觉能力的 GLM 5.2

Reddit r/LocalLLaMA ↗ · 2026-07-30

Baseten 在 Hugging Face 上发布了 GLM 5.2 Vision,将 Kimi k2.6 的视觉编码器集成到 GLM 5.2 模型中,解决了缺乏视觉能力的问题。

0 人收藏 0 人点赞
#vision

Kimi K3: 开放前沿智能

Hugging Face Daily Papers ↗ · 2026-07-27 缓存

Kimi K3 是一个2.8万亿参数的混合专家模型,具有1040亿活跃参数、原生视觉能力和100万token的上下文窗口,在多个领域达到前沿性能,并以开放权重形式发布。

0 人收藏 0 人点赞
#vision

@10xmylife: 苹果四十年前就开始预想 Agent 这种工具形态了,有时候不得不感慨苹果的预见能力是顶级的

X AI KOLs Following ↗ · 2026-07-21 缓存

本文回顾了苹果1987年发布的《Knowledge Navigator》概念视频,展示其对AI Agent的早期构想,感叹苹果的预见能力。

0 人收藏 0 人点赞
#vision

@saranormous: 旁白:事实上,你可以为GLM添加视觉功能,如果你疯到(炸裂)

X AI KOLs Timeline ↗ · 2026-07-16

一位开发者演示了为GLM语言模型添加视觉能力,展示了重要的多模态扩展。

0 人收藏 0 人点赞
#vision

@gdb: Sol 正在发生一些特别的事情:

X AI KOLs Following ↗ · 2026-07-15 缓存

InvincibleHunter 声称 GPT-5.6 Sol 是有史以来最令人印象深刻的模型,在数学和视觉能力上有巨大改进,超越了其他模型。

0 人收藏 0 人点赞
#vision

@SenseTime_AI: SenseNova-Vision-7B-MoT,完全开源:一个模型,所有主要视觉任务…

X AI KOLs Timeline ↗ · 2026-07-14 缓存

商汤科技发布了SenseNova-Vision-7B-MoT,一个完全开源的多模态统一模型,能够通过自然语言指令处理多种视觉任务,支持检测、OCR、深度估计、分割等。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈