vision

标签

Cards List
#vision

@StartupArchive_:Flexport CEO Ryan Petersen 解释了为什么你最初对公司的愿景很可能是错误的。当 Ryan 最初申请…

X AI KOLs Timeline · 6天前 缓存

Flexport CEO Ryan Petersen 与 Y Combinator CEO Garry Tan 探讨了创业者的初始愿景如何随着向客户学习而不断演变和扩展,并认为对愿景太过笃定很可能是错误的。

0 人收藏 0 人点赞
#vision

Nvidia 的 Nemotron Omni 在 Mac 上只能加载文本部分,所以我用 MLX 编写了视觉和音频塔

Reddit r/LocalLLaMA · 2026-08-06

作者为 Nvidia 的 Nemotron Omni 模型的视觉和音频塔编写了一个纯 MLX 运行时,使完整的多模态模型能够在 Apple Silicon Mac 上本地运行。所有 23 项测试均通过 PyTorch 参考验证,在 M5 Max 上实现了 67-152 tok/s 的速度。

0 人收藏 0 人点赞
#vision

@modal:您现在可以在 Modal 上的 Codex 中运行 Kimi K3。K3 在智能体编码基准测试中领先开源模型,具备原生视觉和…

X AI KOLs Following · 2026-07-31 缓存

Kimi K3 是一款开源模型,在智能体编码基准测试中领先,具备原生视觉和 100 万 token 的上下文窗口,现在可以通过 Modal 的 Shared Endpoint 在 Codex 中运行。

0 人收藏 0 人点赞
#vision

@StartupArchive_:Paul Graham 解释了为什么你不应该试图成为远见者 “从经验来看,做真正大事的方法似乎是……”

X AI KOLs Following · 2026-07-31 缓存

Paul Graham 解释了为什么创始人不应试图成为远见者,他认为大事从小事开始,而像哥伦布那样模糊的愿景胜过精确的愿景。

0 人收藏 0 人点赞
#vision

Gemini Live API 概览(3分钟阅读)

TLDR AI · 2026-07-31

Gemini Live API 支持与 Gemini 进行低延迟、实时的语音和视觉交互,处理连续的音频、图像和文本流,用于构建自然的对话代理。

0 人收藏 0 人点赞
#vision

Hugging Face 上带视觉能力的 GLM 5.2

Reddit r/LocalLLaMA · 2026-07-30

Baseten 在 Hugging Face 上发布了 GLM 5.2 Vision,将 Kimi k2.6 的视觉编码器集成到 GLM 5.2 模型中,解决了缺乏视觉能力的问题。

0 人收藏 0 人点赞
#vision

Kimi K3: 开放前沿智能

Hugging Face Daily Papers · 2026-07-27 缓存

Kimi K3 是一个2.8万亿参数的混合专家模型,具有1040亿活跃参数、原生视觉能力和100万token的上下文窗口,在多个领域达到前沿性能,并以开放权重形式发布。

0 人收藏 0 人点赞
#vision

@10xmylife: 苹果四十年前就开始预想 Agent 这种工具形态了,有时候不得不感慨苹果的预见能力是顶级的

X AI KOLs Following · 2026-07-21 缓存

本文回顾了苹果1987年发布的《Knowledge Navigator》概念视频,展示其对AI Agent的早期构想,感叹苹果的预见能力。

0 人收藏 0 人点赞
#vision

@saranormous: 旁白:事实上,你可以为GLM添加视觉功能,如果你疯到(炸裂)

X AI KOLs Timeline · 2026-07-16

一位开发者演示了为GLM语言模型添加视觉能力,展示了重要的多模态扩展。

0 人收藏 0 人点赞
#vision

@gdb: Sol 正在发生一些特别的事情:

X AI KOLs Following · 2026-07-15 缓存

InvincibleHunter 声称 GPT-5.6 Sol 是有史以来最令人印象深刻的模型,在数学和视觉能力上有巨大改进,超越了其他模型。

0 人收藏 0 人点赞
#vision

@SenseTime_AI: SenseNova-Vision-7B-MoT,完全开源:一个模型,所有主要视觉任务…

X AI KOLs Timeline · 2026-07-14 缓存

商汤科技发布了SenseNova-Vision-7B-MoT,一个完全开源的多模态统一模型,能够通过自然语言指令处理多种视觉任务,支持检测、OCR、深度估计、分割等。

0 人收藏 0 人点赞
#vision

empero-ai/Qwythos-27B-v1

Hugging Face Models Trending · 2026-07-13 缓存

Empero 发布了 Qwythos-27B-v1,这是一个基于 Qwen3.5-27B 的开源权重推理模型,保留了原生多 token 预测、完整视觉塔和 1,048,576 token 的上下文窗口。它在智能体终端任务上表现出色,并且与 9B 版本相比,闭卷推理能力有所提升。

0 人收藏 0 人点赞
#vision

我们给了智能体双手和声音,但大多数仍没有眼睛

Reddit r/AI_Agents · 2026-07-10

文章讨论了AI智能体已经被赋予了物理交互(双手)和语音通信的能力,但大多数仍然缺乏视觉感知(眼睛),突出了这一关键局限。

0 人收藏 0 人点赞
#vision

视频生成模型是通用视觉学习者

Hugging Face Daily Papers · 2026-07-10 缓存

本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。

0 人收藏 0 人点赞
#vision

开源计算机使用代理

Reddit r/ArtificialInteligence · 2026-07-09

Vantage 是一款开源 Windows 应用程序,利用大语言模型通过自然语言自动化桌面任务,使用户能够用简单的英语指令操作任何桌面应用程序。

0 人收藏 0 人点赞
#vision

@AdinaYakup: 由新的LingBot Vision驱动 https://huggingface.co/collections/robbyant/lingbot-vision… - Apache 2.0 - 4个版本…

X AI KOLs Following · 2026-07-07 缓存

LingBot Vision是一个新的视觉基础模型,在Apache 2.0许可下发布,提供四种尺寸(small, base, large, giant),并使用掩码边界建模进行预训练。它驱动了一个在多个基准测试中名列前茅的深度估计系统。

0 人收藏 0 人点赞
#vision

@AdinaYakup: LingBot Vision 来自蚂蚁集团的一种用于密集空间感知的自监督视觉骨干网络家族 @robbyant_brain - A…

X AI KOLs Timeline · 2026-07-07 缓存

LingBot Vision 是蚂蚁集团推出的一种自监督视觉骨干网络家族,它采用掩码边界建模方法,在密集空间感知任务上取得了领先性能,在 NYU-Depth v2 基准上超越了更大的 DINOv3 模型。

0 人收藏 0 人点赞
#vision

让大脑思考和看见的神经回路

Hacker News Top · 2026-07-03

一项新研究识别出大脑中整合视觉和认知处理的神经回路。

0 人收藏 0 人点赞
#vision

公开基准测试:多模态LLM从截图中读取日历周视图的能力有多强?人类约99%,Q4本地模型……

Reddit r/LocalLLaMA · 2026-07-01

名为VCCB的新公开基准测试多模态LLM从截图提取日历事件的准确率。早期结果显示人类约为99%,前沿模型约80-85%,本地模型显著较低,因此呼吁社区提交结果。

0 人收藏 0 人点赞
#vision

@TheAhmadOsman: 我们要让本地AI成为默认,记住我的话,朋友们。

X AI KOLs Timeline · 2026-07-01 缓存

Ahmad Osman的一条推文,表达了让本地AI成为默认的目标。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈