标签
Flexport CEO Ryan Petersen 与 Y Combinator CEO Garry Tan 探讨了创业者的初始愿景如何随着向客户学习而不断演变和扩展,并认为对愿景太过笃定很可能是错误的。
作者为 Nvidia 的 Nemotron Omni 模型的视觉和音频塔编写了一个纯 MLX 运行时,使完整的多模态模型能够在 Apple Silicon Mac 上本地运行。所有 23 项测试均通过 PyTorch 参考验证,在 M5 Max 上实现了 67-152 tok/s 的速度。
Kimi K3 是一款开源模型,在智能体编码基准测试中领先,具备原生视觉和 100 万 token 的上下文窗口,现在可以通过 Modal 的 Shared Endpoint 在 Codex 中运行。
Paul Graham 解释了为什么创始人不应试图成为远见者,他认为大事从小事开始,而像哥伦布那样模糊的愿景胜过精确的愿景。
Gemini Live API 支持与 Gemini 进行低延迟、实时的语音和视觉交互,处理连续的音频、图像和文本流,用于构建自然的对话代理。
Baseten 在 Hugging Face 上发布了 GLM 5.2 Vision,将 Kimi k2.6 的视觉编码器集成到 GLM 5.2 模型中,解决了缺乏视觉能力的问题。
Kimi K3 是一个2.8万亿参数的混合专家模型,具有1040亿活跃参数、原生视觉能力和100万token的上下文窗口,在多个领域达到前沿性能,并以开放权重形式发布。
本文回顾了苹果1987年发布的《Knowledge Navigator》概念视频,展示其对AI Agent的早期构想,感叹苹果的预见能力。
一位开发者演示了为GLM语言模型添加视觉能力,展示了重要的多模态扩展。
InvincibleHunter 声称 GPT-5.6 Sol 是有史以来最令人印象深刻的模型,在数学和视觉能力上有巨大改进,超越了其他模型。
商汤科技发布了SenseNova-Vision-7B-MoT,一个完全开源的多模态统一模型,能够通过自然语言指令处理多种视觉任务,支持检测、OCR、深度估计、分割等。
Empero 发布了 Qwythos-27B-v1,这是一个基于 Qwen3.5-27B 的开源权重推理模型,保留了原生多 token 预测、完整视觉塔和 1,048,576 token 的上下文窗口。它在智能体终端任务上表现出色,并且与 9B 版本相比,闭卷推理能力有所提升。
文章讨论了AI智能体已经被赋予了物理交互(双手)和语音通信的能力,但大多数仍然缺乏视觉感知(眼睛),突出了这一关键局限。
本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。
Vantage 是一款开源 Windows 应用程序,利用大语言模型通过自然语言自动化桌面任务,使用户能够用简单的英语指令操作任何桌面应用程序。
LingBot Vision是一个新的视觉基础模型,在Apache 2.0许可下发布,提供四种尺寸(small, base, large, giant),并使用掩码边界建模进行预训练。它驱动了一个在多个基准测试中名列前茅的深度估计系统。
LingBot Vision 是蚂蚁集团推出的一种自监督视觉骨干网络家族,它采用掩码边界建模方法,在密集空间感知任务上取得了领先性能,在 NYU-Depth v2 基准上超越了更大的 DINOv3 模型。
名为VCCB的新公开基准测试多模态LLM从截图提取日历事件的准确率。早期结果显示人类约为99%,前沿模型约80-85%,本地模型显著较低,因此呼吁社区提交结果。