标签
本文评测了Space Bunny,一个具有强大视觉理解和编码能力的AI模型,在图像到代码、3D建模和创意原型设计等任务中表现出色,可在OpenCode中使用。
MIT Senseable City Lab的研究人员在一本新书中讨论了使用视觉AI分析城市环境的方法,强调了其在城市规划中的潜力,同时探讨了隐私和公平性方面的担忧。
在ECCV 2026的AI City挑战赛中,展示了开发稳健视觉AI系统的获胜者,其中顶级解决方案在视频预测中使用NVIDIA Cosmos世界基础模型,用于场景理解和预测等任务。
Perceptron,一家由前Meta科学家创立的初创公司,推出了Isaac 0.5,这是一个开放权重的视觉AI模型,旨在帮助机器人在仓库和工厂等工业环境中感知、推理和行动。
Collov Labs 出品的 NewEyes AI 是一款视觉助手,能够理解相机输入的上下文——搭配服装、计算卡路里、提醒植物养护——而不仅仅是捕捉像素。
ComfyUI是一款开源的、基于节点的AI创作引擎,让构建者和视觉专业人士无需编码即可设计复杂的生成工作流,支持图像、视频、音频和3D,具备部分重新执行能力和广泛的模型支持。
前DeepMind研究员Andrew Dai为其视觉AI初创公司Elorian以3亿美元估值完成了5500万美元的种子轮融资,并讨论了融资策略以及视觉理解在AI中的重要性。
视觉AI领域发生重大转变,顶级工具不再直接生成最终输出,而是生成其背后的源代码,a16z合伙人Yoko Li对此进行了深入分析。
文章认为,视觉AI的下一个前沿是生成代码(例如SVG、HTML/CSS、React组件),而非原始像素,从而实现了可编辑性、迭代性以及与专业设计和开发工作流程的集成。
马丁·斯科塞斯加入 Black Forest Labs 担任顾问,并使用 FLUX 进行故事板制作,展示了 AI 在视觉创意中的作用。
EyeBench-V3 视觉基准测试评估了 Claude Opus 4.8,发现它仍然无法完成基本视觉任务,这与 IBench 类似。该基准测试是通过 Adonis Singh 的 Twitter 帖子介绍的。
OpenAI 发布 ChatGPT Images 2.0,号称实现 GPT-3 到 GPT-5 的飞跃;Simon Willison 用“找浣熊+火腿电台”的 Where’s Waldo 式提示词,把它与 gpt-image-1、Google Nano Banana 2 和 Pro 对比测试,捉迷藏成功率参差不齐。
开启“思考”模式的 ChatGPT Images 2.0,能把 1,000 字提示或 70 页 PDF 直接变成可立即使用的信息图、幻灯片及学术海报,无需手动调整。