@Alacritic_Super: MIT 刚刚免费提供了最好的计算机视觉书籍之一。如果你对机器人、具身AI感兴趣,…

X AI KOLs Timeline 新闻

摘要

MIT 已将教科书《计算机视觉基础》免费在线提供。该书涵盖从图像形成到视觉语言模型的广泛主题,面向机器人、具身AI、自动驾驶和视觉AI领域的学生和实践者。

MIT 刚刚免费提供了最好的计算机视觉书籍之一。 如果你对机器人、具身AI、自动驾驶或视觉AI感兴趣,这绝对值得一读。 主题 • 图像形成 • 相机与光学 • 机器学习基础 • CNN与Transformer • 图像处理 • 特征提取 • 表示学习 • 生成模型 • 相机标定 • 立体视觉 • 3D重建 • 运动恢复结构 • 辐射场 (NeRF) • 运动估计 • 视觉语言模型 • 物体识别 • 研究与论文写作 适合人群 • 计算机视觉工程师 • 机器人工程师 • 具身AI工程师 • 自动驾驶工程师 • AI研究人员 免费学习MIT课程: https://visionbook.mit.edu
查看原文
查看缓存全文

缓存时间: 2026/07/22 20:36

MIT 刚刚免费开放了最好的计算机视觉书籍之一。

如果你对机器人、具身智能、自动驾驶或视觉 AI 感兴趣,这本书必读。

目录

• 图像形成 • 相机与光学 • 机器学习基础 • 卷积神经网络与 Transformer • 图像处理 • 特征提取 • 表示学习 • 生成模型 • 相机标定 • 立体视觉 • 三维重建 • 运动恢复结构 • 辐射场(NeRF) • 运动估计 • 视觉-语言模型 • 目标识别 • 研究与论文写作

适合人群

• 计算机视觉工程师 • 机器人工程师 • 具身智能工程师 • 自动驾驶工程师 • AI 研究人员

免费从 MIT 学习:

https://visionbook.mit.edu


计算机视觉基础

来源:https://visionbook.mit.edu/ 你可以在此处购买该书的印刷版(https://mitpress.mit.edu/9780262048972/foundations-of-computer-vision/)。

The MIT Press 出版

马萨诸塞州剑桥市

英国伦敦

封面

前言

献给每一个像素。

关于本书

本书以图像处理和机器学习的视角,涵盖计算机视觉的基础主题。我们希望建立读者的直觉,因此包含了许多可视化内容。目标读者是刚进入该领域的本科生和研究生,但我们希望有经验的从业者也能从中受益。

我们最初的目标是写一本大书,全面覆盖该领域。然而,计算机视觉领域实在太大,无法做到。所以,我们决定写一本小书,将每章限制在五页以内。这个目标迫使我们真正专注于理解每个主题所需的重要概念。写一本小书是完美的,因为我们没有时间写长书,而你们也没有时间读它。可惜,我们在这个目标上也失败了。

写这本书的过程

要了解我们写这本书的心路历程,先来看一些数据。下图显示了从 2010 年 11 月 24 日我们首次向 MIT 出版社提及这个想法以来,所写的页数随时间的变化。

[插图:书稿页数随时间变化图]

图 1:书稿页数随时间的变化。 开始写这本书就像进入一个洞穴,我们完全不知道自己将面临什么。

写这本书并非线性过程。如图表所示,手稿长度的变化是非单调的,曾有一段时期书稿缩水后又重新增长。自 2010 年 11 月开始构思这本书以来,发生了很多事情;是的,我们花了十多年时间写这本书。如果第一天就知道写这样一本书需要投入多少工作,我们绝不会开始。然而,从今天的角度来看,大部分工作已经完成,我们很高兴踏上了这段旅程。通过写作和整理书中展示的许多示例,我们学到了很多,希望你们通过阅读和亲自复现这些示例也能有所收获。

刚开始写书时,这个领域稳步发展,但尚未意识到不到两年后即将发生的革命。幸运的是,2012 年的深度学习革命为这个领域奠定了更坚实的基础,提供了工具,使我们能够实现对领域自诞生以来许多原始想法的可行实现。2012 年后的最初几年,由于新方法的流行,一些早期想法被遗忘,但随着时间的推移,许多想法又重新回归。我们觉得用领域内发生的变革视角来看待写书的过程很有意思。图 1(https://visionbook.mit.edu/#fig-evolution_pages)显示了写书期间人工智能(AI)领域发生的一些重要事件。

本书结构

计算机视觉在过去十年中经历了一场革命。我们目前使用的方法似乎与十年前的方法关系不大,但事实并非如此。名称确实变了,一些想法也确实是新的,但当今的方法实际上深深植根于计算机视觉和 AI 的历史。在整本书中,我们将强调所呈现概念背后的统一主题。有些章节会从不同角度重新审视先前提出的概念。

视觉的核心隐喻之一是多重视角。存在一个真实的物理场景,我们从不同角度、使用不同传感器、在不同时间观察它。通过收集不同的视角,我们逐渐理解背后的真实。本书也提供了多种视角,我们的目标是识别其背后统一的基础。

本书分为多个部分,每个部分包含几章,专门讨论计算机视觉中的一个连贯主题。建议按顺序阅读,因为大多数章节都假设读者已熟悉之前章节涵盖的主题。各部分内容如下:

第一部分 讨论一些动机主题,以介绍视觉问题并将其置于社会背景中。我们将介绍一个简单的视觉系统,用以引出贯穿全书的有用概念,并复习一些基本数学工具。

第二部分 涵盖图像形成过程。

第三部分 以视觉示例为基础介绍学习的基础,引介广泛适用的概念。

第四部分 介绍信号和图像处理的基础,这是计算机视觉的基础。

第五部分 描述一系列有用的线性滤波器(高斯核、二项式滤波器、图像导数、拉普拉斯滤波器、时域滤波器)及其一些应用。

第六部分 描述多尺度图像表示。

第七部分 描述用于视觉的神经网络,包括卷积神经网络、循环神经网络和 Transformer。这些章节将聚焦主要原理,而不深入描述特定架构。

第八部分 介绍图像的统计模型和图模型。

第九部分 聚焦于神经网络时代的两种强大建模方法:生成建模和表示学习。生成图像模型是统计图像模型,它生成遵循自然图像形成规则和正确几何形状的合成图像。表示学习旨在寻找有用的图像抽象表示,例如向量嵌入。

第十部分 由简短章节组成,讨论构建基于学习的视觉系统所面临的一些挑战。

第十一部分 介绍几何工具及其在计算机视觉中的应用,以从二维图像重建三维世界结构。

第十二部分 聚焦于序列处理及如何测量运动。

第十三部分 涉及场景理解和目标检测。

第十四部分 是一组章节,为初级研究人员提供关于有效演讲、论文写作方法以及高效研究者心态的建议。

第十五部分 回到简单的视觉系统,并应用书中介绍的一些技术来解决第一部分中引入的玩具问题。

我们没有涵盖什么?

这一节应该很长,但我们长话短说。我们没有提供对计算机视觉当前最新技术的综述;而是专注于基础概念。我们没有深入介绍计算机视觉的许多应用,如形状分析、目标跟踪、人体姿态分析或人脸识别。这些主题最好通过阅读计算机视觉会议的最新论文和专题专著来学习。

致谢

我们感谢世界各地的老师、学生和同事,他们教会我们很多,并在研究对话中带给我们很多快乐。这本书也借鉴了全世界许多计算机视觉课程,帮助我们决定应包含哪些主题。我们感谢所有提供讲义和教学大纲的人。本书的许多内容是在准备 MIT 课程“计算机视觉进展”时创作的。

我们感谢给予我们评论的同事:Ted Adelson、David Brainard、Fredo Durand、David Fouhey、Agata Lapedriza、Pietro Perona、Olga Russakovsky、Rick Szeliski、Greg Wornell、Jose María Llauradó 和 Alyosha Efros。特别感谢 David Fouhey 和 Rick Szeliski 提供的所有帮助和建议。我们还感谢 Rob Fergus 和 Yusuf Aytar 对早期手稿的贡献。许多同事和学生帮助校对本书和进行一些实验。特别感谢 Manel Baradad、Sarah Schwettmann、Krishna Murthy Jatavallabhula、Wei-Chiu Ma、Kabir Swain、Adrian Rodriguez Muñoz、Tongzhou Wang、Jacob Huh、Yen-Chen Lin、Pratyusha Sharma、Joanna Materzynska 和 Shuang Li。感谢 Manel Baradad 在第 55 章“简单视觉系统——重访”(https://visionbook.mit.edu/simplesystem_final.html)实验中的帮助,感谢 Krishna Murthy Jatavallabhula 协助编写第 44 章“多视图几何与运动恢复结构”(https://visionbook.mit.edu/multiview.html)的代码,以及 Aina Torralba 帮助设计封面和多个图形。

Antonio Torralba 感谢 Juan、Idoia、Ade、Sergio、Aina、Alberto 和 Agata 多年来的支持。

Phillip Isola 感谢 Pam、John、Justine、Anna、DeDe 和 Daryl 在这段旅程中的美好支持。

William Freeman 感谢 Franny、Roz、Taylor、Maddie、Michael 和 Joseph 的爱与支持。

如何引用本书

如果你希望引用本书,请使用以下 BibTeX 条目:

@book{foundationsCVbook,
  title={Foundations of Computer Vision},
  author={Torralba, A. and Isola, P. and Freeman, W.T.},
  isbn={9780262378666},
  lccn={2023024589},
  series={Adaptive Computation and Machine Learning series},
  url={https://mitpress.mit.edu/9780262048972/foundations-of-computer-vision/},
  year={2024},
  publisher={MIT Press}
}

教师资源

  1. 该书的印刷版可在 MIT Press(https://mitpress.mit.edu/9780262048972/foundations-of-computer-vision/)购买。
  2. 配套此书的幻灯片可在此处下载(https://www.dropbox.com/scl/fo/gcoxinej7b4mxaj4bd4kl/ABS0wiObwBY74mGI_cHoDxE?rlkey=rn1ny067y2av1ojnqtw7dbzje&st=h7x6e0yo&dl=0)。

相似文章