@hayou_soufiane: 与 @nikhilghosh101 合教关于 𝐓𝐡𝐞𝐨𝐫𝐲 𝐨𝐟 𝐒𝐜𝐚𝐥𝐢𝐧𝐠 𝐢𝐧 𝐌𝐨𝐝𝐞𝐫𝐧 𝐃𝐞𝐞𝐩 𝐋𝐞𝐚�… 的短期课程

X AI KOLs Timeline 事件

摘要

Soufiane Hayou 和 Nikhil Ghosh 将于 2026 年 7 月 31 日在哈佛大学举行的 STAI-X 2026 会议上教授一门关于 Theory of Scaling in Modern Deep Learning 的短期课程。该课程涵盖使用 muP 及其变体进行跨规模的超参数迁移。

与 @nikhilghosh101 合教关于 𝐓𝐡𝐞𝐨𝐫𝐲 𝐨𝐟 𝐒𝐜𝐚𝐥𝐢𝐧𝐠 𝐢𝐧 𝐌𝐨𝐝𝐞𝐫𝐧 𝐃𝐞𝐞𝐩 𝐋𝐞𝐚𝐫𝐧𝐢𝐧𝐠 的短期课程。2026 年 7 月 31 日。这是 STAI-X 2026 会议的一部分,将在哈佛大学举办。 我们将讨论如何使用 muP 及其变体进行跨规模的超参数迁移:理论、实现、失败模式,以及从小规模代理运行到大规模运行的可操作方案。 详情及注册 https://statsupai.org/STAIX2026/short-courses.html#sc2…
查看原文
查看缓存全文

缓存时间: 2026/07/02 22:27

与 @nikhilghosh101 共同主讲关于现代深度学习中的扩展理论的短期课程。2026年7月31日。作为 STAI-X 2026 会议的一部分,将在哈佛大学举办。

我们将讨论如何通过 muP 及其变体实现跨尺度的超参数迁移:包括理论、实现、失败模式,以及从小型代理运行迈向大型运行的可操作方案。

详情及注册 https://statsupai.org/STAIX2026/short-courses.html#sc2…


STAI-X 2026 - 短期课程

来源:https://statsupai.org/STAIX2026/short-courses.html STAI-X 2026 将于 2026 年 7 月 31 日在哈佛大学举办六场短期课程。课程由顶尖研究人员授课,涵盖统计学、机器学习和人工智能的基础与应用主题——从智能体 AI 工作流和扩展理论到大语言模型、强化学习、临床试验和扩散模型。

上午课程(上午 8:00 – 中午 12:00)和下午课程(下午 1:00 – 下午 5:00)各三场,并行进行。参与者可报名一个上午课程和一个下午课程。

#时间标题授课教师SC1上午 8:00 – 中午 12:00智能体 AI:从零到无穷 (https://statsupai.org/STAIX2026/short-courses.html#sc1)Tian Zheng (哥伦比亚大学)SC2上午 8:00 – 中午 12:00现代深度学习中的扩展理论 (https://statsupai.org/STAIX2026/short-courses.html#sc2)Soufiane Hayou (约翰霍普金斯大学), Nikhil Ghosh (Flatiron 研究所)SC3上午 8:00 – 中午 12:00为统计学家概述大语言模型 (https://statsupai.org/STAIX2026/short-courses.html#sc3)Linjun Zhang (罗格斯大学)SC4下午 1:00 – 下午 5:00强化学习:基础与应用 (https://statsupai.org/STAIX2026/short-courses.html#sc4)Chengchun Shi (伦敦政治经济学院)SC5下午 1:00 – 下午 5:00人工智能在加速临床试验和药物开发中的作用 (https://statsupai.org/STAIX2026/short-courses.html#sc5)Alexia Iasonos (纪念斯隆凯特琳癌症中心), John O’Quigley (伦敦大学学院)SC6下午 1:00 – 下午 5:00扩散模型理论:连续与离散 (https://statsupai.org/STAIX2026/short-courses.html#sc6)Sitan Chen (哈佛大学)

SC12026年7月31日 · 上午 8:00 – 中午 12:00

智能体 AI:从零到无穷 — 面向统计学家的构建与调试 AI 工作流实操工作坊

授课教师:Tian Zheng, 哥伦比亚大学

课程描述

智能体 AI 系统能够迭代地进行规划、行动和优化输出,正在迅速改变研究、教学和专业工作流的方式。本实操工作坊从实用的系统导向视角,向统计学家介绍此类系统的设计与使用。参与者将构建一个简单的智能体 AI 工作流,以解决自身研究、教学或专业实践中的一项任务。参与者将学习如何识别和诊断常见的失败模式,如不一致性、偏差和上下文误设,以及如何使用自然语言作为编程接口来迭代改进系统性能。课程结束时,参与者将开发和优化一个可工作的原型,并掌握一套有原则的框架,用于在自己的工作中评估和扩展智能体 AI 工作流。

先修要求

本工作坊面向具备基本编程知识并对将 AI 融入工作流感兴趣的统计学家和数据科学家。无需智能体 AI 系统的先前经验。

讲师简介Tian Zheng目前是哥伦比亚大学统计学教授。在她的研究中,她开发新方法来探索和理解来自不同应用领域(如生物学、心理学、气候建模等)的复杂数据中的模式。她的研究曾获得美国统计协会(ASA)2008 年杰出统计应用奖、ISBA 的 Mitchell 奖以及谷歌研究奖。她于 2014 年成为美国统计协会会士,2022 年成为国际数理统计学会会士,2024 年成为美国科学促进会会士。2017 年至 2020 年,她担任哥伦比亚数据科学研究所教育副主任。2019 年至 2025 年,她担任哥伦比亚大学统计系主任。Zheng 教授是 2017 年哥伦比亚总统杰出教学奖的获得者。2021 年,她获得了 Lenfest 杰出哥伦比亚教师奖,该奖项表彰教师在本科生和研究生教学与指导方面的卓越表现。

SC22026年7月31日 · 上午 8:00 – 中午 12:00

现代深度学习中的扩展理论

授课教师:Soufiane Hayou, 约翰霍普金斯大学 · Nikhil Ghosh, Flatiron 研究所

范围与课程目标

扩展现代深度学习模型(如大语言模型)受到超参数调优成本的制约。本短期课程解释理论如何通过诸如最大更新参数化(muP)等技术指导实践中的扩展。我们将理论分析(无限宽度训练动态、有效学习率的稳定性以及参数化设计)与可靠跨宽度和深度迁移超参数的实际工作流联系起来。

学习目标。参与者将:

  • 理解超参数可跨尺度迁移的含义以及为什么这对计算最优实验很重要。
  • 学习 muP 的核心设计原则以及它们如何从理论中产生(包括一个自包含的证明思路)。
  • 学习如何在实践中实现 muP 和超参数迁移,以及如何诊断常见失败模式。
  • 理解快速迁移的概念,了解何时保证/有用,以及何时失败。
  • 掌握将学习率、权重衰减及相关超参数从小型代理运行迁移到大型运行的可操作方案。

课程内容

本短期课程将聚焦神经网络扩展理论。我们将重新审视关于无限宽度分析的主题,如神经正切核(Jacot 等人,2018)和特征学习无限宽度网络(Yang 等人,2022)。课程(暂定)结构如下:

第一部分:超参数迁移概述

  • 扩展瓶颈:为什么在大型尺度上直接调优超参数不可行;代理运行范例。
  • 定义:迁移误差、跨宽度/深度的稳定性,以及实践者实际需要什么(尺度不变的超参数)。

第二部分:muP 理论及其工作原理

  • 从标准参数化到 muP:什么被稳定了(更新幅度 / 有效学习率)。
  • 张量程序直觉:宽度极限、特征学习与懒惰机制,以及参数化如何控制极限。
  • 使用 muP 进行学习率迁移的证明:一个自包含推导,展示 muP 如何平衡逐层更新幅度,并在标准假设下产生宽度稳定的训练动态。
  • 实际意义:哪些超参数迁移良好(学习率、权重衰减、初始化尺度),哪些通常不行。
  • 扩展和相关思想:深度方面的考虑,以及理论如何预测额外的缩放规则。

第三部分:快速超参数迁移

  • 定义快速迁移:迁移超参数带来的次优性消失速度快于有限尺度性能差距。
  • 何时快速迁移可证明成立 vs. 失败:依赖于问题结构;合成反例及它们给我们的启示。
  • 一个推测的机制:将损失改进分解为宽度稳定和宽度敏感两个组成部分,作为理解快速迁移结构的视角。
  • 实际意义:使用分解视角为迁移何时快或慢提供直觉。

参考文献

  • G. Yang 等人. “Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer” (NeurIPS 2021 / arXiv:2203.03466)。
  • S. Hayou. “A Proof of Learning Rate Transfer” (AISTATS 2026 / arXiv:2511.01734)。
  • N. Ghosh, D. Wu, A. Bietti. “Understanding the Mechanisms of Fast Hyperparameter Transfer” (ICLR 2026 / arXiv:2512.22768)。
  • G. Yang 等人. “Tensor Programs VI: Feature Learning in Infinite-Depth Neural Networks” (ICLR 2024 / arXiv:2310.02244)。

先修要求

标准的集中结果(中心极限定理及其高级变体)。

讲师简介Soufiane Hayou目前是约翰霍普金斯大学应用数学与统计系的助理教授,同时在计算机科学系有兼任职务。他也是数据科学与人工智能研究所的成员。此前,他曾在加州大学伯克利分校的西蒙斯研究所担任研究学者,并在新加坡国立大学担任数学访问助理教授。他于 2021 年从牛津大学获得统计学和机器学习博士学位,并在加入牛津之前于 2018 年从巴黎综合理工学院毕业。他的研究主要聚焦于大规模学习的理论与实践:对大规模神经网络进行理论分析,旨在获得用于训练/微调的有原则方法。

Nikhil Ghosh是 Flatiron 研究所的研究学者。他的主要兴趣在于深度学习理论,特别是神经网络的优化和缩放。此前,他是加州大学伯克利分校统计学系的博士生,与 Bin Yu 和 Song Mei 合作。

SC32026年7月31日 · 上午 8:00 – 中午 12:00

为统计学家概述大语言模型:基础知识、LLM 辅助统计分析与智能体 AI

授课教师:Linjun Zhang, 罗格斯大学

课程描述

本课程探讨现代大语言模型的基础与前沿。我们将涵盖嵌入、transformer 以及 LLM 训练流程(预训练、参数高效微调、基于人类反馈的强化学习)背后的统计原理。在此基础上,我们将讨论推理模型、智能体 AI(包括上下文工程和工具工程)以及 AI 安全的关键问题。课程强调统计洞察和实际应用,使学生具备批判性分析和设计可信 AI 系统的工具。

先修要求

线性代数、微积分、基本概率论和数理统计、Vibe Coding 的基本技能。

讲师简介Linjun Zhang是罗格斯大学统计系的副教授,也是计算机科学系的附属教员。他于 2019 年在宾夕法尼亚大学沃顿商学院获得统计学博士学位,并在毕业时分别因研究和教学方面的卓越表现获得了 J. Parker Bursk 纪念奖和 Donald S. Murray 奖。他还获得了 NSF CAREER 奖、2024 年罗格斯大学校长教学奖,以及 2025 年 Warren I. Susman 卓越教学奖。他目前的研究兴趣包括大语言模型的统计基础、算法公平性、隐私保护数据分析和深度学习理论。

SC42026年7月31日 · 下午 1:00 – 下午 5:00

强化学习:基础与应用

授课教师:Chengchun Shi, 伦敦政治经济学院

课程描述

本短期课程全面介绍强化学习,将基础理论与现代应用相结合。借鉴 RL“圣经”(Sutton & Barto)以及人工智能的最新进展,课程涵盖马尔可夫决策过程、规划与学习、Q 学习、基于策略和模型的方法、离线强化学习,及其在视频游戏、网约车和大语言模型中的应用。该课程已在超过 10 所大学授课,其材料在GitHub (https://github.com/callmespring/RL-short-course) 上公开可用。

先修要求

需要概率和统计学的基本知识。

讲师简介Chengchun Shi是伦敦政治经济学院统计系的副教授。他在强化学习、大语言模型和统计学的交叉领域工作,应用于网约车和医疗保健。他的工作揭示了统计学习在 AI 中的相关性和重要性,并展示了强化学习作为双边市场中策略评估和 A/B 测试框架的有用性。Chengchun 已发表 70 多篇论文,其中大部分被知名统计期刊(JRSSB, JASA, AoS)和顶级机器学习会议(NeurIPS, ICML, KDD, JMLR, CVPR, ICLR)接收。他的杰出贡献获得了多项奖项,如 Peter Gavin Hall IMS 早期职业奖、IMS Tweedie 奖和皇家统计学会研究奖。他曾担任知名期刊 JRSS-B、JASA 和 AoAS 的副主编。

SC52026年7月31日 · 下午 1:00 – 下午 5:00

人工智能在加速临床试验和药物开发中的作用

授课教师:Alexia Iasonos, 纪念斯隆凯特琳癌症中心 · John O’Quigley, 伦敦大学学院

课程描述

人工智能正在变革药物开发,加速发现、优化临床试验、降低总体成本和缩短时间线。传统的药物开发通常漫长且昂贵,受到高失败率和复杂不确定性的阻碍。AI 驱动的方法,包括机器学习、深度学习和自然语言处理,能够快速分析海量生物医学数据集,以识别新的药物靶点、预测分子相互作用并优化化合物设计。在临床前阶段,AI 模型模拟药代动力学、毒性和有效性,在实验室测试前缩小可行候选药物的范围。在临床开发过程中,AI 可以协助试验设计、加速患者招募和实时监测,提高效率和精准度。此外,AI 通过识别基因组和临床数据中的模式,发现现有药物的新治疗用途,增强药物再利用。

AI 与计算生物学、基因组学和高通量筛选的进步相结合,正在推动向数据驱动、个性化和自适应药物发现过程的范式转变。然而,在数据质量、可解释性、监管接受度和伦理治理方面仍然存在挑战。AI 专家、制药行业合作伙伴和监管机构之间的持续合作对于充分发挥 AI 在创造更安全、更有效和可及的治疗方法方面的潜力至关重要。

在本课程中,我们将说明 AI 在肿瘤学临床试验中的三种应用:

  1. 关键性 III 期注册试验的设置,其中进行头对头确定性比较,使用生存终点并利用真实世界数据和合成对照。
  2. 样本量有限的 II 期单臂设置,使用“选择胜者”方法优化药物组合选择。
  3. I 期剂量探索研究中的因果推断设置,旨在比较不同剂量水平的安全性和有效性。

先修要求

所需统计知识:一般的临床试验设计专业知识。示例包括具有时间至事件终点的双臂样本量计算、单臂两阶段 Simon 设计以及基于模型的 I 期设计。无需编程。

讲师简介Alexia Iasonos, 纪念斯隆凯特琳癌症中心。个人简介 (https://www.mskcc.org/profile/alexia-iasonos)。

John O’Quigley, 伦敦大学学院。出版物 (https://profiles.ucl.ac.uk/72162-john-o’quigley/publications)。

SC62026年7月31日 · 下午 1:00 – 下午 5:00

扩散模型理论:连续与离散

授课教师:Sitan Chen, 哈佛大学

课程描述

本短期课程将概述近期关于扩散模型的理

相似文章