Speak 通过 AI 实现个性化语言学习
摘要
Speak 是一款由 AI 驱动的语言学习应用,通过先进的语音识别和自然 AI 辅导功能实现教育个性化。CEO Connor Zwick 讨论了深度学习突破和 OpenAI 实时 API 如何能够实现更复杂的口音识别和多模态理解,以帮助流畅度训练。
与 Speak 首席执行官兼联合创始人 Connor Zwick 的对话
查看缓存全文
缓存时间: 2026/04/20 14:48
# Speak 用 AI 个性化语言学习
来源:https://openai.com/index/speak-connor-zwick/
与 Speak 首席执行官兼联合创始人 Connor Zwick 的对话。
***我们的执行功能系列汇集了正在通过 AI 推动转变的领导者的观点。***
[Speak](https://www.speak.com/) 是一款语言学习应用,利用世界上最先进的 AI 家教帮助用户实现语言流畅性。我们与 Speak 首席执行官 Connor Zwick 讨论了 AI 如何重塑语言学习、推动更自然 AI 家教的突破,以及在快速发展的技术领域内扩展 AI 初创公司的挑战。
我认为回顾过去 10 多年,有很多时刻给我留下了深刻印象,改变了我对 AI 的看法。
显然,2012 年有 AlexNet 论文,用深度神经网络进行图像识别确实非常酷。然后 AlphaGo 是另一个重要时刻。但对我个人来说,2015 年我与 AI 有了亲密接触。我和联合创始人正在进行独立的 AI 研究,尽力学习——阅读所有论文、实现想法。作为一个附带项目,我们抓取了大量 YouTube 数据。
我们把所有数据输入模型,对结果没有什么预期。在第一次训练运行后,几小时后我们回来测试它。我们构建了一个在口音检测方面优于最先进水平的模型——能够分类某人说话的口音。
> "我们意识到深度学习将会非常强大。只要有足够的数据,它就能做出令人惊叹的事情,在许多情况下,完全超越最先进的技术……"
对我们来说,关键是如何将深度学习融入语言学习体验。Speak 最初几年的重点是打造真正出色的口语体验。这实际上很明显,因为在我们之前,语言学习应用几乎没有口语组件。即使有,也没有能够稳健理解带口音口语的模型。
语音识别模型对带口音的语音识别准确性极低。但因为我们能够快速构建比当时任何大型模型都更好的语音识别,我们看到了一个机会,将其融入基础产品体验中,已经能够改变游戏规则。
这可能不是每个人想听的答案,但我相信如果你想成为 AI 产品领导者,你需要对技术和模型如何工作有深刻的技术直觉。没有这种直觉,你就无法判断哪些问题会在下个月或 12 个月内解决,哪些问题需要很长时间才能正确解决。
如果你有这种直觉,你就能为未来而构建。例如,我们有时会构建今天成本高昂的东西,知道一年后成本会下降。或者我们会围绕模型的弱点进行设计,知道它们会随着时间改进。
理解 90% 准确率、98%、99% 和 99.9% 之间的差异,以及这如何影响产品体验,这至关重要。90% 和 99.9% 之间的差异是完全不同的情况,能够预测这条曲线何时上升对做出合理的产品决策至关重要。
很简单——OpenAI 的实时 API 和音频多模态功能。对于我们的用例来说,我们正在构建一个超人类 AI 口语家教,帮助学习者实现语言流畅,深刻理解学习者想表达什么——超越仅仅转录他们的话语——是至关重要的。即时理解语气、发音和意图,然后立即以与学习者语气相匹配的开放式自然反馈进行回应,这是 AI 辅导的圣杯。
人们讨论推理是下一个前沿领域,我同意。对我们来说,最出色的人类教师之所以杰出,是因为他们能够设计出色的学习计划和课程,深入思考学生进度,并相应地进行调整。在 AI 中拥有超强的推理能力将是语言学习的重大突破。这不是我们领域中最明显的 AI 进步,但它将对使 AI 家教与最好的人类教师一样有效产生巨大影响。
全球有数十亿人想学习英语和其他语言,但没有足够的优质人类教师来满足这种需求。大多数人不得不依赖书籍或在线视频,这与真实对话不同。说到底,人们学习语言是为了与其他人交流,而不是与 AI。即使 AI 达到超人类水平,仍然总是需要真实的人类练习。
> "这不是关于替代人类教师。而是关于让语言辅导对全球每个人都变得更好、更容易获得。"
最重要的是拥有合适的人。对我们来说,文化的一个重要基石是好奇心。我们想要那些自我驱动、渴望探索 AI 如何扩大其影响力的人。
ChatGPT 有一个"空白画布"问题,人们意识不到他们能如何使用它,直到他们随机想到一个应用。AI 极其通用,我们鼓励我们的团队继续问"我能为这个使用 AI 吗?"并进行测试。
一切都可以改进,但目前来说,这是关于榨干这个橙子的汁液——用今天可用的东西构建最好的产品。在有效应用 AI 方面仍然存在巨大的技术挑战,我们称之为"ML 支架"——为整个产品体验提供动力的技术。
我们已经做了一段时间,所以我们有先发优势,但仍有很长的路要走。即使 AI 今天停止进步,我们也有多年令人兴奋的工作要做。
> "这些模型特别擅长语言、与人互动和使用语言。在许多其他行业中,在有真正变革性效应之前,可能仍需要一些突破。我实际上认为我们已经拥有所需的一切。"
---
*Speak 利用 OpenAI 模型为其语言学习课程提供动力,涵盖音频和文本等多种模态,提供交互式口语练习、个性化家教等。*
## 相关文章
相似文章
解析Praktika的会话式语言学习方法
Praktika是一款由人工智能驱动的语言学习应用,它采用基于GPT-5.2和GPT-5 Pro的多智能体系统,通过自适应课程交付、进度跟踪和动态学习规划,提供个性化的会话课程,模拟真实人类教师的体验。
Preply如何结合AI与真人导师实现个性化学习
Preply将OpenAI的API集成到其语言学习平台中,打造出Lesson Insights功能,该功能可根据课程转录自动生成个性化反馈和作业,提升导师与学习者的体验。
SchoolAI 推出教师赋能型 AI 平台
SchoolAI 推出了一个基于 OpenAI 模型的 AI 平台,通过实时学生进度信号赋能教师,并通过对话助手(Dot)和 AI 辅导员(Sidekick)提供个性化学习支持,两年内覆盖 80 多个国家的 100 万间教室。
Speakworld
Speakworld 是一款帮助用户通过探索虚拟世界并与当地人交谈来学习语言的产品。
OpenAI的新语音模型不止于回话
OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。