DeepSeek创始人梁文峰自述(18分钟阅读)

TLDR AI 新闻

摘要

本文汇编了DeepSeek创始人梁文峰的64条语录,涵盖其愿景驱动的管理风格、开源策略、AGI路线图以及计算限制,罕见地揭示了这家中国AI初创公司背后的理念。

本文包含DeepSeek投资者电话会议中的64条语录。在会议中,创始人梁文峰讨论了公司的愿景、动机和文化。他还详细介绍了公司的开源策略、商业化计划、AGI路线图等更多内容。
查看原文
查看缓存全文

缓存时间: 2026/07/24 17:01

# DeepSeek 创始人梁文锋自述:DeepSeek 投资人电话会议64条语录 来源:https://www.geopolitechs.org/p/deepseek-founder-liang-wenfeng-in [](https://substackcdn.com/image/fetch/$s_!I1xW!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc6d0314e-7b0b-4d4e-98e1-92b1fa0c7961_1179x814.jpeg) **核心要点:** - **愿景驱动:** 没有KPI、没有书面愿景,甚至“没有组织”——靠对世界的善意和对AGI的痴迷运转。“我们只是一群非常普通的人。” - **克制即策略:** API定价的目标仅仅是在十个月内收回硬件成本。不争夺消费者流量,不追逐企业风口。“你越克制,就越可能成功。” - **开源是根本:** 即使是最强的模型也会开源。不担心别人竞争。“我只担心他们部署不了。” - **AGI路线图:** CoT → Agent → 持续学习 → “奇点” → 具身智能。“持续学习之后,它可以自己开发下一个版本。” - **算力现实:** 大约2万张“H等效”GPU;落后美国12-18个月;用二十分之一的算力追赶。对于国产芯片:“生态没问题;产能是瓶颈。” - **终局视角:** 中国今年可能追上外国模型,但“那还不是AGI”。“中国的基础模型公司太多了,会收敛的。” *“我们没有组织,我们由愿景驱动。”* 1. 创立公司时,我们的初衷不是“我能赚多少钱”,也不是“去资本市场”、“IPO”之类的。那不是初衷。最初几十个人从来没那么想过。如果他们那么想,就不会加入。 2. 总的来说,我们做这件事是出于对世界的很大善意,我们认为它对人类有用。这是超越金钱的东西。 3. 大约二十年前,在管理方面,我最钦佩的人是杰克·韦尔奇,通用电气前CEO。现在回头看,他说的很多话可能都不再正确,但他有一件事说对了:公司最重要的东西是愿景。管理大公司不是靠规则和流程,而是靠愿景。什么是愿景?愿景不是墙上的口号。愿景是你怎么做,而不是你怎么说。 4. 事实上,我们并没有真正的组织——我们被愿景驱动,被愿景组织。那个愿景甚至没有写下来。我们从未写过任何东西。 5. 我们并不是特别能干。我们没有比别人更多的钱,也不是我们的人比所有人都优秀。我们只是一群非常普通的人。 6. 我们的公司建立在共识之上。不是我说了算。我寻求共识。我在公司内部的权威建立在共识之上。 7. 我们的管理有两条线:一条自上而下,一条自下而上。自下而上意味着每个人自己决定想做什么,然后就去做了。没人管他们。没有KPI。一般来说,我们希望“正式工作”不超过员工一半的时间。另一半是未分配的——他们可以做任何想做的事。 8. 我们一般不加班。第一,研究需要放松的环境;如果你逼得太紧,就没法做研究。第二,我们非常专注,这意味着我们做的事情很少。 9. CoT不消耗资源。对于研究来说,它不烧GPU——你只需要少量卡。你需要的是想法。门槛很低,任何人都可以尝试。但谁能真正做出成果——我不知道那是天赋还是什么。 *“即使是我们最强的模型也会开源,因为我看不出闭源有什么好处。”* 1. 为什么我们坚持开源?因为愿景本身就需要开源。没有那个愿景,你无法组织人。 2. 智谱也开源,但他们的开源和我们的不一样。他们的开源有一种“被追赶”的感觉——他们不把它当作根本。对我们来说,这就是根本。 3. AI足够大,最终可能占据人类社会GDP的10%。一个人无法垄断它。你必须与别人分享,否则你无法生存。 4. 我认为我们会开源,而我们最强的模型大概也会开源,因为我看不出闭源有什么好处。 5. 即使你开源模型并告诉所有人一切,门槛仍然非常高。别人要实际使用它仍然很难。 6. 如果我们只赚,比如说,6倍利润,开源其实没什么损失。但如果你想要100倍利润,那么开源确实有影响。 7. 我们从一开始就开源了。我们不会因为你是竞争对手就区别对待——这是开源的一部分。我不担心别人部署我们的模型来与我们竞争。我希望他们能够部署它。我只担心他们部署不了——某个细节出错,结果变差,或者成本变高。 8. 我们提供的开源模型和我们自己部署的是相同的吗?是的,是相同的。我们不会开源一个较弱的模型,然后在内部用一个更好的。去年,基本上消费者端的所有东西都是开源的,我们没有看到与消费者服务的冲突。 *“克制是一种策略。十个月收回成本是合理的利润。”* 1. 如果我们想让AI在我们手中成功,首先,我认为是克制。你不能想“人类GDP的很大一块应该是我的”。你越这么想,就越不可能成功。 2. 对我来说,克制是一种策略。有时你放弃一些东西来获得其他东西。 3. 对于我们的API定价,我们认为合理的利润是:从市场上购买一批设备,十个月内收回成本。我认为这很合理。这不是利润最大化。如果你想最大化利润,你会定价更高。在这个价格范围内,需求不是弹性的。即使我把价格提高50%,token使用量变化也不大。 4. 我讲一个故事。对于我们的DCP(Decoder Context Parallelism)模型,一开始我们担心需求太高,所以定价相对较高。团队里的人不太高兴。后来我降价了——降到四分之一——大家都很高兴。我们降价的时候,公司群聊里大家都在欢呼。 5. 刚才有人评论说“十个月回本太高了”。确实,价格还有下降空间。模型端也有优化空间,所以总体还有很大空间。 6. 在那个成本水平——十个月回本——我们可以做到。其他公司做不到。阿里或腾讯,没有我们的优化,他们的成本应该高出几倍。 7. 如果我进一步降价,需求不会增加,或者只会小幅增加。在这个价格,每个人都能负担且满意。降价不会给公司带来更多收入,也不会给社会增加更多价值。即使更便宜,也不会增加太多“幸福感”。 8. 成本越低,我就能训练越大的模型,也越能承担更大的模型。在算力有限的情况下,如果我的算力效率更高,我就能承担更大的模型。 9. 一家商业公司没有动力去追求模型效率。如果效率提高……成本下降……那你赚什么?对我们来说,这是愿景的一部分。我们的队友是普通人;他们知道使用这个要花钱。他们有同理心:别人要付钱来用,所以如果更便宜,就更容易接受。 *“C端和B端都是我们通往AGI路上的副产品。”* 1. 我们做AGI就是为了做AGI。我们只是碰巧产生了一些可以商业化东西,所以我们就用了。这和其他公司不同。其他公司建模型是为了服务消费者用户或企业用户。对我们来说,消费者和企业都是通往AGI路上的副产品。 2. 去年春节前后我们突然火了,那不在我们的计划中。我们从未预料到。我们只是想把技术做好。 3. 去年用户突然激增时,我们没有试图留住他们以变现,或者争夺那些商业利益。我们没有争夺用户,没有试图赚钱——但我们努力服务好他们。 4. 今年,如果需求持续扩大,并且我们能买到更多GPU,我们的API/AI收入很有可能达到几亿美元的ARR。如果AI收入能达到十亿美元,我们的现金流基本上可以转正。 5. 过去三年里,任何时候,如果你来找我谈商业化路线图或产品线,那都是浪费时间,因为你无法预测未来。 6. 如果今年我们能有几亿美元的企业收入,明年企业收入继续,需求持续增长,我们离净利润就不远了。最坏情况下,仅靠销售API就可以支撑一家上市公司。如果之后没有新的技术进展,我们的技术“冻结”在这里,那我们就全力专注于销售API并做好服务——那就够了。 *“AI不缺品味或直觉。它缺的是持续学习。”* 1. 你可以把AI进步看作爬台阶。去年的台阶是CoT。今年的台阶是Agent。为什么是台阶?因为每一步都建立在前一步之上。Agent依赖于CoT,而CoT依赖于前一步——语言模型。 2. 在Agent之后,我们认为要解决的下一个问题是持续学习:如何让模型持续不断地学习,而不是只给它一次强大的训练。它应该能够像人类一样长期学习。 3. 在持续学习之后,我们可能会达到一个“奇点”。那就是一个能够持续学习的模型已经可以做人类能做的所有事情。它可以开发自己的版本,自己进行研究,构建下一个版本——构建更先进的AI模型。 4. 这个“奇点”其实不是一个点;它也是一个渐进的过程。可能是一个漫长而渐进的改变——不是一个突然的跳跃。 5. 在那之后,我认为你会得到具身智能。然后它进入现实世界:它可以做家务、照顾老人等等。 6. 我们认为这个路线图是最容易的。我们可以遵循它而不需要加班。如果路线图反过来——比如说,你试图先做具身智能——你会很痛苦。那是苦活。 7. AI不缺品味或直觉。它的品味和直觉都很好。如果你让它写一篇文章,我认为它的品味和直觉基本没问题。它缺的是持续学习。 8. 全世界都在研究这个。从投资者的角度看,他们看到最多的是Agent。但对于像我们这样的研究者来说,我们看到更多的是学习,以及如何解决学习问题。 9. 在内部我们在乎这样一个叙事:对于我们下一个版本的模型,我们希望它能帮助我们自己发展。它可以提升DeepSeek的效率。我们模型的第一个工作就是提高DeepSeek自身的工作效率。首先它必须对我们有用。这是通往AGI最快的路径。 *“我们落后美国主要是在资源上。在人方面,几乎没有差距。”* 1. 我们现在大约有2万张H等效计算卡,而且大多数是最近才到的——过去一两个月内。 2. 我们与美国的差距主要是资源。在人方面,几乎没有差距,因为基本上是一群人。人才不是瓶颈;资源是最大的瓶颈。人才差距本质上也是算力差距。 3. 对于目前最大的模型,我们训练不起。最大的模型大约有800B活跃参数;国内我们还在几十亿级别。如果我想训练一个和领先者一样大的模型,我需要5万张GB300或华为950——20万张卡。那只是训练,还不包括研究。 4. 在我们能承受的范围内,卡越多越好。在合理价格下,我们尽量多买。理想情况下,如果能在六个月内花掉钱,那是最好的。把钱变成Nvidia卡绝对比放在银行里好。 5. 我们与美国的差距可能是12个月,可能是12-18个月,也可能是6-12个月。简单说:大约落后两年,但只用了美国二十分之一的算力。未来我们想改写这个叙事:用一小部分算力,但把时间缩短到6个月、3个月——甚至在某些领域超越他们。 6. Nvidia的CUDA护城河正在快速被侵蚀。一个原因是AI现在可以写代码,所以我可以利用AI来建立生态。另一个原因是新技术——比如TileLang(北京大学计算机学院开发的开源高性能AI算子编程语言)。用更高级的语言编写CUDA算子,你可以快速重写Nvidia的整个生态系统。 7. 国产AI芯片有历史性的替代进口机会。我们相信在未来一年内会看到有些验证:国产芯片的生态没有问题。以前人们认为有问题——不能用、不可用——但一年之内,我认为我们可以改变这种看法。 8. 我们购买华为950的目标仍然是帮助华为改善生态。华为950“超级节点”在性能和价格上可以替代Nvidia GB200/GB300。唯一的权衡是:四张华为卡等于一张Nvidia卡,并且时间上落后两年。华为950超级节点将在今年Q3或Q4出货;Nvidia GB200在两年前的Q3出货。 9. Nvidia卡可以用五年折旧。华为卡最多三年。华为950今年用还行;明年应该还可以。之后,可能真的会太耗电。 *“视频生成、3D、世界模型——这些不能决定智能的上限。”* 1. AI是一个广阔的领域。有很多东西我们认为不在主线上——比如3D和视频生成。我不认为它们与智能的主线有强相关,所以我们不会做。 2. 视频生成刚出来的时候非常火——好像你必须得做,否则就不是AI公司。但你可以看到后来发生了什么:Sora之后,大家都做了——大公司、小公司。然后小公司砍掉了。它不影响智能的天花板。商业上,这是一个好生意,但它不属于智能。我们不会仅仅因为它是好生意就去做。 3. 世界模型,我认为目前也和智能的上限关系不大,所以我们不会做。在我们看来,世界模型和智能在这个阶段不是最重要的事情。 4. 多模态对产品很重要,对消费者产品也很重要。但对于智能的上限,它是一个组成部分,不是主线本身。我们肯定会做多模态,我们也在做。V4及以后版本将支持原生多模态。 1. 美国的数据标注成本和中国其实没什么区别。中国在标注上没有成本优势,尤其是高端标注。这让我们很难像美国那样在标注数据上投入。这条路径在中国很难,因为标注太贵了。 2. 目前公司里最重要的人中有一半在标注数据。 3. 瓶颈不是我们不能快速招更多人了。不是钱的问题,也不是卡的问题。但我们扩张很快。所以我们认为一年之内,中国的高质量数据问题有望得到更好的处理。 *“中国的基础模型公司太多了,会收敛的。”* 1. 我们最大的核心利益是保持团队稳定。这是我们最大的核心利益——可能是唯一

相似文章

据传DeepSeek创始人提出AGI路线图——以及一份长长的“暂不优先”清单。您如何看待梁文峰关于AI未来走向的观点?

Reddit r/artificial

据传DeepSeek创始人梁文峰概述了一份AGI路线图,侧重于思维链推理、智能体、持续学习、AI自我改进和具身智能。该路线图解释了公司当前的优先事项,包括编码智能体和通用智能体,同时降低垂直智能体、视频生成和商业化的优先级,以集中解决持续学习这一关键瓶颈。

关于DeepSeek的笔记

Hacker News Top

参观DeepSeek总部后,可见其低调的出身、年轻的团队和独特的文化。这家公司由一家对冲基金运营,专注于保持小规模,且对AGI风险并不担忧,而是更关注失业等社会问题。