转载:刘胜,DeepSeek 的机器学习系统工程师——“我曾不得不将才华深埋过往”

Reddit r/ArtificialInteligence 新闻

摘要

文章反思了AI的快速发展,特别是在算子设计方面,以及在DeepSeek v4.1发布后,对一位DeepSeek机器学习系统工程师个人带来的影响。

几天前,DeepSeek v4.1发布了,将小语言模型的能力推向了全新的高度。AI的发展速度远超所有人的预期。从早期只能进行笨拙对话、上下文窗口仅有几千个token的ChatGPT,到像OpenAI o1、DeepSeek R1和Kimi 1.5 Thinking这样具备推理能力的模型——这段旅程只用了短短两年时间。而从推理模型出现到今天能够在各种约束环境中流畅执行指令、处理复杂任务的智能体,也仅约一年半的时间。很难想象再过一两年或三年,AI会变成什么样子。它是否将获得自我进化的能力,并深度渗透到具身智能等领域?AI越来越擅长编写算子 在我从事的算子设计与实现领域,AI也取得了长足进步。短短一年内,它从一个只能查阅文档、阅读代码和调试错误的助手,蜕变为一个能够独立阅读CUDA、PTX和SASS代码的算子专家。它能通过专业工具分析指令延迟并相应地优化算子。我相信在不久的将来,它将能够独立设计算子调度方案、评估不同调度方案的性能、进行实现并加以优化。 我当然为DeepSeek v4.1的成功感到自豪——毕竟,它的主要Attention算子是我编写的[1]。其出色的性能证明了我工作的价值。然而,时光之轮滚滚向前,无人能阻挡技术进步。我清楚地知道,半年或一年后,由AI编写的算子很可能与我的持平,甚至超越。AI每秒能处理300个token,半秒钟生成一行代码,二十秒就能完成一整段代码——这是我做不到的。AI能持续提升其建模深度、推理能力、工具调用量、与环境的交互频率和并行性,而我却不能。人类在带来自身毁灭这件事上,从未犹豫过。 我为什么还在优化算子,明明知道算子越好,新模型的训练和推理就越快,模型能力就越强,而我被取代的日子也就越近?一方面,编写算子给我带来巨大快乐,就像玩游戏一样。当我发明一项新技术或看到算子性能提升时,那种兴奋感堪比速通玩家打破自己的记录。当我的算子性能超越硬件厂商的官方版本时,我也感到无比自豪。但还有另一个更重要的原因。即使我故意懈怠,或者故意编写有缺陷的算子来拖慢模型训练,其他公司的模型仍会进步,最终还是会让我被淘汰。“我希望自己不要被推翻。但如果革命不可避免,我想成为推翻自己的那个人。”当所有人都在奔向自我颠覆时,我别无选择,只能加入这场残酷的军备竞赛。 那我呢?当AI能写出比我更好的算子时,我会怎样?我的判断是:我不会“失业”,但我将不得不“转行”。我可能还能保住工作,但很可能再也不能从事我曾经热爱的事情了。我曾思考社会变迁将如何塑造我的未来。世界变化如此之快——AI的爆发式增长就是绝佳例证。我无法预测五年或十年后会发生什么。但我相信,凭借我的视野、判断力、主动性和才智,我能够留在牌桌上,乘上下一波浪潮。这并不意味着我能避免职业转型;恰恰相反,它告诉我,我需要转变方向才能保住工作。 这种职业转变意味着什么?意味着我必须放弃算子设计、实现与优化——这个我曾全身心投入并深爱的领域——转而成为智能体的“机甲驾驶员”。此前,我的兴趣、优势和行业需求高度契合。如今,AI在我曾经最擅长的领域表现出色。行业需求正从“编写高性能算子的人”转向“利用AI更快产出高性能算子的人”。为了适应,我可能将告别我热爱的手艺,踏入一个未知的新领域。我相信,凭借我对工程的理解、对高层模型需求和底层硬件的掌握,我仍然能够高效地交付高质量的工作。我甚至可能逐渐爱上这个新方向,也可能不会。但眼睁睁看着自己的热情被剥夺,确实令人痛苦。 那种坐在书桌前编写成千上万个算子带来的宁静喜悦,或许在这个夏天就会永远消逝。我不得不将才华深埋昨日,成为一名机甲驾驶员。我手中握着更多的齿轮,但心中却更少跳动的节拍。 打个比方。想象你是一位编织大师,擅长编织复杂的图案和搭配色彩。你的毛衣做工精美,在镇上小有名气;富人们会来找你,并支付优厚的报酬。你珍惜那些靠窗的宁静午后,啜饮清茶,眺望青山、绿水、牛群和农舍炊烟,静静地编织着。然后有一天,有人发明了一台神奇的机器。给它喂入毛线和图样,它就能自动编织出和你一样好的毛衣,而且快得多。你知道其他编织者也能用这台机器达到你过去的水平,所以你不再需要手工编织。你也知道,凭借你数十年的经验,即使有了机器,你依然能比其他人织得更好更快。但是,机器的轰鸣声压倒了手工编织的静谧魅力:穿针引线,调整张力,沉浸在时光里。我知道这很苦,但别无他法。我或许能维持生计,但我旧日的热爱很可能会失去。我能够分离理性与情感。在解决问题时我保持逻辑,但我仍有感性的一面。当我打包离开住了整整一年的租屋时,我哭了,为旧日回忆和告别而悲伤。告别手工编写、人类优化算子的时代,更令人痛彻心扉。我想知道是否有读者也有同感。我想,事情大概就是如此吧。 其他人呢?随着AI不断发展,我担心几个问题:学生们是否会倾向于用AI完成作业,尤其是实践性的实验课?想象两个选择:花八个小时痛苦地做一个实验,还可能拿不到完美的分数;或者启动一个AI模型,花几分钱、几分钟就能得到满分代码。大多数学生会选哪个?这可能会让许多学生在工程技能方面出现严重缺口:代码结构、系统构建、在设计、抽象等方面预见未来需求的能力。在一个AI日益强大的世界里,这些工程技能还有必要吗?它们会像手写的x86汇编一样过时,还是会像理解从软件到硬件的全栈计算机系统一样永久保持价值?如果是后者,危险就在眼前。工程技能薄弱的人配合AI,其代码产出速度可能是以前的数倍,却会在系统中埋下各种隐患,把世界变成一个摇摇欲坠的烂摊子。 在未来社会,权力是否比技术技能或智力更重要?或许只有时间能回答这些问题。 结论 随着AI的发展,未来社会可能走向两个极端:共产主义或《赛博朋克2077》。在前一种情况下,生产力得到极大解放,人民生活水平大幅提高。(我在这里打住,否则思绪会泛滥。)在后一种情况下,少数科技巨头控制了大部分资源。只有极少数精英能接触到最前沿的AI和技术,实现近乎“飞升”的境界。大多数人只能使用弱AI。社会流动性变得极其困难:你需要尖端AI才能实现阶级跨越,从而形成恶性循环。 猜测:如果Anthropic...
查看原文

相似文章

DeepSeek创始人梁文峰自述(18分钟阅读)

TLDR AI

本文汇编了DeepSeek创始人梁文峰的64条语录,涵盖其愿景驱动的管理风格、开源策略、AGI路线图以及计算限制,罕见地揭示了这家中国AI初创公司背后的理念。

@Phoenixyin13: DeepSeek在人才争夺战中有点飘了。 2026年AI人才极度稀缺,尤其李博杰这种既有顶会论文、又有华为大厂工程经验的复合型人才,如果我是面试官,我会当宝贝对待。结果却搞成这样,这属于典型的流程不成熟外加面试官素质参差。 在当前AI圈,…

X AI KOLs Timeline

批评DeepSeek面试流程不当,错失李博杰这样的复合型AI人才,反映了当前AI人才争夺战中企业招聘流程的问题。