掌握你的智能:操作指南(7分钟阅读)
摘要
AI公司应选择性掌控其智能,以解决成本、延迟和数据隐私限制,方法是通过后训练和在线学习构建持续改进的领域特定模型。
查看缓存全文
缓存时间: 2026/08/18 15:35
选择性掌控智能:应对前沿API约束
当前沿API在成本、延迟、私有数据或战略控制方面形成制约时,AI公司应选择性掌控自身智能。其路线图在于:评估体系、定制化工具链、针对性后训练,以及能将生产流程转化为持续优化领域专属模型的在线学习循环。
掌控你的智能:实践指南
作者:@sonyatweetybird, @gradypb, @w1tness1ngh
AI应用层的竞赛不仅关乎界面、工作流或市场策略——更是对智能层本身的争夺。
要求掌控自身智能的呼声日益高涨…
近日,Alex Karp呼吁企业“掌控生产资料“。不久后,@satyanadella明确指出:从前沿实验室购买智能犹如双重付费——既付出金钱,也暴露了让该智能产生价值的私有知识。
所有人都面临同一个问题:谁应当掌控你业务核心的智能?
需要明确的是,掌控智能并非强制要求或建议完全脱离实验室。对于许多工作负载,前沿API与智能体仍是正确选择。但在我们的投资组合中,越来越多的企业正构建自有AI能力,逐步实现对模型权重的掌控与塑造。
数周前,我们在@sequoia组织了一场关于掌控AI技术栈的创始人与开发者交流活动。首先邀请@harvey分享客户视角,随后由@mercor_ai、@LangChain、@trajectorylabs与@FireworksAI_HQ详细解析后训练技术栈的核心模块。
通过一系列演讲,清晰的实施路径逐渐浮现。
为何是当下?
首先,开源前沿模型的进步速度超出预期。Kimi K3与GLM 5.2表现极其出色!过去在开源模型上训练如同原地踏步——历经数月微调后,新一代前沿模型发布便可能抹平所有优势。如今,开发者可以基于接近前沿水平的基座模型展开工作。
其次,独立后训练技术栈已日趋成熟。得益于@FireworksAI_HQ与@Mercor_ai等企业,现在每家公司都能获取从训练到推理、从人类数据到合成数据的完整技术栈。通过构建强大的评估体系、工具链工程、后训练与在线学习,开源模型在特定领域已能超越前沿模型。
一年前,选择开源权重意味着性能妥协。而今,这已成为关乎存续的战略决策。最新的战场正是智能层——非关模型权重,而关乎产品本质。
何时该采取行动?
没有放之四海皆准的方案。除性能考量外,产品中可能存在某些环节,使租赁智能转变为制约因素:
**1. 成本控制。**AI产品越成功,AI的销售成本(COGS)越高。若推理成本随使用量线性增长,自建模型是保护利润的最佳途径。
**2. 速度需求。**在编程(代码补全)或网络安全等领域,经过蒸馏的定制小模型可能超越大型通用模型,因为速度至关重要。
**3. 数据安全。**若系统的优化依赖反馈数据、评估结果、客户交互或领域知识,你可能更希望这些数据留在内部。
**4. 掌控命运。**应用层与智能层正逐渐融合。实验室向上延伸至产品端,应用公司向下深入训练循环以定义产品的“思维方式“。掌控产品越来越意味着控制更多学习循环与智能本身(致谢@harvey Research、@RampLabs、@glean、@factoryAI等)。
实践路线图
若已确定自建与租赁的策略边界,接下来的问题是:如何实现从0到1的突破?
**组建团队。**勿将其简单并入平台团队。掌控智能需要进攻型人才:构建评估体系、塑造数据、试验开源模型、调优工具链、并在特定领域持续提升性能。从零组建的精干团队配合多家生态伙伴往往效果显著。例如@harvey仅凭七人团队便完成了令人惊叹的研究工作!
**让工作成果显性化。**当前每位客户都在选择AI合作伙伴,而公开的研究成果、基准测试或技术文章正成为关键决策因素。若选择自主研发,请将成果分享给整个生态。
**执行技术步骤。**以下为高层框架:
1/ 评估体系
@gabepereyra的总结十分精辟:“没有优质的基准测试,就无法训练模型。”
评估体系是衡量系统能否出色完成任务的一组任务集合。每个任务包含提示词、模型可用的上下文及评分器。大多数评估体系始于创始人凝视输出结果,凭直觉判断是否符合预期。目标是将这种判断转化为可重复的标准。
@harvey构建法律智能体基准测试时,将真实法律工作转化为离散任务进行测试。首版包含24个法律领域的1200余项智能体任务,由75000余条专家编写的评分标准进行评估。
在决定掌控智能前建立评估体系至关重要。当每次模型调用都经过评估,选择模型便成为基于数据的决策而非猜测。
2/ 工具链与上下文工程
智能体由三部分构成:模型、上下文与工具链。工具链管理模型周围的产品逻辑:路由、检索、工具、记忆、降级方案与执行追踪。@hwchase17曾言简意赅地总结:“工具链的核心职责是在正确时机将上下文传递给模型。“当任务分布偏离模型训练数据越远,现成工具链的表现越差。
优秀的工具链能够:将任务路由至最适合的特定模型;跨模型复用相同评估体系;决定智能体获取哪些上下文与工具。同时使智能体具备可解释性——可追踪输入的上下文、调用的工具及卡顿节点。
3/ 后训练
后训练涵盖多种技术。具体采用哪种取决于优化目标。
@lqiao曾阐释:若模型缺失事实信息,无需后训练——直接使用上下文或RAG(检索增强生成)即可。若输出格式或行为异常,使用监督微调。若涉及产品品味问题,采用偏好调优。若模型需在专业任务上提升表现,应用强化学习。若模型速度过慢或成本过高,则进行蒸馏。
目标是选择能提升评估结果的最轻量级方法。随后通过同一工具链部署模型,测量其运行时的质量、延迟与成本。
4/ 在线学习
当系统组件(评估体系、工具链与模型)就位后,最终步骤是在生产环境中持续优化系统。
@QuantumArjun提出了深刻观点:模型不断变得更智能,但每次交互都像它们职业生涯的第一天。你可以让陶哲轩进入会计事务所,但至少在第一天,他不太可能是最佳会计师。缺失的并非智能,而是经验。智能体在运行过程中不断积累这种经验。
“轨迹“是任务执行路径:模型获取的上下文、调用的工具与子智能体、产出的答案,以及用户的编辑、撤销或重试操作。通过@LangChain的LangSmith等工具捕捉这些轨迹,是构建持续生产循环的关键。失败的任务转化为评估用例;缺失的信息进入上下文或记忆模块;错误的工具响应驱动工具链修复。
结语
警示:掌控智能如同开启潘多拉魔盒。
闭源模型技术栈简洁明了:调用前沿模型,使用现成工具链(如Claude Code或Codex),添加提示词与上下文,即可上线产品。这提供了较高的基准线,但也限制了上限。
掌控技术栈意味着承担更多系统职责。生产技术栈变为:开源模型+定制工具链+专用工具+私有上下文。开发技术栈转化为:私有评估体系+领域数据+在线学习循环。
这确实需要更多投入!可能降低基准线——但同样突破上限。
实验室将持续构建巨型智慧体,我们都应善用这些成果。
但与此同时,顶尖产品公司正培育自身的“小天才“:快速、有主见、专注领域、为特定工作优化。当更多企业掌控自身智能,生态系统将蓬勃发展,个性化将脱颖而出。
这便是企业掌控智能的愿景。我们欣喜地见证那些渴望将此愿景变为现实的初创公司(小家伙们)正在取得的进展。💚
相似文章
几年之内,拥有最聪明的人工智能将毫无意义——每个人都会拥有它。真正的优势在于知道如何运行它。
作者认为,随着人工智能商品化,真正的优势将来自一个共同的标准,即如何协作地运行智能。他们提出了自己经过10多年开发的可证伪框架,并邀请批评。
@GokuMohandas: https://x.com/GokuMohandas/status/2066853420326384055
这篇技术指南解释了为什么组织应该基于开源AI模型构建自己的学习循环,而不是从前沿实验室租用智能,并引用了金融、机器人和生物技术领域的案例研究。
精简您的智能开销(13分钟阅读)
本文主张企业应通过为不同任务选用适配规模的模型与混合系统来优化AI智能开销,而非对所有应用都默认采用昂贵的前沿模型。
@levie:关于当AI模型在各公司间共享并承载了该行业大量智能时,未来竞争优势需深思的一些动态的精彩帖子
关于当AI模型在各行业广泛可用时,企业如何保持竞争优势的思考,强调了模型智能、专有数据、工作流程与员工互动之间的强化循环。
AI之长,AGI之短(3分钟阅读)
本文认为,AI智能正变得像计算和存储一样商品化,最有价值的公司将不是模型构建者,而是那些拥有客户关系、专有数据和工作流程的公司。