@Yangtze_Seventh:暴论:技能正在消亡,方法论永存。昨天,我参加了 Bilibili 的 Build in Public 活动,Kabi 老师……
摘要
一位参会者回顾了 Kabi 在 Bilibili Build in Public 活动上分享的八种 AI Agent 工作流方法论,涵盖第一性原理问题求解、对抗性审查、消融实验和多 Agent 协作等框架,用于提升提示工程效率。
查看缓存全文
缓存时间: 2026/09/06 08:48
暴论:技能正在消亡,方法论永存。
昨天参加了 Bilibili 的 Build in Public 活动,Kabi 老师 @jakevin7 居然直接把这句话放进了 PPT 公开分享!这绝对是整个下午的高光时刻——感觉就像在上课一样!
干货中的干货——太干了!
正如 Kabi 老师所说,随着模型不断通过训练迭代,大量通用知识和标准工作流会逐渐被内化到模型里。以前需要长篇大论的指令才能教会它做事?未来可能只需要几句精准的 prompt,就能调用这些内置能力。
这让我们可以把更多精力放在:这次要解决什么问题?该用什么方法?以及如何验证它真的做对了?
Kabi 老师分享的这 8 个点可以直接嵌入你的日常 prompt,大幅拉升工作流效率。结合你自己的洞察使用,绝对值得收藏:
1️⃣ 第一性原理 -> 先把问题本身彻底厘清。 把这个喂给你的 Agent,让它回归现实:检查问题是否可复现、根因是什么、修复前后结果有何差异。确保核心问题真实存在,且从一开始就可执行。
Kabi 老师用 Claude 尝试证明费马大定理作为及时案例——非常贴切。100 轮之后,你怎么让 Claude 还记得它到底要干啥?
2️⃣ 对抗性审查 -> 启动一个专门的挑刺 Agent。 让一个未参与构建的 Agent 做独立审计:寻找反例、漏洞和失效场景,并要求它用证据支撑一切。 本质上就是多 Agent 交叉验证——让所有人都对结果签字画押。
3️⃣ 消融实验 -> 抽掉一个组件,看看还能不能立住。 这是写论文时不可妥协的一步:Ablation Study。说白了,就是剔除某个关键变量,衡量其对结果的影响。 要测试某条规则、某个工具或某段 prompt 是否真的有用,保持其他一切稳定,删掉它,重新运行,对比结果。这是证明每个部分都在发挥作用的唯一方式。
4️⃣ 奥卡姆剃刀 -> 先交付能跑的最简版本。 如果脚本就能搞定,那就尽快让脚本跑起来。让架构随真实需求演化。 这和会议开场时 Neko Girl Project 创始人分享的观点完美契合。既然大家都在 Build in Public,如果你有一个能跑的想法,就丢出来接受审视——收集真实反馈和需求,产品就能顺势升级!
5️⃣ 列出所有不安全感 -> 给怀疑留出空间。 明确要求 Agent 自我坦白:哪些结论缺乏证据?哪些场景尚未测试?哪些地方只是在拍脑袋? 哪怕最强的 Agent 也会翻车(Astra 的 100% 基准测试?呃,先搁置吧)。自我检查是降低错误率的唯一途径。
6️⃣ 保持独立思考 -> 先自己判断,再看别人的说法。 尤其在多 Agent 协作中,让每个 Agent 在群聊前先独立抛出结论和推理。这样更容易发现分歧,避免一个 Agent 胡说、其他 Agent 跟着点头的局面。 后面他还深入讲了多 Agent 架构——Swarm、Graph、Agent Teams,以及如何选择。
7️⃣ 批判性思维 -> 审查证据,没有例外。 别因为一个分析听起来天衣无缝就全盘接受。要求 Agent 区分观察到的事实和猜测,并明确说出什么证据会推翻它自己的判断。
8️⃣ 高内聚、低耦合 -> 钉死模块边界。 把相关逻辑打包在一起;让模块通过干净接口握手。这直接决定了 Agent 的工作难度:调整某个模块的范围越清晰,就越容易喂给它正确的上下文并测试变更。
我对“技能正在消亡“的理解,主要针对那些冗长的通用知识堆砌。以前那些上千行的说明文档?预训练已经把大部分内容内化了——现在几行文字就能出惊艳效果。
当然,技能不只是文本;视觉、工具调用等仍有其价值。
这场分享简直是金矿——价值密度拉满!喜欢 Kabi 老师把工程方法论转化为我们下次启动 Agent 就能直接上手的东西。有的值得深思,有的即插即用!
感谢 Kabi 老师的分享——下次见!
真的受益匪浅!
如果预加载的话堆积在上下文,可能还没等执行任务就已经把1M限制打爆了。。
在我们的memory里面是支持wiki,如果涉及到了对应的任务才会高效的加载。日常使用的话我觉的涉及到一个完整的流程、重复的流程,新开一个窗口单独完成效率高很多。
其实日常使用完全够了,模型也越来越强,解决问题的能力也会越来越强
但上层肯定有人会想追求效率,追求更好的效果嘛,自然会有一些小技巧。我觉的AI 工具可以提高人的下限,但对不同人提高的程度也不一样嘛
哈哈其实不冲突,大模型会越来越强,之前的skill由于会占用太多上下文,现在都已经在预训练中内置好了,只需要一些名词来出发,这本身就是一种进步。
而且,大模型解决基础的任务已经非常足够了,如果有更高的开发需求和效率提升,才需要注意更多细节上的使用。
安装到本机最好是按照自己的工作习惯来做一些适配。开箱即用且好用的并不多
相似文章
@hnshah: https://x.com/hnshah/status/2062647149582750101
本文认为,公司的首个AI策略应该是创建一个'技能库',以捕捉顶尖员工可复用的工作方法,这样智能体可以学习任务背后的方法,而不仅仅是访问数据。它还推广了一个名为Skills 101的在线研讨会。
@qinzytech: https://x.com/qinzytech/status/2066585405479371092
对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。
@knoYee_: https://x.com/knoYee_/status/2062780637677752366
作者复盘了使用多Agent协作三个月的经验,总结出五个主要痛点(如Agent间矛盾、忽略边界条件、自我审查失效、合并决策困难、压缩执行后暴露更难问题)和两个心得(只读审查Agent价值高、Agent矛盾暴露需求模糊),强调了人类在AI协作中的核心决策作用。
@EchoShao8899: 编码代理是通用代理,每家公司都在改进模型和代理工具——但如何让更多人受益,而不仅是科技小圈子?
本期播客节目邀请了来自CMU的Zora Wang讨论AI代理的未来,重点关注技能、记忆和协作,以让其造福科技圈之外更广泛的受众。
如何评估技能以构建更好的智能体工具
一篇文章讨论评估技能的方法,以构建更好的智能体工具,可能侧重于AI智能体开发的实用方法。