LLM的有效用例
摘要
本文分享了LLM在软件工程中的实际应用案例,包括通过RAG搜索客户对话、从日志中排查API故障以及内容精简。重点强调了效率提升和减少手动筛选工作。
<p><a href="https://lobste.rs/s/77kygu/effective_use_cases_for_llms">评论</a></p>
查看缓存全文
缓存时间: 2026/06/22 01:29
# LLM 的有效用例——积极改写我
来源:https://aggressivelyparaphrasing.me/2026/06/21/effective-use-cases-for-llms/
关于 LLM 缺点的讨论很多。它们其实不会推理。它们很昂贵,尤其是在循环运行时。它们做事相当慢。
有一类狭窄的用例 LLM 特别擅长,其中之一就是“从噪音中筛选”。噪音是我们为了得到真正想要的东西而必须处理的一切。
以下是我作为软件工程师体验过、但没听别人提过的一些用例。
## 搜索客户对话
一位产品同事把与头部客户的每一次通话记录都上传到了嵌入数据库。现在他们的产品提案有了扎实的证据支撑。我们知道 40% 的头部客户都提过这个痛点。这位产品经理还找出了一群急切的私测客户,准备试用我们的新功能。
当客户的问题比较抽象时,这尤其有用。这类问题往往没有明确的解决方案,或者解决方案没有清晰的名称。这让提功能需求变得困难,整理和去重就更难了。在 LLM 出现之前,最好的指望就是团队里有人资历够深、见过足够多次这个问题,而且记得怎么找到所有相关的链接和联系。现在,有了 RAG(检索增强生成)。
## 从端点告警到日志分析
> 任何大型系统大部分时间都将在故障模式下运行。——John Gall,引自 Lorin Hochstein(Netflix)
> (https://www.youtube.com/watch?v=3IdGjhETIVA&t=214s)
当我在值班时,我的职责之一是对团队负责的 API 端点的故障进行分类。这些故障报告为“HTTP 4XX/5XX 高发率”。有时是噪音,比如 Pod 的数据库连接短暂中断;有时则暗示着 bug,比如客户无法删除某个东西了。
分类很繁琐:
1. 第一步是搜索标记了特定端点和特定 HTTP 故障的规范日志行(https://stripe.com/blog/canonical-log-lines),并按时间过滤。
2. 找到触发告警的请求后,我按请求 ID 搜索,查看请求从开始到结束的全貌。根据日志和源代码,我通常能猜出哪里出了问题。
3. 有时候堆栈跟踪是编译后的 JavaScript,而不是 TypeScript,因此行号对不上。我不得不根据下一个函数调用的名称来猜测。
4. 我会再次确认自己看的是一个有代表性的请求。快速再看两三个请求 ID,确保它们都是同一个根因。
5. 对于更棘手的问题,比如数据库连接超时,我会检查规范日志行是否在时间戳、宿主机器、客户 ID 上存在聚类。这可能不是我的路由问题,而是基础设施问题。
总之,需要筛选的东西很多。需要大量的判断,而我甚至还没找到问题,更别说思考解决方案了。
然而,一个智能体工具对此几乎是完美的。给定某个告警和时间戳,它能把我指向正确的方向:日志、源代码或聚类。这已经把我每个问题的分类时间从 15 分钟以上减少到了 1-2 分钟。你甚至不需要最先进的($$$$)模型。省点钱,用个更快的模型吧。
我把这个工作流发布成一项技能,供队友使用,目的是分享其中包含的实际人为判断。输出结果会列出它尝试过的所有查询,分为“信息丰富”和“无信息”两类,并附上进一步深挖的链接。我不希望它看起来太神奇,因为我希望队友们知道如何思考分类问题。我也希望它能成为独立探索的跳板。
## 缩短内容
我特意没有把这项能力称为“总结”,因为:
> ChatGPT 并不总结。当我让 ChatGPT“总结”这段文字时,它反而是“缩短了文字”。
> ——https://ea.rna.nl/2024/05/27/when-chatgpt-summarises-it-actually-does-nothing-of-the-kind/
但尽管如此,我仍然发现缩短文本有巨大的价值!我有时会收到推荐超过 1 小时的播客或视频。有时我在前 5 分钟就被吸引住了(https://www.youtube.com/watch?v=wscQpkcwgNU)。但对于技术内容,我的兴趣往往埋藏在视频深处,对于录制的演讲来说,可能要 30 分钟以后。我不想花那么多时间来判断某个内容是否对我有吸引力,而 LLM 在这方面帮助很大。
根据我的经验,如果缩短版里有足够多的有趣内容,那么完整版里肯定也有更多。有个视频偶然提到了美国东海岸 vs 西海岸编程(https://youtu.be/I7fEsbksKRE?t=197)。如果没有缩短,我会因为不感兴趣而在 19 秒前就停止观看。
## 转录
好吧,缩短内容对我来说非常有用,但我怎么把它应用到视频和播客上呢?我给自己写了个小自动化,给定一个链接,它会检查:
1. 如果有字幕,就下载字幕
2. 如果是视频,就下载音频用于转录
3. 如果是音频,直接转录
一旦我把缓慢的视频或音频格式转换成文本,我就可以进行总结了!
我说这些时有一个前提:也许这是我应对注意缺陷/多动障碍(ADHD)的一种技巧。对我来说,保持注意力很难,尤其在音频方面。我确实有测试结果,显示我在听觉专注力、一致性和耐力方面都处于最低的 1%。这是三项不同的技能,而我在统计上每一项都很糟糕。所以最重要的可能是把音频转换成文本的能力,因为我处理文本比处理音频好得多(虽然统计上仍然只是平均水平)。
## 过滤招聘人员垃圾邮件
我每天会收到 1-4 封来自“招聘人员”或他们的智能体的邮件。这很烦人。它们会在周末、深夜、节假日出现。
于是我设置了一个自动化,每 15 分钟读取我的邮件,并将它们分类为是否来自招聘人员。如果是,就标记为已读并打上标签。
像这样的小事大大减少了我的邮件维护量。
有时我会仔细看看并尝试退订,但很多时候这些只是个人邮箱的垃圾邮件,而不是真正的邮件列表订阅。
过去,我会回复说我目前不找工作,但邮件数量之多让我觉得不会有真人真正看我的回复——不过是另一个 LLM 罢了。
## Instagram 视频搜索
这是我的一个梦想:我想为我所有在 Instagram 上点过赞的视频建立索引。我想对屏幕上的字幕进行光学字符识别(OCR),转录视频中的音频,并从缩略图中检测物体。我之所以想这么做,是因为要找到三年前我喜欢的那条视频太难了。它就在互联网的某个角落,在 Instagram 或 TikTok 上。我完全不知道该怎么找它。但我认为嵌入可以做到(https://technicalwriting.dev/2024/10/embeddings/index.html)。
当然,谷歌想要“组织全世界的信息”。我很欣赏在 Apple 照片应用里搜索“马”就能看到我见过的所有马。但我想要的是对我的表情包也能这样,而且我很惊讶 Instagram 在这方面如此落后。
## 结语
这就是我的全部分享了。
我仍然对 LLM 非常纠结。我喜欢使用我的开放权重模型。我很期待看到推理成本降低方面的进展。同时我也对它们对我们经济、社会结构和个体心理的影响感到恐惧。不过,我还是从中得到了一些有趣的小玩意儿(https://matthewbutterick.com/extinction-level-capitalism.html)。
> 是的,星球被毁了。但在一段美好的时光里,我们为股东创造了很多价值。
> ——Tom Toro,《纽约客》
> (https://www.newyorker.com/cartoon/a16995)
相似文章
顶级科技公司在内部如何真正使用大语言模型,而不仅仅是基础的编码辅助?
这篇文章探讨了谷歌、Meta 和 OpenAI 等主要科技公司如何在内部运用先进的大语言模型工作流,重点关注智能体任务、人在回路系统以及超越基础编码的实际应用。它旨在寻找实际的用例和操作流程,供小型初创公司和团队借鉴,以提高生产力和效率。
软件工程师:说正经的,你们真的从LLMs中有所收获吗?
一位软件工程师对使用本地LLM进行智能编码感到沮丧,指出诸如技术债务、忽略指令和过度生成代码等问题,质疑其有用性。
除了写作和编程,LLM为你做过的最有用的事情是什么?
一个讨论话题,询问人们实际采用的、非同寻常且实用的非写作、非编程的LLM使用案例。
LLM编码时代的软件工程最佳实践
一篇讨论软件工程最佳实践如何随着LLM编码工具的整合而发展的文章,为开发者提供指导。
@bibryam: 我作为高级工程师在2026年如何使用LLMs https://seangoedecke.com/how-i-use-llms-in-2026… 最大的AI工作流变化…
一位高级工程师描述了到2026年LLM代理如何演变成编码、调试和代码库研究的可靠协作者,而人类仍负责判断和审查。