该用哪个 API 来构建通用实时 LLM 代理 [讨论]
摘要
一篇 Hacker News 上的讨论,探讨应该使用什么 API/接口来构建通用的实时异步 LLM 代理,使其能在推理过程中对新刺激(中断、实时事件流)做出反应。文中引用了 AsyncLLM 预印本以及各厂商现有的实时 API 作为部分解决方案。
[基于 AsyncLLM、System 1 大模型、交互模型、推理库] 我注意到许多项目(学术、创业公司、个人项目等)都在尝试让大模型工作在一个实时世界中——在模型思考的同时,事情仍在不断发生。代理需要足够快,同时还要在思考过程中有办法接收新刺激,比如用户打断语音助手、浏览器弹出通知等等。而这些东西在原理上已经存在,例如大多数机器人代理、实时助手 [videoLLM] [gpt4o]、视频通话 [wan-streamer],以及 Codex 中的 [中途引导](mid-turn steering)功能——你可以在代理工作的同时添加补充说明,等等。所以看起来大模型已经能够在特定场景下实现实时交互——我在想,这种能力是否可以被泛化,让开发者像我们现在编写自定义 MCP 工具那样,编写自己的实时代理。这样一来,我们就需要某种可复用的构建模块,将它们组合起来,比如一个能实时帮你调试的编码代理、一个能在搜索过程中与你对话并根据你的反馈实时调整的"深度研究"代理,或是一个语音控制的日历/电子表格助手等等。我的观点有点天马行空,重点是:现有的模型还没有覆盖这些应用。我在想:如果有人要构建这样一套系统,你会用什么接口来构建通用的异步代理?各厂商技术上确实有"实时 API"[1,2],但那些主要是针对编码场景的。我找到的最接近通用异步代理的东西是 [AsyncLLM 预印本 2609.35427](免责声明:我认识这篇论文的作者),在该预印本中,程序员使用 asyncio 编写协程,并通过共享内存块来让代理进行通信(下图来自该预印本)。
img from https://huggingface.co/papers/2609.35427
不过,这套方案仍然假设程序员需要手写底层推理流程,所以也许存在一种更自然的方式,让 openai/anthropic 等厂商暴露某个 API,让开发者能为自己的用例运行通用异步代理,并向其输入实时事件流。
相似文章
LLM 即通用异步智能体
论文提出了一种通用的异步 LLM 框架,允许用户定义具有重叠记忆状态的推理协程,并展示 Qwen3.x 模型无需针对特定任务进行训练,即可异步处理流式视频、电子游戏和监控任务。
用于了解Agent工作方式的LLM代理?
用户寻找一个开源代理,用于拦截和调试AI Agent的API调用,以了解其内部工作原理,因为发现LiteLLM过于面向企业。
ProactiveLLM: 学习主动交互的流式大语言模型
ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。
多流大语言模型:通过并行思维、输入与输出流解锁语言模型的潜力
本文提出了多流大语言模型(Multi-Stream LLMs),将基于顺序消息的指令微调转变为并行流处理。这种方法允许语言模型在多个并发数据流中同时进行读取、思考和生成,解决了自主智能体应用中的瓶颈问题。
超越标记:基于LLM的多智能体系统中潜在通信的统一框架
本文提出了一个基于LLM的多智能体系统中潜在通信的统一框架,按照通信信息内容、发送者-接收者对位和融合技术对方法进行分类,并回顾了2024至2026年间的十八种代表性方法。