当我的API账单不再合理后,我构建了一个代理来压缩智能体的LLM请求
摘要
一位独立创始人介绍了Orqen,这是一个位于你的SDK和LLM提供商之间的代理,通过压缩工具结果、管理历史记录和降低token成本来优化出站请求,而无需更改智能体代码。
我一直在OpenAI/Anthropic/Bedrock上构建智能体应用。订阅感觉有上限,直到每个循环都会重新发送完整的工具列表、臃肿的工具结果和不断增长的历史记录。输入token才是真正的计费单位——不是“一次聊天”,而是几十个完整的有效载荷。我想要前沿模型,而不是“买一块GPU跑27B参数模型”,但云账单依然让人心痛。于是我构建了Orqen:它位于你的SDK和提供商之间,优化每一轮的所有出站请求(工具路由、压缩工具结果、长会话历史记录/总结、模式清理、带故障开放的验证)。你只需更改API密钥和基础URL;智能体代码保持不变。它现在已经上线。我是一位独立创始人,英国公司。仍处于早期阶段——正在寻找在生产环境中运行工具调用智能体的人,告诉我什么能让他们信任路径中的代理。我正在尝试回答的问题:- 你的token膨胀主要来自哪里——工具、历史还是工具结果?- 响应头加上仪表盘展示节省的token是否足够?- 什么会阻止你尝试它?
相似文章
用于了解Agent工作方式的LLM代理?
用户寻找一个开源代理,用于拦截和调试AI Agent的API调用,以了解其内部工作原理,因为发现LiteLLM过于面向企业。
@alex_prompter: 这个开源代理无需改动一行代码就能降低你的AI agent成本。Plano位于你的agent和你的…
Plano是一个开源代理,位于AI agent和LLM提供商之间,通过智能路由、护栏过滤和成本感知选择来降低成本,所有配置通过单个YAML文件完成,无需修改agent代码。
@tonysimons_: 一位Netflix工程师构建了一个开源代理,可将AI token使用量减少60-95%。零代码更改。基准测试显示±0…
一位Netflix工程师构建了Headroom,这是一个开源代理,可在无需代码更改且精度损失可忽略的情况下,将LLM上下文压缩60-95%。它支持主要AI代理,并在GitHub上以Apache 2.0许可提供。
还有人对为每个代理工具管理API密钥和计费感到厌倦吗?
讨论了在代理工作流中管理多个工具的单独API密钥和计费的麻烦。重点介绍了Orthogonal(YC W26),一个MCP服务器/SDK,提供统一按次付费访问各种API的服务。
我开源了 Orkas——一个本地优先的桌面代理,由主代理指挥一组子代理(MIT 许可证,自带密钥)
Orkas 是一个开源、本地优先的桌面代理应用,其中主代理协调多个专业子代理,每个子代理拥有独立的上下文边界,并使用用户从不同大语言模型提供商提供的 API 密钥。