更新:暂停 HITL 写入。廉价 Flash 用于只读分析代理 — 日期、双语路由和 Gemini 缓存率为 0%

Reddit r/AI_Agents 新闻

摘要

作者更新了一个使用 Gemini Flash Lite 的只读分析代理项目,讨论了缓存效率低下和双语路由的挑战,并寻求日期处理的建议。

感谢大家对上一篇帖子的回复(只读 POS 助手,路由 → 获取 → 叙述 → 落地,Node/TS + Vercel AI SDK)。关于写入路径的评论一致:预览 ≠ 在同一循环中确认,幂等性 + 乐观锁,在变更附近失败即关闭。这足以让我暂停 HITL。在读取循环更严格之前,我不会添加变更工具。我采取的是:尊重固定设置(不再“计算但未注册”),保持 CORE 优先模式,评估跟踪 / 获取 / 步骤计数 / $/% ⊆ DTO。我没有分成两次调用“CORE 然后固定”的路由器。模型。在开发中仍然是 Gemini 2.5/3.5 Flash Lite。它很便宜,而且这个任务是“选择一个工具,读取一个小 JSON,用英语或法语说出来”。我不想在循环中使用高思维模型。开发使用他们的免费套餐。如果这是个陷阱(缓存、工具调用、双语),我愿意尝试另一个 LLM——同样的约束:低成本,擅长工具 + 简短叙述,不是推理型。成本,典型请求(50 意图轮次,一个店铺,Redis 未命中,Flash Lite):指标平均中位输入 token 数 4,840 4,718 Gemini 缓存输入 0 0 输出 token 数 123 107 LLM 步骤(往返次数)2.0 2 工具调用数 1.0 1 墙上时间 2.3s 2.0s 注册工具数 12.2 12。形状几乎总是:步骤 0 选择一个工具(~2.3k 输入)→ 获取精简 DTO → 步骤 1 叙述(~2.6k 输入)。更广泛的日志(n=229):Gemini 隐式缓存整体 2.2%,在当前 CORE-12 上为 0/96,在固定设置上为 0/51。唯一的命中是较旧的 CORE-10 前缀(~40% 的该请求输入)。所以前缀可以缓存;目前没有。固定设置未被证明是问题所在——单独 CORE-12 也是冷的。这就是为什么我没有添加第二次模型调用。注意事项:本地评估 + 一个店铺,短期会话。Redis 精确匹配仅用于首轮操作指南,不用于分析。不同的缓存。接下来我将优化读取代理(加拿大 EN+FR)。两个请求:日期。门户总是发送可见的 dateRange。我们代码中的短语表可能会覆盖它。模型从不设置工具 from/to —— 上次 generateObject 发明了时间窗口。当表缺失时(例如,“本月 vs 上月”),你是用芯片暂停(Claude/OpenClaw 风格,但作为 UI 中断,不是 Gemini 工具),还是保持栏位默认并在第一句中命名时间窗口?我不想在每次“我们的收入是多少?”时都询问。双语路由。Gemini 可以写法语。关键词固定设置 / 操作指南术语是英语,所以 « préparation cuisine » 从不加载 get_fulfillment。我倾向于在相同正则表达式上使用 EN+FR 同义词表,而不是为路由翻译(会破坏 $/%),也不对其他语言返回 HTTP 400。有人运行过不会腐烂的双语关键词路由器吗?请求语言区域是否足以确定回答语言?不卖任何东西。乐意在评论中讨论。
查看原文

相似文章

Gemini 3.5 Flash (Low)(1分钟阅读)

TLDR AI

Google 推出了 Gemini 3.5 Flash (Low),这是一种新模型变体,在 SWE 任务上比旧版 Gemini 3 Flash (High) 表现更优,同时相比 Medium 版本使用的 token 减少了约 45%。他们还重置了所有付费计划的配额。

Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Hacker News Top

Google 推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 模型,提升了 token 效率、降低了延迟,并为智能体工作流带来更优性能。其中,3.6 Flash 减少了 17% 的输出 token 用量,并在编程和知识任务中表现出色。

Gemini 2.5 Flash-Lite 现已准备就绪,可用于大规模生产

Google DeepMind Blog

Google 发布 Gemini 2.5 Flash-Lite 作为稳定版本并正式上线,这是 Gemini 2.5 系列中速度最快、成本最低的模型,定价为每 100 万个令牌 $0.10(输入)/$0.40(输出),具备原生推理能力和与原生工具的完全功能对等。