标签
一位用户分享了一个技巧:在代理工作流程中使用 Ollama 本地的 llama3.1:8b 模型压缩对话上下文,相较于将上下文发送给提供商,能降低延迟并减少 token 使用量。
一位开发者在工具调用任务上测试了五个AI模型,发现廉价模型的表现与Opus等昂贵模型相差不到2%,腾讯混元(Tencent's Hunyuan)成本低于1.50美元,而Opus为15美元,通过将简单任务路由到廉价模型,每日成本从40美元降至9美元。
本文提供了一份全面指南,旨在将Agentic AI系统的令牌成本降低95%,详细介绍了七种核心技术,包括树状文档架构、AI自动压缩、本地模型管理以及脚本到API调用。
本文讨论了使用小型本地语言模型持续检查代码质量并强制执行编码标准的想法,旨在保持代码库的清洁和安全,而无需依赖云LLM。
文章探讨了 DeepSeek-V4-Flash 这一强大的本地模型如何使 LLM 引导再次变得实用,并讨论了 antirez 在 DwarfStar 4 项目中的概念及其实现。
一个比较显示,Hermes Agent 在令牌处理时间和代码生成方面优于 OpenClaw,使用的是 MacBook Pro M5 Max 上的本地 Qwen 35B 模型。
Hermes Agent 与 OpenClaw 使用 Qwen 35B 本地模型的对比,代理抓取 GitHub 星标历史,识别增长高峰,并构建实时仪表板。OpenClaw 耗时 12 分 01 秒(203k 令牌),Hermes 耗时 33 分 01 秒(257k 令牌),采用不同方法。