标签
本文提出 Agentic Context Management(ACM),将智能体记忆视为包含五个原语的生命周期问题,并介绍了参考实现 Maximem Synap,该实现取得了强劲的基准测试结果。
Grok Build 新增了代币使用跟踪、模型配置、提示批量处理和诊断功能,以帮助开发者提高代币效率。
Google 宣布推出 Gemini 3.6 Flash,其编码效率提升且令牌成本降低,同时发布 Gemini 3.5 Flash Lite 和一款专注于网络安全的模型,而 Gemini 3.5 Pro 仍在开发中,并暗示了 Gemini 4。
A user reports that using three local AI models (GLM 5.2, DeepSeek v4 Flash, Qwen 3.6 35B A3B) over 7 days with 500 million tokens can cover most business automation needs.
基于 Qwen3 235B A22B Instruct 2507 构建的内存管道在 LongMemEval-S 上获得最高分(470/500),同时其令牌效率比次优系统高出约 10 倍。
DeepSeek的OCR论文引入了‘光学压缩’的概念,表明一个图像Token可以编码大约10个文本Token的信息量,且准确性很高,使得文本图像比原始文本更具Token效率。社区工具和新应用Imagizer展示了这种方法在实际中的应用。
DeepSWE 1.1 突出展示了 GPT-5.6 Sol,根据 Sam Altman 的说法,该模型以一半的成本取得最高分,且令牌效率约为 Fable 的两倍。
Sam Altman 宣布,GPT-5.6 sol 的价格是 fable 的一半,并且在许多任务中 token 效率大约是 fable 的两倍,计划以四分之一的价格交付。
本技术报告介绍了 Mach-Mind-4-Flash,一个拥有35B参数(3B激活参数)的混合专家(MoE)代理模型,仅通过后训练优化即可达到或超越100B参数级别的模型性能。它提出了一种新颖的训练基础设施,包括动态多教师调度、多教师在线策略蒸馏以及用于令牌效率的混合中位长度策略优化。
一种名为IAPO(Information-Aware Policy Optimization)的新后训练方法,根据每个token与最终答案的条件互信息为其分配优势,实现了推理长度缩短高达47%,同时提高了数学基准的准确性。
GLM-5.2 被称赞为目前输出质量最好的中文开源模型,但要注意其较高的 token 消耗。用户希望能在 3 台 DGX Sparks 上运行它。
barebrowse 是一款从网页生成精简 ARIA 快照的工具,通过去除样板内容和广告来降低本地 AI 模型的 token 消耗,并可复用现有浏览器 cookies。
这篇新闻综述探讨了前沿AI中的权衡取舍:Anthropic重新发布的Fable 5展示了安全与质量之间的紧张关系,OpenAI的token效率提升降低了计算成本,而美国政府可能介入OpenAI则凸显了国家对AI基础设施控制的代价。
Glean 的工程博客详细介绍了他们的新代理框架,该框架通过代码执行实现 100% 程序化工具调用,与标准工具调用相比,减少 24% 的 Token 使用量。该框架通过工具截断和沙箱文件系统管理上下文,适用于长时间运行的复杂工作流。
SpaceXAI 发布了 Grok 4.5,这是一款 Opus 级别模型,相比 Anthropic 的 Opus 4.7 和 OpenAI 的模型等竞争对手,它提供了更快的速度、更高的 token 效率和更低的成本。
本文提出了针对交易法律文件LLM分析的令牌高效检索方法,证明结构化检索可以在使用更少的令牌和更低成本的同时,在答案质量上与全语料注入相匹配。
docx-cli 是一个 CLI 工具,通过使用稳定定位器并原地修改 XML,使 AI 代理能够高效读取和编辑 Word 文档,与默认方法相比,令牌使用量和时间减少一半。
一位开发者构建了一个开源代理(KU-Gateway),能够在LLM合成前丢弃向量数据库检索中的过时上下文,从而减少约50%的Token消耗,并防止过时数据导致的幻觉。该工具现已开放为期14天的压力测试/黑客马拉松。
介绍了 Sparse-Reslim,一种即插即用的路由模块,仅通过昂贵的 Transformer 块处理 25% 的空间令牌,以实现高效的天气预测,最高可实现 3.18 倍的加速并提高预报准确性。
本文认为,由于分词器和Token效率的差异,按每百万Token价格比较AI模型会产生误导。文章提供了一个基准成本分析,表明每Token价格较高的模型在完成每个任务时反而可能更便宜,其中DeepSeek V4 Pro是一个突出的成本效率异常值。