token-efficiency

标签

Cards List
#token-efficiency

Agentic Context Management:将智能体记忆与成本作为生命周期与架构问题来解决

Hugging Face Daily Papers · 2026-07-23 缓存

本文提出 Agentic Context Management(ACM),将智能体记忆视为包含五个原语的生命周期问题,并介绍了参考实现 Maximem Synap,该实现取得了强劲的基准测试结果。

0 人收藏 0 人点赞
#token-efficiency

@elonmusk: Grok Build 正在添加功能以帮助您跟踪和提高代币效率

X AI KOLs Timeline · 2026-07-22 缓存

Grok Build 新增了代币使用跟踪、模型配置、提示批量处理和诊断功能,以帮助开发者提高代币效率。

0 人收藏 0 人点赞
#token-efficiency

Google 发布 Gemini 3.6 Flash 与网络安全 AI,预告 3.5 Pro 和 Gemini 4

Ars Technica · 2026-07-21 缓存

Google 宣布推出 Gemini 3.6 Flash,其编码效率提升且令牌成本降低,同时发布 Gemini 3.5 Flash Lite 和一款专注于网络安全的模型,而 Gemini 3.5 Pro 仍在开发中,并暗示了 Gemini 4。

0 人收藏 0 人点赞
#token-efficiency

@YRSM_Simon: 7天,5亿token,Local AI GLM 5.2,deepseek v4 flash,Qwen 3.6 35B A3B,三个模型几乎能满足绝大部分业务自动化需求了

X AI KOLs Following · 2026-07-21 缓存

A user reports that using three local AI models (GLM 5.2, DeepSeek v4 Flash, Qwen 3.6 35B A3B) over 7 days with 500 million tokens can cover most business automation needs.

0 人收藏 0 人点赞
#token-efficiency

基于 Qwen3 235B A22B Instruct 2507 构建的内存管道在 LongMemEval-S 上获得第一名(470/500),同时其令牌效率比次优系统高出约 10 倍

Reddit r/LocalLLaMA · 2026-07-14

基于 Qwen3 235B A22B Instruct 2507 构建的内存管道在 LongMemEval-S 上获得最高分(470/500),同时其令牌效率比次优系统高出约 10 倍。

0 人收藏 0 人点赞
#token-efficiency

将文本转换为图像以节省Token使用量

Reddit r/ArtificialInteligence · 2026-07-14

DeepSeek的OCR论文引入了‘光学压缩’的概念,表明一个图像Token可以编码大约10个文本Token的信息量,且准确性很高,使得文本图像比原始文本更具Token效率。社区工具和新应用Imagizer展示了这种方法在实际中的应用。

0 人收藏 0 人点赞
#token-efficiency

@reach_vb: DeepSWE 1.1:GPT 5.6 Sol 以不到一半的成本取得最高分

X AI KOLs Timeline · 2026-07-14 缓存

DeepSWE 1.1 突出展示了 GPT-5.6 Sol,根据 Sam Altman 的说法,该模型以一半的成本取得最高分,且令牌效率约为 Fable 的两倍。

0 人收藏 0 人点赞
#token-efficiency

@sama: GPT-5.6 sol 的价格是 fable 的一半,并且在许多情况下完成相同任务的 token 效率大约是 fable 的两倍。很高兴…

X AI KOLs · 2026-07-14 缓存

Sam Altman 宣布,GPT-5.6 sol 的价格是 fable 的一半,并且在许多任务中 token 效率大约是 fable 的两倍,计划以四分之一的价格交付。

0 人收藏 0 人点赞
#token-efficiency

Mach-Mind-4-Flash 技术报告

arXiv cs.CL · 2026-07-13 缓存

本技术报告介绍了 Mach-Mind-4-Flash,一个拥有35B参数(3B激活参数)的混合专家(MoE)代理模型,仅通过后训练优化即可达到或超越100B参数级别的模型性能。它提出了一种新颖的训练基础设施,包括动态多教师调度、多教师在线策略蒸馏以及用于令牌效率的混合中位长度策略优化。

0 人收藏 0 人点赞
#token-efficiency

@VukRosic99: GRPO后训练使LLMs准确但冗长:在20道MATH-500问题上,一个蒸馏的1.5B模型和一位博士志愿者……

X AI KOLs Timeline · 2026-07-13 缓存

一种名为IAPO(Information-Aware Policy Optimization)的新后训练方法,根据每个token与最终答案的条件互信息为其分配优势,实现了推理长度缩短高达47%,同时提高了数学基准的准确性。

0 人收藏 0 人点赞
#token-efficiency

@MiaAI_lab: GLM-5.2 是目前最好的中文开源模型。输出质量极高——我能真切感受到差异。问题是……

X AI KOLs Following · 2026-07-12 缓存

GLM-5.2 被称赞为目前输出质量最好的中文开源模型,但要注意其较高的 token 消耗。用户希望能在 3 台 DGX Sparks 上运行它。

0 人收藏 0 人点赞
#token-efficiency

我构建了 barebrowse:为本地模型代理提供浏览器,无需 Playwright — 使用精简的 ARIA 快照替代原始 HTML(大幅减少 token 消耗)

Reddit r/LocalLLaMA · 2026-07-10

barebrowse 是一款从网页生成精简 ARIA 快照的工具,通过去除样板内容和广告来降低本地 AI 模型的 token 消耗,并可复用现有浏览器 cookies。

0 人收藏 0 人点赞
#token-efficiency

Quantized AI News 26/05:前沿AI中控制的代价

Reddit r/artificial · 2026-07-09 缓存

这篇新闻综述探讨了前沿AI中的权衡取舍:Anthropic重新发布的Fable 5展示了安全与质量之间的紧张关系,OpenAI的token效率提升降低了计算成本,而美国政府可能介入OpenAI则凸显了国家对AI基础设施控制的代价。

0 人收藏 0 人点赞
#token-efficiency

@tonygentilcore: https://x.com/tonygentilcore/status/2075234683202531403

X AI KOLs Timeline · 2026-07-09 缓存

Glean 的工程博客详细介绍了他们的新代理框架,该框架通过代码执行实现 100% 程序化工具调用,与标准工具调用相比,减少 24% 的 Token 使用量。该框架通过工具截断和沙箱文件系统管理上下文,适用于长时间运行的复杂工作流。

0 人收藏 0 人点赞
#token-efficiency

SpaceXAI 发布 Grok 4.5,Elon 称其为‘Opus 级别模型’

TechCrunch AI · 2026-07-08 缓存

SpaceXAI 发布了 Grok 4.5,这是一款 Opus 级别模型,相比 Anthropic 的 Opus 4.7 和 OpenAI 的模型等竞争对手,它提供了更快的速度、更高的 token 效率和更低的成本。

0 人收藏 0 人点赞
#token-efficiency

注入还是导航?面向交易法律文件LLM分析的令牌高效检索方法

arXiv cs.CL · 2026-07-08 缓存

本文提出了针对交易法律文件LLM分析的令牌高效检索方法,证明结构化检索可以在使用更少的令牌和更低成本的同时,在答案质量上与全语料注入相匹配。

0 人收藏 0 人点赞
#token-efficiency

Show HN:Docx-CLI:智能代理以一半的时间和令牌读写Word文档

Hacker News Top · 2026-07-07 缓存

docx-cli 是一个 CLI 工具,通过使用稳定定位器并原地修改 XML,使 AI 代理能够高效读取和编辑 Word 文档,与默认方法相比,令牌使用量和时间减少一半。

0 人收藏 0 人点赞
#token-efficiency

我构建了一个确定性代理来丢弃过时上下文(减少约50%的Token消耗)。本周进行压力测试。[P]

Reddit r/MachineLearning · 2026-07-07

一位开发者构建了一个开源代理(KU-Gateway),能够在LLM合成前丢弃向量数据库检索中的过时上下文,从而减少约50%的Token消耗,并防止过时数据导致的幻觉。该工具现已开放为期14天的压力测试/黑客马拉松。

0 人收藏 0 人点赞
#token-efficiency

更少的令牌,更好的预测:用于高效天气预测的稀疏残差路由

arXiv cs.LG · 2026-07-07 缓存

介绍了 Sparse-Reslim,一种即插即用的路由模块,仅通过昂贵的 Transformer 块处理 25% 的空间令牌,以实现高效的天气预测,最高可实现 3.18 倍的加速并提高预报准确性。

0 人收藏 0 人点赞
#token-efficiency

每百万Token的价格毫无意义

Hacker News Top · 2026-07-06 缓存

本文认为,由于分词器和Token效率的差异,按每百万Token价格比较AI模型会产生误导。文章提供了一个基准成本分析,表明每Token价格较高的模型在完成每个任务时反而可能更便宜,其中DeepSeek V4 Pro是一个突出的成本效率异常值。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈