token-efficiency

标签

Cards List
#token-efficiency

Google 发布 Gemini 3.6 Flash 与网络安全 AI,预告 3.5 Pro 和 Gemini 4

Ars Technica ↗ · 2026-07-21 缓存

Google 宣布推出 Gemini 3.6 Flash,其编码效率提升且令牌成本降低,同时发布 Gemini 3.5 Flash Lite 和一款专注于网络安全的模型,而 Gemini 3.5 Pro 仍在开发中,并暗示了 Gemini 4。

0 人收藏 0 人点赞
#token-efficiency

@YRSM_Simon: 7天,5亿token,Local AI GLM 5.2,deepseek v4 flash,Qwen 3.6 35B A3B,三个模型几乎能满足绝大部分业务自动化需求了

X AI KOLs Following ↗ · 2026-07-21 缓存

A user reports that using three local AI models (GLM 5.2, DeepSeek v4 Flash, Qwen 3.6 35B A3B) over 7 days with 500 million tokens can cover most business automation needs.

0 人收藏 0 人点赞
#token-efficiency

基于 Qwen3 235B A22B Instruct 2507 构建的内存管道在 LongMemEval-S 上获得第一名(470/500),同时其令牌效率比次优系统高出约 10 倍

Reddit r/LocalLLaMA ↗ · 2026-07-14

基于 Qwen3 235B A22B Instruct 2507 构建的内存管道在 LongMemEval-S 上获得最高分(470/500),同时其令牌效率比次优系统高出约 10 倍。

0 人收藏 0 人点赞
#token-efficiency

将文本转换为图像以节省Token使用量

Reddit r/ArtificialInteligence ↗ · 2026-07-14

DeepSeek的OCR论文引入了‘光学压缩’的概念,表明一个图像Token可以编码大约10个文本Token的信息量,且准确性很高,使得文本图像比原始文本更具Token效率。社区工具和新应用Imagizer展示了这种方法在实际中的应用。

0 人收藏 0 人点赞
#token-efficiency

@reach_vb: DeepSWE 1.1:GPT 5.6 Sol 以不到一半的成本取得最高分

X AI KOLs Timeline ↗ · 2026-07-14 缓存

DeepSWE 1.1 突出展示了 GPT-5.6 Sol,根据 Sam Altman 的说法,该模型以一半的成本取得最高分,且令牌效率约为 Fable 的两倍。

0 人收藏 0 人点赞
#token-efficiency

@sama: GPT-5.6 sol 的价格是 fable 的一半,并且在许多情况下完成相同任务的 token 效率大约是 fable 的两倍。很高兴…

X AI KOLs ↗ · 2026-07-14 缓存

Sam Altman 宣布,GPT-5.6 sol 的价格是 fable 的一半,并且在许多任务中 token 效率大约是 fable 的两倍,计划以四分之一的价格交付。

0 人收藏 0 人点赞
#token-efficiency

Mach-Mind-4-Flash 技术报告

arXiv cs.CL ↗ · 2026-07-13 缓存

本技术报告介绍了 Mach-Mind-4-Flash,一个拥有35B参数(3B激活参数)的混合专家(MoE)代理模型,仅通过后训练优化即可达到或超越100B参数级别的模型性能。它提出了一种新颖的训练基础设施,包括动态多教师调度、多教师在线策略蒸馏以及用于令牌效率的混合中位长度策略优化。

0 人收藏 0 人点赞
#token-efficiency

@VukRosic99: GRPO后训练使LLMs准确但冗长:在20道MATH-500问题上,一个蒸馏的1.5B模型和一位博士志愿者……

X AI KOLs Timeline ↗ · 2026-07-13 缓存

一种名为IAPO(Information-Aware Policy Optimization)的新后训练方法,根据每个token与最终答案的条件互信息为其分配优势,实现了推理长度缩短高达47%,同时提高了数学基准的准确性。

0 人收藏 0 人点赞
#token-efficiency

@MiaAI_lab: GLM-5.2 是目前最好的中文开源模型。输出质量极高——我能真切感受到差异。问题是……

X AI KOLs Following ↗ · 2026-07-12 缓存

GLM-5.2 被称赞为目前输出质量最好的中文开源模型,但要注意其较高的 token 消耗。用户希望能在 3 台 DGX Sparks 上运行它。

0 人收藏 0 人点赞
#token-efficiency

我构建了 barebrowse:为本地模型代理提供浏览器,无需 Playwright — 使用精简的 ARIA 快照替代原始 HTML(大幅减少 token 消耗)

Reddit r/LocalLLaMA ↗ · 2026-07-10

barebrowse 是一款从网页生成精简 ARIA 快照的工具,通过去除样板内容和广告来降低本地 AI 模型的 token 消耗,并可复用现有浏览器 cookies。

0 人收藏 0 人点赞
#token-efficiency

Quantized AI News 26/05:前沿AI中控制的代价

Reddit r/artificial ↗ · 2026-07-09 缓存

这篇新闻综述探讨了前沿AI中的权衡取舍:Anthropic重新发布的Fable 5展示了安全与质量之间的紧张关系,OpenAI的token效率提升降低了计算成本,而美国政府可能介入OpenAI则凸显了国家对AI基础设施控制的代价。

0 人收藏 0 人点赞
#token-efficiency

@tonygentilcore: https://x.com/tonygentilcore/status/2075234683202531403

X AI KOLs Timeline ↗ · 2026-07-09 缓存

Glean 的工程博客详细介绍了他们的新代理框架,该框架通过代码执行实现 100% 程序化工具调用,与标准工具调用相比,减少 24% 的 Token 使用量。该框架通过工具截断和沙箱文件系统管理上下文,适用于长时间运行的复杂工作流。

0 人收藏 0 人点赞
#token-efficiency

SpaceXAI 发布 Grok 4.5,Elon 称其为‘Opus 级别模型’

TechCrunch AI ↗ · 2026-07-08 缓存

SpaceXAI 发布了 Grok 4.5,这是一款 Opus 级别模型,相比 Anthropic 的 Opus 4.7 和 OpenAI 的模型等竞争对手,它提供了更快的速度、更高的 token 效率和更低的成本。

0 人收藏 0 人点赞
#token-efficiency

注入还是导航?面向交易法律文件LLM分析的令牌高效检索方法

arXiv cs.CL ↗ · 2026-07-08 缓存

本文提出了针对交易法律文件LLM分析的令牌高效检索方法,证明结构化检索可以在使用更少的令牌和更低成本的同时,在答案质量上与全语料注入相匹配。

0 人收藏 0 人点赞
#token-efficiency

Show HN:Docx-CLI:智能代理以一半的时间和令牌读写Word文档

Hacker News Top ↗ · 2026-07-07 缓存

docx-cli 是一个 CLI 工具,通过使用稳定定位器并原地修改 XML,使 AI 代理能够高效读取和编辑 Word 文档,与默认方法相比,令牌使用量和时间减少一半。

0 人收藏 0 人点赞
#token-efficiency

我构建了一个确定性代理来丢弃过时上下文(减少约50%的Token消耗)。本周进行压力测试。[P]

Reddit r/MachineLearning ↗ · 2026-07-07

一位开发者构建了一个开源代理(KU-Gateway),能够在LLM合成前丢弃向量数据库检索中的过时上下文,从而减少约50%的Token消耗,并防止过时数据导致的幻觉。该工具现已开放为期14天的压力测试/黑客马拉松。

0 人收藏 0 人点赞
#token-efficiency

更少的令牌,更好的预测:用于高效天气预测的稀疏残差路由

arXiv cs.LG ↗ · 2026-07-07 缓存

介绍了 Sparse-Reslim,一种即插即用的路由模块,仅通过昂贵的 Transformer 块处理 25% 的空间令牌,以实现高效的天气预测,最高可实现 3.18 倍的加速并提高预报准确性。

0 人收藏 0 人点赞
#token-efficiency

每百万Token的价格毫无意义

Hacker News Top ↗ · 2026-07-06 缓存

本文认为,由于分词器和Token效率的差异,按每百万Token价格比较AI模型会产生误导。文章提供了一个基准成本分析,表明每Token价格较高的模型在完成每个任务时反而可能更便宜,其中DeepSeek V4 Pro是一个突出的成本效率异常值。

0 人收藏 0 人点赞
#token-efficiency

@LiorOnAI: Hy3 花了更少时间去追逐另一个基准点,而是更多时间修复那些让智能体悄然失败的问题。工具…

X AI KOLs Following ↗ · 2026-07-06 缓存

腾讯发布了 Hy3,一个 295B 的 MoE 模型,专注于智能体任务的实用可靠性,采用 Apache 2.0 开源许可证,并提供两周的免费 API。

0 人收藏 0 人点赞
#token-efficiency

一种简单的代理网络访问模式:搜索、获取、浏览,但将原始页面保留在主上下文之外

Reddit r/AI_Agents ↗ · 2026-07-06

本文提出了一种更简洁的 Agent 网页访问模式,通过将功能拆分为三个独立的通道——搜索(search)、抓取(fetch)和浏览器(browser),并借助一个阅读器子代理(reader subagent)避免原始页面进入主上下文,从而显著降低 Token 消耗和上下文污染。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈