token-compression

标签

Cards List
#token-compression

@GitTrend0x: AI 网关天花板! 一个端点接 268+ 提供商、500+ 模型,Cursor/Claude Code 直接用 用 AI coding 时最烦的几个问题: • 模型太多,切换麻烦 • 免费额度分散,经常超限 • Token 吃得太凶,成本…

X AI KOLs Timeline · 昨天 缓存

OmniRoute is a free, open-source AI gateway that unifies access to 268+ providers and 500+ models through a single local endpoint, featuring smart routing, token compression, and free tier aggregation to reduce costs and complexity for developers.

0 人收藏 0 人点赞
#token-compression

OmniFocus: 查询引导的模态平衡令牌压缩方法用于全模态大语言模型

arXiv cs.LG · 2026-07-07 缓存

OmniFocus 是一种无需训练、查询引导的令牌压缩方法,用于全模态大语言模型,它独立估计视频和音频的重要性,以保留模态特定的证据同时保持对齐,在低令牌保留比率下实现了显著的推理加速,同时精度损失极小。

0 人收藏 0 人点赞
#token-compression

所有视觉标记都同等重要吗?面向视觉-语言检索的保留对象证据的标记合并

Hugging Face Daily Papers · 2026-07-06 缓存

介绍了SaMer,一种面向对象的标记合并框架,用于压缩视觉-语言检索中的图像侧标记,同时保留对象级证据,显著减少存储并提升检索性能。

0 人收藏 0 人点赞
#token-compression

我花了大约4.5个月构建了一个免费、自托管的AI网关:一个端点连接237家服务商(其中90多个免费),自动回退,以及一个令牌压缩管道(MIT许可)

Reddit r/artificial · 2026-07-02

一个开源、自托管的AI网关,为237家LLM服务商提供单一端点,支持自动回退、令牌压缩和路由。该项目在4.5个月内获得了9.8K个GitHub星标和280多位贡献者,获得了显著关注。

0 人收藏 0 人点赞
#token-compression

@IndieDevHailey: 最强开源AI网关神器:OmniRoute,一个本地端点,搞定236个AI模型 免费开源AI网关,把236个提供商(90+免费、11个永久免费)统一成一个OpenAI兼容接口。本地自托管,3分钟部署完成。 - 永不断流:自动fallback…

X AI KOLs Timeline · 2026-07-01 缓存

OmniRoute是一个免费开源AI网关,能够将236个AI提供商的API统一成一个OpenAI兼容接口,支持本地自托管、自动fallback、智能路由和token压缩等功能。

0 人收藏 0 人点赞
#token-compression

@VaibhavSisinty:我刚刚发现了一个工具,能将AI代币成本降低95%,并且每月提供16亿免费代币。这是最……

X AI KOLs Timeline · 2026-06-28 缓存

OmniRoute 是 GitHub 上一个热门的工具,它通过压缩 AI 提示词,将代币使用量减少高达 95%,并通过无缝路由请求到多个提供商(如 Claude Code、Codex、Cursor、Cline 和 Copilot),每月提供 16 亿免费代币。

0 人收藏 0 人点赞
#token-compression

AVOC: 通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解

arXiv cs.CL · 2026-06-24 缓存

AVOC 提出了一种针对全模态大语言模型的检索启发的令牌压缩方法,通过基于相关性、重要性和多样性选择信息丰富的令牌,有效处理长达一小时的音视频输入。该框架在长时音视频理解基准测试中取得了最先进的结果,大幅超越了先前的方法。

0 人收藏 0 人点赞
#token-compression

@AYi_AInotes: Damn,这个开源工具直接减少了95%token消耗 这可能是今年最狠的LLM降本神器, Netflix工程师开源的Headroom 把本地Agent套在Codex,Cursor,OpenClaw,Hermes或Claude code外面…

X AI KOLs Timeline · 2026-06-21 缓存

Netflix工程师开源了Headroom工具,在本地预处理阶段自动压缩LLM输入上下文,减少高达95%的token消耗,兼容Codex、Cursor等主流AI编码工具,无需修改代码即可生效。

0 人收藏 0 人点赞
#token-compression

@nini_incrypto_: Headroom,把大模型 Token 成本砍掉 95% ! 1. 真·零代码更改:提供 Proxy 代理模式,任何编程语言只需改个端口就能直接无缝接入。 2. 全吞吐压缩:自动压缩工具输出、运行日志、RAG 知识库切片以及密密麻麻的聊天…

X AI KOLs Timeline · 2026-06-21 缓存

Headroom 是一个上下文压缩层,可以将 AI agent 读取的 Token 成本降低 60-95%,支持零代码更改的代理模式,且不降低模型回答质量。

0 人收藏 0 人点赞
#token-compression

令牌压缩幻象:为什么我对RTK持怀疑态度

Hacker News Top · 2026-06-18 缓存

本文批评了RTK,一种用于LLM代理的令牌压缩工具,认为其声称的60-90%成本节省具有误导性,引入了静默失败风险,缺乏严格的准确性基准,并且作为独立产品在结构上脆弱。

0 人收藏 0 人点赞
#token-compression

@tonysimons_: 一位Netflix工程师构建了一个开源代理,可将AI token使用量减少60-95%。零代码更改。基准测试显示±0…

X AI KOLs Timeline · 2026-06-17 缓存

一位Netflix工程师构建了Headroom,这是一个开源代理,可在无需代码更改且精度损失可忽略的情况下,将LLM上下文压缩60-95%。它支持主要AI代理,并在GitHub上以Apache 2.0许可提供。

0 人收藏 0 人点赞
#token-compression

将示例提炼为任务指令:面向真实B2B对话的增强型上下文学习

arXiv cs.CL · 2026-06-16 缓存

本文介绍了用于分类真实B2B对话的Call Playbook数据集,并提出将示例提炼为紧凑、可解释的任务指令的方法,相比传统上下文学习实现了99%的Token压缩和高达7%的AUC提升。

0 人收藏 0 人点赞
#token-compression

@jiqizhixin: 如果你的AI能像流媒体编解码器一样“看”视频——只把令牌花在最关键的时刻?介绍……

X AI KOLs Timeline · 2026-06-15 缓存

LLaVA-OneVision-2 引入了编解码流令牌化技术以实现高效的视频理解,在时间与空间基准测试上显著超越 Qwen3-VL-8B。模型、数据和代码均已开源。

0 人收藏 0 人点赞
#token-compression

@hasantoxr: 所以我发现了一个GitHub仓库,它可以阻止AI代理无谓地消耗token。它叫Headroom。它是由一位……

X AI KOLs Timeline · 2026-06-14

Headroom是Netflix的Tejas Chopra开发的一个GitHub工具,它能在将输入(工具输出、日志、RAG块等)发送给LLM之前进行压缩,承诺在不改变答案的前提下减少60–95%的token。它支持Python/TypeScript库、本地代理、MCP服务器,以及针对流行编程代理的封装器。

0 人收藏 0 人点赞
#token-compression

Snapcompact: 通过图像节省Token

Reddit r/LocalLLaMA · 2026-06-13 缓存

Snapcompact 是一种技术,它将文本渲染为密集的像素字体图像,用更便宜的图像Token替换文本Token,以极低的输入成本实现近乎逐字逐句的召回。

0 人收藏 0 人点赞
#token-compression

开源 InfiniteKV:一种 KV 缓存,将旧 token 压缩为 104 字节的可搜索记录存储在内存或磁盘中,而非删除。Mistral-7B 从 token 76,747 处作答,超出其训练窗口 2.3 倍。附 Colab 演示

Reddit r/LocalLLaMA · 2026-06-12

InfiniteKV 是一种开源 KV 缓存技术,将旧 token 压缩为 104 字节的可搜索记录,存储在内存或磁盘中,使模型能够处理超出训练窗口的百万 token 上下文而无需丢弃数据。已验证可与 Mistral-7B 和 SmolLM2 配合使用。

0 人收藏 0 人点赞
#token-compression

HiLo-Token: 输入自适应高低频令牌压缩实现高效图像编辑

Hugging Face Daily Papers · 2026-06-11 缓存

HiLo-Token 提出了一种面向扩散变换器的输入自适应令牌压缩框架,为高频区域分配更多令牌,在图像编辑任务中实现高达 3.13 倍的加速且无质量损失。

0 人收藏 0 人点赞
#token-compression

@Pavel_Izmailov: 新论文:潜在上下文语言模型(LCLMs)!思想:将16个token编码为1个潜在token,让LLM处理t…

X AI KOLs Timeline · 2026-06-10 缓存

介绍潜在上下文语言模型(LCLMs),该模型将16个token编码为1个潜在token,以提高性能、速度和内存使用。

0 人收藏 0 人点赞
#token-compression

每个多模态证据一个Token:面向资源受限问答的Latent Memory

Hugging Face Daily Papers · 2026-06-09 缓存

潜在记忆(Latent Memory)引入了一种用于问答中外部记忆的压缩表示方法,在减少Token消耗和存储需求的同时,在纯文本和多模态基准测试中保持有竞争力的表现。

0 人收藏 0 人点赞
#token-compression

@Chenzeze777: 兄弟们今天刷 GitHub 直接愣住了。 Headroom,一周涨了 1.4 万星,海外开发者圈彻底炸了。我本来以为是又一个 PPT 开源项目,结果仔细看了眼实测数据——代码搜索 1.7 万 token 压到 1400,答案一字没变。 给…

X AI KOLs Timeline · 2026-06-08 缓存

Headroom 是一个开源工具,可将代码搜索结果和AI对话中的token数量压缩高达92%(如从1.7万压缩到1400),且保持答案质量不变,支持多平台本地免费运行。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈