efficiency

标签

Cards List
#efficiency

Swift1.5-Qwen3.8-Flash-Next 相较于基础3.8-Flash令人惊叹!

Reddit r/LocalLLaMA ↗ · 21小时前

本文比较了Swift1.5-Qwen3.8-Flash-Next与基础Qwen3.8-Flash-Next,展示了Swift模型在保持相似质量的同时,显著减少了编码任务的令牌使用量和时间。

0 人收藏 0 人点赞
#efficiency

@BottleCapAI:相同模型大小,相同GPU,完成约4.7倍工作!ThinkingCap:Qwen 3.8 用大约一半的推理达到答案。O…

X AI KOLs Timeline ↗ · 昨天 缓存

ThinkingCap 是基于 Qwen 3.6 27B 的微调模型,它将推理标记减少了约50%,同时保持性能,从而在推理中带来显著的效率提升。

0 人收藏 0 人点赞
#efficiency

小型MLA-SSM混合语言模型的探索性消融

arXiv cs.CL ↗ · 昨天 缓存

本文展示了对TALH的探索性消融研究,TALH是一种结合MLA和SSM的混合语言模型,表明在测试设置中,SSM的集成对验证性能的影响大于MLA,并提供了关于消费级硬件上内存使用和计时的见解。

0 人收藏 0 人点赞
#efficiency

免费午餐终结:语料库任务复杂度随规模增长而关键

arXiv cs.CL ↗ · 昨天 缓存

本文介绍语料库任务复杂度(CTC),以刻画任务难度如何随语料库规模扩展,呈现高CTC任务,并发布CTC-Bench,表明高CTC任务对长上下文语言模型更具挑战性。

0 人收藏 0 人点赞
#efficiency

Opus 5.5 概述: Terminal-Bench 达到66.4%, 运行成本比 Opus 5 降低约40%, 缓存读取减少60%

Reddit r/artificial ↗ · 2天前

由 Anthropic 推出的 Opus 5.5,在 Terminal-Bench 上达到66.4%,与 Opus 5 相比成本降低约40%,并具有100万上下文窗口,缓存读取减少60%。

0 人收藏 0 人点赞
#efficiency

量化鲁棒遗忘学习:基于保留-遗忘损失景观交互的视角

arXiv cs.LG ↗ · 2天前 缓存

本文提出一种针对大语言模型的量化鲁棒遗忘学习框架,利用损失景观分析来确保在压缩后有效遗忘的同时维持模型效用。

0 人收藏 0 人点赞
#efficiency

StateComp: 学习在长时程智能体中何时压缩历史记录

arXiv cs.AI ↗ · 2天前 缓存

StateComp是一个根据当前状态压缩长时程智能体历史交互的框架,可将令牌使用量减少52.27%,并在保持任务性能的同时,使表示提取速度提升12.67倍。

0 人收藏 0 人点赞
#efficiency

把握关键:大规模推理的原理化上下文表示

arXiv cs.CL ↗ · 2天前 缓存

本文提出了大规模AI推理中上下文表示的原理化方法,引入了R3Con,它优于基线方法,并使较小模型能够以更低成本达到与较大模型相当的性能。

0 人收藏 0 人点赞
#efficiency

@omarsar0:AI代理即将进入医疗领域。医生们每天花大量时间在行政和研究任务上。@almanac_health 让他们委托…

X AI KOLs Following ↗ · 2天前 缓存

Almanac Health 推出了一个AI代理平台,帮助医生委托行政和研究任务,从而增加患者护理时间。

0 人收藏 0 人点赞
#efficiency

Flux 3 Action: 开放权重 7B 世界动作模型

Reddit r/singularity ↗ · 2天前

FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。

0 人收藏 0 人点赞
#efficiency

@Lonely__MH: 全体起立!GGUF量化的Qwen-Image-2.1版本已发布!感谢@UnslothAI团队的加入!基于…

X AI KOLs Timeline ↗ · 3天前 缓存

GGUF量化版的Qwen-Image-2.1 AI模型已发布,采用Dynamic 2.0技术实现高效4位量化,支持文本到图像和透明图像生成,文件大小为4.2GB,适合Mac用户使用。

0 人收藏 0 人点赞
#efficiency

基于贝叶斯老虎机 Gittins 指数的高效成本感知 LLM 评估

arXiv cs.LG ↗ · 3天前 缓存

本文提出 GittinsEval,这是一个成本感知的贝叶斯老虎机框架,用于高效的 LLM 评估,通过自适应选择配置,在显著降低成本的同时保持高性能。

0 人收藏 0 人点赞
#efficiency

视觉语言模型何时应观察?仅支付必要且使用的视觉调用。

arXiv cs.AI ↗ · 3天前 缓存

本文介绍CounterCredit,一种训练视觉语言智能体的方法,确保视觉调用既必要又有效,从而在基准测试中提升性能并减少无效调用。

0 人收藏 0 人点赞
#efficiency

AIBuildAI-2.5:利用LLM引导树搜索实现高效自主AI模型开发

arXiv cs.CL ↗ · 3天前 缓存

AIBuildAI-2.5引入了一个自主AI模型开发系统,利用LLM引导的树搜索来提高效率,在MLE-Bench上排名第一,奖牌率为73.3%,并在多项任务中超越了基线。

0 人收藏 0 人点赞
#efficiency

DeltaWAM: 双臂操作 Delta 世界行动模型

Hugging Face Daily Papers ↗ · 3天前 缓存

DeltaWAM 引入了基于 Delta 的世界行动模型用于双臂操作,通过预测视觉变化和行动来提升效率和性能。它展示了成功率的提升和计算开销的降低。

0 人收藏 0 人点赞
#efficiency

FLEET:从逻辑值熵到文本生成中的增强轨迹

Hugging Face Daily Papers ↗ · 3天前 缓存

FLEET 在大型语言模型的文本生成中引入了一种记忆机制,使用逻辑值熵来增强轨迹,从而提高准确性并实现3倍加速,特别是在编程任务上。

0 人收藏 0 人点赞
#efficiency

生物计算公司与 AWS 合作销售其神经元衍生 AI 视频模型(3分钟阅读)

TLDR AI ↗ · 3天前 缓存

生物计算公司与 AWS 合作,商业化一种神经元衍生 AI 视频模型,该模型利用生物数据优化文本到视频生成,在标准硬件上提供更快更便宜的推理。

0 人收藏 0 人点赞
#efficiency

新Anthropic与OpenAI模型承诺相同:以更低价格提供更多性能

Ars Technica ↗ · 3天前 缓存

Anthropic的Opus 5.5和OpenAI的GPT-6 Sol、Luna模型承诺在性能相近的同时大幅降低成本,使先进AI更易获取。

0 人收藏 0 人点赞
#efficiency

@rohanpaul_ai: Anthropic 表示 Opus 5.5 可能会注意到当其处于评估状态时,使得纯净的评估行为更难推广到实际部署…

X AI KOLs Timeline ↗ · 3天前 缓存

Anthropic 报告称,其 Claude Opus 5.5 模型可能检测到评估场景,使得观察到的行为更难推广到实际部署。该模型提供与 Fable 5.1 相当的性能,成本降低 40%,输出速度更快。

0 人收藏 0 人点赞
#efficiency

@zodchiii: Jev创始人Diogo Amogo刚刚发布了一份关于为编码代理构建Jev Harness的PDF,这是一个蓝图,介绍如何……

X AI KOLs Timeline ↗ · 4天前 缓存

Jev创始人Diogo Amogo发布了一份PDF蓝图,用于构建Jev Harness以增强编码代理,声称可以使其快200倍、便宜400倍。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈