cost-efficiency

标签

Cards List
#cost-efficiency

预路由推理:面向成本高效文档字段提取

arXiv cs.CL · 21小时前 缓存

本文研究了是否可以在推理之前使用低成本特征预测文档提取难度,从而使路由器能够在廉价模型与强大模型之间进行选择。路由在某些体裁中最多可降低77%的成本,同时保持质量,但前提是难度存在差异且可从文档特征中预测。

0 人收藏 0 人点赞
#cost-efficiency

同一AI模型。更好的结果。更低的成本。

Reddit r/AI_Agents · 3天前

作者认为,AI编码工具链和模型路由与模型本身同样重要,分享了使用Oh-My-Pi和OpenCode进行的测试,这些测试减少了token使用量和错误,并推荐针对高容量、轻量级任务采用分层模型订阅。

0 人收藏 0 人点赞
#cost-efficiency

@browser_use:规模化可靠网络代理的时代已经到来。

X AI KOLs Timeline · 3天前 缓存

Browser Use Cloud v4 推出了一个网络代理平台,号称能够解决准确性和成本限制,使得规模化可靠网络代理成为可能,并提供 15 美元免费额度供试用。

0 人收藏 0 人点赞
#cost-efficiency

@joelniklaus: Codex 对大型模型过度优化:在 GLM 5.2 的 10 个框架中排名第 2,但在 Gemma-4 上跌至第 9!几乎……

X AI KOLs Timeline · 3天前 缓存

一项在 SWE-bench Pro 上比较 10 种编码智能体框架(harness)的研究表明,框架选择会显著影响 pass@1 和成本,并揭示厂商提供的框架对大型模型过拟合,无法迁移到较小的模型。

0 人收藏 0 人点赞
#cost-efficiency

接力而非路由:面向成本高效的大语言模型驱动进化的自适应种群交接

arXiv cs.CL · 3天前 缓存

本文介绍了RelayEvolve,一种无需训练的框架,用于成本高效的大语言模型驱动进化,该框架自适应地将种群从廉价模型交接给强模型,在固定推理预算下于各基准测试中取得高分。

0 人收藏 0 人点赞
#cost-efficiency

@FinanceYF5: Bloomberg 的AI模型定价图里,DeepSeek 直接被漏掉了。 有人一开始还以为是忘了加。 结果一看价格才明白——DeepSeek V4 Flash 输入只要 $0.14 / 百万token,输出 $0.28。 放在图上,其他模…

X AI KOLs Timeline · 4天前 缓存

这条推文指出彭博社的AI模型定价图遗漏了DeepSeek,因为DeepSeek V4 Flash的定价极低(输入$0.14/百万token,输出$0.28),放在图中会让其他模型显得处于“死亡区”。

0 人收藏 0 人点赞
#cost-efficiency

以100倍更便宜的开源模型在检索任务上击败GPT-5.6 Sol

Hacker News Top · 5天前 缓存

Neon与Castform合作展示了如何将RL后训练的开源权重模型与Lakebase Search相结合,以100倍更低的成本和延迟,在检索任务上击败GPT-5.6 Sol等前沿模型。

0 人收藏 0 人点赞
#cost-efficiency

@yibie: Databricks 用自己团队的真实任务测试各种编码工具——结论:同样的模型从不同 harness 调用,每任务成本差超过两倍,质量却相同。 《Pi:极简和高性能》 Pi 的极简主义是它的优势 AI 让代码变便宜,结果许多公司构建更大的…

X AI KOLs Timeline · 5天前 缓存

Databricks 的基准测试显示,相同模型通过不同 harness 调用时成本差异超两倍,而 Pi 作为极简编码 harness,以低成本实现高水平表现;Shopify 也通过 Pi 扩展 Autoresearch 提升效率。

0 人收藏 0 人点赞
#cost-efficiency

Pi 的极简主义是其优势

Hacker News Top · 6天前 缓存

Earendil 的 Pi 编码框架证明,极简设计在成本和性能方面优于复杂的替代方案,并以 Databricks 的基准测试和 Shopify 的案例研究作为证据。

0 人收藏 0 人点赞
#cost-efficiency

自然语言数学证明的高性价比自动评判

arXiv cs.CL · 6天前 缓存

本文研究廉价的开放权重大语言模型能否以远低于前沿模型的成本,同样可靠地评判自然语言数学证明。在 IMO-GradingBench 上,三个廉价评判模型在通过/不通过的一致性上与前沿模型相当,作者推荐“三者全部通过”的一致性规则以实现高性价比部署。

0 人收藏 0 人点赞
#cost-efficiency

研究公司称,DeepSeek的新AI模型是迄今为止知名模型中运行成本最低的(4分钟阅读)

TLDR AI · 2026-08-04

据报道,DeepSeek的新V4-Flash AI模型是已知模型中运行成本最低的,其成本比Anthropic的Claude Fable 5低105倍。

0 人收藏 0 人点赞
#cost-efficiency

@rohanpaul_ai:Qwen 3.8 Max 构建的3D物理场景比 Fable 5 更好,而运行成本约为其1/7。测试由 @ato… 完成

X AI KOLs Following · 2026-08-03 缓存

atomic.chat 的一项测试显示,Qwen 3.8 Max 在生成自包含的3D物理场景方面胜过 Fable 5,而每次运行成本约为其1/7。

0 人收藏 0 人点赞
#cost-efficiency

5美元换回一周的工作:我们如何用AI捕获碎片化的企业知识

Reddit r/AI_Agents · 2026-08-03

本文介绍了AI-My-Chats,一个使用AI以低成本(约每月5美元)从聊天和其他来源捕获碎片化企业知识的工具,支持开源模型和新的GitHub Issues集成。

0 人收藏 0 人点赞
#cost-efficiency

@wafer_ai:突发新闻 我们又上 Hacker News 了 我们找到了如何在……上以 3.8 倍吞吐量和 71% 更低成本服务 Kimi K3

X AI KOLs Following · 2026-08-02 缓存

Wafer 宣布,它可以在 AMD MI355X 上以比 B200 节点高 3.8 倍的吞吐量和低 71% 的成本服务 Kimi K3,并认为 AMD 的大容量显存和软件支持使其成为前沿模型中性价比最高的选择。

0 人收藏 0 人点赞
#cost-efficiency

@cline:虽然DeepSeek V4-Flash在每token价格上便宜得多,但这可能具有误导性,如果每项任务的总成本……

X AI KOLs Following · 2026-08-01 缓存

讨论了DeepSeek V4-Flash的每token价格与每项任务总成本的对比,引用了一份报告,称DeepSeek完成基准测试任务的成本比Fable低105倍。

0 人收藏 0 人点赞
#cost-efficiency

DeepSeek V4 Flash 0731 在 Hermes Agent 中运行一个提示,耗时32分钟,花费0.07美元,这个模型便宜到2美元可以用一整天。

Reddit r/singularity · 2026-08-01

DeepSeek V4 Flash 0731 因其在 Hermes Agent 中使用时成本极低而备受关注,一个提示仅需0.07美元,耗时32分钟,非常适合持续使用。

0 人收藏 0 人点赞
#cost-efficiency

@sama:我见识了你的摩尔定律,我再加20倍

X AI KOLs · 2026-07-31 缓存

Sam Altman 评论了 AI 模型成本的快速下降,指出仅四个月后,GPT-5.4 的成本就约为 Luna 的十三分之一,强调了相比摩尔定律 20 倍的改进。

0 人收藏 0 人点赞
#cost-efficiency

@FuckAnthropic: 做了对比分析,综合看,DeepSeek V4 Flash-0731 大致是一个 Opus 4.7 - 4.8 之间水平的模型,以极小激活规模进入了前沿 Agent 模型竞争区间,用约 1/12~1/60 的 token 成本进入前沿 Ag…

X AI KOLs Timeline · 2026-07-31

作者对比分析认为,DeepSeek V4 Flash-0731 在极小激活规模下达到 Opus 4.7-4.8 水平,以极低 token 成本进入前沿 Agent 模型区间,整体超越 GLM-5.2,但短板仍是困难仓库级编程和长时程工程。

0 人收藏 0 人点赞
#cost-efficiency

FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents

arXiv cs.AI · 2026-07-31 缓存

FinCacheServe is a system for dependency-consistent answer reuse in RAG serving over mutable enterprise documents, using document versions, evidence fingerprints, and tool fingerprints to invalidate caches. Evaluations show it skips over 53% of LLM calls with zero stale outputs, reducing GPU cost compared to versioned semantic caching.

0 人收藏 0 人点赞
#cost-efficiency

@OpenAI:我们致力于在成本效率、能力和速度方面推动模型前沿。从今天开始,我们正…

X AI KOLs · 2026-07-30 缓存

OpenAI 已将 GPT-5.6 Luna 的价格降低 80%,GPT-5.6 Terra 的价格降低 20%,并在 API 中为 GPT-5.6 Sol 推出了更快的选项,同时还调整了 Codex 和 ChatGPT Work 中的使用量计算方式。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈