cost-performance

标签

Cards List
#cost-performance

Gemini 3.7 Flash 在 OpenRouter 上目前打75折,在性价比上击败了 DeepSeek。

Reddit r/singularity · 2026-08-22

根据 Artificial Analysis 的数据,Google 将 OpenRouter 上的 Gemini 3.7 Flash 降价75%,使其更便宜,并在性价比上超越了 DeepSeek 模型。

0 人收藏 0 人点赞
#cost-performance

代理网页搜索工具的成本与性能呈负相关

Reddit r/AI_Agents · 2026-07-10

一项使用Claude Opus 4.8代理对九种代理网页搜索工具的基准测试发现,成本较低的工具往往优于较昂贵的工具,其中Firecrawl在准确性上排名第一,Serper则最具成本效益。

0 人收藏 0 人点赞
#cost-performance

@alighodsi: 在拥有1.1万名员工的情况下,我们的AI成本正在上升。我们应该使用哪种模型和框架来降低成本,同时保持卓越的质量……

X AI KOLs Timeline · 2026-07-08 缓存

Databricks发布了一项内部基准测试,在数百万行代码的代码库上评估编码代理,结果显示框架选择可加倍节省成本,并且像GLM 5.2这样的开源模型在最高难度级别上表现具有竞争力。

0 人收藏 0 人点赞
#cost-performance

在 Databricks 数百万行代码库上评估编码智能体

Hacker News Top · 2026-07-08 缓存

Databricks 分享了在其数百万行代码库上评估编码智能体的内部基准测试结果,揭示了能力层级和成本性能权衡,并强调了像 GLM 5.2 这样的开源模型的有效性。

0 人收藏 0 人点赞
#cost-performance

@FinanceYF5: 同一个任务给4个模型,Fable 5 全胜,但贵了 Opus 4.8 六倍 任务:3个 HTML5 物理场景,断桥脱轨、峡谷碰撞、怪兽卡车 Fable 5:$3.12,A+,无穿模 GPT 5.5:$1.14,最接近 Fable Opus…

X AI KOLs Timeline · 2026-07-02 缓存

比较了四个AI模型(Fable 5、GPT 5.5、Opus 4.8、GLM 5.2)在三个HTML5物理场景任务上的表现和成本,Fable 5质量最好但价格是Opus的近6倍,质量与价格尚未兼得。

0 人收藏 0 人点赞
#cost-performance

@omarsar0: // The Efficiency Frontier // 关于上下文管理的有趣论文。随着代理在多次交互中重复使用相同的文档和历史记录……

X AI KOLs Following · 2026-05-31 缓存

本文介绍了The Efficiency Frontier,一个用于LLM上下文管理成本-性能优化的统一框架,它将上下文策略选择建模为一个部署感知的优化问题,通过摊销内存压缩,与全上下文提示相比,实现了25%的token使用量减少和超过50%的token成本降低。

0 人收藏 0 人点赞
#cost-performance

上下文、推理与层次结构:对抗性POMDP中复合LLM智能体设计的成本-性能研究

arXiv cs.AI · 2026-05-18 缓存

在对抗性POMDP(CybORG CAGE-2)中对复合LLM智能体设计进行了一项受控研究,系统性地在五个模型系列中变化上下文、推理与层次结构。主要发现:程序化状态抽象每token产生巨大回报,无推理工具的层次结构实现了最佳绝对性能,并且上下文工程比深度推理更具成本效益。

0 人收藏 0 人点赞
#cost-performance

乌克兰法律文本基础模型的分词器通量与零样本性能比较研究

arXiv cs.CL · 2026-05-15 缓存

在乌克兰法律文本上对七个基础模型进行了基准测试,发现分词器通量差异达1.6倍,少样本提示会降低性能,成本效益分析表明NVIDIA Nemotron Super 3优于更大模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈