cost-analysis

标签

Cards List
#cost-analysis

在我的编码代理上,一个35B模型以95%对53%击败了120B模型。构建你自己的基准测试。

Reddit r/AI_Agents ↗ · 9小时前

一位开发者为编码AI代理构建了自定义基准测试,并发现当测试框架优化时,一个35B参数模型优于120B参数模型,凸显了定制化评估相对于通用规格的重要性。

0 人收藏 0 人点赞
#cost-analysis

这很有趣。我终于可以跟进一个 RemindMe 评论了。今年3月25日,六个月前,没有模型在 ARC-AGI-3 上能拿到 1%。一位评论者问我们是否能在 $2 成本下看到 75%。现在成本仍然很高($26.1k),但 GPT-6-Astra-Max 达到了 62.7%(无需 harness!)

Reddit r/singularity ↗ · 22小时前

GPT-6-Astra-Max 在 ARC-AGI-3 基准测试中在六个月内达到了 62.7%,并且使用记忆适配器后,基准测试已饱和,尽管成本仍然很高,这表明 AI 模型朝着更便宜的趋势发展。

0 人收藏 0 人点赞
#cost-analysis

@omarsar0: 结果很有趣。这就是为什么我预计更多智能体工作负载将运行在混合模型上。来自@TheUnbiasedCo的Pareto 26.9...

X AI KOLs Timeline ↗ · 昨天 缓存

文章讨论了一项性能评估,其中混合AI模型Pareto 26.9在智能体任务中与GPT-6 Astra并列第一,每个成功任务的成本约为其他模型的三分之一,并且完成速度快于其他模型,这表明混合模型在智能体工作负载方面具有潜力。

0 人收藏 0 人点赞
#cost-analysis

@theo_the_dev: 突发:Opus 5.5 在 Medium 上刚刚完胜 GPT-6 Astra Ultra。为 @threejs 游戏花费了 $21,365 的 token。只需比较这两个……

X AI KOLs Following ↗ · 2天前 缓存

一条推文称,Opus 5.5 在 three.js 游戏开发中优于 GPT-6 Astra Ultra,涉及高额 token 成本和计算时间,且有人类参与。

0 人收藏 0 人点赞
#cost-analysis

这个交互式岛屿使用Opus 5.5在8小时内构建

Reddit r/singularity ↗ · 2天前

Dan Greenheck使用Opus 5.5和简单的提示在8小时内构建了一个交互式岛屿,具有动画和效果,令牌成本为$1,874.40。

0 人收藏 0 人点赞
#cost-analysis

@mattshumer_: Jacob 发给我的一张截图,显示了他前几天进行的一次 Claude 运行的费用。我几乎不好意思说它花了多少钱……

X AI KOLs Following ↗ · 2天前 缓存

一位用户分享了使用 26 个 Claude Opus 5.5 代理一夜之间构建复杂多人游戏的高昂费用,展示了 AI 在游戏开发中的应用。

0 人收藏 0 人点赞
#cost-analysis

@paulg: Paweł Huryn 测试了模型在代码中发现植入错误的能力。成本随性能呈指数增长(注意...

X AI KOLs Following ↗ · 3天前 缓存

Paweł Huryn 测试了 AI 模型在代码中发现植入错误的能力,揭示性能提升伴随着指数级增长的成本,如图表所示,其中 x 轴采用对数刻度。

0 人收藏 0 人点赞
#cost-analysis

StudentBench: 人工智能与人类辅导在GRE学习成效上相当

Hugging Face Daily Papers ↗ · 3天前 缓存

StudentBench研究发现,人工智能辅导在GRE题目上的学习成效与人类辅导相当,其中一个人工智能导师以显著更低的成本取得了类似的结果。

0 人收藏 0 人点赞
#cost-analysis

Opus 5.5 在 ArtificialAnalysis.ai 的所有三项性能指标中占主导地位

Reddit r/artificial ↗ · 3天前

Opus 5.5 在 ArtificialAnalysis.ai 的所有三项性能指标中占主导地位,并提供了相较于 Fable 5.1 的高性价比替代选择。

0 人收藏 0 人点赞
#cost-analysis

299个真实用户意图测试Jev与生产基线的对比。结果如下。

Reddit r/AI_Agents ↗ · 3天前

文章报告了glm-4-flash和TypeSafe Jev在299个真实用户意图上的性能比较,显示glm-4-flash的准确率更高,但TypeSafe Jev的速度更快且成本更低。

0 人收藏 0 人点赞
#cost-analysis

Opus 5.5 与 GPT-6 Astra/Sol 的所有基准测试对比

Reddit r/singularity ↗ · 3天前

如图所示,在基准测试对比中,Opus 5.5 的表现优于 GPT-6 Astra 和 Sol,但成本更高。

0 人收藏 0 人点赞
#cost-analysis

Opus 5.5 在 Terminal-Bench 4.0 上的成本与性能对比

Reddit r/singularity ↗ · 4天前

本文评估了 Opus 5.5 AI 模型在 Terminal-Bench 4.0 基准测试中的成本效益和性能。

0 人收藏 0 人点赞
#cost-analysis

@ProfTomYeh: 你能手算这些agentic AI数学题吗?现在有点难了。下载PDF:http://byhand.ai/tokens-…

X AI KOLs Timeline ↗ · 4天前 缓存

Prof. Tom Yeh分享了一份PDF,包含agentic AI主题的数学题,如令牌成本和系统提示,鼓励手算以学习。

0 人收藏 0 人点赞
#cost-analysis

多轮编程代理中上下文压缩网关的经验性成本归属研究

arXiv cs.CL ↗ · 4天前 缓存

本文实证分析了多轮编程代理中上下文压缩网关的成本节省情况,发现工具模式过滤提供固定令牌节省,而内容压缩呈二次方节省但可能被召回抵消,为成本优化提供了可操作的见解。

0 人收藏 0 人点赞
#cost-analysis

群体扩展(13分钟阅读)

TLDR AI ↗ · 4天前 缓存

本文分析了大型AI代理群体的能力和扩展动态,引用了OpenAI的最新示例,并讨论了它们作为推理扩展新形式的潜力。

0 人收藏 0 人点赞
#cost-analysis

在Jev发布后我发现的607个AI代理用例

Reddit r/AI_Agents ↗ · 4天前

作者在Jev发布后收集了607个AI代理用例,强调演示和生产就绪应用之间的区别,并建立了ShipWithJev.com来编目这些用例。

0 人收藏 0 人点赞
#cost-analysis

AI不住在云端,而是生活在地球上。

Reddit r/artificial ↗ · 5天前

本文批评了忽视AI有形环境影响的现象,强调AI依赖能源、水和硬件等物理资源,并呼吁将行星管理纳入AI开发中。

0 人收藏 0 人点赞
#cost-analysis

回复评论区的问题 - 如何读取游戏状态?我们并没有让Jev查看截…

X AI KOLs Timeline ↗ · 6天前 缓存

一位开发者解释使用名为Jev的AI代理玩Slay the Spire 2,通过C# Mod提取游戏数据并使用Python API进行决策,同时指出高token成本和一般的性能。

0 人收藏 0 人点赞
#cost-analysis

@corbin_braun: 所以逻辑上AI编辑器确实需要一些时间,可能每视频5-6小时。成本方面大约是30美元的代币费用,比较…

X AI KOLs Timeline ↗ · 6天前 缓存

一条推文比较了使用AI视频编辑器与人类编辑的时间和成本。AI编辑器每视频需要5-6小时和30美元代币费用,而人类编辑需要3-5天并花费250美元,指出AI能处理任何编辑风格。

0 人收藏 0 人点赞
#cost-analysis

@yibie: Jev 生态系统 72 小时:从 46 到 160 Jev 将“判断”转化为一个足够廉价可直接在代码中调用的原语…

X AI KOLs Timeline ↗ · 2026-09-18 缓存

在 72 小时内,Jev 生态系统从 46 个项目扩展到 160 个,重点包括上下文压缩、平台集成以及金融交易等新领域,同时围绕其新颖性和实现方式展开了辩论。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈