@paulg: Paweł Huryn 测试了模型在代码中发现植入错误的能力。成本随性能呈指数增长(注意...
摘要
Paweł Huryn 测试了 AI 模型在代码中发现植入错误的能力,揭示性能提升伴随着指数级增长的成本,如图表所示,其中 x 轴采用对数刻度。
Paweł Huryn 测试了模型在代码中发现植入错误的能力。成本随性能呈指数增长(注意 x 轴上的对数刻度)。我让 ChatGPT 叠加了一条趋势线。划算 = 在线之上。https://t.co/tI616AZGt2
查看缓存全文
缓存时间: 2026/09/23 16:08
Paweł Huryn测试了模型在代码中查找植入bug的能力。注意x轴的对数刻度,成本随性能提升呈指数增长。我使用ChatGPT叠加了趋势线。高于线的部分表示性价比高。https://t.co/tI616AZGt2
相似文章
AI安全扫描在10周内发现17个漏洞
基于AI的安全扫描在10周内在Perfetto的trace处理器中发现了17个漏洞,凸显了AI发现那些此前很少受到关注的长尾代码中漏洞的潜力。
质量差距不到2%但成本相差10倍:在相同的工具调用任务上测试5个模型[D]
一位开发者在工具调用任务上测试了五个AI模型,发现廉价模型的表现与Opus等昂贵模型相差不到2%,腾讯混元(Tencent's Hunyuan)成本低于1.50美元,而Opus为15美元,通过将简单任务路由到廉价模型,每日成本从40美元降至9美元。
@IntuitMachine:你的AI编程代理仅修复一个bug就烧掉2美元。你以为这是“廉价自动化”。以下是16,000次生产运行揭示的真相…
对AI编程代理成本的分析显示,代理工作流消耗的token数可达简单ChatGPT调用的3500倍,大部分浪费来自冗余的上下文加载。文章建议追踪重复的文件操作并使用高效模型降低成本。
模型越多越好。一个昂贵模型输给三个廉价模型,而且有篇论文探讨了这一点。
一篇关于混合智能体的论文(arxiv 2406.04692)表明,一组廉价开放模型利用去相关误差,在AlpacaEval 2.0上超越了GPT-4o。作者还分享了类似的真实世界发现:多个廉价模型比单个昂贵模型能发现更多漏洞。
你现在可以任意选择想要的bug数量了
这篇文章讨论了AI编码工具如何使软件中的缺陷检测变得几乎免费,同时强调了诸如工作量增加、修复缺陷的权衡,以及需要更好的管理策略来维持软件质量等挑战。