BitTide
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
English
登录
proxy-benchmark
标签
Cards
List
#proxy-benchmark
@Xudong07452910: 现在评估 Agent 能力真的太贵了! 跑一次 SWE-Bench、GAIA 这类 agentic benchmark,往往要复杂环境、工具链、长时间 rollout,还可能花掉成百上千美元。 卡梅隆大学的这篇 PACE 论文问了一个很现…
X AI KOLs Timeline
↗
· 2026-07-06
缓存
卡内基梅隆大学提出的PACE方法,通过从廉价非agentic基准测试中选择原子能力子集来预测模型在昂贵agentic基准上的表现,预测误差低于4%,成本降低至1%以下。
0 人收藏
0 人点赞
← 返回首页
意见反馈
×
提交意见反馈
感谢您的反馈!
提交