分布式本地代理基准测试。
摘要
这篇文章介绍了一个针对AI代理的分布式基准测试网站,允许社区成员在各种本地模型和硬件配置上测试和共享结果。
我想要一个可以将所有测试工具与所有本地模型进行比较的设置。结果发现这是一个无底洞。例如,你不仅需要测试所有测试工具(确保它们配置正确),还需要测试所有模型,包括它们的各种版本,以及所有类型的硬件。每个人可以尽自己的一份力,但没有人能假装能全面进行所有可能的测试。为了解决这个问题,我创建了一个网站,每个人可以测试他们想要的配置,并在愿意的情况下共享结果。你可以在这里尝试:airbench.ai 有一个排行榜,我在其中分享我正在进行的测试,但我希望能用其他人的测试来填充它。https://airbench.ai/leaderboard?k=poL 我的希望是将此转变为一个完全分布式的代理基准测试。请告诉我你的想法。
相似文章
AA-AgentPerf-Local:在笔记本和工作站上对本地 AI 智能体进行基准测试
Artificial Analysis 开源了 AA-AgentPerf-Local,这是一款推理基准测试工具,通过重放真实智能体轨迹来测量智能体式 AI 在笔记本和工作站上的运行速度,并给出了 NVIDIA DGX Spark、RTX 5090、AMD Ryzen AI Halo 和 MacBook Pro M5 Pro 的初步测试结果。
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
跨尺度科学挑战的AI智能体基准测试
介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。
基准测试:万事万物,无处不在,一气呵成
介绍 Benchmark Agent,一个完全自主的系统,用于创建多样化的基准测试,只需最少的人工干预,支持跨领域的持续模型评估。
本地模型的行星级测试
正在进行一项针对本地运行AI模型的行星级测试,很可能是在不同环境中对其性能进行基准测试。