(吐槽;)) 让你的基准测试更贴近现实

Reddit r/LocalLLaMA 新闻

摘要

社区吐槽:呼吁AI模型基准测试应更贴近现实,考虑上下文大小、多模态特性、具体硬件配置和并行处理,而不仅仅是原始速度。

各位都在发布运行不同模型的优化方案——这很好,但请让这些基准测试更贴近现实,因为速度并非有效运行LLM的唯一因素。 1. 上下文大小是关键——在智能体、编程、检索增强生成(RAG)工作中,你需要合适的上下文大小,因此如果要进行基准测试,应进行长会话或大上下文的往返测试——这样你才能获得真正的真实环境。 2. 如果你测试多模态模型,应使用这些多模态特性——例如,通过图像处理进行基准测试——这将在现实场景中带来更多价值。 3. 注明你的具体硬件配置——所有显卡都有不同的变体。 4. 同时进行并行处理基准测试——在智能体工作中这也同样重要。 让你的帖子对社区更有用!
查看原文

相似文章