4B模型分类任务上60-82%的准确率波动:唯一变量是评估框架设计

Reddit r/LocalLLaMA 论文

摘要

一项研究显示,仅改变评估框架设计就能使4B参数模型的分类准确率从60%摆动到82%,凸显了评估方法的关键影响。

暂无内容
查看原文

相似文章

不是能力问题:LLM智能体层级间的控制敏感度是非单调的

arXiv cs.AI

本文通过实证测试了“更结构化的控制(harness)能普遍提高LLM智能体可靠性”这一常见假设,发现不同模型层级间存在非单调关系。它引入了HEAT-24基准,并揭示了严格的控制可能会损害前沿聊天模型,但有利于推理模型。