开源权重LLM在准确性上已迎头赶上(21分钟阅读)
摘要
一个新的基准ClinReg在真实的监管和临床试验任务上评估LLM,发现开源权重模型现在在准确性上与闭源模型相当,而成本仅为其一小部分。
开源权重LLM在监管和临床任务中的准确性现已与闭源模型持平,且成本显著更低。ClinReg基准测试显示,GLM 5.2和Kimi K3等模型的表现与GPT 5.6 Sol等顶级专有模型在一个标准差以内,而成本仅为后者的三分之一。不同模型展现出不同的错误特征,这突显了根据具体任务需求而非仅根据排名来选择模型的重要性。
查看缓存全文
缓存时间: 2026/07/31 18:27
# 开放权重LLM在准确性上已迎头赶上
Source: https://arjunbansal.substack.com/p/open-weight-llms-have-caught-up-on
[](https://substackcdn.com/image/fetch/$s_!3bYK!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F09aa5124-c79b-416b-9f96-8e62fecd859b_2332x1444.png)
在受监管的生命科学工作中——为上市后监测筛查文献、从临床文档中提取结构化数据并生成监管申报文件,以及基于临床试验数据生成表格、清单和图形(TLFs)——一个错误的答案不只是带来不便。系统评价中静默漏掉的一篇论文,或数据提取表中一个编造的值,都可能扩散到监管申报文件中。在生命科学背景下,由于风险极高,准确性最为重要。
人们普遍认为,只有闭源前沿模型才能被信任处理此类任务。我们对这一假设进行了检验——发现它已不再成立。
在生命科学领域,大部分基准测试的关注点都集中在发现阶段。结构预测有CASP ((https://predictioncenter.org/)),这个已有数十年历史的盲测被AlphaFold ((https://www.nature.com/articles/s41586-024-07487-w))变成了该领域的经典衡量标准。LAB-Bench ((https://www.futurehouse.org/research/lab-bench-measuring-capabilities-of-language-models-for-biology-research))和BixBench ((https://www.futurehouse.org/research/bixbench))测试智能体能否对生物学文献进行推理并运行真实的生物信息学分析——值得注意的是,BixBench难度很高,前沿模型在发布时得分仅在个位数到十几的百分比范围内。Coscientist ((https://www.nature.com/articles/s41586-023-06792-0))展示了LLM在实验室硬件上规划和执行自己的化学实验。这些工作很重要,但衡量的是流程的前端。资金和时间都花在流程后端:美国国会预算办公室 ((https://www.cbo.gov/publication/57126))指出,发现和临床前工作约占药物研发支出的31%——每款获批药物约4.74亿美元——而临床试验约为10.7亿美元,临床阶段约95个月,而临床前阶段为31个月。其他受监管行业已经开始衡量自己相应的后半段流程。Harvey的Legal Agent Benchmark ((https://www.h
相似文章
开源权重大语言模型与闭源大语言模型之间的差距
使用Artificial Analysis Intelligence Index和其他基准测试分析开源权重与闭源大语言模型之间的差距,发现在某些指标上差距正在缩小,但在其他指标上保持稳定。
估计开放权重大型语言模型的最坏情况前沿风险
OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。
18 款 LLM OCR 实测(7k+ 次调用):便宜/旧模型常吊打旗舰,完整数据集+框架已开源 [R]
对 18 款大模型在 OCR 任务上的全面评测(7k+ 次调用)发现,便宜或旧模型往往能以极低成本达到与旗舰模型相当的准确率,数据集与评测框架已完全开源。
压力测试医学大语言模型揭示基准准确率之外的潜在安全病理
本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。
@browser_use: 开源权重模型已正式追赶上。我们在BrowserCode中测试了GLM 5.2,得分接近Opus级别,且是迄今为止最便宜的模型……
开源权重模型已追赶上专有模型,GLM 5.2在浏览器代理任务中以低成本实现了接近Opus级别的得分。其他模型如Minimax M3和Kimi k2.7也显示出显著的改进。