开源权重LLM在准确性上已迎头赶上(21分钟阅读)

TLDR AI 新闻

摘要

一个新的基准ClinReg在真实的监管和临床试验任务上评估LLM,发现开源权重模型现在在准确性上与闭源模型相当,而成本仅为其一小部分。

开源权重LLM在监管和临床任务中的准确性现已与闭源模型持平,且成本显著更低。ClinReg基准测试显示,GLM 5.2和Kimi K3等模型的表现与GPT 5.6 Sol等顶级专有模型在一个标准差以内,而成本仅为后者的三分之一。不同模型展现出不同的错误特征,这突显了根据具体任务需求而非仅根据排名来选择模型的重要性。
查看原文
查看缓存全文

缓存时间: 2026/07/31 18:27

# 开放权重LLM在准确性上已迎头赶上 Source: https://arjunbansal.substack.com/p/open-weight-llms-have-caught-up-on [](https://substackcdn.com/image/fetch/$s_!3bYK!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F09aa5124-c79b-416b-9f96-8e62fecd859b_2332x1444.png) 在受监管的生命科学工作中——为上市后监测筛查文献、从临床文档中提取结构化数据并生成监管申报文件,以及基于临床试验数据生成表格、清单和图形(TLFs)——一个错误的答案不只是带来不便。系统评价中静默漏掉的一篇论文,或数据提取表中一个编造的值,都可能扩散到监管申报文件中。在生命科学背景下,由于风险极高,准确性最为重要。 人们普遍认为,只有闭源前沿模型才能被信任处理此类任务。我们对这一假设进行了检验——发现它已不再成立。 在生命科学领域,大部分基准测试的关注点都集中在发现阶段。结构预测有CASP ((https://predictioncenter.org/)),这个已有数十年历史的盲测被AlphaFold ((https://www.nature.com/articles/s41586-024-07487-w))变成了该领域的经典衡量标准。LAB-Bench ((https://www.futurehouse.org/research/lab-bench-measuring-capabilities-of-language-models-for-biology-research))和BixBench ((https://www.futurehouse.org/research/bixbench))测试智能体能否对生物学文献进行推理并运行真实的生物信息学分析——值得注意的是,BixBench难度很高,前沿模型在发布时得分仅在个位数到十几的百分比范围内。Coscientist ((https://www.nature.com/articles/s41586-023-06792-0))展示了LLM在实验室硬件上规划和执行自己的化学实验。这些工作很重要,但衡量的是流程的前端。资金和时间都花在流程后端:美国国会预算办公室 ((https://www.cbo.gov/publication/57126))指出,发现和临床前工作约占药物研发支出的31%——每款获批药物约4.74亿美元——而临床试验约为10.7亿美元,临床阶段约95个月,而临床前阶段为31个月。其他受监管行业已经开始衡量自己相应的后半段流程。Harvey的Legal Agent Benchmark ((https://www.h

相似文章

估计开放权重大型语言模型的最坏情况前沿风险

OpenAI Blog

OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。