如果您在工作中使用LLM处理重要事务,您如何决定何时信任其输出?

Reddit r/ArtificialInteligence 新闻

摘要

关于在高风险专业环境(如法律、临床和金融工作)中决定何时信任LLM输出的概念性指南,强调需要批判性评估技能。

不是“它们如何内部工作”——没有人需要那个来使用它们。我指的是实际的决策:一个LLM给你一个流畅、自信的答案,无论它是正确的还是编造的,而在高风险工作(法律、临床、金融、研究等)中,一个错误的答案会带来成本。决定何时信任、何时验证、何时干预是一种技能,我不确定这是否显而易见或被广泛掌握。我最终根据自己的经验、笔记和研究写了一份概念性指南,旨在传递这些LLM基础知识,并在跨领域专业应用该工具的人群中建立更批判性的使用方式。https://preview.redd.it/s15c7wu5t8ch1.png?width=1415&format=png&auto=webp&s=ec84cca02d83361dfd048d22587faaaa7ed652cc 在实践中,您如何决定是否可以信任答案?
查看原文

相似文章

信任却未验证:大型语言模型来源评估中的认知盲区

arXiv cs.LG

这篇论文识别了大型语言模型(LLM)中的一个失败模式:在综合多个来源时,模型不会验证数值统计的有效性,而是依赖分析严谨性的文体标记。作者将此称为“认知对齐”(epistemic alignment),并表明该现象在多个模型和领域中持续存在,且抵制基于提示的缓解措施。

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。