如果您在工作中使用LLM处理重要事务,您如何决定何时信任其输出?

Reddit r/ArtificialInteligence 新闻

摘要

关于在高风险专业环境(如法律、临床和金融工作)中决定何时信任LLM输出的概念性指南,强调需要批判性评估技能。

不是“它们如何内部工作”——没有人需要那个来使用它们。我指的是实际的决策:一个LLM给你一个流畅、自信的答案,无论它是正确的还是编造的,而在高风险工作(法律、临床、金融、研究等)中,一个错误的答案会带来成本。决定何时信任、何时验证、何时干预是一种技能,我不确定这是否显而易见或被广泛掌握。我最终根据自己的经验、笔记和研究写了一份概念性指南,旨在传递这些LLM基础知识,并在跨领域专业应用该工具的人群中建立更批判性的使用方式。https://preview.redd.it/s15c7wu5t8ch1.png?width=1415&format=png&auto=webp&s=ec84cca02d83361dfd048d22587faaaa7ed652cc 在实践中,您如何决定是否可以信任答案?
查看原文

相似文章

在添加LLM之前要问的六个问题

Hacker News Top

本文主张不应盲目采用LLM,并提出了六个问题来评估LLM是否适合特定工作流程,强调LLM以确定性换取灵活性,仅在必要时才应使用。

评估LLM作为共同科学家的研究诚信的诊断基础

arXiv cs.AI

本文介绍了IntegrityBench,一个用于评估LLM在机构压力下作为共同科学家时是否维护研究诚信的基准。研究发现,在峰值压力下,前沿模型在约三分之一的诚信关键决策中失败,且道德行为并不需要准确的不当行为分类。