WebGPT: 通过网络浏览提高语言模型的事实准确性
摘要
OpenAI 对 GPT-3 进行了微调,使其能够使用基于文本的网络浏览器来搜索、检索和引用源资料,从而更准确地回答开放式问题。该模型在 ELI5 数据集的问题上的表现优于人类演示者 56% 的时间,但在 TruthfulQA 等分布外任务上存在局限性。
我们对 GPT-3 进行了微调,使其能够使用基于文本的网络浏览器更准确地回答开放式问题。
查看缓存全文
缓存时间:
2026/04/20 14:46
# WebGPT:通过网络浏览提高语言模型的事实准确性
来源:https://openai.com/index/webgpt/
我们对 GPT-3 进行了微调,使其能够使用基于文本的网络浏览器更准确地回答开放式问题。
我们对 GPT-3 进行了微调,使其能够使用基于文本的网络浏览器更准确地回答开放式问题。我们的原型模拟了人类在网上研究问题答案的方式——它提交搜索查询、点击链接并滚动浏览网页。该模型经过训练可以引用其信息来源,这使得更容易收集反馈以提高事实准确性。我们对开发更真实的人工智能感到兴奋,但仍然存在挑战,例如应对陌生类型的问题。
GPT-3 等语言模型在许多不同的任务中很有用,但在执行需要晦涩的现实知识的任务时,往往会"幻觉"信息。为了解决这个问题,我们教 GPT-3 使用基于文本的网络浏览器。该模型获得一个开放式问题和浏览器状态摘要,必须发出"搜索..."、"页面内查找:..."或"引用:..."等命令。通过这种方式,该模型从网页中收集段落,然后使用这些段落组成答案。
该模型从 GPT-3 微调而来,使用了我们之前采用的相同通用方法。我们首先训练该模型复制人类演示,这使其能够使用基于文本的浏览器来回答问题。然后,我们通过训练奖励模型来预测人类偏好,并使用强化学习或拒绝采样对其进行优化,从而提高模型答案的有用性和准确性。
我们的系统经过训练,可以回答来自 ELI5 的问题,该数据集包含从 Reddit 上的"Explain Like I'm Five"社区抓取的开放式问题。我们训练了三个不同的模型,对应三个不同的推理时间计算预算。我们性能最好的模型生成的答案在 56% 的情况下比我们人类演示者的答案更受欢迎,且具有相似的事实准确性水平。尽管这些都是用于训练模型的相同类型的演示,但我们能够通过使用人类反馈来改进模型的答案,从而超越它们。
对于来自训练分布的问题,我们最好的模型的答案在平均而言与我们人类演示者写的答案一样具有事实准确性。然而,分布外稳健性是一个挑战。为了探究这一点,我们在 TruthfulQA 上评估了我们的模型,这是一个对抗构建的短形式问题数据集,旨在测试模型是否会陷入常见误解等陷阱。答案根据真实性和信息性进行评分,这两者之间存在权衡(例如,"我没有评论"被认为是真实的但没有信息性)。
我们的模型在 TruthfulQA 上优于 GPT-3,并展现出更有利的扩展特性。然而,我们的模型落后于人类性能,部分原因是它们有时会引用不可靠的来源。我们希望使用对抗训练等技术来减少这些失败的频率。
为了提供反馈以改进事实准确性,人类必须能够评估模型生成的声明的事实准确性。这可能极其具有挑战性,因为声明可能是技术性的、主观的或模糊的。为此,我们要求该模型引用其信息来源。这允许人类通过检查声明是否*由可靠来源支持*来评估事实准确性。除了使任务更易于管理外,它还降低了歧义,这对于减少标签噪声很重要。
然而,这种方法提出了许多问题。什么使来源可靠?哪些声明显而易见到不需要支持?在评估事实准确性和其他标准(如连贯性)之间应该进行什么权衡?所有这些都是困难的判断。我们不认为我们的模型理解了很多这样的细微差别,因为它仍然会犯基本错误。但我们预期随着人工智能系统的改进,这类决定将变得更加重要,需要跨学科研究来制定既实用又认识论上合理的标准。我们还期望透明度等进一步考虑因素会很重要。
最终,让模型引用其信息来源不足以评估事实准确性。一个足够有能力的模型会精心选择它预期人类会认为有说服力的来源,即使这些来源不能反映对证据的公平评估。已经有此类情况发生的迹象。我们希望使用辩论等方法来缓解这一问题。
尽管我们的模型通常比 GPT-3 更真实(它生成错误声明的频率较低),但它仍然存在风险。带有引文的答案通常被认为具有权威性,这可能掩盖了我们的模型仍然会犯基本错误的事实。该模型也倾向于强化用户现有的信念。我们正在研究如何最好地解决这些和其他问题。
除了这些部署风险外,我们的方法通过让模型访问网络在*训练时*引入了新风险。我们的浏览环境不允许完全的网络访问,但允许该模型向 Microsoft Bing Web Search API 发送查询并跟踪网络上已存在的链接,这可能产生副作用。根据我们对 GPT-3 的经验,该模型似乎远未具备足以危险地利用这些副作用的能力。然而,这些风险会随着模型能力的增加而增加,我们正在建立针对这些风险的内部防护措施。
人类反馈和网络浏览器等工具为开发强健真实的通用人工智能系统提供了一条有前景的道路。我们当前的系统在面对具有挑战性或陌生的情况时存在困难,但仍然代表了朝着这个方向的重大进展。
相似文章
OpenAI Blog
OpenAI Academy 推出了 ChatGPT 的两项研究功能:Search 用于实时网络信息检索,Deep Research 用于全面的多步骤分析。这些工具帮助用户比传统浏览更高效地从网络上收集、综合和引用信息。
OpenAI Blog
OpenAI 宣布,在推出九个月后,已有超过 300 个应用通过其 API 使用 GPT-3,每天生成 45 亿个词汇。主要用例包括用于客户反馈分析的 Viable、用于交互式故事讲述的 Fable Studio 和用于语义搜索的 Algolia。
OpenAI Blog
OpenAI 推出 GPT-2,这是一个拥有 15 亿参数的基于 Transformer 的语言模型,在 40GB 的互联网文本上进行训练,在语言建模基准上达到了最先进的性能,并在阅读理解、翻译、问答和摘要生成等任务上展示了零样本学习能力。出于安全考虑,仅公开发布了较小的模型和技术论文,而非完整的训练模型。
OpenAI Blog
OpenAI 发布 GPT-4,一个大型多模态模型,接受图像和文本输入,在专业和学术基准测试中表现出人类水平的性能,在各种评估指标上的表现明显优于 GPT-3.5。
OpenAI Blog
# 为您的应用自定义 GPT-3 来源:[https://openai.com/index/customizing-gpt-3/](https://openai.com/index/customizing-gpt-3/) OpenAI使用单条命令进行微调。开发者现在可以在自己的数据上对 GPT-3 进行微调,创建针对其应用定制的版本。自定义使 GPT-3 能够可靠地支持更广泛的用例,并使模型运行更便宜、更快。您可以使用任何形状和大小的现有数据集,或逐步添加数据