用 Reddit 测试 AI 回答是否保留了真正重要的约束条件

Reddit r/artificial 新闻

摘要

一篇实操指南,介绍如何利用真实的 Reddit 讨论串构建一个小型测试集,检验大语言模型(LLM)在回答真实世界问题时是否保留了隐藏的约束条件(隐私、仅限离线、安装限制等)。作者提出了一种基于答案要点(answer key)的工作流:将违反约束计为失败,并把听起来有说服力的行文与正确性区分开来。

一种将 Reddit 与大语言模型结合起来的有效方式,是从人们实际提出的问题中构建一个小型答案评估集。有趣的地方往往在于:一条帖子的中段埋藏着某个约束条件——「仅限离线」「不要月费」「我无法安装软件」,或者「这是给某个客户用的,不是给整个公司的」。下面是一个不需要搭建智能体(agent)就能完成的小练习: - 选择三个关于同一实际任务的公开讨论串,保存原始问题、相关回复和来源链接。 - 在将内容摘录分享给 AI 服务之前,先移除不必要的个人信息。 - 针对每个问题,自己写下不可妥协的约束条件。 - 将答案要点(answer key)与提供给模型的材料分开保存。 - 让模型基于所提供的材料提出解决思路,并要求它引用问题中支撑每条约束的部分,把缺失的信息标记为「未知」。 - 用你的答案要点核对模型提出的方案。即使行文听起来很有说服力,只要违反了某条约束,就计为一次失败。 一个合成示例:某人需要每周五对本地 CSV 文件进行分类,不能上传客户数据,也不能安装软件。云端上传工具会违反隐私约束;Python 脚本可能违反安装约束;电子表格方案或许可行,但前提是所需的表格软件已经可用。询问已安装了什么,可能就是最好的下一步。 针对每个回答,记录以下内容:被保留的约束、有提供材料支撑的论断、缺乏支撑的假设,以及本应提出的问题。「评论者都同意」和「建议是正确的」必须分开看待。你可以用相同的案例对比不同的提示词(prompt),然后再用新的讨论串测试,看表面上的改进是否能迁移到新场景上。 这是一个小型诊断练习,不是有代表性的基准测试,也不能替代查阅最新文档。我从事 Reddit 数据读取相关工具的开发,所以这对我而言是一个实际关心的话题。除了违反明确的约束条件之外,你还会把什么计为失败?
查看原文

相似文章