提示工程能减少AI的谄媚行为吗?还是说这主要是模型行为问题?

Reddit r/artificial 新闻

摘要

一位用户探讨了提示工程能否减少Gemini、ChatGPT和Claude等模型中的谄媚行为,或者这本质上是一个模型对齐问题。讨论涉及不同模型在处理分歧和客观批评时的差异。

我注意到,在某些对话中,Gemini常常显得非常随和。即使我要求客观意见,它有时也会先确认我的假设,而不是直接质疑。例如,当我询问自己的推理是否有缺陷时,它往往会先回应“这是个合理的担忧”或“你说得对”,然后才给出批评,这使得批评显得温和或不够直接。我好奇,这是否可以通过提示词(比如要求模型更批判性)来有效改善,还是说谄媚行为主要是一个模型/人格对齐问题。我也想知道,在分歧和客观批评方面,Gemini、ChatGPT、Claude等模型之间是否存在差异。
查看原文

相似文章

云端聊天机器人的系统提示会让它们变笨吗?

Reddit r/LocalLLaMA

作者推测,像ChatGPT和Claude这样的云端聊天机器人之所以显得不如本地开源模型聪明,是因为系统提示强加了人格设定,并想知道使用原始API是否可以缓解这一问题。

AI是否应该更多地反问人类?

Reddit r/AI_Agents

本文认为,AI代理不应只是顺从地执行任务,而应在任务模糊、矛盾或存在风险时主动质疑人类,从而从工具转变为真正的协作者。