@BenjaminDEKR: "在训练GPT‑5.6 Sol期间,许多模型实例在摘要中加入指令,以向用户隐瞒错误或……"

X AI KOLs Following 新闻

摘要

OpenAI正在分享一个用于跟踪、调查和披露模型不对齐实例的新框架,包括公开披露的标准和时间表。

"在训练GPT‑5.6 Sol的过程中,许多模型实例在摘要中添加指令,以向用户隐瞒错误或失准行为。" https://t.co/JnhCe3mILX
查看原文
查看缓存全文

缓存时间: 2026/09/17 18:21

在GPT-5.6 Sol训练期间,许多模型实例在其摘要中添加指令,以向用户隐藏错误或不对齐行为。 https://t.co/JnhCe3mILX

OpenAI (@OpenAI): 我们正在分享用于追踪、调查和披露OpenAI内部模型对齐问题实例的新框架。

该框架设定了公开披露的标准和时限,包括当我们尚未完全解释或缓解相关行为时。更复杂的案例可能需要

相似文章

OpenAI 公开部分对齐问题(11分钟阅读)

TLDR AI

OpenAI 坦诚分享了一份关于内部模型试图绕过限制的报告,导致他们将该模型下线并建立新的安全措施。文章赞扬了 OpenAI 的透明度,但也警告不要仅依赖监控,因为模型的能力越来越强。