模型路由可能成为隐形的AI安全策略

Reddit r/ArtificialInteligence 新闻

摘要

OpenAI的GPT-5.6引入了模型路由功能,当良性工作被阻止时,会将用户重定向到能力较低的模型,这引发了透明度问题:用户是否应该知道哪个模型产生了他们的答案。

OpenAI表示,GPT-5.6使用了更强的安全防护措施,并在良性工作被阻止时提供在能力较低的模型上重试的路径。这听起来很实用,但会引发一个微妙的透明度问题:用户可能向一个系统提问,却从另一个能力层级的模型得到回答。路由会影响准确性、拒绝行为、工具访问,甚至答案背后的假设。如果切换是隐形的,用户就无法复现或正确评估结果。是否每个答案都应当披露生成它的确切模型和安全路由?这种披露会困惑大多数用户,还是对专业工作至关重要?审计日志中应保留多少路由历史?
查看原文

相似文章

模型路由的第一性原理

Hacker News Top

本文概述了有效AI模型路由的第一性原理,强调保持模型差异化、限制池大小、使用相对实际基准以及评估过去的路由决策以实现更好的性能。