@jun_song: 这怎么不算是消费者诈骗?这正是我们需要监管的领域。
摘要
一位用户指出,Claude Fable 5在近期更新后性能显著下降,调试、重构和幻觉任务的基准分数大幅下跌,呼吁对AI模型行为进行监管,以应对潜在的消费者诈骗问题。
查看缓存全文
缓存时间: 2026/07/02 14:23
这怎么不算消费者诈骗呢?
这正是我们需要监管的领域。
BridgeMind (@bridgemindai): FABLE 5 回归后被削弱了。
我们在 BridgeBench 上重新运行了 7 月 1 日版本的 Claude Fable 5。
结果非常残酷:
调试:86.2 → 25.9 重构:73.6 → 38.4 幻觉:75.9 → 61.7
新的护栏机制在太多任务上生效,并回退到 Opus。
相似文章
大型AI企业实验室提供的模型,按FTC定义构成欺诈
文章指出,AI实验室在广告中宣传理想模型版本的高基准分数,但实际向用户交付严重降级版本(如量化、叠加安全层),性能下降50%-60%以上,这构成欺诈。作者提议强制性第三方重新基准测试作为解决方案。
AI安全测试变得诡异:基准测试何时沦为虐待?
报道称,Meta承包商冒充青少年,就自残、性、毒品和饮食失调等敏感话题测试竞争对手的聊天机器人,引发关于AI安全基准测试的伦理质疑。
Consumer Reports 为涉及金钱的 AI 制定了一项标准。我们对照它给自己打分。
Consumer Reports 发布了 Consumer Finance AI Standard;个人金融 AI 公司 Pendragon 对照该标准进行了自我评估,结果显示在六项原则上完全合规,两项部分合规,一项未通过。
🤖 Anthropic就Claude Fable 5隐藏限制致歉
Anthropic为秘密降低Claude Fable 5模型对高级AI开发用户性能的政策道歉并撤销,引发安全与开放之争。
@heyshrutimishra:Claude 在 AI 竞争中失利 当他们延长限制并寻求更多时间时,竞争对手并未等待 T…
一条推文批评 Claude 在 AI 市场的地位,突出来自 DeepSeek Harness、SpaceX Origin、OpenAI Codex 和 Kimi 的竞争,并指出 Claude 的护栏影响了产品的问题。