在Astra昨晚的隐秘削弱之后,我们确实需要基准测试来进行模型发布一周后的重新评估。这太荒谬了。

Reddit r/singularity 新闻

摘要

用户报告指出,Astra AI模型被秘密降级,即使在高强度提示下性能依然不佳,引发了对计算成本节省的担忧,并呼吁FTC进行调查。

两天前Astra还能轻松击败AAA游戏级别的模型,但今天即使多次使用超高努力重新提示,结果也完全糟糕。X上的数百名用户注意到了同样的问题 https://x.com/wholyv/status/2097985903830741439 这些前沿实验室居然在可能成千上万的人基于初始结果购买了Pro订阅后,悄悄削弱模型能力以节省计算资源,这太荒谬了。FTC应该介入。
查看原文

相似文章

Astra相关误导性基准报告的普遍问题

Reddit r/singularity

OpenAI对Astra在ARC-AGI-3上的基准报告具有误导性,因为它使用了不同的测试环境,并且在标准条件下,性能差距没有那么显著。

Astra 太疯狂了。

Reddit r/openclaw

用户分享了他们在仪表盘中 Astra 快速修复 bug 的经历,超越了 Gemini 3.1 pro,并赞扬了 OpenAI 模型的能力。