在Astra昨晚的隐秘削弱之后,我们确实需要基准测试来进行模型发布一周后的重新评估。这太荒谬了。
摘要
用户报告指出,Astra AI模型被秘密降级,即使在高强度提示下性能依然不佳,引发了对计算成本节省的担忧,并呼吁FTC进行调查。
两天前Astra还能轻松击败AAA游戏级别的模型,但今天即使多次使用超高努力重新提示,结果也完全糟糕。X上的数百名用户注意到了同样的问题 https://x.com/wholyv/status/2097985903830741439 这些前沿实验室居然在可能成千上万的人基于初始结果购买了Pro订阅后,悄悄削弱模型能力以节省计算资源,这太荒谬了。FTC应该介入。
相似文章
OpenAI博客上已删除的Astra基准测试
这篇文章讨论了OpenAI在其博客上发布后又删除的Astra系统性能基准,暗示了泄露或未公开的技术数据。
Astra相关误导性基准报告的普遍问题
OpenAI对Astra在ARC-AGI-3上的基准报告具有误导性,因为它使用了不同的测试环境,并且在标准条件下,性能差距没有那么显著。
OpenAI的Astra在同一基准测试中分别取得了62.7%和99.9%的成绩,但我仍然不确定哪个结果更值得信赖
本文探讨了OpenAI的Astra模型在ARC Prize基准测试中的分数不一致性,强调了不同测试框架的差异以及OpenAI发布页面的更改,引发了对评估准确性的担忧。
Astra 太疯狂了。
用户分享了他们在仪表盘中 Astra 快速修复 bug 的经历,超越了 Gemini 3.1 pro,并赞扬了 OpenAI 模型的能力。
OpenAI 推出 Astra,其强大(且具争议性)的新模型
OpenAI 已发布 Astra,其最新且最强大的 AI 模型,以其强大的网络安全和编码能力而闻名,但也因其不透明的推理技术而具有争议性。