@maiff20: 拿25年高考数学卷给codex做了下,让他别访问网络,思考过程是拿python真的在做,而不是在模型里找历史信息比对,最后7m做完,得分150分,还指出答案自相矛盾的地方
摘要
用户测试OpenAI Codex解答2025年高考数学卷,限制其不联网、仅用Python进行真实计算,7分钟内完成并得满分150分,还指出了官方答案中的矛盾之处。
拿25年高考数学卷给codex做了下,让他别访问网络,思考过程是拿python真的在做,而不是在模型里找历史信息比对,最后7m做完,得分150分,还指出答案自相矛盾的地方 https://t.co/qjZThHx5KH
查看缓存全文
缓存时间: 2026/06/08 11:24
拿25年高考数学卷给codex做了下,让他别访问网络,思考过程是拿python真的在做,而不是在模型里找历史信息比对,最后7m做完,得分150分,还指出答案自相矛盾的地方 https://t.co/qjZThHx5KH
相似文章
Meet a mathematician solving previously unsolvable math problems with GPT-5.6
一位数学家使用Codex 5.6成功推翻了自己耗时三年试图证明的代数曲面猜想,模型能够自动派生子代理处理繁重计算,让他能专注于难题与生活。
@AISuperDomain: OpenAI专坑国内用户!发现好多Codex用户将推理级别开到Ultra的时候,其实给分配的模型是降智的gpt-5.5-mini。 但大部分用户根本没有注意到,只是无脑的跑loop。但检测方式也很简单,用下面的prompt就可以测试是否是…
帖子称OpenAI Codex在Ultra推理级别下给国内用户分配降智的gpt-5.5-mini模型,并提供检测prompt,呼吁用户扣1或扣2以统计针对国内用户的降智率。
@MaxForAI: 一个残酷的事实,AI的数学能力已经超过这个世界上99%的人类了。 @MenloVentures 合伙人,曾投资了Anthropic、OpenRouter的Deedy @deedydas 进行了一次测试。 他用刚结束的2026 年国际数学奥…
AI模型Fable、Sol、K3和Axiom在2026年国际数学奥林匹克竞赛中全部取得满分42/42的成绩,首次完全解决了该竞赛,且成本低廉。其中Claude Fable 5速度最快,GPT 5.6 Sol成本最低。
@FakeMaidenMaker: 这可能是目前最完整的 Codex 实战课——作者 Riley Brown 用 30 分钟,通过 7 个白领工作真实场景,一个个演示给你看如何用 Codex 提效: - 60 张收据照片自动 OCR 进 Excel - 扫两周邮件自动整理成…
这篇内容介绍了Codex这款AI代理产品的七大能力,通过7个白领工作真实场景(如OCR收据、整理邮件、制作PPT等)演示如何提升工作效率,是一个完整的实战教程。
@amiaoapp: 70年高考数学真题,被一个 GitHub 仓库一次性整理完了。 从 1952 → 2025,几乎全覆盖。 说夸张点,它像是把“高考数学的历史数据”直接打包成了一个数据库。 这个项目叫 gaokaomath,特点很直接: 历年高考数学真题 …
该项目 gaokaomath 在 GitHub 上整理了从 1952 年到 2025 年的全部高考数学真题 PDF,按年份清晰分类,持续更新,方便刷题和教学研究。