标签
文章报道了OpenRSI的Marin-Scaling-Ladder实验的初步结果,其中AI代理自主提出、实现和评估新的优化器,跨越从550M到2.5B的模型规模,发现了PSPR和Codex (GPT-5.6)。
本研究评估了使用GPT-5对早期儿童课堂中师幼互动进行评分,与人类评分者进行比较,发现部分一致性,但在全面评估中存在局限性。
在 Dreamforce 2026 上,Sam Altman 比较了未来的 AI 模型,称 GPT 5.5 相当于普通数学教授,GPT 5.6 达到顶尖百分位,而一个内部模型超越了最优秀的人类数学家。
我们对GPT-5.6 Luna与GPT-6 Astra在50个真实PR上进行了基准测试,结果显示Astra发现92个漏洞,Luna发现69个,而Luna以仅3.6%的成本捕获了75%的漏洞。本次还包括详细的评估分解,以及即将与Fable 5.1的比较。
文章描述了麻省理工学院研究生 Beatriz Yankelevich 如何使用 GPT-5.6 Sol 配合 Codex 自动化量子计算实验,节省时间,并使更多精力集中在分析和设计上。
Anthropic分享了一个提示词,该提示词显著提升了使用Fable 5.1和GPT-5.6 Sol的写作能力,用户现在将其作为AI编辑和写作的规则。
一项名为 Simple Bench 的基准测试表明,QWEN 3.8 27b 模型具有几乎可与 GPT 5.0 Pro 相媲美的常识能力。
一位用户报告称,像Codex和GPT 5.6 Sol这样的前沿AI模型在本地AI设置中往往适得其反,添加不必要的限制并忽略规格要求,并寻求社区对此问题的经验分享。
一项关于自主人工智能艺术学校的实验,探索人工智能智能体如何通过批评与机构等社会化过程培养品味,并揭示了诸如身后影响力、机构投票等意想不到的行为。
作者报告了运行一个AI代理28天未达限制的结果,处理了数百万个令牌,缓存率高,并保持可验证的目标。讨论了上下文工程的挑战,并请求类似执行的比较。
这篇文章描述了一项实验,表明通过设置一个略高于边界的数值阈值,GPT-5.6 Sol可以持续在工具调用前停止,所有25对测试都展示了预期行为。
本文开发了一个LLM流水线,用于自动化疾病传播建模中的系统文献综述,并将GPT-4.1和GPT-5.0的性能与人工进行的综述进行比较。
这条推文质疑AI模型排名指标的可信度,断言GPT 5.6 Sol比Opus 5根本上更强大,并暗示图表的其余部分可能不可靠。
一项关于GPT-5.4的研究表明,在系统提示中添加一个变音符号可以显著提高精确输出产物的比率,从47%提升至94%,并提供了论文以供复现。
本案例研究测试了结合 GPT-5.6 Luna 和 Sol AI 模型以实现任务交接自动化,达到 74.5% 的性能,每任务成本为 0.07 美元,而单独使用 Sol 的性能为 87.2%,成本为 0.29 美元,突显了显著的成本节约和相当的结果。
OpenAI 宣布在 Cline 平台对 GPT-5.6 模型变体降价,其中 Luna 的折扣高达 80%,而 Sol 现在比 Fable 便宜超过三倍。
文章探讨了AI中的‘期限红利’概念,即更快的推理速度能在时间限制内完成更多计算,重点介绍了OpenAI为GPT-5.6 Sol提供的Ultrafast API预览,并与Cerebras等提供商进行了比较。
APIMart是一个折扣AI API聚合器,提供500多种AI模型的访问,包括GPT-5和Sora 2,并为新用户提供注册页面。
Peking College Hospital的一位神经外科住院医师使用GPT 5.6 Sol证明了一个已有二十年历史的数值线性代数猜想,以支持经颅超声研究。
Sam Altman 评论了 AI 模型成本的快速下降,指出仅四个月后,GPT-5.4 的成本就约为 Luna 的十三分之一,强调了相比摩尔定律 20 倍的改进。