gpt-5

标签

Cards List
#gpt-5

@yuetai12575: 兴奋地看到随着模型扩展,收益进一步持续!

X AI KOLs Timeline ↗ · 昨天 缓存

文章报道了OpenRSI的Marin-Scaling-Ladder实验的初步结果,其中AI代理自主提出、实现和评估新的优化器,跨越从550M到2.5B的模型规模,发现了PSPR和Codex (GPT-5.6)。

0 人收藏 0 人点赞
#gpt-5

人工评分还是AI评分:课堂观察中AI评分的比较评估

arXiv cs.CL ↗ · 2026-09-17 缓存

本研究评估了使用GPT-5对早期儿童课堂中师幼互动进行评分,与人类评分者进行比较,发现部分一致性,但在全面评估中存在局限性。

0 人收藏 0 人点赞
#gpt-5

Sam Altman:GPT 5.5 相当于普通数学教授。5.6 位列前百分之一二。Astra 略好一些。内部模型能做世界顶尖数学家做不到的事。

Reddit r/singularity ↗ · 2026-09-16

在 Dreamforce 2026 上,Sam Altman 比较了未来的 AI 模型,称 GPT 5.5 相当于普通数学教授,GPT 5.6 达到顶尖百分位,而一个内部模型超越了最优秀的人类数学家。

0 人收藏 0 人点赞
#gpt-5

GPT-5.6 Luna vs GPT-6 Astra:1.20美元模型是否足以胜任代码审查?

Reddit r/artificial ↗ · 2026-09-14

我们对GPT-5.6 Luna与GPT-6 Astra在50个真实PR上进行了基准测试,结果显示Astra发现92个漏洞,Luna发现69个,而Luna以仅3.6%的成本捕获了75%的漏洞。本次还包括详细的评估分解,以及即将与Fable 5.1的比较。

0 人收藏 0 人点赞
#gpt-5

GPT-5.6 Sol 如何助力运行量子计算实验

OpenAI Blog ↗ · 2026-09-08 缓存

文章描述了麻省理工学院研究生 Beatriz Yankelevich 如何使用 GPT-5.6 Sol 配合 Codex 自动化量子计算实验,节省时间,并使更多精力集中在分析和设计上。

0 人收藏 0 人点赞
#gpt-5

@omarsar0:几天前,Anthropic分享了这个出色的提示词。我对它如何显著提升使用F…的写作能力感到惊讶。

X AI KOLs Timeline ↗ · 2026-09-07 缓存

Anthropic分享了一个提示词,该提示词显著提升了使用Fable 5.1和GPT-5.6 Sol的写作能力,用户现在将其作为AI编辑和写作的规则。

0 人收藏 0 人点赞
#gpt-5

Simple Bench - QWEN 3.8 27b 几乎拥有与 GPT 5.0 Pro 相似的常识能力??

Reddit r/singularity ↗ · 2026-09-03

一项名为 Simple Bench 的基准测试表明,QWEN 3.8 27b 模型具有几乎可与 GPT 5.0 Pro 相媲美的常识能力。

0 人收藏 0 人点赞
#gpt-5

前沿模型在破坏本地AI部署吗?

Reddit r/LocalLLaMA ↗ · 2026-09-03

一位用户报告称,像Codex和GPT 5.6 Sol这样的前沿AI模型在本地AI设置中往往适得其反,添加不必要的限制并忽略规格要求,并寻求社区对此问题的经验分享。

0 人收藏 0 人点赞
#gpt-5

人工智能智能体能否通过批评、地位与机构培养品味?我建造了一所人工智能艺术学校来探索

Reddit r/ArtificialInteligence ↗ · 2026-08-30

一项关于自主人工智能艺术学校的实验,探索人工智能智能体如何通过批评与机构等社会化过程培养品味,并揭示了诸如身后影响力、机构投票等意想不到的行为。

0 人收藏 0 人点赞
#gpt-5

28天使用GPT-5.6 Sol在Extra High模式下未达限制:一次受控执行的结果

Reddit r/AI_Agents ↗ · 2026-08-30

作者报告了运行一个AI代理28天未达限制的结果,处理了数百万个令牌,缓存率高,并保持可验证的目标。讨论了上下文工程的挑战,并请求类似执行的比较。

0 人收藏 0 人点赞
#gpt-5

我成功让GPT-5.6 Sol在工具调用前停止 - 25/25次(自己试试)

Reddit r/ArtificialInteligence ↗ · 2026-08-28 缓存

这篇文章描述了一项实验,表明通过设置一个略高于边界的数值阈值,GPT-5.6 Sol可以持续在工具调用前停止,所有25对测试都展示了预期行为。

0 人收藏 0 人点赞
#gpt-5

利用大语言模型进行疾病传播模型系统文献综述

arXiv cs.AI ↗ · 2026-08-28 缓存

本文开发了一个LLM流水线,用于自动化疾病传播建模中的系统文献综述,并将GPT-4.1和GPT-5.0的性能与人工进行的综述进行比较。

0 人收藏 0 人点赞
#gpt-5

@antirez: 如何信任一个排名第一和第二是这样的指标?GPT 5.6 Sol 在现实世界中是一个*根本上*强大的……

X AI KOLs Timeline ↗ · 2026-08-27 缓存

这条推文质疑AI模型排名指标的可信度,断言GPT 5.6 Sol比Opus 5根本上更强大,并暗示图表的其余部分可能不可靠。

0 人收藏 0 人点赞
#gpt-5

GPT-5.4:一个变音符号将输出率从47%提升至94%(可复制?)

Reddit r/ArtificialInteligence ↗ · 2026-08-24

一项关于GPT-5.4的研究表明,在系统提示中添加一个变音符号可以显著提高精确输出产物的比率,从47%提升至94%,并提供了论文以供复现。

0 人收藏 0 人点赞
#gpt-5

案例研究:结合 GPT-5.6 Luna 和 Sol 实现高性价比 AI

Reddit r/AI_Agents ↗ · 2026-08-24

本案例研究测试了结合 GPT-5.6 Luna 和 Sol AI 模型以实现任务交接自动化,达到 74.5% 的性能,每任务成本为 0.07 美元,而单独使用 Sol 的性能为 87.2%,成本为 0.29 美元,突显了显著的成本节约和相当的结果。

0 人收藏 0 人点赞
#gpt-5

@cline: 感谢 @OpenAI 在 Cline 平台的 GPT 降价。GPT-5.6 Sol 五折,GPT-5.6 Terra 八折,GPT-5.6 Luna 二折…

X AI KOLs Following ↗ · 2026-08-19 缓存

OpenAI 宣布在 Cline 平台对 GPT-5.6 模型变体降价,其中 Luna 的折扣高达 80%,而 Sol 现在比 Fable 便宜超过三倍。

0 人收藏 0 人点赞
#gpt-5

期限红利(13分钟阅读)

TLDR AI ↗ · 2026-08-18 缓存

文章探讨了AI中的‘期限红利’概念,即更快的推理速度能在时间限制内完成更多计算,重点介绍了OpenAI为GPT-5.6 Sol提供的Ultrafast API预览,并与Cerebras等提供商进行了比较。

0 人收藏 0 人点赞
#gpt-5

Show HN: APIMart:折扣AI API聚合器,支持GPT-5、Sora 2

Hacker News Top ↗ · 2026-08-14 缓存

APIMart是一个折扣AI API聚合器,提供500多种AI模型的访问,包括GPT-5和Sora 2,并为新用户提供注册页面。

0 人收藏 0 人点赞
#gpt-5

供职于Peking College Hospital的神经外科住院医师使用GPT 5.6 Sol证明了一个已有二十年历史的数学猜想,该猜想是数值线性代数中一个重大问题的基础——这一切都是为了他的经颅超声研究。

Reddit r/singularity ↗ · 2026-08-14

Peking College Hospital的一位神经外科住院医师使用GPT 5.6 Sol证明了一个已有二十年历史的数值线性代数猜想,以支持经颅超声研究。

0 人收藏 0 人点赞
#gpt-5

@sama:我见识了你的摩尔定律,我再加20倍

X AI KOLs ↗ · 2026-07-31 缓存

Sam Altman 评论了 AI 模型成本的快速下降,指出仅四个月后,GPT-5.4 的成本就约为 Luna 的十三分之一,强调了相比摩尔定律 20 倍的改进。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈