ai-benchmark

标签

Cards List
#ai-benchmark

PolyRange:面向网络目标的抗污染攻击型AI基准测试(那不是基准,这才是基准)

Reddit r/LocalLLaMA · 2026-05-31

PolyRange是一个新的开源基准测试,用于评估网络目标上的攻击型AI能力,其设计通过每次部署生成新任务并包含主动防御层级来抵抗污染。

0 人收藏 0 人点赞
#ai-benchmark

@sashimikun_void: GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8。Opus 4.8 耗时两倍,生成三倍的…

X AI KOLs Following · 2026-05-30 缓存

GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8,以更低的成本和更少的 token 膨胀获得了更高的分数。

0 人收藏 0 人点赞
#ai-benchmark

@bentossell: 等等……如果大多数人都认为5.5优于4.7,我猜那是在终端编码基准测试上……4.8仍然被5.5超…

X AI KOLs Following · 2026-05-28 缓存

这条推文讨论了Claude Opus 4.8的发布,该版本在Opus 4.7的基础上提升了判断力并延长了独立工作能力,不过也指出在终端编码基准测试中,5.5版本仍然优于它。

0 人收藏 0 人点赞
#ai-benchmark

研究警告:AI已能比人类更出色地通过图灵测试

Reddit r/ArtificialInteligence · 2026-05-20 缓存

一项发表在PNAS上的新研究表明,诸如GPT-4.5等先进LLM已能通过图灵测试,且参与者认为它们比真人更具人性,这一结果促使学界重新审视该测试的衡量标准。

0 人收藏 0 人点赞
#ai-benchmark

关于 GPT-5.5 的效率,我是不是漏看了什么?

Reddit r/singularity · 2026-05-11

一位用户质疑 Codex 中 GPT-5.5 相较于 GPT-5.4 的 Token 效率,分析了 Artificial Analysis 的图表,并称赞了 Cursor 的 Token 表现。

0 人收藏 0 人点赞
#ai-benchmark

ProgramBench(5分钟阅读)

TLDR AI · 2026-05-07 缓存

ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。

0 人收藏 0 人点赞
#ai-benchmark

The International 2018:比赛结果

OpenAI Blog · 2018-08-23 缓存

OpenAI Five 在2018年国际邀请赛中与顶级职业 Dota 2 战队竞争,尽管在与顶尖人类选手的两场比赛中都不幸落败,但展现了通过自我学习所掌握的具有竞争力的游戏表现和战略深度。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈