标签
PolyRange是一个新的开源基准测试,用于评估网络目标上的攻击型AI能力,其设计通过每次部署生成新任务并包含主动防御层级来抵抗污染。
GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8,以更低的成本和更少的 token 膨胀获得了更高的分数。
这条推文讨论了Claude Opus 4.8的发布,该版本在Opus 4.7的基础上提升了判断力并延长了独立工作能力,不过也指出在终端编码基准测试中,5.5版本仍然优于它。
一项发表在PNAS上的新研究表明,诸如GPT-4.5等先进LLM已能通过图灵测试,且参与者认为它们比真人更具人性,这一结果促使学界重新审视该测试的衡量标准。
一位用户质疑 Codex 中 GPT-5.5 相较于 GPT-5.4 的 Token 效率,分析了 Artificial Analysis 的图表,并称赞了 Cursor 的 Token 表现。
ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。
OpenAI Five 在2018年国际邀请赛中与顶级职业 Dota 2 战队竞争,尽管在与顶尖人类选手的两场比赛中都不幸落败,但展现了通过自我学习所掌握的具有竞争力的游戏表现和战略深度。