ai-capabilities

标签

Cards List
#ai-capabilities

用于衡量前沿AI能力的开放世界评估

arXiv cs.AI · 2026-05-22 缓存

本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。

0 人收藏 0 人点赞
#ai-capabilities

要是笛卡尔能看到现在的LLM该多好

Reddit r/singularity · 2026-05-21

一条推文反思:笛卡尔曾论证机器无法恰当排列词语来回应对话,如今这一观点正受到现代LLM的挑战。

0 人收藏 0 人点赞
#ai-capabilities

@Noahpinion: 人们开始意识到,人工智能是超级智能的,因为它们将大致相当于人类水平的推理能力与计算机般的速度、知识和记忆力结合起来了……

X AI KOLs Following · 2026-05-20 缓存

Noahpinion在推文中表示,人们开始意识到人工智能是超级智能的,因为它们将人类水平的推理能力与计算机般的速度、知识和记忆力相结合,引发了关于人工智能能力的讨论。

0 人收藏 0 人点赞
#ai-capabilities

吐槽:别再说什么LLM只是“下一个词预测器”了。

Reddit r/singularity · 2026-05-17

对LLM“只是下一个词预测器”这一过于简单化的说法提出批判,认为大规模预测会诱导出有用的表示和能力,并且这种轻率的否定混淆了目标与学习系统。

0 人收藏 0 人点赞
#ai-capabilities

锯齿形智能——或许是终点,而非临时绕道

Reddit r/ArtificialInteligence · 2026-05-17

文章讨论了安德烈·卡帕西(Andrej Karpathy)提出的“锯齿形智能”概念,强调了AI能力在不同领域的不均匀分布,并指出真正的价值在于“鞍具”——围绕通用模型构建的领域特定工程和工具。文章断言,拥有深厚领域专业知识的小团队可以取得显著的策略优势,尤其是在网络安全领域。

0 人收藏 0 人点赞
#ai-capabilities

@daniel_mac8: https://x.com/daniel_mac8/status/2054994899422826592

X AI KOLs Following · 2026-05-14 缓存

该讨论串指出,有最新证据表明AI代理已基本实现自主运作,其中Claude Mythos成功解决了此前未破解的网络攻击模拟实例,并超出当前基准测试测量极限,显示出超指数级进步。同时强调了安全影响及机构应对措施。

0 人收藏 0 人点赞
#ai-capabilities

ChatGPT 的图像模型在数学方面优于大多数人

Reddit r/singularity · 2026-05-09

文章指出,ChatGPT 的图像模型在数学推理能力方面优于大多数人类。

0 人收藏 0 人点赞
#ai-capabilities

META超级智能实验室发布:ProgramBench:最先进的AI能否在没有互联网的情况下从零复现真实可执行程序(ffmpeg、SQLite、ripgrep)?

Reddit r/MachineLearning · 2026-05-07

Meta的超级智能实验室推出ProgramBench,这是一个评估最先进AI模型能否在没有互联网接入的情况下从零复现诸如ffmpeg和SQLite等真实可执行程序的基准测试。

0 人收藏 0 人点赞
#ai-capabilities

AI进展和建议

OpenAI Blog · 2025-11-06 缓存

OpenAI发布了一份关于AI进展和建议的立场文件,讨论了AI系统超越图灵测试里程碑的快速发展,对2026-2028年发现能力的预测,以及他们对安全和对齐研究的承诺,以应对AI能力不断增强的情况。

0 人收藏 0 人点赞
#ai-capabilities

用 OpenAI o1 回答量子物理问题

OpenAI Blog · 2024-09-12 缓存

OpenAI 发布了 o1 新型 AI 模型系列,该模型能在响应前花费更多时间进行推理,在处理复杂量子物理问题以及解决科学、编码和数学中的难题方面展现出显著能力。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈