ai-evaluation

标签

Cards List
#ai-evaluation

如果 Opus 是一个循环而非纯粹模型,ARC AGI 3 可能被利用

Reddit r/singularity · 2026-07-24

讨论 ARC AGI 3 基准测试中的一个潜在漏洞,如果 Opus 模型作为循环而非纯粹模型运行,则可能被利用。

0 人收藏 0 人点赞
#ai-evaluation

@no_stp_on_snek: 在Poolside自有的agent(pool)中对Laguna S 2.1进行了此操作,指向DGX Spark上的本地实例,使用提示词…

X AI KOLs Timeline · 2026-07-24 缓存

两个AI编码智能体构建马里奥游戏的对比:Poolside agent中的Laguna S 2.1耗时62分钟,具备自我纠正能力并通过测试,而之前的Qwen模型耗时数小时且需要人类帮助;突出展示了oracle纪律和原生测试框架的优势。

0 人收藏 0 人点赞
#ai-evaluation

测试了AI模型是否能在盲测中识别自己的写作。Grok在9次测试中全部失败。它写了些东西,一分钟后却坚称是别人写的。

Reddit r/artificial · 2026-07-22 缓存

一项针对Claude、Gemini和Grok的自我意识测试发现,Claude和Gemini几乎满分,而Grok在自我识别方面得分为0,未能识别自己的写作。该研究衡量了功能性自我认知的六个维度。

0 人收藏 0 人点赞
#ai-evaluation

SciHazard:一种使用分解危害评分衡量科学安全风险的基准

arXiv cs.AI · 2026-07-22 缓存

介绍SciHazard,一种使用分解危害评分框架衡量LLM中科学安全风险的基准,并评估了31个前沿模型,发现深度研究智能体带来更高风险。

0 人收藏 0 人点赞
#ai-evaluation

BACON:预算有限的人工校准与多AI评判的建模与评估

arXiv cs.LG · 2026-07-21 缓存

BACON提出了一个四阶段流水线,将预算有限的人工标签与多AI评判输出相结合,生成校准的项目级替代预测,支持总体估计和个体评分,提高了准确性并减少了偏差。

0 人收藏 0 人点赞
#ai-evaluation

@rohanpaul_ai: 自我改进的AI的真实性仅取决于其测试信号的有效性。梳理1250篇论文揭示了……

X AI KOLs Timeline · 2026-07-20 缓存

对1250篇关于AI递归自我改进的论文的分析表明,评估者信号是关键瓶颈。模型只有在强大且可信的信号(如证明检查器)下才能可靠改进,而弱信号则会导致循环崩溃或强化错误。

0 人收藏 0 人点赞
#ai-evaluation

Agents Last Exam 最迟明年二月将饱和。

Reddit r/singularity · 2026-07-20

文章预测AI基准测试‘Agents Last Exam’将在明年二月前达到饱和(模型性能达到极限)。

0 人收藏 0 人点赞
#ai-evaluation

智能体失败应成为评估标准,而不仅仅是追踪记录

Reddit r/AI_Agents · 2026-07-20

主张将智能体失败视为评估基准,而不仅仅是追踪日志,强调需要对AI智能体行为进行系统性测试。

0 人收藏 0 人点赞
#ai-evaluation

Fable 5 与 GPT-5.6 领跑奇点门测试:用于检验 AI 能否预测模型训练截止后的范式突破性发现

Reddit r/singularity · 2026-07-16

奇点门基准测试旨在检验前沿 AI 模型能否预测在其训练数据截止日后发表的范式突破性科学发现。Claude Fable 5 目前领先,但由于拒绝回答导致回复率较低;而 GPT-5.6 Sol 在更低的价格点上展现出强大的性能,且无拒绝回答的情况。

0 人收藏 0 人点赞
#ai-evaluation

@sayashk:我下周二博士答辩!演讲题目为“AI评估中缺失的科学”,基于我的求职报告。

X AI KOLs Following · 2026-07-15 缓存

Sayash Kapoor宣布即将举行的博士答辩,主题为“AI评估中缺失的科学”,讨论基于AI的科学、代理评估和开放模型风险,将进行直播,对所有人开放。

0 人收藏 0 人点赞
#ai-evaluation

模型知道你的项目,但不知道你:利用NameRank衡量LLM中的识别能力

arXiv cs.AI · 2026-07-15 缓存

本文介绍了NameRank,一种衡量LLM如何从参数化知识中识别个体和产出的方法,发现模型对命名项目和方法的识别远好于对资历或贡献者的识别。

0 人收藏 0 人点赞
#ai-evaluation

好的基准

arXiv cs.AI · 2026-07-15 缓存

这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。

0 人收藏 0 人点赞
#ai-evaluation

@HamelHusain: 新博客文章:自动化评估有效吗?最近出现了一些工具,通过AI分析你的追踪数据来识别问题…

X AI KOLs Timeline · 2026-07-14 缓存

Parlance Labs的一篇博客文章在真实生产数据上测试了自动化AI评估工具(Braintrust Loop、Arize Alyx、LangSmith Engine),发现它们能捕获人类标记的87%的问题,但会遗漏领域特定的失败案例并引入噪音,建议采用迭代式人机协同使用。

0 人收藏 0 人点赞
#ai-evaluation

配备工具后的GPT-5.5在BabyVision基准上已超越10岁儿童水平

Reddit r/singularity · 2026-07-11

GPT-5.5在配备工具后,在BabyVision基准测试中的表现已超越10岁儿童,标志着AI视觉推理能力的显著进步。

0 人收藏 0 人点赞
#ai-evaluation

心理能力:AI评估中缺失的一个维度

arXiv cs.AI · 2026-07-10 缓存

本文提出将心理能力作为AI评估中缺失的一个维度,并提出了一个概念框架,用于评估AI系统在面向人类角色时如何支持用户认知、情绪解读和决策。

0 人收藏 0 人点赞
#ai-evaluation

当大语言模型意见一致时,它们是对的吗?——将自洽性与跨模型一致性作为置信度信号的审计

arXiv cs.AI · 2026-07-10 缓存

本文审计了自洽性与跨模型一致性是否是LLM正确性的可靠指标,发现一致性是一个弱的、依赖于场景的代理指标,且前沿模型表现出过度自信。

0 人收藏 0 人点赞
#ai-evaluation

超越人类尺度的智能测量

arXiv cs.AI · 2026-07-09 缓存

本文提出了一种新的范式,用于测量超越人类能力的智能,采用对抗性心理测量评分系统,其中模型生成挑战以区分其他系统,从而实现与AI能力同步扩展的评估。

0 人收藏 0 人点赞
#ai-evaluation

我们让 Grok 4.5、GPT-5.5 和 Claude 构建了相同的应用

Reddit r/singularity · 2026-07-09 缓存

本文对 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5 进行了基准测试,让每个模型根据单一提示构建三个交互式应用(3D 魔方、粒子重力沙箱、打砖块游戏),比较它们的一次性编码能力。

0 人收藏 0 人点赞
#ai-evaluation

@OpenAI: 随着编码模型的改进,评估需要变得更严格、更公平、更可信。更好的基准有助于领域了…

X AI KOLs · 2026-07-08 缓存

OpenAI 强调编码AI模型评估需要更严格、更可信,以更好地衡量实际进展。

0 人收藏 0 人点赞
#ai-evaluation

你能信任本地模型准确回答吗?

Reddit r/LocalLLaMA · 2026-07-08

探讨在本地运行AI模型的可靠性和准确性,质疑用户能否信任其输出。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈