ai-evaluation

标签

Cards List
#ai-evaluation

按下X以怀疑评估:我告诉14个AI模型现在是2026年9月,并在无网络搜索的情况下展示了20件今年真实发生的事件。平均而言,它们给现实打了36%的概率。

Reddit r/singularity ↗ · 2小时前

一位工程师测试了14个AI模型,向它们展示了20个来自2026年的真实AI事件,且无网络访问权限,发现模型对这些事件的平均可能性评分仅为36%,凸显了其自我预测能力的显著差距。

0 人收藏 0 人点赞
#ai-evaluation

通过测试或淘汰

Reddit r/ArtificialInteligence ↗ · 17小时前

本文探讨了在竞争激烈的技术环境中通过测试的关键重要性,失败可能导致淘汰或严重后果。

0 人收藏 0 人点赞
#ai-evaluation

Human-AI-Powered Hypothesis Testing: Cost-Aware Selective AI Scoring and Sequential Human Escalation

arXiv cs.AI ↗ · 昨天 缓存

本文提出 SCALE,一种顺序成本感知的假设检验策略,该策略利用 AI 判断并辅以选择性的人工验证,在控制错误率的同时最小化成本,可应用于软件可靠性评估等场景。

0 人收藏 0 人点赞
#ai-evaluation

@akshay_pachaar: Jev 与 LLM 作为评判者的清晰对比解析。设想一个客服人员说:“已处理,退款已发放。”追踪记录却显示……

X AI KOLs Timeline ↗ · 昨天 缓存

本文解析了用于评估 AI 智能体回应的 Jev 与 LLM 作为评判者之间的区别,强调了根据需要开放式推理还是结构化并行判断来选择使用哪种方式。

0 人收藏 0 人点赞
#ai-evaluation

Jev能否评估放射学报告?评估System One模型在临床事实性方面的表现

arXiv cs.CL ↗ · 2天前 缓存

本研究评估了Jev,一个System One模型,用于测量AI生成的放射学报告中的事实性差异,证明了其相较于其他评估方法的有效性和效率。

0 人收藏 0 人点赞
#ai-evaluation

Humanity’s Last Exam 的更新版:HLE-Diamond

Reddit r/singularity ↗ · 2天前

Humanity’s Last Exam 的一个更新版本,这是一个用于AI评估的基准,名为 HLE-Diamond,已经宣布并发布。

0 人收藏 0 人点赞
#ai-evaluation

推出MentalHealthBench

OpenAI Blog ↗ · 3天前 缓存

OpenAI推出了MentalHealthBench,这是一个开放基准,用于评估心理健康对话中的AI回复,与超过80名心理健康专家共同创建,以衡量安全性、上下文、主动性和指导性。

0 人收藏 0 人点赞
#ai-evaluation

@shao__meng: https://x.com/shao__meng/status/2102648813425135777

X AI KOLs Timeline ↗ · 3天前 缓存

本文总结了来自 Hamel Husain 和 Shreya Shankar 的 AI Evals 课程的 8 个核心技能,旨在指导工程师和产品经理构建有效的 AI 评测系统,涵盖错误分析、评测器设计、校准和监控等步骤。

0 人收藏 0 人点赞
#ai-evaluation

FrontierMath Erdős

arXiv cs.CL ↗ · 3天前 缓存

本文介绍了FrontierMath Erdős,这是一个包含68个开放性Erdős问题的基准测试,用于使用Lean证明助手评估数学领域的AI模型,旨在解决当前AI研究演示中的不足。

0 人收藏 0 人点赞
#ai-evaluation

Claude 对比 Antigravity 对比 3.827b 对比 Flash Next 对比 Bonsai 对比 Swift... 我基于自己的Git提交历史构建了自定义质量基准测试框架,初步结果令人惊讶且震惊。

Reddit r/LocalLLaMA ↗ · 4天前

作者利用自己的git历史记录构建了一个自定义基准测试框架,用于评估本地AI模型在代码任务中的表现。早期测试结果显示,Flash Next和Swift等模型的性能表现令人惊讶。

0 人收藏 0 人点赞
#ai-evaluation

屡见内存基准测试的吐槽,我动手做了一个。Glasshouse v0.1 正式推出

Reddit r/AI_Agents ↗ · 4天前

Glasshouse v0.1 是一款内存基准测试工具,旨在解决现有 AI 内存基准测试的痛点,支持多语言、多种对话长度,并在多个维度上进行细致评估。

0 人收藏 0 人点赞
#ai-evaluation

CleanScore: 包含负控制和灵敏度界限的黑盒基准审计

arXiv cs.LG ↗ · 4天前 缓存

CleanScore是一种黑盒方法,用于审计公共基准测试分数,通过比较在原始问题上的表现与独立编写的题目,并使用负控制来区分技能和暴露效应。

0 人收藏 0 人点赞
#ai-evaluation

评估表格数据基础模型的比较框架:医疗保健案例研究

arXiv cs.LG ↗ · 4天前 缓存

本文介绍OpTFM,一个针对医疗保健领域表格基础模型的比较评估框架,从六个临床意义显著的维度(如泛化性和公平性)评估模型,并应用于两个用例以展示上下文依赖的排名。

0 人收藏 0 人点赞
#ai-evaluation

情境身份测试(SIT):区分持久认知身份与人格模仿

arXiv cs.CL ↗ · 4天前 缓存

情境身份测试(SIT)是一个架构无关的框架,旨在评估AI代理的行为是否功能上可归因于特定的发展谱系,以解决大语言模型中的人格模仿问题。

0 人收藏 0 人点赞
#ai-evaluation

UK AISI 与 EvalEval 如何使基准测试结果可复现

Hugging Face Blog ↗ · 4天前 缓存

UK AISI 与 EvalEval 正在合作,通过标准化架构和平台公开共享人工智能评估结果,从而提升人工智能模型基准测试的可复现性和透明度。

0 人收藏 0 人点赞
#ai-evaluation

最终基准测试

Reddit r/singularity ↗ · 4天前

本文提出了一项权威基准测试,旨在评估和比较AI模型或系统,并为未来的评估确立标准。

0 人收藏 0 人点赞
#ai-evaluation

Spider Bench:在2,000张蜘蛛照片上比较9个视觉模型 [P]

Reddit r/MachineLearning ↗ · 5天前

Spider Bench 基准测试在2,000张蜘蛛照片的数据集上比较了九个视觉模型,其中 Gemini 3.8 Flash 取得了最高的精确物种准确率,为49.85%。该研究提供了公开的代码、任务、预测和结果,以确保可复现性。

0 人收藏 0 人点赞
#ai-evaluation

又一个疯狂的Jev用例!Jev让评估代理内部实际发生的事情变得极其便宜…

X AI KOLs Timeline ↗ · 5天前 缓存

Beacon是一个开源的AI编码代理记忆层,使用Jev评估代理运行,并将有用的工作流程、纠正和调试模式转化为跨多个工具的可重用技能。

0 人收藏 0 人点赞
#ai-evaluation

PolyBridgeBench:用于基于物理的桥梁设计的多模态大型语言模型基准测试

arXiv cs.AI ↗ · 5天前 缓存

PolyBridgeBench是一种新的可执行基准测试,用于评估多模态大型语言模型在基于物理的桥梁设计任务中的表现,揭示了结构合成与修复中确定性有效性与动态成功之间的差距。

0 人收藏 0 人点赞
#ai-evaluation

CogGym:迈向人类与机器认知的规模化对比评估

arXiv cs.AI ↗ · 5天前 缓存

CogGym 是一个可扩展框架,利用认知实验比较人类与AI认知能力,研究发现规模更大的语言模型能更好地模仿人类推理,但仍落后于形式化基准。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈