ai-evaluation

标签

Cards List
#ai-evaluation

你能信任本地模型准确回答吗?

Reddit r/LocalLLaMA · 2026-07-08

探讨在本地运行AI模型的可靠性和准确性,质疑用户能否信任其输出。

0 人收藏 0 人点赞
#ai-evaluation

@cognition:我们对 FrontierCode 方法进行了改进,并发布了 FrontierCode 1.1,其中包含了更清晰的……

X AI KOLs Following · 2026-07-08 缓存

Cognition 发布了 FrontierCode 1.1,这是一个用于评估代码质量的更新基准,改进了公平互联网使用和评分标准的指南,同时提供了 Sonnet 5 和 Fable 5 的新模型评分。

0 人收藏 0 人点赞
#ai-evaluation

大型语言模型的是-否偏差反映答案顺序和措辞,而非道德判断的转变

arXiv cs.CL · 2026-07-08 缓存

本文介绍了一种心理测量工具,用于将语言模型的框架伪影与真实的道德判断区分开来。研究发现,前沿模型具有一致的内在道德尺度,但表现出的是/否偏差纯粹是答案顺序和措辞的表层伪影,而非真正的拒绝倾向。

0 人收藏 0 人点赞
#ai-evaluation

Hy3 基准测试综述:从 SWE-Bench Pro 到 312 个真实工作流任务

Reddit r/singularity · 2026-07-07

基准测试综述,涵盖 SWE-Bench Pro 和 312 个真实工作流任务,可能用于评估人工智能在软件工程挑战中的表现。

0 人收藏 0 人点赞
#ai-evaluation

@HamelHusain: 新一期会谈:如何正确地用AI自动化评估(正确做法)评估工作流中最重要的一部分是……

X AI KOLs Timeline · 2026-07-06 缓存

Hamel Husain和Shreya带来新一期内容:如何正确地进行AI评估自动化,涵盖常见错误、迭代错误分析以及构建失败模式分类法。该环节包含一个评审界面的现场演示,并强调了发现未知未知的重要性。

0 人收藏 0 人点赞
#ai-evaluation

基准测试将开放模型与封闭产品进行比较,而非封闭模型。我们可能忽略了真正付费的部分。

Reddit r/artificial · 2026-07-06

认为将开放模型与封闭API产品进行比较的基准测试具有误导性,因为它们衡量的是原始推理能力,而非隐藏的工具和预处理,暗示实际模型质量差距可能比报告的要小。

0 人收藏 0 人点赞
#ai-evaluation

性能优化基准是否可靠地衡量编码代理?

Hugging Face Daily Papers · 2026-07-01 缓存

本文审计了针对编码代理的三个性能优化基准(GSO、SWE-Perf、SWE-efficiency),发现运行时不稳定、评分规则和任务覆盖率显著影响可靠性,并且许多任务已经至少有一个公开提交解决了。

0 人收藏 0 人点赞
#ai-evaluation

分析一家Agentic AI供应商:我们应该关注什么?

Reddit r/AI_Agents · 2026-06-30

评估Agentic AI供应商时的关键考量因素分析,包括能力、架构和集成。

0 人收藏 0 人点赞
#ai-evaluation

@levie: 我们一直在用Anthropic的Claude Sonnet 5运行Box AI Complex Work Eval,这是我们用于评估模型在复杂企业文档工作中表现的智能体基准测试…

X AI KOLs Following · 2026-06-30 缓存

Box在其智能体基准测试中运行了Claude Sonnet 5,发现它在尽职调查、成本分析等复杂企业任务上超越了Sonnet 4.6。Sonnet 5即将在Box AI Studio中可用。

0 人收藏 0 人点赞
#ai-evaluation

@Phoenixyin13: 这种学生出题难倒AI的考核方式确实非常新颖,且极具前沿意义。 学生需要探索 Claude、DeepSeek 和 MiniMax 这三个模型的长处与短板。 在这个过程中,学生不再盲信AI的输出,而是学会用审视、批判的眼光去复核AI的回答,这…

X AI KOLs Timeline · 2026-06-30 缓存

这种教育考核方式鼓励学生探索 Claude、DeepSeek 和 MiniMax 三个模型的长处与短板,出题难倒AI,从而培养批判性思维和AI时代所需的竞争力。

0 人收藏 0 人点赞
#ai-evaluation

临床AI工具在真实临床即时查询中的专家评估

arXiv cs.AI · 2026-06-30 缓存

本文报告了一项针对临床AI工具的盲评,采用医生在临床即时提出的真实查询,比较了专用模型与通用模型在五个维度上的表现。专用工具(OpenEvidence)在所有维度上均优于通用模型,作者同时发布了Real-POCQi基准测试集。

0 人收藏 0 人点赞
#ai-evaluation

深入解读GeneBench-Pro

OpenAI Blog · 2026-06-30 缓存

GeneBench-Pro 是 OpenAI 推出的一项全面基准测试,旨在评估人工智能模型在复杂基因组学任务上的表现,包括体细胞肿瘤学、功能基因组学以及临床携带者筛查。

0 人收藏 0 人点赞
#ai-evaluation

GeneBench-Pro 介绍

OpenAI Blog · 2026-06-30 缓存

OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。

0 人收藏 0 人点赞
#ai-evaluation

在Hugging Face模型页面上展示Every Eval Ever的所有结果

Hugging Face Blog · 2026-06-30 缓存

Every Eval Ever (EEE) 与 Hugging Face Community Evals 现已互操作,允许将 AI 评估结果标准化地交叉发布到模型页面,提升信任度和可比性。

0 人收藏 0 人点赞
#ai-evaluation

专为小型模型设计的新基准:ObviousBench.com

Reddit r/LocalLLaMA · 2026-06-27

ObviousBench 是一个专门为评估小型 AI 模型而设计的新基准。

0 人收藏 0 人点赞
#ai-evaluation

@ms_aifrontiers: 在每个检查点上运行所有基准测试既慢又昂贵。微软AI前沿团队的新工作提出了一个问题:你是否……

X AI KOLs Following · 2026-06-25 缓存

微软AI前沿团队推出了BenchPress,一种无需运行实际基准测试即可预测基准分数的方法,节省时间和计算资源。

0 人收藏 0 人点赞
#ai-evaluation

我不再相信模型基准测试,开始运行自己的评估集,这是变化所在[D]

Reddit r/MachineLearning · 2026-06-25

作者描述了由于供应商创建的指标、自报参数和缺乏独立验证而对公开AI模型基准测试失去信心,并主张从真实生产流量中构建自定义评估集以进行更相关的模型比较。

0 人收藏 0 人点赞
#ai-evaluation

贵公司如何衡量智能体和技能在实际生产中的影响,而不仅仅是基准测试?

Reddit r/AI_Agents · 2026-06-25

关于公司应如何衡量AI智能体和技能在生产环境中的实际影响,而不是仅仅依赖基准测试结果的讨论。

0 人收藏 0 人点赞
#ai-evaluation

华盛顿邮报用于评估AI政治偏见的问题与答案完整列表

Reddit r/singularity · 2026-06-25

华盛顿邮报公布了用于评估AI模型政治偏见的问题与答案完整列表,揭示了具体的评估方法和潜在偏见。

0 人收藏 0 人点赞
#ai-evaluation

基于LLM的科学同行评审:方法、基准与可靠性挑战

arXiv cs.CL · 2026-06-25 缓存

本综述从系统层面对基于LLM的科学同行评审进行了分析,涵盖方法、基准以及包括提示注入和数据投毒等稳健性风险在内的可靠性挑战。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈