human-evaluation

标签

Cards List
#human-evaluation

Human Bench 3.0,Humanity-2 AI-0

Reddit r/singularity · 2026-09-09

介绍 Human Bench 3.0,一个用于评估 AI 系统与人类表现对比的基准,Humanity-2 AI-0 可能表示特定的分数或版本。

0 人收藏 0 人点赞
#human-evaluation

信息满意度:以读者为中心的摘要评估维度

arXiv cs.CL · 2026-08-17 缓存

本文提出信息满意度作为以读者为中心的摘要评估维度,指出当前指标未能捕捉用户特定的信息需求,且与人类判断的一致性较差。

0 人收藏 0 人点赞
#human-evaluation

EuroExec:前沿语言模型在欧洲高管决策任务上未达到专家判断水平

arXiv cs.CL · 2026-08-06 缓存

本文介绍了 EuroExec,这是一个用于评估前沿大语言模型在开放式欧洲高管决策任务上表现的人类专家基准。研究发现,最强的模型仅能解决 56.9% 的任务,远低于专家撰写的参考答案,凸显了现实世界开放式问题解决能力的差距。

0 人收藏 0 人点赞
#human-evaluation

动态分配评估努力以进行模型排名

arXiv cs.CL · 2026-08-05 缓存

本文将多模型人类评估形式化为多臂老虎机设置中的最佳臂识别问题,自适应地分配标注努力以聚焦于有竞争力的模型,并提高排名区分度。

0 人收藏 0 人点赞
#human-evaluation

FriendBench:在人类和多模态大语言模型中基准测试二元熟悉度推断

arXiv cs.CL · 2026-08-03 缓存

FriendBench 是一个新的基准测试,用于评估人类和多模态大语言模型是否能够从一段20秒的破冰对话视频片段中推断出两个人是熟人还是陌生人。结果表明,最佳模型在准确率上与人类相当,但在偏差上有所不同,并且只有人类能从更丰富的视觉行为中受益。

0 人收藏 0 人点赞
#human-evaluation

跨度引导的去毒化何时有效?受控比较中的人类偏好与评估器诊断

arXiv cs.CL · 2026-07-30 缓存

本文通过人工评估对跨度引导和无引导的文本去毒化进行了受控比较,发现存在一种权衡:当保留原始立场很重要时,跨度引导的重写更受青睐;而无引导的重写则因更彻底的缓解而更受欢迎,尤其是在较轻度的毒性上。研究还将自动评估器视为诊断工具,而非替代人工判断。

0 人收藏 0 人点赞
#human-evaluation

对比ESA:同时对多个翻译进行人工评估

arXiv cs.CL · 2026-07-30 缓存

介绍对比错误跨度标注(cESA),这是一种同时对多个翻译进行人工评估的协议,与标准方法相比,减少了标注时间和噪声。

0 人收藏 0 人点赞
#human-evaluation

前沿大型语言模型的响应漂移

arXiv cs.CL · 2026-07-24 缓存

一项针对10个前沿大语言模型、涵盖62个问题的大规模人类评估发现,所有模型都表现出响应漂移,其中大多数模型收敛到78-81%的偏差上限,而两个模型实现了较低的偏差。漂移程度因领域和问题而异,自动指标几乎无法解释人类判断,这凸显了人类评估的必要性。

0 人收藏 0 人点赞
#human-evaluation

推出 Real World VoiceEQ:衡量语音AI的拟人化质量

Hugging Face Blog · 2026-07-15 缓存

Real World VoiceEQ 是一个新基准,用于评估语音AI的拟人化质量,基于超过一百万的人类评分,在真实世界条件下评估语音识别、合成和理解的模型。

0 人收藏 0 人点赞
#human-evaluation

AI翻译文学文本“还行”,但读者依然更偏爱人工翻译

Hugging Face Daily Papers · 2026-06-24 缓存

一项对比文学作品中人工翻译与AI翻译的研究表明,虽然机器翻译被视为“还行”,但读者仍因其沉浸感和清晰度更偏爱人工翻译。自动指标无法捕捉读者偏好。

0 人收藏 0 人点赞
#human-evaluation

GLM-5.2的人类评估

Reddit r/LocalLLaMA · 2026-06-23

作者称赞GLM-5.2(一个MIT开源权重模型)在人类评估基准中表现出色,声称其能与Claude等最佳闭源模型相媲美。

0 人收藏 0 人点赞
#human-evaluation

技能增强型AI代理在医学研究分析中的应用:一项NSCLC转录组生物标志物任务中的探索性多模型人类评估

arXiv cs.AI · 2026-06-11 缓存

本探索性研究在NSCLC生物标志物任务中使用多模型人类评估,评估将AI代理与医学研究技能包相结合是否能提高转录组研究分析输出的质量(与原生AI相比)。结果显示有方向性但无统计显著性的改善,强调了进行更大规模、更稳健评估的必要性。

0 人收藏 0 人点赞
#human-evaluation

论LLM作为裁判在科学新颖性评估中的局限性

Hugging Face Daily Papers · 2026-06-10 缓存

本文介绍了RQ-Bench,一个用于评估LLM判断科学研究问题新颖性的基准。研究发现,LLM裁判一致认为生成的问题比人类专家认为的更新颖,这引发了对使用LLM进行科学新颖性评估可靠性的担忧。

0 人收藏 0 人点赞
#human-evaluation

在LLM个性化中重新以人类为中心

Hugging Face Daily Papers · 2026-06-04 缓存

本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。

0 人收藏 0 人点赞
#human-evaluation

用LLM评审员增强人工评估:你需要多少人工审核?

arXiv cs.LG · 2026-05-19 缓存

本文提出了一种两阶段抽样设计,其中LLM评估用于增强而非替代人工评分,并利用缺失数据文献中的双重稳健估计量,提供了确定人工和LLM评审样本量的指导。

0 人收藏 0 人点赞
#human-evaluation

关于 TranslateGemma-12b 基准测试文章的跟进:人工审核发现 71% 被自动指标评为合格的片段存在错误

Reddit r/LocalLLaMA · 2026-05-12

对 TranslateGemma-12b 翻译结果的人工审核显示,71% 被自动指标评定为合格的片段实际上存在错误,凸显了仅依赖自动指标评估多语言翻译质量时的显著不足。

0 人收藏 0 人点赞
#human-evaluation

对抗游戏提高语言模型输出的可读性

OpenAI Blog · 2024-07-17 缓存

# 对抗游戏提高语言模型输出的可读性 来源: [https://openai.com/index/prover-verifier-games-improve-legibility/](https://openai.com/index/prover-verifier-games-improve-legibility/) 确保语言模型生成可理解的文本对于提高其实用性至关重要,尤其是在处理复杂任务(如解决数学问题)时。我们发现,当我们仅针对获得正确答案来优化强大模型的问题求解过程时

0 人收藏 0 人点赞
← 返回首页

提交意见反馈