llm-assessment

标签

Cards List
#llm-assessment

FakeSpotter:一个与内容和策略无关的病毒性错误信息检测工具

arXiv cs.CL ↗ · 2026-09-18 缓存

FakeSpotter 是一个与内容和策略无关的工具,旨在通过测量结构性指纹来估算文本内容的病毒性错误信息风险,使用重复的LLM评估和逻辑回归分类器,在标记语料库上报告短文本的宏观F1分数为0.788,长文本为0.793。

0 人收藏 0 人点赞
#llm-assessment

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL ↗ · 2026-05-12 缓存

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈