标签
PROOF 是一个面向可靠性的基准测试,通过基于Wikidata的多选题和受控干预,评估大语言模型的事实可靠性,揭示了特定领域的覆盖率以及模型在扰动下的稳定性。
SWORD引入了一个基于Wikidata的基准,用于评估LLM在拒绝事实错误时的跨语言不一致性,揭示模型依赖于分布熟悉度,并在亚洲语言中表现出性能下降。
一个客户端WebGL应用程序,利用LLMs将对话输出转换为交互式3D历史地图,借助Wikidata获取地理空间数据,并使用URL压缩进行状态管理。
This paper proposes a hybrid knowledge graph generation pipeline that combines top-down grounding in Wikidata with bottom-up agentic synthesis to handle noisy, multilingual HR skill declarations, producing a scalable and self-healing skills taxonomy.
本文介绍了Kontrast,一种利用Text-to-SPARQL和LLM推理自动检测Wikipedia文本、表格和Wikidata知识图谱之间知识不一致性的框架。
Kyutai Labs 推出 KairosQA,这是一个包含超过7000个来自 Wikidata 的基于时间轴问题的数据集,重点关注那些答案在2018年至2025年间多次变化的流行维基百科页面。