IRC-Bench:基于语境线索在自传体回忆中识别实体
摘要
本文介绍了 IRC-Bench,这是一个用于在自传体回忆中识别隐式实体的基准测试,侧重于利用语境线索而非显式提及。文章评估了各种大型语言模型(LLM)和检索配置,发现经过 QLoRA 微调的 Llama 3.1 8B 在开放世界设置中表现最佳。
arXiv:2605.06142v1 宣布类型:新论文
摘要:当人们叙述个人记忆时,他们通常间接提及人物、地点和事件,依赖语境线索而非显式的名称。这类隐式指代是自传体回忆叙述的核心:第一人称的生活经历叙述,常用于治疗、档案和社会场景。它们提出了一个复杂的计算问题,因为目标实体必须从分散的叙述证据中推断出来,而非来自局部提及。我们引入了 IRC-Bench(隐式回忆语境基准),用于评估回忆转录文本中的隐式实体识别。该基准针对非局部性:实体识别线索分布在多个不连续的子句中,这与命名实体识别、实体链接或共指消解不同。IRC-Bench 包含 25,136 个样本,这些样本由跨越 11 个主题领域的 1,994 个转录文本中的 12,337 个 Wiki-data 链接实体构建而成。每个样本将“实体接地叙述”(其中明确提及目标实体)与“实体省略叙述”(其中移除直接提及)配对。我们评估了涵盖 LLM 生成、密集检索、RAG 和微调的 19 种配置。在开放世界设置中,经过 QLoRA 微调的 Llama 3.1 8B 表现最佳(精确匹配率 38.94%;Jaccard 相似度 51.59%),而经过微调的 DPR 在封闭世界检索中领先(Hit@1 为 35.38%;Hit@10 为 71.49%)。我们发布了包含数据、代码和评估工具的 IRC-Bench。
查看缓存全文
缓存时间: 2026/05/08 07:16
# IRC-Bench:从第一人称回忆叙述的语境线索中识别实体 来源:https://arxiv.org/abs/2605.06142 查看 PDF (https://arxiv.org/pdf/2605.06142) > 摘要:人们在讲述个人记忆时,往往通过间接方式提及人物、地点和事件,依赖语境线索而非明确名称。这种隐含指代是回忆叙述的核心:即用于治疗、档案保存和社交场景中的第一人称经历叙述。它们构成了一个极具挑战性的计算问题,因为目标实体必须从分散的叙述证据中推断出来,而非依赖于局部的直接提及。我们推出了 IRC-Bench(Implicit Reminiscence Context Benchmark,隐含回忆语境基准),用于评估回忆转录文本中的隐含实体识别。该基准侧重于“非局部性”(non-locality):与命名实体识别、实体链接或共指消解不同,识别实体的线索分布在多个不连续的子句中。IRC-Bench 包含 25,136 个样本,这些样本基于 1,994 份跨越 11 个主题领域的转录文本,其中涉及 12,337 个与 Wiki-data 关联的实体。每个样本包含一对叙事:一是“实体锚定叙事”(Entity-Grounded Narrative),其中目标实体被明确提及;二是“实体省略叙事”(Entity-Elided Narrative),其中去除了直接提及。我们评估了涵盖大语言模型(LLM)生成、密集检索、检索增强生成(RAG)及微调的 19 种配置。在开放世界设定下,QLoRA 适配的 Llama 3.1 8B 表现最佳(精确匹配率 38.94%;Jaccard 相似度 51.59%),而在封闭世界检索中,微调后的 DPR 领先(Hit@1 为 35.38%;Hit@10 为 71.49%)。我们发布了包含数据、代码和评估工具的 IRC-Bench。 ## 提交历史 作者:Yehudit Aperstein [查看邮件 (https://arxiv.org/show-email/806637db/2605.06142)] **[v1]** 2026 年 5 月 7 日 星期四 12:39:49 UTC (1,211 KB)
相似文章
当用户未提问时:对话代理中上下文驱动记忆检索的基准测试
本文介绍了LoCoMo-Conv,一个对话记忆基准,用于评估长期对话代理中使用不同查询风格的记忆检索和响应质量,揭示了现有QA基准中的差距,并建议基于推理的记忆细化作为一个有前景的方向。
IFCMemoryBench:评估基于LLM的智能体在BIM信息检索中的长期记忆
本文介绍了IFCMemoryBench,一个经过人工验证的基准测试,用于评估基于LLM的智能体在BIM信息检索中的长期记忆。研究表明,当前的记忆系统仅能达到32.4%的答案准确率,揭示了智能体记忆中的领域迁移差距。
RECON:面向长上下文组合推理的智能体记忆基准测试
介绍RECON,一个用于评估基于LLM的智能体在长上下文中组合推理能力的基准测试,涵盖刑事、医疗和金融领域的24个案例文件。最佳非Oracle系统仅达到22.4%的准确率,揭示了当前记忆架构的严重局限性。
LabyrinthBench:一个本地优先、无需裁判的LLM基准测试,用于衡量多步骤智能体任务中干扰下的上下文记忆。
LabyrinthBench是一个本地化、无需裁判的LLM基准测试,能够确定性地衡量多步骤智能体任务中干扰下的上下文记忆。初步实验表明,清空上下文并重新注入门控答案对9个模型中的7个有帮助,但对2个适得其反,凸显了上下文管理策略的复杂性。
RealICU:大型语言模型代理是否能理解长上下文ICU数据?一个超越行为模仿的基准测试
RealICU是一个事后标注的基准测试,用于评估ICU场景中的大型语言模型(LLM),涵盖四个由医生驱动的任务。实验表明,现有LLM在回忆-安全权衡和锚定偏差方面存在困难,而一种新的结构化记忆代理改善了推理能力,但未能完全消除安全故障。