标签
本文区分了增量叙事解释中由修正驱动的更新(非单调)和延迟阐述(单调),并通过视觉叙事展示了它们的应用。
本文介绍了 MT-InfoSeek,一个用于评估 LLMs 多轮信息检索能力的可控评估套件,揭示模型低估缺失信息,并在跨领域欠规范增加时表现不佳。
本文介绍了一个在模糊情境下进行交互式任务对齐的框架,并将其形式化为POMDP。研究表明,当前的大语言模型仅在22%到32%的情况下能恢复用户预期任务,落后于人类表现。