使用本地语法图为韩语法律聊天机器人生成训练数据集
摘要
本文提出了一种利用本地语法图(LGG)为韩语法律聊天机器人生成大规模、带标注训练数据集的方法,在使用 DIET 分类器时达到了 91% 的 F1 分数。
arXiv:2605.07432v1 公告类型:新论文
摘要:聊天机器人是指能够通过文本或语音信号与人类进行交流的机器人。由于律师提供的法律代理和法律建议成本高昂,往往将处于劣势和弱势群体排除在外,因此法律聊天机器人有助于提高司法获取度。然而,在用于深度学习对话系统(聊天机器人)的数据集中捕捉真实用户输入的多样性是一项技术挑战。多样性需要大量的数据,而且这些数据还必须进行标注以分类用户意图,而数据标注的成本随着数据量的增加而上升。与其对大量来自用户的真实数据进行标注,我们的方法是通过联合生成大量话语和高质量的标签来解决这一问题。标注数据集的生成器基于以本地语法图(LGG)形式呈现的语言资源,这些资源捕捉并概括了语言学家在文本中观察到的词汇和局部语法。LGG 根据特定领域的分类系统将标签与话语关联起来。我们通过实现韩语法律聊天机器人 LIGA 来测试这种方法。该聊天机器人通过提供韩国政府公开的类似法律案例的信息,回答用户关于法律情况的对话式查询。我们借助开源 Unitex 平台从 LGG 生成了带标注的话语。这一过程产生了 7 亿条话语。我们使用由这些话语组成的数据集训练了一个 DIET 分类器,训练后的模型达到了 91% 的 F1 分数性能。我们实现了一个名为 LIGA 的聊天机器人,它利用模型的结果来选择指向记录类似法律案例网页的链接。
查看缓存全文
缓存时间: 2026/05/11 07:03
# 为韩语法律聊天机器人生成训练数据集 来源: https://arxiv.org/abs/2605.07432 查看 PDF (https://arxiv.org/pdf/2605.07432) > 摘要:聊天机器人是通过文本或语音信号与人类通信的机器人。由于律师的法律代表和法律咨询成本高昂,将弱势和脆弱人群排除在外,因此法律聊天机器人可以提高获取正义的机会。然而,在深度学习对话系统(聊天机器人)的数据集中捕捉实际用户输入的多样性是一项技术挑战。多样性需要大量数据,这些数据还必须进行标注以分类用户意图,而数据标注的成本随着数据量的增加而增加。与其标注大量来自用户的真实数据,我们的方法是通过联合生成大量话语和高质量标签来实现。标记数据集的生成器基于语言资源的形式为局部语法图(LGG),它捕捉并概括语言学家在文本中观察到的词汇和局部语法。LGG 根据特定领域的分类系统将标签与话语关联。我们通过在韩语中实现法律聊天机器人 LIGA 来测试这种方法。聊天机器人通过提供韩国政府公开提供的类似法律案例的信息,回答用户关于法律情况的对话查询。我们在开源 Unitex 平台的帮助下,从 LGG 生成了已标记的话语。这一过程产生了 7 亿条话语。我们在由这些话语组成的数据集上训练了一个 DIET 分类器,经过训练的模型达到了 91% 的 f1-score 性能。我们实现了一个名为 LIGA 的聊天机器人,它使用模型的结果来选择记录类似法律案例的网页链接。 ## 提交历史 来自: Eric Laporte [查看邮件 (https://arxiv.org/show-email/9dabeb0b/2605.07432)] **[v1]** 星期五, 8 五月 2026 08:32:56 UTC (825 KB)
相似文章
将韩国文化融入LLM对齐:迈向文化一致性
本文提出一种数据集生成管道,通过DPO微调使大语言模型与韩国文化规范对齐,在提升文化安全性的同时不损害通用性能。
KoNeoBench:一个用于评估 LLM 对韩语新词理解的精选评估数据集
本文介绍了 KoNeoBench,这是一个精选的基准数据集,用于评估大型语言模型对韩语新词的理解,基于自2020年以来的1,785个在线新闻条目。它揭示了当前 LLM 在处理近期词汇变化和特定韩语语言特性方面的局限性。
利用细粒度错误校正优化咨询服务中的韩语语音识别
本文介绍了DasanCallDial,一个针对对话级ASR错误校正的大规模韩语基准数据集,并提出了DCSC框架,在纯文本后编辑中达到了最先进的性能。
GLAN-QnA-KR:一个基于无种子分类驱动的韩语指令语料库
本文发布了GLAN-QnA-KR,一个包含303,581行的韩语指令问答语料库,通过基于无种子分类驱动的GLAN合成流水线并使用Phi-3.5-MoE-instruct作为生产模型生成,具有近乎零重复和低基准污染的特点。
KG2Cypher:用于构建企业级文本到Cypher系统的数据驱动管道
KG2Cypher 提出了一种数据驱动管道,利用现有知识图谱构建企业级文本到Cypher系统。它使用LLM生成自然语言问题-Cypher对,并通过LLM评估器和人工审核进行验证,通过基于LoRA的微调在韩语企业数据集上取得了显著的性能提升。