标签
本文介绍了一个针对孟加拉语习语的基准数据集,并评估了近期大型语言模型在习语相关任务上的表现,揭示了不同模型在性能上存在显著差异。
FrameBench 是一个新的基准,用于评估大型语言模型是否能区分动词在上下文中的依赖框架语义的解释,针对英语和日语构建,使用 FrameNet 资源,并随代码发布。
MineTRACE 是一个基于证据的交互式网络推理系统,集成了地球化学、地球物理和地质数据,提供透明的矿产勘查潜力评分和自然语言交互,支持高效且可验证的矿产勘查。
本文探讨了使用不同属性选择方法的角色提示如何影响大型语言模型与社会调查中人类响应的对齐。研究发现,其有效性取决于人类响应的变异性和属性的选择。
MultiGhostBench是一个多语言基准,用于评估分布偏移下长文本LLM生成文本的归因。它包含六种语言的928本书籍,并突出了性能下降以及没有单一方法在所有设置中始终最佳的现象。
本研究提出一种两阶段框架,用于句级抑郁症状识别,采用候选生成与定义引导验证方法,在评估方法中取得了最佳准确率和F1分数。
本文探讨了Pangram,一家检测AI生成文本的AI初创公司,它在出版丑闻中的角色,以及对其检测模型可信度的质疑。
本文详细解释了Transformer架构,包括注意力机制、QKV和残差连接,并从N-gram到LSTM的历史发展入手。
本文研究了词汇规范化中的多语言诅咒,发现同时在多种语言上训练单个模型会导致各语言准确率下降,而当语言以小组形式训练时性能最佳。
CUDA-Harness是一个利用智能体技术从自然语言描述生成和优化CUDA内核的框架,通过连接高级语义与低级实现和验证来解决Text2CUDA中的挑战。
AI Historian是一个AI智能体系统,帮助历史学家组织和验证分散历史叙事中以人为中心的时间线索,降低历史研究的成本,同时实现高精度的时间定位。
本文展示了一个使用Telnyx Call Control和AI推理的Python/Flask示例,用于创建自然语言IVR系统,使呼叫者能口头表达需求,而无需操作固定菜单。
本文首次应用数据科学,利用自然语言处理技术评估英国荣誉系统,并引入一种新型情感分析算法Minos,以评估公众对荣誉获得者的意见。
本文介绍了一种生产级框架,利用大语言模型将自然语言定价策略转换为旅游定价的可执行决策,在实际部署中实现了显著的效率提升和可审计性。
本文研究了基于DAPF的痴呆检测模型的可解释性,揭示了虽然DAPF取得了强劲的性能,但其token级别的解释缺乏忠实性。
本文介绍了一种基于因果图的注意力机制,以提升检索增强生成(RAG)系统中的检索精度,并在专有知识库的关键词填充机制中显示改进。
本文介绍了Peony,首个评估大型语言模型在理解现代中文诗歌中诗歌逻辑的基准,并评估了六种主流LLM,揭示了它们在这一专业任务中的局限性。
本文提出了一种本体驱动的框架,用于量化并强制执行文档级关系提取数据集中的结构一致性,减少逻辑矛盾,并在使用远程监督数据时提高模型泛化能力。
本文介绍了ImmigrationReason,一个用于法律推理研究的大规模美国移民上诉结构化数据集,填补了自然语言处理研究中行政裁决数据的空白。
本研究开发了一个歧义分类体系,用于评估大语言模型在从未经处理的电子病历数据中进行临床数据登记抽象时的表现,发现LLM的准确性显著低于人工抽象者,并且随着任务歧义性的增加而下降。