标签
本文实证研究了自然对话中问题的显著性与可回答性之间的关系,发现一个稳健但低的正相关关系,且弱于独白文本中的相关性,这表明对话结构的可预测性较低。
本文介绍了Coupled Usage–Sense Processes (CUSP),一个用于分析词汇语义变化的层次化模型,通过量化词语使用中随时间变化的时间、机制和归因。
本文提出一种基于知识图谱的评估框架,用于评估大型语言模型在问答任务中的上下文理解能力,并引入一种新的相似度度量S3KG,该度量在性能上优于现有的基线方法。
本文介绍了一种基于ℓp正则化的自动秩分配方法ℓp-LoRA,该方法用于低秩适应,并在自然语言处理任务上展示了具有竞争力的性能。
本研究引入 SHAP-RTL,一个渲染层,用于校正针对右到左语言的 SHAP 和 LIME 解释可视化,解决标记序列和文本塑形等问题,同时保留原始归因值。
本文复现了一种针对印地语的分布式语义抽取式摘要方法,并在标准语料库上进行评估,发现句子位置是唯一有效的特征,且当前的印地语基准测试未能激励高级内容选择。
本文提出了一种检索策略,用于过滤大语言模型驱动的自主网络智能体中的无关HTML内容,从而提升其在WebArena等基准测试上的表现。
本文介绍了NAF-Bench,用于研究大型语言模型对指定否定语义的遵守情况。研究发现,像o4-mini这样的前沿模型表现良好,而开源模型则滞后。建议通过求解器委托或微调来改进。
本文介绍UGTPhon,一个针对用户生成文本字音转换的基准,并提出一种组合方法,通过利用标准形式提升性能。
本文提出设计原则及'AGIMUD'软件,该软件利用生成式人工智能和分布式处理,以支持在模拟动态世界中人类与多个AI智能体之间的社会情感交互。
本文介绍了Arafa,一个使用LLM生成的大规模阿拉伯语事实核查数据集,旨在解决阿拉伯语自动事实核查资源稀缺的问题。
本文提出一种上下文与答案对齐的记忆压缩(CMC)框架,通过将长输入上下文压缩为紧凑的记忆嵌入,在不修改解码器权重的情况下降低LLM推理成本,显著提升性能和效率。
Peerify 是一个用于自动验证同行评审声明与稿件证据的流程,使用来自 NeurIPS 2024 和 ICLR 2024 的 800 个声明的基准,证明以检索为中心的验证优于蕴含基线。
OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna,这是基于 GPT-6 Astra 进步的更快、更实惠的模型,旨在实现大规模使用。
本文提出了一种使用语义量化和跨模态指标评估多模态合成数据的统一框架,强调了进行显式评估时需要排列基线和覆盖报告。
Hemmingway-1 是 Qwen3.8-27B AI 模型的微调版本,旨在生成更像人类的写作风格的文本。
用户描述了让AI代理可靠地将原始会议记录转化为带有负责人和截止日期的结构化行动项的挑战和部分解决方案,强调了幻觉和遗漏上下文等问题。
论文提出CaLR框架,通过因果拓扑构建有约束隐空间优化机制以增强扩散语言模型,在复杂基准测试中实现了最先进的性能。
本文分析了大型推理模型在机器翻译中的推理轨迹,发现推理收益是有条件的,并引入Hierarchical Meta-Summarization来理解轨迹模式。