标签
Taranis AI 是一个开源 OSINT 工具,利用人工智能和自然语言处理来收集、丰富和整理来自多个来源的非结构化新闻,以生成可发布的情报报告。
本文利用mT5和成对迁移矩阵,研究了五种突厥语族语言之间的机器翻译跨语言迁移,发现迁移在紧密相关的语言对之间最强,并且在文字不匹配的设置中,拉丁化有所帮助。
本文对六种前沿大语言模型(LLM)进行基准测试,评估其根据警方事故叙述为事故属性编码的效果,并与官方致命事故数据库进行对照。研究发现,虽然 GPT-5.5 High 在 LLM 中表现领先,但简单基线方法的性能可与 LLM 媲美甚至更优,且属性间的差异大于模型间的差异。
本文介绍了体验性互文性检测,使用包括零样本LLM评分在内的无标注方法,以识别来自不同路线的法语移民叙事中共享的体验回声。
M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.
This paper presents a computational framework for automatically compiling collected commentaries on classical Chinese texts, preserving contextual dependencies of inline notes via prompt chaining and cross-source clustering.
Presents TELLER, a dual-path iterative preference optimization approach for table entity linking, with direct-answer and reasoning paths that improve accuracy on TableInstruct and MammoTab V2 benchmarks.
介绍了FinIndices,一个大规模基准测试,用于评估LLM在未裁剪财务报表上的数据处理保真度,揭示了财务推理中的知识瓶颈和结构瓶颈。
本文提出了一种新颖的无监督数据增强方法,结合高斯混合模型和大语言模型,通过为代表性不足的聚类生成合成文档,改善不平衡文本数据集上的聚类效果。
本文介绍了分层 Copula-Gumbel-Top-K(H-CGA)路由,一种在冻结混合专家模型中控制词元路由选择之间联合依赖关系的方法,同时保持每个词元的路由律完全固定。它提供了一致性与负载分散之间的理论权衡,并通过一个小规模试点验证了该机制。
本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。
一条推文重点介绍了一篇由Michel Fabrice Serret撰写的arXiv论文,该论文从应用数学的角度介绍了Transformer和注意力机制,涵盖了向量化、多头注意力以及降低注意力成本的方法,如KV缓存和Latent Attention。
Stanford NLP Group 推荐了2024年的CS224N视频播放列表,提醒观众观看最新的基于深度学习的自然语言处理讲座。
Introduces MORFES, a benchmark of 500 expert-verified items for testing productive inflectional competence in Modern Greek, and evaluates open language models including their own Sophea-Genesis-1, which leads on inflectional morphology.
本文介绍了ICLE++,一个包含整体评分和特征评分的说服性学生作文新语料库,旨在提升自动化作文评分(AES)研究中的泛化能力和多特征评分能力。
This paper recasts fine-grained intertextuality extraction in Classical Chinese histories as an agentic LLM task, grounding reuse in exact character spans and a five-dimension typology, validated by expert-adjudicated benchmarks and scaled to the Twenty-Four Histories.
本文比较了基于LLM的对话中情绪-原因对提取的生成与判断范式,发现对级判断优于对话级生成,并引入辅助检索器以改进性能。
本文通过人工评估对跨度引导和无引导的文本去毒化进行了受控比较,发现存在一种权衡:当保留原始立场很重要时,跨度引导的重写更受青睐;而无引导的重写则因更彻底的缓解而更受欢迎,尤其是在较轻度的毒性上。研究还将自动评估器视为诊断工具,而非替代人工判断。