标签
本文介绍了BPE引导插入,用于对字节级BPE模型进行事后分词器适配,在保持词汇表大小固定的同时保留大多数token-ID分配。该方法将乌克兰语的token数量减少约33-36%,同时将对英语和其他欧洲语言的影响降至最低。
This paper argues that the loanword-vs-switch annotation boundary, rather than the choice of model, drives Kazakh-Russian code-switching identification. The authors present a document-level gold LID dataset with an explicit annotation rule and show that naive heuristics and off-the-shelf LID tools fail to distinguish integrated borrowings from genuine code-switches.
介绍DE-NER,一种用于零样本命名实体识别的对话引导框架,通过提问者和角色扮演LLM之间的自我对弈来明确实体边界,相比基线平均提高了3.75%的F1值。
本文提出了一种从社交媒体文本构建大规模俄语数据集的方法,用于检测自杀前兆和反自杀信号,包括标注指南和基线分类实验。
本研究应用计算语言学和监督式机器学习,仅凭文本描述即可预测早期初创企业的退出情况,发现创始人叙述携带预测信号,并引入了一个可量化的夸张得分(Hyping Score)。
介绍了DataSpace,一个用于在异构工作空间上评估数据代理可验证表格分析能力的基准测试,包含410个跨语言任务和7,439个工件。当前前沿模型仅达到66.34%的准确率,表明仍有提升空间。
ChronoLens是一个框架,利用多语言语言模型和crosscoders测量五个议会传统(1803–2026年)中4498万篇文档跨语言层面的历史语言变化,表明变化幅度和方向在不同语言和不同时间会有所不同。
A developer deep dive into an NLP-based grocery categorization tool, covering input lexing, stemming, and a unigram database approach to classify products into categories.
Taranis AI 是一个开源 OSINT 工具,利用人工智能和自然语言处理来收集、丰富和整理来自多个来源的非结构化新闻,以生成可发布的情报报告。
本文利用mT5和成对迁移矩阵,研究了五种突厥语族语言之间的机器翻译跨语言迁移,发现迁移在紧密相关的语言对之间最强,并且在文字不匹配的设置中,拉丁化有所帮助。
本文对六种前沿大语言模型(LLM)进行基准测试,评估其根据警方事故叙述为事故属性编码的效果,并与官方致命事故数据库进行对照。研究发现,虽然 GPT-5.5 High 在 LLM 中表现领先,但简单基线方法的性能可与 LLM 媲美甚至更优,且属性间的差异大于模型间的差异。
本文介绍了体验性互文性检测,使用包括零样本LLM评分在内的无标注方法,以识别来自不同路线的法语移民叙事中共享的体验回声。
M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.
This paper presents a computational framework for automatically compiling collected commentaries on classical Chinese texts, preserving contextual dependencies of inline notes via prompt chaining and cross-source clustering.
Presents TELLER, a dual-path iterative preference optimization approach for table entity linking, with direct-answer and reasoning paths that improve accuracy on TableInstruct and MammoTab V2 benchmarks.
介绍了FinIndices,一个大规模基准测试,用于评估LLM在未裁剪财务报表上的数据处理保真度,揭示了财务推理中的知识瓶颈和结构瓶颈。
本文提出了一种新颖的无监督数据增强方法,结合高斯混合模型和大语言模型,通过为代表性不足的聚类生成合成文档,改善不平衡文本数据集上的聚类效果。
本文介绍了分层 Copula-Gumbel-Top-K(H-CGA)路由,一种在冻结混合专家模型中控制词元路由选择之间联合依赖关系的方法,同时保持每个词元的路由律完全固定。它提供了一致性与负载分散之间的理论权衡,并通过一个小规模试点验证了该机制。
本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。
一条推文重点介绍了一篇由Michel Fabrice Serret撰写的arXiv论文,该论文从应用数学的角度介绍了Transformer和注意力机制,涵盖了向量化、多头注意力以及降低注意力成本的方法,如KV缓存和Latent Attention。