标签
一位开发者分享了为金融科技构建印地语-英语语音代理的事后复盘,重点介绍了数字回读、语码混合TTS、负载下的延迟和合规性等挑战。关键的修复是选择对印度语码混合有一流支持的TTS,并在真实并发条件下进行测试。
本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。
本文系统研究了基于扰动的持续预训练(CPT)在提升多语言大语言模型零样本方言鲁棒性方面的作用,比较了德语、意大利语和阿拉伯语中的六种训练条件。研究发现,字符级噪声CPT是最有效的通用策略,并揭示了不同扰动方法会引发不同的鲁棒性机制。
本文探讨了重复出现的 LLM 工作负载是否可以在适当情况下被自动合成的、由类型化 ML/NLP 算子组成的确定性流水线所替代,并征求关于可行性和方法的反馈。
IslamicTurathBench(ISTB)是一个新的多任务、多学科基准,用于评估大语言模型在古典伊斯兰学术上的表现,包含 3,465 道专家审核的题目,涵盖 35 部著作和七个领域。
FinReportBench 是一个基于专家经验的基准测试,用于衡量和改进机构级财务报告生成,包含 35 项可观察标准,涵盖可交付性、报告身份和机构完整性。它精选了 244 个双语任务,评估了九个模型家族,并使用基准引导的技能蒸馏来改进五个模型家族的生成和自我审查能力。
本文从计算角度研究双关语翻译,将其视为一个发现、探索和选择的过程,使用基于图的可供性检索和多评估器排序。作者表明,成功的双关语翻译依赖于在目标语言中发现新的音义碰撞,而非保留源语言词汇。
本文提出了一个使用大语言模型构建塔吉克语电子详解词典的概念框架,该框架整合了词法分析、词形还原、语义聚类和词典条目生成,并采用PEFT策略。
该论文提出了MAP-PO,一个多智能体框架,通过标注行为对标注者进行聚类,并使用偏好优化为每个聚类微调独立的LLM智能体,从而在性别歧视检测任务中保留分歧。在EXIST 2024数据集上的实验表明,聚类特定训练是必要的,且共享的团队级奖励能使智能体保持校准。
本文提出了HomoEnsNER,一个由五个GujaratiBERT模型组成的同质集成,用于古吉拉特语命名实体识别,并表明它优于依赖架构多样性的异构替代方案,在Naamapadam测试集上取得了最先进的F1分数。
TabletCraft 是一个开源系统,支持阿卡德语与英语之间的双向神经机器翻译,并具备楔形文字渲染功能,使用户既能阅读古代泥板,也能用楔形文字撰写新消息。该系统已被 ACL 2026 的 C3NLP 研讨会接收,并首次公布了英语到阿卡德语翻译的量化结果。
本文提出了Archive,一个用于开放域问答中歧义检测的框架,利用逻辑冲突区分歧义与答案多样性,并引入了包含4,703个查询的基准QuireQA。实验表明,Archive将F1最高提升21.6%,同时比竞争对手快16倍。
一条推文认为掩码语言建模没有必要,自回归模型就足够了,并顺便提到了 BERT。
This paper proposes Pruned BPE, a post-training method that prunes low-exposure tokens from a BPE vocabulary and reallocates slots to better-exposed candidates, reducing encoded length without increasing model-visible vocabulary size. Experiments on English and Chinese corpora show approximately 0.27–0.36% encoded length reduction over standard BPE.
The paper proposes QQ, a framework that leverages the intrinsic duality between multi-hop question generation and question answering via bidirectional alignment constraints and contrastive learning, improving question quality on HotpotQA and MuSiQue.
AttnLink is a research paper presenting an attention-based framework for schema linking in Text-to-SQL, converting LLM internal attention into continuous relevance scores for schema items. Experiments on Spider, BIRD, and Spider2-SQLite show high mAP scores and millisecond-scale latency.
本文介绍了SANE,一种用于检索增强生成的轻量级插件,通过基于摘要选择最佳候选者并执行蓝图引导的查询时证据提取,同时改进检索和阅读。
本文介绍了BPE引导插入,用于对字节级BPE模型进行事后分词器适配,在保持词汇表大小固定的同时保留大多数token-ID分配。该方法将乌克兰语的token数量减少约33-36%,同时将对英语和其他欧洲语言的影响降至最低。