multilingual

标签

Cards List
#multilingual

不同扰动,不同机制:理解面向零样本方言鲁棒性的持续预训练

arXiv cs.CL · 2天前 缓存

本文系统研究了基于扰动的持续预训练(CPT)在提升多语言大语言模型零样本方言鲁棒性方面的作用,比较了德语、意大利语和阿拉伯语中的六种训练条件。研究发现,字符级噪声CPT是最有效的通用策略,并揭示了不同扰动方法会引发不同的鲁棒性机制。

0 人收藏 0 人点赞
#multilingual

@MSFTResearch:Paza:为低资源和多语言语言构建稳健语音技术的指南,从数据收集…

X AI KOLs Following · 2天前 缓存

微软研究院推出了Paza语音手册,这是一份交互式指南,用于为低资源和多语言语言构建稳健的语音技术,涵盖数据收集、模型训练、部署和评估。配套视频介绍了该手册,并演示了如何应用经过验证的实践。

0 人收藏 0 人点赞
#multilingual

基于资源感知的语音编码器混合体打破多对多语音到文本翻译中的多语言诅咒

arXiv cs.CL · 3天前 缓存

本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。

0 人收藏 0 人点赞
#multilingual

MERaLiON-GR:面向英语和东南亚语言的语音性别识别模型

arXiv cs.CL · 3天前 缓存

本文介绍了MERaLiON-GR,一个面向英语和东南亚语言的语音性别识别模型,基于MERaLiON-SpeechEncoder-2,使用LoRA和ECAPA-TDNN头部进行微调,在多语言基准上取得了最先进的性能。

0 人收藏 0 人点赞
#multilingual

注意输出上限:不同预算机制改变所测多语言推理差距

arXiv cs.CL · 3天前 缓存

本文研究MGSM上原生语言与翻译之间的多语言推理差距是否是输出token预算的伪影。作者表明,在不同的硬性上限下,测得的差距显著波动,并且长度归一化可以逆转策略排序,因此得出结论:在评估中应将输出上限视为一个独立变量。

0 人收藏 0 人点赞
#multilingual

面向多语言数学推理的同策略Delta蒸馏

Hugging Face Daily Papers · 3天前 缓存

本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。

0 人收藏 0 人点赞
#multilingual

使用跨语言对齐预测LLMs的多语言分类和翻译性能——英语足够吗?

arXiv cs.CL · 4天前 缓存

论文比较了27种跨语言对齐(CLA)分数变体,用于预测LLM在多语言分类和翻译任务上的性能,并提出了一种基于PMI的翻译指标。研究发现,与英语的CLA对翻译质量的预测能力与源语言-目标语言CLA相当或更好,支持了LLMs使用英语作为内部枢轴语言的观点。

0 人收藏 0 人点赞
#multilingual

评估OpenAI隐私过滤器:跨语言、跨领域的42个基准上的PII检测

arXiv cs.CL · 4天前 缓存

本文首次对OpenAI隐私过滤器(OPF)——一个15亿参数的个人身份信息(PII)检测器——进行了独立的系统性评估,涵盖22种语言、5个领域的42个基准,并与Presidio、GLiNER、GPT-4o和XLM-RoBERTa进行了比较。主要发现包括:OPF在结构化合成PII上表现强劲,但在非拉丁文字和叙事性散文中性能严重下降。

0 人收藏 0 人点赞
#multilingual

我开源了多语言教育视频生成器背后的系统

Reddit r/AI_Agents · 4天前

作者开源了 SarasFlow,这是一个 AI 流水线,能够根据主题生成教育视频:编写脚本、生成旁白、制作视觉内容、添加字幕并组装最终视频,所有组件都是模块化且可替换的。

0 人收藏 0 人点赞
#multilingual

教 Nemotron 学希腊语:面向专业领域的语料挖掘、检索适配与有依据的生成

Hugging Face Daily Papers · 4天前 缓存

本文介绍了对 NVIDIA 的 Nemotron 检索栈进行的端到端适配,使其适用于现代希腊语,包括新基准 HERA,以及在专业领域针对检索、重排序和有依据的生成进行微调的模型。

0 人收藏 0 人点赞
#multilingual

NOLLI:用于诊断英语-韩语性能差距的难度校准谜题基准

Hugging Face Daily Papers · 4天前 缓存

介绍NOLLI,一个程序化生成的英语-韩语谜题基准,用于诊断LLM性能差距,包含15种谜题类型和校准难度,揭示书写系统密集型任务表现出显著的性能差距。

0 人收藏 0 人点赞
#multilingual

K-EXAONE 2.0 技术报告

Hugging Face Daily Papers · 4天前 缓存

K-EXAONE 2.0 是 LG AI Research 推出的开源权重多语言 MoE 基础模型,总参数达 750B,激活参数为 37B,支持 10 种语言和 256K 上下文,在智能体编码、长上下文理解和安全性方面均有显著提升。

0 人收藏 0 人点赞
#multilingual

面向字节级BPE的书写系统级分词器适配

arXiv cs.CL · 5天前 缓存

本文介绍了BPE引导插入,用于对字节级BPE模型进行事后分词器适配,在保持词汇表大小固定的同时保留大多数token-ID分配。该方法将乌克兰语的token数量减少约33-36%,同时将对英语和其他欧洲语言的影响降至最低。

0 人收藏 0 人点赞
#multilingual

低资源东南亚语言中的原生多语言思维链推理

arXiv cs.CL · 5天前 缓存

介绍了OSCD,一种后训练算法,用于改进低资源东南亚语言中的原生多语言思维链推理,在数学基准上实现了高达3.2倍的提升。

0 人收藏 0 人点赞
#multilingual

开源我一直在构建的 AI 视频平台:SARAS

Reddit r/AI_Agents · 5天前

作者开源了 SARAS,一个 AI 视频平台,能从简单主题生成完整视频(脚本、配音、画面、剪辑、字幕),支持 24 种语言和多种风格,包含后端功能如认证、支付和 270+ 测试。

0 人收藏 0 人点赞
#multilingual

ChronoLens:跨时间、跨语言和语言层面的语言变化测量

Hugging Face Daily Papers · 5天前 缓存

ChronoLens是一个框架,利用多语言语言模型和crosscoders测量五个议会传统(1803–2026年)中4498万篇文档跨语言层面的历史语言变化,表明变化幅度和方向在不同语言和不同时间会有所不同。

0 人收藏 0 人点赞
#multilingual

M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models

arXiv cs.CL · 6天前 缓存

M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.

0 人收藏 0 人点赞
#multilingual

23种语言,只有一种我能检查

Lobsters Hottest · 6天前 缓存

作者使用AI将其应用Popsicle Boat翻译成23种语言,依靠自己的德语水平在发布前抽查质量,并分享了关于信任AI进行本地化的经验教训。

0 人收藏 0 人点赞
#multilingual

LG AI Research 发布 K-EXAONE 2.0 750B A37B

Reddit r/LocalLLaMA · 2026-07-30 缓存

LG AI研究院在Hugging Face上发布了750B参数规模的开源AI基础模型'K-EXAONE 2.0'。该模型采用Apache 2.0许可证,可商业使用,支持多语言,性能与国际领先模型相当。

0 人收藏 0 人点赞
#multilingual

@rohanpaul_ai: Fish Audio 刚刚将 S2.1 Pro 免费开放一个月。以下是您需要了解的一切 - 从10秒音频克隆任何声音…

X AI KOLs Following · 2026-07-30 缓存

Fish Audio 已将其 S2.1 Pro 语音克隆服务免费开放一个月,支持10-15秒语音克隆、约90毫秒响应时间、83种语言、单词级控制,以及开放权重模型,成本仅为 ElevenLabs 的六分之一。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈