标签
EnSiTa 是一个支持英语、僧伽罗语和泰米尔语的三语多领域平行数据集和基准,包含人工后编辑的训练数据,并进行了大量领域特定机器翻译的实验,以应对低资源语言的挑战。
JEPA-Anything 提出了一种基于正交预测因子分解的领域无关框架,用于跨视觉、生物学和控制等多种系统学习预测模型,并展示了改进效果和实验验证。
Odyssey-3是一个新的基础世界模型,能够通过最少经验在机器之间重用世界知识来控制机器人、汽车、无人机和虚拟世界。
TurnBench介绍了一个多领域基准测试,用于评估口语对话中的话轮转换动态,特点是拥有手工标注的语料库和标准化的评估协议,用于检测话轮结束和中断。
本文诊断了 MoE+LoRA 微调中的适配器内竞争,并介绍了 SpawnLoRA,该方法动态添加子适配器以减少跨领域的负迁移。
FirstPass 是来自 Nature Communications 的大规模同行评审数据集,涵盖多个科学领域和多轮对话,旨在改进 AI 模型在科学判断方面的能力。
Flower Hub 是一个可复现的联邦学习基准测试平台,支持在模拟和部署运行时环境中执行和评估任务。
本文提出LT-MKT,一种用于多领域知识追踪的方法,该方法利用大型语言模型构建层次图,融合认知负荷和知识迁移,在现实数据集上实现了最先进的性能。
本文提出PAMT,一种面向多领域机器翻译的过程对齐强化学习框架,将领域感知的长思维链监督与步骤级过程奖励相结合,以改进对领域敏感的翻译决策。
本文介绍了Translation with Thought (TwT),一种资源理性的多领域机器翻译框架,可根据输入难度自适应调节推理强度,通过难度感知推理轨迹上的监督微调和强化学习训练而成。TwT-7B和TwT-14B在降低32–60% token用量的同时,在翻译质量上超越了更大的SOTA推理模型。
本文介绍了腾讯WorkBuddy Bench,一个面向编码智能体的多领域评估套件,通过从真实提交和业务场景逆向工程任务来抵抗数据污染,涵盖代码、Web、办公和安全领域。
Relay-Bench是一个新的基准测试,旨在评估大型语言模型在需要跨多个领域知识的推理链上的表现。
Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。
LOGOS是一个科学生成语言模型,它将多种科学对象及其空间交互编码为令牌序列,从而在自然科学的各类任务中实现统一的自主回归框架。1B、3B和8B参数的模型展现出性能随规模一致提升,并已发布以促进研究。
Count Anything 是一个用于文本引导的目标计数的通用模型,统一了多个领域,由新的 CLOC 数据集支持,该数据集包含跨越六个视觉领域的 220K 张图像。它实现了强大的准确性和多领域泛化能力。
本文介绍了DoRA-RBAC,一个用于组合LLM适配器的框架,并测试了几何感知合并是否能提升多域性能。结果显示,与标准平均方法相比,没有一致的改进,表明适配器干扰并非主要由参数空间几何驱动。
Arbor是一个用于自主科学研究的AI框架,它使用协调器、执行器和一个持久的假设树,在多个领域迭代改进研究成果,在六个真实研究任务上取得了强劲的成果。
SoCRATES提出了一个真实的多领域基准,用于评估主动式LLM调解器,显示顶尖模型在冲突解决中仅能弥合约三分之一的共识差距。
本文提出了一种局部扰动理论,用于解释多域强化学习中的跨域干扰现象。研究表明,干扰主要由低维冲突子空间中的二阶损伤项驱动,并证明短暂的域刷新或无需训练的回滚操作能够选择性地恢复丢失的能力。