标签
提出了一种基于VAE的多任务语义通信框架,用于卫星辅助自动驾驶,在保持交通标志重建和分类性能的同时,实现了显著的带宽压缩。
Infinity-Parser2 技术报告介绍了一个用于端到端文档解析的大型多模态模型,该模型具有可扩展的数据合成流水线及多任务强化学习能力。它在多项基准测试中取得了领先结果,同步发布了开源模型变体及一个包含500万样本的双语语料库。
SupraLabs 发布了 Supra-Router-51M,这是一个拥有 5170 万个参数的微型 LLM,用于多任务基础设施路由,旨在决定是将提示词在边缘设备上本地处理还是发送到云端模型。在一个小型数据集上进行微调后,它使用多任务序列生成来实现稳健的路由。
本文介绍了Goku,一个百万规模的指令驱动视频编辑数据集与基准,支持多任务和结构性操作。配套的模型Goku-Edit在指令遵循方面比开源模型提升了高达8%。
本文介绍了OpenFinGym,这是一个统一的多任务Gym环境,用于评估量化金融中的大语言模型Agent,涵盖预测、市场生成、实时交易和欺诈检测,具备可验证执行和自动化任务构建功能。
MacroLens 是一个用于上下文金融推理的新型多任务基准,它联合评估了价格历史、会计基本面、宏观经济体制以及文本数据,覆盖 4,416 只美国小盘股和微盘股。该基准包含七个任务、1,130 个宏观经济事件,并对 19 种方法进行了评估,旨在填补金融 AI 评估中的空白。
SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。
OdysSim对人类行为模拟的行为基础模型进行了系统研究,引入了Soul分类法、一个包含2140万次交互的语料库以及一种训练方法,该方法在23个基准任务中的8个上达到了最先进水平,同时生成更类人的输出。
SenseNova U1 发布了其 U1-8B-MoT 基础模型的信息图专用微调版本,在信息图准确性、图表理解和文本渲染方面实现了显著的基准提升。
提出ULPS,一种将校准的LLM集成到RL训练中的框架,通过不确定性调制的引导和基于A*的符号轨迹,在MiniGrid-UnlockPickup上实现了更高的成功率和样本效率。
Ultralytics YOLO26 引入了一个统一的实时视觉模型家族,具有无需NMS的推理、改进的训练策略以及用于检测、分割和姿态估计的多任务能力,实现了最先进的精度与延迟权衡。
本文提出了一种新的模型合并框架,将问题转化为关于残差更新的凸二次规划,以最小化平方输出的校准目标。该框架涵盖现有的启发式方法,并提供了一种闭式诊断指标来预测合并质量,在语言和视觉基准测试中持续取得改进。
Qwen-VLA是一个面向具身决策的统一视觉-语言-动作模型,整合了不同机器人平台上的操作、导航与轨迹预测。它采用基于DiT的动作解码器和具身感知提示条件,实现了强性能与分布外泛化。
本文介绍了AsyncTool,一个用于评估基于LLM的智能体在多任务场景下具有延迟工具响应的异步函数调用能力的基准测试。它提出了面向效率的度量指标,并识别了当前工具使用智能体的关键失败模式。