multi-task

标签

Cards List
#multi-task

一种基于VAE的多任务卫星辅助语义通信框架,用于支持6G的互联自动驾驶汽车

arXiv cs.LG · 4天前 缓存

提出了一种基于VAE的多任务语义通信框架,用于卫星辅助自动驾驶,在保持交通标志重建和分类性能的同时,实现了显著的带宽压缩。

0 人收藏 0 人点赞
#multi-task

Infinity-Parser2 技术报告

arXiv cs.AI · 2026-07-10 缓存

Infinity-Parser2 技术报告介绍了一个用于端到端文档解析的大型多模态模型,该模型具有可扩展的数据合成流水线及多任务强化学习能力。它在多项基准测试中取得了领先结果,同步发布了开源模型变体及一个包含500万样本的双语语料库。

0 人收藏 0 人点赞
#multi-task

SupraLabs/Supra-Router-51M

Hugging Face Models Trending · 2026-07-05 缓存

SupraLabs 发布了 Supra-Router-51M,这是一个拥有 5170 万个参数的微型 LLM,用于多任务基础设施路由,旨在决定是将提示词在边缘设备上本地处理还是发送到云端模型。在一个小型数据集上进行微调后,它使用多任务序列生成来实现稳健的路由。

0 人收藏 0 人点赞
#multi-task

Goku:百万规模通用数据集与指令驱动视频编辑基准

Hugging Face Daily Papers · 2026-06-30 缓存

本文介绍了Goku,一个百万规模的指令驱动视频编辑数据集与基准,支持多任务和结构性操作。配套的模型Goku-Edit在指令遵循方面比开源模型提升了高达8%。

0 人收藏 0 人点赞
#multi-task

OpenFinGym:一个可验证的多任务Gym环境,用于评估量化交易Agent

arXiv cs.AI · 2026-06-26 缓存

本文介绍了OpenFinGym,这是一个统一的多任务Gym环境,用于评估量化金融中的大语言模型Agent,涵盖预测、市场生成、实时交易和欺诈检测,具备可验证执行和自动化任务构建功能。

0 人收藏 0 人点赞
#multi-task

MacroLens:宏观经济场景下上下文金融推理的多任务基准

arXiv cs.LG · 2026-06-25 缓存

MacroLens 是一个用于上下文金融推理的新型多任务基准,它联合评估了价格历史、会计基本面、宏观经济体制以及文本数据,覆盖 4,416 只美国小盘股和微盘股。该基准包含七个任务、1,130 个宏观经济事件,并对 19 种方法进行了评估,旨在填补金融 AI 评估中的空白。

0 人收藏 0 人点赞
#multi-task

SpeechDx:临床语音AI的多任务基准

arXiv cs.AI · 2026-06-17 缓存

SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。

0 人收藏 0 人点赞
#multi-task

OdysSim:构建人类行为模拟的基础模型

arXiv cs.CL · 2026-06-15 缓存

OdysSim对人类行为模拟的行为基础模型进行了系统研究,引入了Soul分类法、一个包含2140万次交互的语料库以及一种训练方法,该方法在23个基准任务中的8个上达到了最先进水平,同时生成更类人的输出。

0 人收藏 0 人点赞
#multi-task

SenseNova U1 推出面向信息图的微调模型

Reddit r/LocalLLaMA · 2026-06-10

SenseNova U1 发布了其 U1-8B-MoT 基础模型的信息图专用微调版本,在信息图准确性、图表理解和文本渲染方面实现了显著的基准提升。

0 人收藏 0 人点赞
#multi-task

面向稀疏奖励强化学习的不确定性感知LLM引导策略塑形

arXiv cs.LG · 2026-06-08 缓存

提出ULPS,一种将校准的LLM集成到RL训练中的框架,通过不确定性调制的引导和基于A*的符号轨迹,在MiniGrid-UnlockPickup上实现了更高的成功率和样本效率。

0 人收藏 0 人点赞
#multi-task

Ultralytics YOLO26:统一的实时端到端视觉模型

Hugging Face Daily Papers · 2026-06-02 缓存

Ultralytics YOLO26 引入了一个统一的实时视觉模型家族,具有无需NMS的推理、改进的训练策略以及用于检测、分割和姿态估计的多任务能力,实现了最先进的精度与延迟权衡。

0 人收藏 0 人点赞
#multi-task

基于输出空间投影的模型合并

arXiv cs.LG · 2026-05-29

本文提出了一种新的模型合并框架,将问题转化为关于残差更新的凸二次规划,以最小化平方输出的校准目标。该框架涵盖现有的启发式方法,并提供了一种闭式诊断指标来预测合并质量,在语言和视觉基准测试中持续取得改进。

0 人收藏 0 人点赞
#multi-task

Qwen-VLA:统一跨任务、环境与机器人具身形态的视觉-语言-动作建模

Hugging Face Daily Papers · 2026-05-28 缓存

Qwen-VLA是一个面向具身决策的统一视觉-语言-动作模型,整合了不同机器人平台上的操作、导航与轨迹预测。它采用基于DiT的动作解码器和具身感知提示条件,实现了强性能与分布外泛化。

0 人收藏 0 人点赞
#multi-task

AsyncTool:多任务场景下异步函数调用能力评估

Hugging Face Daily Papers · 2026-05-27 缓存

本文介绍了AsyncTool,一个用于评估基于LLM的智能体在多任务场景下具有延迟工具响应的异步函数调用能力的基准测试。它提出了面向效率的度量指标,并识别了当前工具使用智能体的关键失败模式。

0 人收藏 0 人点赞
#multi-task

首次微调求把关——多任务推理选3B还是7B?

Reddit r/MachineLearning · 2026-04-23

一位自学开发者首次做多任务微调,想训练模型深入理解问题本质,在社区请教3B与7B模型该如何选择。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈