标签
本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。
本文提出了Architect-Ant,一个可编辑的建筑平面图自动家具布局框架,以及一个包含270个带家具标注的平面图的精选数据集(AntPlan-270)。该方法使用微调的视觉语言模型和领域特定语言生成几何有效且功能合理的家具布局,并可光栅化为蓝图风格图像。
一个可扩展的框架结合了自蒸馏和强化学习,将任务解决能力从视觉语言模型迁移到视频扩散模型,无需标注的任务-视频数据。
OmniGameArena 引入了一个统一的基准,用于在多样化的Unreal Engine 5游戏环境中评估VLM代理,该基准包含一个改进动态曲线,用于追踪技能在反思轮次中的演化过程。
VoLoAgent 将视觉语言模型与机器人能力相结合,用于开放词汇长程操作任务,引入了一个物理编排器,该编排器使用可中断工具进行规划、监控和恢复,并提出了一个名为 RoboVoLo 的基准用于评估。
一份解析 Gemma 4 12B 完整架构的可视化指南,介绍了该模型如何在移除传统视觉和音频编码器的情况下,无需独立编码器模型即可处理文本、图像和音频。
本文提出结构化缺陷定位(SDG)方法,将文本到图像缺陷建模为(位置、类型、原因、重要性)结构化元组,并利用视觉语言模型(VLM)进行检测,同时构建了包含3万张图像的SDG-30K数据集以及名为BoxFlow-GRPO的诊断到对齐框架。
H Company发布Holo3.1,这是一个面向计算机使用代理的视觉语言模型系列(0.8B至35B),支持Web、桌面和移动端自动化,具备原生函数调用功能,并提供优化后的量化检查点,便于本地部署。
本文提出MAOAM,一个统一的视觉-语言模型框架,能够通过文本或点击交互实现精确的物体和材质选择,用于交互式图像编辑。它引入了一个可扩展的数据生成流程,并展示了在推理时结合文本和点击的涌现提升。
PaddleOCR-VL-1.6 通过识别并精炼欠优化区域,结合针对性的数据优化与渐进式后训练,提升了文档解析性能,在 OmniDocBench v1.6 上达到 96.33% 的最新最优水平。
MLX-VLM v0.6.0 已发布,新增推测解码、兼容 Anthropic API 的智能体服务器、新模型(DeepSeek V4、ZAYA1-VL 等)、图像生成/编辑以及音频输入支持,使 Apple 设备上能运行本地 AI 智能体。
MMG2Skill通过闭环学习将网络上的过程性指南转化为智能体可执行的技能,在GUI操控、游戏玩法和纸牌游戏任务中提升了性能,宏平均提升了+12.8到+25.3个百分点。
PhyDrawGen 是一个神经符号管道,它结合基于大语言模型的场景理解、确定性约束求解器以及基于视觉语言模型的验证循环,从自然语言生成物理精确的示意图,在物理问题基准测试中优于现有模型。
本文介绍了3DCodeBench——一个用于评估视觉语言模型通过代码进行过程化3D建模的基准测试,以及3DCodeArena——一个基于成对人类偏好的排名平台。
本文介绍了用于基于屏幕条件的动作预测的PiSAR基准,并将监督微调模型与前沿零样本基线进行了比较。关键发现表明,微调的Qwen3-VL-8B达到了0.783的语义相似度,显著优于Claude Opus 4.7和GPT-5.5(0.459和0.482),但同样的微调配方应用于更大的推理调优Gemma模型仅产生0.441,表明存在模型与配方不匹配的问题。
本文提出了VFEAgent,一种通过将视觉语言模型与验证优先的代码合成框架相结合来自动化有限元分析的多智能体系统,实现了从图像和问题描述到端到端模拟。
Stable-Layers是一个强化学习框架,它利用VLM反馈而非配对监督来微调预训练的图层分解模型,采用Flow-GRPO与LoRA以及两阶段奖励校准流程,在Crello数据集上提升图层质量。
本文提出 VisAnomReasoner,一个参数高效的视觉语言模型,在带自然语言解释的新基准 VisAnomBench 上微调,在时间序列异常检测中精度和 F1 提升超过 21 个百分点,并展现出强大的跨基准泛化能力。
提出MedExpMem,一个经验记忆框架,使医学视觉语言模型能够从过往病例中积累和检索具有鉴别性的诊断经验,在放射学基准上将鉴别诊断准确率最多提升7.0%。
InstructSAM 提出了一个统一的框架,用于多实例分割,采用指令驱动的查询,桥接视觉语言模型和 SAM3,在复杂基准上取得了强劲结果。