标签
Euclid-Omni 是一个神经符号框架,它整合了大型语言模型(LLMs)、视觉语言模型(VLMs)和一个符号求解器,用于处理从计算到奥林匹克级别的证明的平面几何问题,并使用合成数据生成进行训练。
作者认为VLM(多模态模型)是死路一条,因为文本的信息量远高于图片和视频,纯文本LLM Agent能解决更复杂的问题。
OpenAI 的 GPT-5.6 Sol 在基准测试中被评估为该公司迄今最强的视觉模型,与 GPT-5.5 等前代模型相比,在物体检测和其他视觉任务上表现出显著提升。
本文介绍了SELR,一个统一的自解释潜在推理框架,它训练单个模型以执行高效推理,同时生成人类可读的解释,从而消除了对外部解码器的需要。
本文介绍了一种 Qwen3.8-27B 模型的量化版本,使用 INT4 AutoRound 量化技术并配备可用的 MTP 进行投机解码,在 GPU 上实现了显著的推理速度提升。
一项针对9个视觉语言模型的专家机械师刹车维修考试评估显示,它们懂得理论,但在实际部署中自主发现问题和适应调整方面表现不佳。
一位社区成员对即将发布的Qwen3.8-27B进行了推测,重点提到了诸如VLM、智能体改进以及思考模式等被预告的功能,并开玩笑地建议采用一种“僧侣”式的推理强度,以实现长时程的认知超脱。
介绍了Click2Poly,一种基于Florence-2的人机协同视觉语言模型,可加速建筑物和墙体矢量图层的手动编辑,并以QGIS插件的形式实现。
介绍了DashArena,这是首个针对LLM开放式、任务驱动的交互式分析仪表板生成的基准测试。它使用浏览器执行器重放交互轨迹,并使用VLM评判器评估结果,人工研究证实了其有效性。
本文研究了在数学评估中预测题目难度时应如何表示视觉证据,比较了仅文本、视觉文本化以及使用LLMs和VLMs的图像原生建模。研究发现,图像原生建模是文本化的有竞争力的替代方案,其性能取决于VLM的适配。
VisionPsy-Nano-460M-Flash 是一款全新的460M视觉语言模型,每张图像仅使用64个视觉token,在iPhone上首token延迟降至0.3秒,同时保留了完整模型约99%的基准分数。这种优化牺牲了部分OCR和精细细节质量。
一条推文声称 Qwen3.8-Max 是最佳目标检测 VLM,在卫星、红外、文档和手绘图像方面表现出色,并分享了示例。
Hunyuan3D-Buffalo 1.0 是一个用于3D生成、理解与编辑的统一多模态模型,基于87M规模的3D多模态语料库进行训练。它结合了Hunyuan3D-VLM和Hunyuan3D-DiT,在文本到3D生成和3D编辑基准上取得了最先进的性能。
本文强调,用于胸部X光报告生成的 VLMs 在基准测试中能取得高分,但同时会抹去有临床意义的术语并引入有偏见的语言,并提出一个框架来度量这些失败。
本文发现多模态大语言模型(MLLMs)存在风格不一致性:其理解能力鲁棒,但安全机制可被风格触发器绕过。提出对抗性风格优化(ASO),利用GRPO微调图像编辑模型以增强越狱攻击。
介绍 ASCIITermDraw Bench,这是一个用于评估视觉语言模型在 ASCII 艺术生成与编辑任务上的基准测试。
HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。
O-VAD 提出了一种无需训练的智能体框架,用于工业视频异常检测,该框架随时间跟踪对象状态演变,并在时间轨迹上进行推理以识别异常对象,在三个数据集上优于现有的 VLM 和 VAD 方法。
本文提出了基础模型部署组合问题,旨在最小化跨交通管理职能部署LLM和VLM的总拥有成本,同时考虑质量、延迟和安全性约束。案例研究表明,与全闭源API基线相比,成本节省达97%。
OvisOCR2是一个0.8B参数的端到端文档解析视觉语言模型,在OmniDocBench排行榜上位居榜首,在实际扫描的医学文档上,其准确性和效率均优于流水线OCR系统。