VectraYX-Vision-1B:面向西班牙语/拉丁美洲网络安全的亚20亿参数视觉语言模型,具有结构化视觉推理和原生工具使用能力

Hugging Face Daily Papers 论文

摘要

介绍了VectraYX-Vision-1B,这是一个面向西班牙语/拉丁美洲网络安全的亚20亿参数视觉语言模型,通过MLP将冻结的SigLIP编码器与西班牙语解码器耦合;然而,尽管流水线功能完全正常,它却报告了近乎为零的视觉基础能力,并提供了开源权重和修复计划。

我们提出了VectraYX-Vision-1B,一个面向西班牙语/拉丁美洲网络安全图像的亚20亿参数视觉语言模型(VLM),通过MLP将冻结的SigLIP-so400m编码器与1.04B西班牙语/拉丁美洲安全解码器耦合。据我们所知,这是首个专用于网络界面(IDA、Ghidra、Wireshark、Nmap、Metasploit、Volatility)的亚20亿参数VLM,它用西班牙语回答,通过原生<|think|>令牌输出结构化推理,通过模型上下文协议(<|tool_call|>)调用工具,并导出为llama.cpp的LLaVA mmproj格式以支持物理隔离部署。我们报告了一个初步的负面视觉基础结果:尽管流水线功能完全正常,当前的视觉SFT(400-1900步,约1600万令牌)产生了接近零的B6分数(工具识别0.08),忽略了图像内容。我们指定了修复方案(更长的SFT、>=60%重放、更低的学习率),并揭示了一个伪装成训练崩溃的检查点加载器错误(未剥离的llm.前缀)。关键的是,我们引入了一个3变体消融矩阵(V0:每4层NoPE,V1:全RoPE,V2:NoPE+可学习2D),以研究周期性无位置编码(NoPE)层对729令牌视觉块上的注意力是有帮助还是有害。代码、配置和权重已发布,以在此架构问题上确立优先权。我们提供了针对文本主干的B1-B5、文本对照实验、初步B6/B7分数、墙钟时间、CPU上的GGUF效率,以及涵盖10个领域的14,596个QA对语料库。我们开源所有模型和轨迹:jsantillana/vectrayx-1b、jsantillana/vectrayx-vision-1b和jsantillana/vectrayx-vision-1b-checks。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:21

论文页面 - VectraYX-Vision-1B:一个低于2B参数的西班牙语/拉美网络安全视觉-语言模型,具备结构化视觉推理与原生工具使用

来源:https://huggingface.co/papers/2608.08477

摘要

一个低于2B参数的西班牙语网络安全视觉-语言模型,通过MLP将冻结的SigLIP编码器与西班牙语解码器耦合,引入了一种用于视觉注意力的NoPE位置编码消融实验,并报告了尽管流水线功能正常但视觉接地近乎为零的结果,同时提供了开源权重和修复方案。

我们提出了VectraYX-Vision-1B,一个面向西班牙语/拉美网络安全图像的低于2B参数的视觉-语言模型(VLM),通过MLP将冻结的SigLIP-so400m编码器与1.04B参数的西班牙语/拉美安全解码器耦合。据我们所知,这是首个专门针对网络UI(IDA、Ghidra、Wireshark、Nmap、Metasploit、Volatility)的低于2B参数VLM,它用西班牙语回答,通过原生<|think|>标记发出结构化推理,通过模型上下文协议(Model Context Protocol)调用工具(<|tool_call|>),并导出为llama.cpp的LLaVA mmproj格式,支持气隙环境部署。我们报告了一个初步的负面视觉接地结果:尽管流水线功能完全正常,当前的视觉SFT(400-1900步,约1600万tokens)产生了接近零的B6分数(工具识别0.08),忽略了图像内容。我们给出了修复方案(更长的SFT、>=60%的重放、更低的学习率),并揭示了一个伪装成训练崩溃的检查点加载器bug(未去除的llm.前缀)。至关重要的是,我们引入了一个3变体消融矩阵(V0:NoPE-every-4,V1:all-RoPE,V2:NoPE+learned 2D),以研究周期性无位置编码(NoPE)层对729-token视觉块上的注意力是有帮助还是有损害。我们发布了代码、配置和权重,以确立在这一架构问题上的优先权。我们提供了文本骨干的B1-B5评分、文本控制、初步的B6/B7分数、墙钟时间、GGUF在CPU上的效率,以及一个涵盖10个领域的14,596个问答对语料库。我们开源了所有模型和轨迹:jsantillana/vectrayx-1b、jsantillana/vectrayx-vision-1b 和 jsantillana/vectrayx-vision-1b-checks。

查看arXiv页面(https://arxiv.org/abs/2608.08477)查看PDF(https://arxiv.org/pdf/2608.08477)项目页面(https://jsantillana.com/)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2608.08477)

在你的agent中获取此论文:

hf papers read 2608\.08477

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型2

jsantillana/vectrayx-vision-1b-checks 图像-文本到文本 • 约18小时前更新(https://huggingface.co/jsantillana/vectrayx-vision-1b-checks)

jsantillana/vectrayx-vision-1b 图像-文本到文本 • 1B • 约18小时前更新 • 14(https://huggingface.co/jsantillana/vectrayx-vision-1b)

引用此论文的数据集0

没有链接到此论文的数据集

在数据集的README.md中引用arxiv.org/abs/2608.08477即可从此页面链接到它。

引用此论文的Space0

没有链接到此论文的Space

在Space的README.md中引用arxiv.org/abs/2608.08477即可从此页面链接到它。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接到它。

相似文章

CaVe-VLM-CoT:一个可解释的视觉-语言模型框架

arXiv cs.AI

CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。

语言模型与视觉语言模型中的后门学习

arXiv cs.CL

本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。