VectraYX-Vision-1B:面向西班牙语/拉丁美洲网络安全的亚20亿参数视觉语言模型,具有结构化视觉推理和原生工具使用能力
摘要
介绍了VectraYX-Vision-1B,这是一个面向西班牙语/拉丁美洲网络安全的亚20亿参数视觉语言模型,通过MLP将冻结的SigLIP编码器与西班牙语解码器耦合;然而,尽管流水线功能完全正常,它却报告了近乎为零的视觉基础能力,并提供了开源权重和修复计划。
查看缓存全文
缓存时间: 2026/08/12 08:21
论文页面 - VectraYX-Vision-1B:一个低于2B参数的西班牙语/拉美网络安全视觉-语言模型,具备结构化视觉推理与原生工具使用
来源:https://huggingface.co/papers/2608.08477
摘要
一个低于2B参数的西班牙语网络安全视觉-语言模型,通过MLP将冻结的SigLIP编码器与西班牙语解码器耦合,引入了一种用于视觉注意力的NoPE位置编码消融实验,并报告了尽管流水线功能正常但视觉接地近乎为零的结果,同时提供了开源权重和修复方案。
我们提出了VectraYX-Vision-1B,一个面向西班牙语/拉美网络安全图像的低于2B参数的视觉-语言模型(VLM),通过MLP将冻结的SigLIP-so400m编码器与1.04B参数的西班牙语/拉美安全解码器耦合。据我们所知,这是首个专门针对网络UI(IDA、Ghidra、Wireshark、Nmap、Metasploit、Volatility)的低于2B参数VLM,它用西班牙语回答,通过原生<|think|>标记发出结构化推理,通过模型上下文协议(Model Context Protocol)调用工具(<|tool_call|>),并导出为llama.cpp的LLaVA mmproj格式,支持气隙环境部署。我们报告了一个初步的负面视觉接地结果:尽管流水线功能完全正常,当前的视觉SFT(400-1900步,约1600万tokens)产生了接近零的B6分数(工具识别0.08),忽略了图像内容。我们给出了修复方案(更长的SFT、>=60%的重放、更低的学习率),并揭示了一个伪装成训练崩溃的检查点加载器bug(未去除的llm.前缀)。至关重要的是,我们引入了一个3变体消融矩阵(V0:NoPE-every-4,V1:all-RoPE,V2:NoPE+learned 2D),以研究周期性无位置编码(NoPE)层对729-token视觉块上的注意力是有帮助还是有损害。我们发布了代码、配置和权重,以确立在这一架构问题上的优先权。我们提供了文本骨干的B1-B5评分、文本控制、初步的B6/B7分数、墙钟时间、GGUF在CPU上的效率,以及一个涵盖10个领域的14,596个问答对语料库。我们开源了所有模型和轨迹:jsantillana/vectrayx-1b、jsantillana/vectrayx-vision-1b 和 jsantillana/vectrayx-vision-1b-checks。
查看arXiv页面(https://arxiv.org/abs/2608.08477)查看PDF(https://arxiv.org/pdf/2608.08477)项目页面(https://jsantillana.com/)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2608.08477)
在你的agent中获取此论文:
hf papers read 2608\.08477
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型2
jsantillana/vectrayx-vision-1b-checks 图像-文本到文本 • 约18小时前更新(https://huggingface.co/jsantillana/vectrayx-vision-1b-checks)
jsantillana/vectrayx-vision-1b 图像-文本到文本 • 1B • 约18小时前更新 • 14(https://huggingface.co/jsantillana/vectrayx-vision-1b)
引用此论文的数据集0
没有链接到此论文的数据集
在数据集的README.md中引用arxiv.org/abs/2608.08477即可从此页面链接到它。
引用此论文的Space0
没有链接到此论文的Space
在Space的README.md中引用arxiv.org/abs/2608.08477即可从此页面链接到它。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接到它。
相似文章
VectraYX-Vision-1B:一个面向西班牙语/拉美网络安全、具备结构化视觉推理和原生工具调用的亚20亿参数视觉语言模型
本文介绍了VectraYX-Vision-1B,一个面向西班牙语/拉美网络安全影像的亚20亿参数视觉语言模型,但报告了一项负面的视觉定位结果,引发了关于NoPE层的架构问题,并发布了代码、基准测试和检查点。
VectraYX-Nano:一个42M参数的西班牙语网络安全语言模型,具备课程学习与原生工具调用能力
介绍了VectraYX-Nano,一个从零开始训练的42M参数仅解码器西班牙语网络安全语言模型,具备课程学习、通过MCP的原生工具调用以及一个1.7亿词元的语料库。实证发现揭示了损失-寄存器反转以及工具使用能力的语料密度伪影。
UltraViT:面向大型视觉语言模型的延迟优化端侧视觉编码器
UltraViT 是一个面向大型视觉语言模型的延迟优化视觉编码器,专为端侧部署设计,采用金字塔架构和两阶段生成式预训练策略,以1.7倍速度实现最先进的性能。
CaVe-VLM-CoT:一个可解释的视觉-语言模型框架
CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。
语言模型与视觉语言模型中的后门学习
本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。