VectraYX-Nano:一个4200万参数的西班牙语网络安全语言模型,具备课程学习和原生工具调用能力
研究人员提出了VectraYX-Nano,一个从零开始用西班牙语训练的4200万参数解码器专用语言模型,专为网络安全设计,并通过模型上下文协议(MCP)实现原生工具调用。该模型使用1.7亿tokens的语料库和带有重放缓冲区的课程学习,实现了单调损失下降和0.78的对话门控值。它是首个具备端到端MCP集成的西班牙语原生网络安全LLM,可在普通硬件上亚秒级运行。
VectraYX-Nano 是一项开创性的工作,由研究团队从零开始训练了一个仅4200万参数的西班牙语语言模型,专门面向网络安全领域。该模型采用解码器专用Transformer架构,集成了分组查询注意力(GQA)、QK归一化、RMSNorm、SwiGLU激活函数、旋转位置编码(RoPE)等先进技术,并使用了带有字节回退的16,384 token BPE分词器。模型权重仅为81 MB(F16精度),可在普通硬件上使用llama.cpp实现亚秒级首token生成时间。
研究团队构建了VectraYX-Sec-ES语料库,总规模达1.7亿tokens,分为对话(4200万tokens)、网络安全(1.18亿tokens)和攻击性安全工具(1000万tokens)三个阶段。该语料库通过八台虚拟机的流水线使用约25美元成本收集。训练采用了带有重放缓冲区的课程学习策略,实现了连续的损失下降:从9.80降至3.17,再至3.00,最终达到2.16。在监督微调阶段,模型使用了OASST-ES、Alpaca-ES、CVE问答对以及6327条工具调用轨迹进行训练,最终对话门控值达到0.78(标准差0.05,4次不同随机种子)。
该模型的一个关键创新是原生支持模型上下文协议(MCP),允许模型直接调用外部工具,如漏洞扫描、脚本执行等。通过LoRA研究,团队发现工具选择能力(B4指标)的低下并非模型容量瓶颈,而是语料库中工具示例密度不足所致。当工具示例增加到2801条后,Nano 42M模型的B4指标从0.000提升至0.145,而更大的260M模型则提升至0.445。
此外,团队还进行了基于自举语料库的消融实验,揭示了小规模模型特有的损失与寄存器反转现象。所有训练脚本、语料配方、GGUF权重以及B1-B5基准测试均已开源发布。据我们所知,VectraYX-Nano是首个具备端到端MCP集成的西班牙语原生网络安全语言模型,为低资源语言在专业领域的应用提供了新的可能性。