VectraYX-Nano:一個4200萬引數的西班牙語網路安全語言模型,具備課程學習和原生工具呼叫能力
研究人員提出了VectraYX-Nano,一個從零開始用西班牙語訓練的4200萬引數解碼器專用語言模型,專為網路安全設計,並透過模型上下文協議(MCP)實現原生工具呼叫。該模型使用1.7億tokens的語料庫和帶有重放緩衝區的課程學習,實現了單調損失下降和0.78的對話門控值。它是首個具備端到端MCP整合的西班牙語原生網路安全LLM,可在普通硬體上亞秒級執行。
VectraYX-Nano 是一項開創性的工作,由研究團隊從零開始訓練了一個僅4200萬引數的西班牙語語言模型,專門面向網路安全領域。該模型採用解碼器專用Transformer架構,整合了分組查詢注意力(GQA)、QK歸一化、RMSNorm、SwiGLU啟用函式、旋轉位置編碼(RoPE)等先進技術,並使用了帶有位元組回退的16,384 token BPE分詞器。模型權重僅為81 MB(F16精度),可在普通硬體上使用llama.cpp實現亞秒級首token生成時間。
研究團隊構建了VectraYX-Sec-ES語料庫,總規模達1.7億tokens,分為對話(4200萬tokens)、網路安全(1.18億tokens)和攻擊性安全工具(1000萬tokens)三個階段。該語料庫透過八臺虛擬機器的流水線使用約25美元成本收集。訓練採用了帶有重放緩衝區的課程學習策略,實現了連續的損失下降:從9.80降至3.17,再至3.00,最終達到2.16。在監督微調階段,模型使用了OASST-ES、Alpaca-ES、CVE問答對以及6327條工具呼叫軌跡進行訓練,最終對話門控值達到0.78(標準差0.05,4次不同隨機種子)。
該模型的一個關鍵創新是原生支援模型上下文協議(MCP),允許模型直接呼叫外部工具,如漏洞掃描、指令碼執行等。透過LoRA研究,團隊發現工具選擇能力(B4指標)的低下並非模型容量瓶頸,而是語料庫中工具示例密度不足所致。當工具示例增加到2801條後,Nano 42M模型的B4指標從0.000提升至0.145,而更大的260M模型則提升至0.445。
此外,團隊還進行了基於自舉語料庫的消融實驗,揭示了小規模模型特有的損失與暫存器反轉現象。所有訓練指令碼、語料配方、GGUF權重以及B1-B5基準測試均已開源釋出。據我們所知,VectraYX-Nano是首個具備端到端MCP整合的西班牙語原生網路安全語言模型,為低資源語言在專業領域的應用提供了新的可能性。