AI News HubLIVE
站內改寫1 分鐘閱讀

VectraYX-Nano:一個4200萬參數的西班牙語網絡安全語言模型,具備課程學習和原生工具調用能力

研究人員提出了VectraYX-Nano,一個從零開始用西班牙語訓練的4200萬參數解碼器專用語言模型,專為網絡安全設計,並通過模型上下文協議(MCP)實現原生工具調用。該模型使用1.7億tokens的語料庫和帶有重放緩衝區的課程學習,實現了單調損失下降和0.78的對話門控值。它是首個具備端到端MCP集成的西班牙語原生網絡安全LLM,可在普通硬件上亞秒級運行。

來源arXiv Computational Linguistics作者: Juan S. Santillana

VectraYX-Nano 是一項開創性的工作,由研究團隊從零開始訓練了一個僅4200萬參數的西班牙語語言模型,專門面向網絡安全領域。該模型採用解碼器專用Transformer架構,集成了分組查詢注意力(GQA)、QK歸一化、RMSNorm、SwiGLU激活函數、旋轉位置編碼(RoPE)等先進技術,並使用了帶有字節回退的16,384 token BPE分詞器。模型權重僅為81 MB(F16精度),可在普通硬件上使用llama.cpp實現亞秒級首token生成時間。

研究團隊構建了VectraYX-Sec-ES語料庫,總規模達1.7億tokens,分為對話(4200萬tokens)、網絡安全(1.18億tokens)和攻擊性安全工具(1000萬tokens)三個階段。該語料庫通過八台虛擬機的流水線使用約25美元成本收集。訓練採用了帶有重放緩衝區的課程學習策略,實現了連續的損失下降:從9.80降至3.17,再至3.00,最終達到2.16。在監督微調階段,模型使用了OASST-ES、Alpaca-ES、CVE問答對以及6327條工具調用軌跡進行訓練,最終對話門控值達到0.78(標準差0.05,4次不同隨機種子)。

該模型的一個關鍵創新是原生支持模型上下文協議(MCP),允許模型直接調用外部工具,如漏洞掃描、腳本執行等。通過LoRA研究,團隊發現工具選擇能力(B4指標)的低下並非模型容量瓶頸,而是語料庫中工具示例密度不足所致。當工具示例增加到2801條後,Nano 42M模型的B4指標從0.000提升至0.145,而更大的260M模型則提升至0.445。

此外,團隊還進行了基於自舉語料庫的消融實驗,揭示了小規模模型特有的損失與寄存器反轉現象。所有訓練腳本、語料配方、GGUF權重以及B1-B5基準測試均已開源發佈。據我們所知,VectraYX-Nano是首個具備端到端MCP集成的西班牙語原生網絡安全語言模型,為低資源語言在專業領域的應用提供了新的可能性。