在PRX系列的第四部分中,Photoroom團隊揭開了資料管道的面紗。該管道是PRX模型訓練的基礎,雖然構建過程中並不起眼,但卻是確保模型質量的關鍵環節。
團隊的核心策略是:混合使用公開和內部資料集,透過視覺語言模型(VLM)重新生成影像的標題,然後將結果轉化為可流式處理的語料庫,用於PRX的訓練。
指導原則
預訓練階段的目標是構建一個大型、多樣化的資料集。此時,模型正在學習視覺世界的結構:視覺概念、物體、場景、構圖和光照等。因此,覆蓋範圍和多樣性遠比單張影像的完美程度重要。一個廣泛且有代表性的語料庫能讓模型學到更多視覺世界的結構,而過於追求美學過濾反而會限制分佈,導致模型丟失概念和構圖多樣性。美學的打磨留到微調和偏好對齊階段。
資料來源方面,團隊優先選擇已進行質量過濾、去重、NSFW內容和個人資訊過濾的資料集,以充分利用現有工作。他們採用了務實的方法,並非從零構建,而是藉助現有資料集和自有工具快速組裝了一個7B模型的預訓練起點。
標題哲學
長期經驗表明,預訓練中使用準確描述影像內容的長標題至關重要。團隊在第二部分中看到,從短標題切換為長標題顯著提升了樣本質量。如果標題準確,偶爾出現的截圖、廣告、標誌或文本都不會成為問題,因為模型會將這些視為可條件控制的屬性。準確的標題能將“噪聲”轉化為可提示或可避免的元素。因此,後續的過濾操作也故意保持輕量。
資料格式
團隊使用Mosaic Streaming和MDS格式進行分散式訓練,同時採用Lance格式進行特徵工程和資料集預處理。MDS格式適合流式訓練但結構僵化,而Lance支援謂詞下推、標量索引和向量搜尋,適合構建和探索數十億行的資料集。兩種格式互補:Lance用於構建,MDS用於流式。
文本潛在向量
此前,團隊使用T5Gemma作為文本編碼器並預計算文本潛在向量。本次改用Qwen3-VL後,決定在訓練時即時計算文本潛在向量。雖然這會帶來約3-4%的吞吐量損失(30天訓練中多出約1天),但好處是MDS分片更小,足以儲存在SSD共享檔案系統中,並且未來更換文本編碼器時無需重寫大量已儲存的潛在向量。
影像編碼
所有影像均以質量92的JPEG格式儲存,而非無損PNG。團隊透過實驗證明,對於已多次JPEG壓縮的真實影像,在質量92下第一次重編碼幾乎無感知損失。多次迴圈後,影像仍保持在不可感知範圍內,而PNG檔案大小是JPEG的3-10倍。此外,對比訓練實驗顯示,使用JPEG和PNG訓練的模型輸出質量幾乎無差異,JPEG生成物檢測到量化結構的比例僅略高一點。因此,高質量JPEG儲存對大規模文本到影像訓練足夠。
構建資料集
在Lance中構建資料集時,團隊學到了關於碎片化的經驗。Lance表由多個片段組成,過多小片段會導致查詢緩慢。第一次匯入時,每個片段僅10萬行,導致數千個小片段,查詢速度極慢。透過壓縮至每片段約100萬行,查詢速度顯著提升。建議避免過度分片。
重新生成標題與探索
為確保一致性,團隊對所有影像重新生成標題,而不是依賴資料集自帶的標題。但原有標題和嵌入向量仍用於快速探索資料集。透過全文搜尋和向量最近鄰搜尋,團隊可以評估資料質量和過濾需求。此外,他們還建立了解析度分佈,並設定了裁剪閾值。基於Lance的全文搜尋和向量搜尋,團隊構建了一個小型使用者介面,用於即時搜尋影像和瀏覽視覺相似影像。
總之,PRX的資料策略強調多樣性、準確標題和實用格式選擇,為7B模型的成功訓練奠定了堅實基礎。