跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

PRX 第四部分:我們的資料策略

文章摘要

本文詳細介紹了PRX(一個7B文本到影像模型)背後的資料管道。關鍵點包括從公開和內部資料集構建多樣化的預訓練資料集,使用VLM生成長而準確的標題,並利用Lance構建資料集、MDS進行流式處理。團隊解釋了選擇質量92的JPEG編碼、即時計算文本潛在向量以及關於資料碎片化的經驗教訓。

PRX 第四部分:我們的資料策略
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在PRX系列的第四部分中,Photoroom團隊揭開了資料管道的面紗。該管道是PRX模型訓練的基礎,雖然構建過程中並不起眼,但卻是確保模型質量的關鍵環節。

團隊的核心策略是:混合使用公開和內部資料集,透過視覺語言模型(VLM)重新生成影像的標題,然後將結果轉化為可流式處理的語料庫,用於PRX的訓練。

指導原則

預訓練階段的目標是構建一個大型、多樣化的資料集。此時,模型正在學習視覺世界的結構:視覺概念、物體、場景、構圖和光照等。因此,覆蓋範圍和多樣性遠比單張影像的完美程度重要。一個廣泛且有代表性的語料庫能讓模型學到更多視覺世界的結構,而過於追求美學過濾反而會限制分佈,導致模型丟失概念和構圖多樣性。美學的打磨留到微調和偏好對齊階段。

資料來源方面,團隊優先選擇已進行質量過濾、去重、NSFW內容和個人資訊過濾的資料集,以充分利用現有工作。他們採用了務實的方法,並非從零構建,而是藉助現有資料集和自有工具快速組裝了一個7B模型的預訓練起點。

標題哲學

長期經驗表明,預訓練中使用準確描述影像內容的長標題至關重要。團隊在第二部分中看到,從短標題切換為長標題顯著提升了樣本質量。如果標題準確,偶爾出現的截圖、廣告、標誌或文本都不會成為問題,因為模型會將這些視為可條件控制的屬性。準確的標題能將“噪聲”轉化為可提示或可避免的元素。因此,後續的過濾操作也故意保持輕量。

資料格式

團隊使用Mosaic Streaming和MDS格式進行分散式訓練,同時採用Lance格式進行特徵工程和資料集預處理。MDS格式適合流式訓練但結構僵化,而Lance支援謂詞下推、標量索引和向量搜尋,適合構建和探索數十億行的資料集。兩種格式互補:Lance用於構建,MDS用於流式。

文本潛在向量

此前,團隊使用T5Gemma作為文本編碼器並預計算文本潛在向量。本次改用Qwen3-VL後,決定在訓練時即時計算文本潛在向量。雖然這會帶來約3-4%的吞吐量損失(30天訓練中多出約1天),但好處是MDS分片更小,足以儲存在SSD共享檔案系統中,並且未來更換文本編碼器時無需重寫大量已儲存的潛在向量。

影像編碼

所有影像均以質量92的JPEG格式儲存,而非無損PNG。團隊透過實驗證明,對於已多次JPEG壓縮的真實影像,在質量92下第一次重編碼幾乎無感知損失。多次迴圈後,影像仍保持在不可感知範圍內,而PNG檔案大小是JPEG的3-10倍。此外,對比訓練實驗顯示,使用JPEG和PNG訓練的模型輸出質量幾乎無差異,JPEG生成物檢測到量化結構的比例僅略高一點。因此,高質量JPEG儲存對大規模文本到影像訓練足夠。

構建資料集

在Lance中構建資料集時,團隊學到了關於碎片化的經驗。Lance表由多個片段組成,過多小片段會導致查詢緩慢。第一次匯入時,每個片段僅10萬行,導致數千個小片段,查詢速度極慢。透過壓縮至每片段約100萬行,查詢速度顯著提升。建議避免過度分片。

重新生成標題與探索

為確保一致性,團隊對所有影像重新生成標題,而不是依賴資料集自帶的標題。但原有標題和嵌入向量仍用於快速探索資料集。透過全文搜尋和向量最近鄰搜尋,團隊可以評估資料質量和過濾需求。此外,他們還建立了解析度分佈,並設定了裁剪閾值。基於Lance的全文搜尋和向量搜尋,團隊構建了一個小型使用者介面,用於即時搜尋影像和瀏覽視覺相似影像。

總之,PRX的資料策略強調多樣性、準確標題和實用格式選擇,為7B模型的成功訓練奠定了堅實基礎。

展開要點與分析

文章情報

工程師進階

要點

  • 預訓練資料由公開和內部資料集混合組成,並使用VLM重新生成標題以確保一致性。
  • 長而準確的標題至關重要;它們將不完美轉化為可控屬性。
  • 使用Lance格式構建和探索資料集,MDS格式用於訓練期間的流式處理。
  • 影像儲存採用質量92的JPEG;實驗表明,與PNG相比,對模型輸出沒有負面影響。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。