跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

PRX 第四部分:我們的數據策略

文章摘要

本文詳細介紹了PRX(一個7B文本到圖像模型)背後的數據管道。關鍵點包括從公開和內部數據集構建多樣化的預訓練數據集,使用VLM生成長而準確的標題,並利用Lance構建數據集、MDS進行流式處理。團隊解釋了選擇質量92的JPEG編碼、實時計算文本潛在向量以及關於數據碎片化的經驗教訓。

PRX 第四部分:我們的數據策略
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在PRX系列的第四部分中,Photoroom團隊揭開了數據管道的面紗。該管道是PRX模型訓練的基礎,雖然構建過程中並不起眼,但卻是確保模型質量的關鍵環節。

團隊的核心策略是:混合使用公開和內部數據集,通過視覺語言模型(VLM)重新生成圖像的標題,然後將結果轉化為可流式處理的語料庫,用於PRX的訓練。

指導原則

預訓練階段的目標是構建一個大型、多樣化的數據集。此時,模型正在學習視覺世界的結構:視覺概念、物體、場景、構圖和光照等。因此,覆蓋範圍和多樣性遠比單張圖像的完美程度重要。一個廣泛且有代表性的語料庫能讓模型學到更多視覺世界的結構,而過於追求美學過濾反而會限制分佈,導致模型丟失概念和構圖多樣性。美學的打磨留到微調和偏好對齊階段。

數據來源方面,團隊優先選擇已進行質量過濾、去重、NSFW內容和個人信息過濾的數據集,以充分利用現有工作。他們採用了務實的方法,並非從零構建,而是藉助現有數據集和自有工具快速組裝了一個7B模型的預訓練起點。

標題哲學

長期經驗表明,預訓練中使用準確描述圖像內容的長標題至關重要。團隊在第二部分中看到,從短標題切換為長標題顯著提升了樣本質量。如果標題準確,偶爾出現的截圖、廣告、標誌或文本都不會成為問題,因為模型會將這些視為可條件控制的屬性。準確的標題能將“噪聲”轉化為可提示或可避免的元素。因此,後續的過濾操作也故意保持輕量。

數據格式

團隊使用Mosaic Streaming和MDS格式進行分佈式訓練,同時採用Lance格式進行特徵工程和數據集預處理。MDS格式適合流式訓練但結構僵化,而Lance支持謂詞下推、標量索引和向量搜索,適合構建和探索數十億行的數據集。兩種格式互補:Lance用於構建,MDS用於流式。

文本潛在向量

此前,團隊使用T5Gemma作為文本編碼器並預計算文本潛在向量。本次改用Qwen3-VL後,決定在訓練時實時計算文本潛在向量。雖然這會帶來約3-4%的吞吐量損失(30天訓練中多出約1天),但好處是MDS分片更小,足以存儲在SSD共享文件系統中,並且未來更換文本編碼器時無需重寫大量已存儲的潛在向量。

圖像編碼

所有圖像均以質量92的JPEG格式存儲,而非無損PNG。團隊通過實驗證明,對於已多次JPEG壓縮的真實圖像,在質量92下第一次重編碼幾乎無感知損失。多次循環後,圖像仍保持在不可感知範圍內,而PNG文件大小是JPEG的3-10倍。此外,對比訓練實驗顯示,使用JPEG和PNG訓練的模型輸出質量幾乎無差異,JPEG生成物檢測到量化結構的比例僅略高一點。因此,高質量JPEG存儲對大規模文本到圖像訓練足夠。

構建數據集

在Lance中構建數據集時,團隊學到了關於碎片化的經驗。Lance表由多個片段組成,過多小片段會導致查詢緩慢。第一次導入時,每個片段僅10萬行,導致數千個小片段,查詢速度極慢。通過壓縮至每片段約100萬行,查詢速度顯著提升。建議避免過度分片。

重新生成標題與探索

為確保一致性,團隊對所有圖像重新生成標題,而不是依賴數據集自帶的標題。但原有標題和嵌入向量仍用於快速探索數據集。通過全文搜索和向量最近鄰搜索,團隊可以評估數據質量和過濾需求。此外,他們還建立了分辨率分佈,並設定了裁剪閾值。基於Lance的全文搜索和向量搜索,團隊構建了一個小型用户界面,用於實時搜索圖像和瀏覽視覺相似圖像。

總之,PRX的數據策略強調多樣性、準確標題和實用格式選擇,為7B模型的成功訓練奠定了堅實基礎。

展開要點與分析

文章情報

工程師進階

要點

  • 預訓練數據由公開和內部數據集混合組成,並使用VLM重新生成標題以確保一致性。
  • 長而準確的標題至關重要;它們將不完美轉化為可控屬性。
  • 使用Lance格式構建和探索數據集,MDS格式用於訓練期間的流式處理。
  • 圖像存儲採用質量92的JPEG;實驗表明,與PNG相比,對模型輸出沒有負面影響。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。