隨著銀行、貸款機構和政府部門把越來越多業務放線上上,對遠端使用者進行身份驗證成為風險控制的重要節點。人臉識別、證件防偽檢測等反欺詐工具雖然已廣泛應用,卻難以獲得足夠多的真實身份證件用於測試。身份檔案是高度敏感的隱私資料,真實樣本數量少、採集口徑不一,導致模型評估容易失真,也無法對不同欺詐方式和拍攝條件做系統性覆蓋。論文作者在摘要中提到,其團隊此前圍繞該主題釋出的八部分相關工作累計下載量已超過1.1萬次,顯示研究社群和企業對可擴充套件合成資料的強烈需求。
在這份於2026年9月2日提交至arXiv的技術報告中,作者提出了 IDSpace。該生成器在三個方向上擴充套件了以往工作。第一,引入模型引導的貝葉斯最佳化。給定目標域中只有少量真實樣本時,最佳化器會調整生成引數,使合成文件不僅肉眼觀感接近真實證件,也能與目標域模型的預測行為保持一致。第二,把使用者關心的後設資料與底層控制引數解耦。評估人員只需提供人口統計特徵、欺詐模式、採集裝置等業務層面的設定,字型風格、噪聲水平和影像質量等低層引數交由系統自動調整,因此沒有計算機視覺專業知識也能完成評估配置。第三,系統不再侷限於模板影像,還支援掃描件和手機翻拍件,能夠模擬證件在真實使用場景中的多種數字化形態。
實驗結果顯示,與CycleGAN、擴散式影像修補和無引導最佳化等基線相比,IDSpace 僅利用少量真實樣本就能把評估一致性提高15%至45%;用於下游識別模型訓練時,最高可帶來約9%的準確率提升;生成影像與目標域的SSIM相似度也提高了10%。研究團隊還發布了一個包含359,240張高質量合成文件的資料集,覆蓋十種歐盟身份證件型別,可用於復現實驗和進一步研究。
該論文同時列入計算機視覺與模式識別(cs.CV)和機器學習(cs.LG)方向,arXiv編號為2609.03052,投稿版本為v1。作者身份資訊顯示,論文由Lulu Xie與其他五位研究者共同完成。隨著數字身份驗證在金融、政務等場景持續普及,這種能夠兼顧視覺真實性和模型一致性的合成資料生成方法,有望為反欺詐系統提供更可靠、更可重複的評估基礎。