随着银行、贷款机构和政府部门把越来越多业务放在线上,对远程用户进行身份验证成为风险控制的重要节点。人脸识别、证件防伪检测等反欺诈工具虽然已广泛应用,却难以获得足够多的真实身份证件用于测试。身份文件是高度敏感的隐私数据,真实样本数量少、采集口径不一,导致模型评估容易失真,也无法对不同欺诈方式和拍摄条件做系统性覆盖。论文作者在摘要中提到,其团队此前围绕该主题发布的八部分相关工作累计下载量已超过1.1万次,显示研究社区和企业对可扩展合成数据的强烈需求。
在这份于2026年9月2日提交至arXiv的技术报告中,作者提出了 IDSpace。该生成器在三个方向上扩展了以往工作。第一,引入模型引导的贝叶斯优化。给定目标域中只有少量真实样本时,优化器会调整生成参数,使合成文档不仅肉眼观感接近真实证件,也能与目标域模型的预测行为保持一致。第二,把用户关心的元数据与底层控制参数解耦。评估人员只需提供人口统计特征、欺诈模式、采集设备等业务层面的设定,字体风格、噪声水平和图像质量等低层参数交由系统自动调整,因此没有计算机视觉专业知识也能完成评估配置。第三,系统不再局限于模板图像,还支持扫描件和手机翻拍件,能够模拟证件在真实使用场景中的多种数字化形态。
实验结果显示,与CycleGAN、扩散式图像修补和无引导优化等基线相比,IDSpace 仅利用少量真实样本就能把评估一致性提高15%至45%;用于下游识别模型训练时,最高可带来约9%的准确率提升;生成图像与目标域的SSIM相似度也提高了10%。研究团队还发布了一个包含359,240张高质量合成文档的数据集,覆盖十种欧盟身份证件类型,可用于复现实验和进一步研究。
该论文同时列入计算机视觉与模式识别(cs.CV)和机器学习(cs.LG)方向,arXiv编号为2609.03052,投稿版本为v1。作者身份信息显示,论文由Lulu Xie与其他五位研究者共同完成。随着数字身份验证在金融、政务等场景持续普及,这种能够兼顾视觉真实性和模型一致性的合成数据生成方法,有望为反欺诈系统提供更可靠、更可重复的评估基础。