模板OCR之所以在演示中表現完美,是因為演示文件的佈局從不改變。然而在實際業務中,供應商可能調整發票設計、掃描件旋轉兩度、行專案表格行數變化,這些都會導致提取結果靜默出錯。傳統的智慧文件處理平臺(如ABBYY、Kofax、Rossum、AWS Textract等)雖然允許構建更復雜的模板,但其核心仍然依賴於描述資料在頁面上的位置。
模板庫的真正成本體現在上線之後:每個不同佈局都需要單獨模板,中型應付賬款部門可能面對數百種供應商格式,每個模板都是一件需要構建、測試和維護的軟體製品。新供應商無法處理直到有人繪製並驗證模板,模板會因供應商重新設計而靜默失效,後處理規則堆疊導致管線難以理解。直通處理率僅在模板覆蓋的佈局上高,但佈局變化時立刻降為零。機器學習文件分類可以自動識別佈局並選擇模板,但仍以佈局為工作單元,繼承了同樣的天花板。
真正的替代方案是放棄座標描述,轉而像人一樣閱讀文件。LlamaParse等智慧體OCR透過佈局感知計算機視覺將頁面分割為真實元件(頁首、行專案表格、徽標、簽名等),並將每個元件路由到最適合的模型(印刷文本用快速OCR,手寫或印章用視覺語言模型,密集表格用表格專用模型)。無需定義區域,也無需在新供應商發票到來時重新繪製,系統尋找的是發票號本身,而不是矩形座標。
這一架構變更消除了整個模板維護負擔:沒有模板庫、沒有上線延遲、沒有漂移。新供應商的第一張發票與昨日處理過的發票透過同一管線,無需任何配置。以下對比展示了模板OCR與智慧體OCR在真實事件中的差異:新供應商發票到達時,模板OCR需要手動繪製模板,智慧體OCR無需設定;行專案表格行數變化時,模板OCR的固定網格會溢位或丟失,智慧體OCR自動檢測表格並完整讀取;頁面旋轉或傾斜時,模板OCR的座標對映失效,智慧體OCR的佈局檢測自動適應;供應商重新設計時,模板OCR立即崩潰,智慧體OCR無模板可破。
智慧體OCR還提供模板無法做到的置信度訊號:每個欄位攜帶一個分數,低置信度值被標記以供人工審查,而不是靜默流入系統。這實現了定向人工在環審閱,只將真正不確定的5%路由給人,其餘直通處理。LlamaParse已基於此方法處理了超過10億份文件,支援90多種檔案格式,棧中沒有任何基於供應商的模板。
模板在格式變化速度超過維護能力的工作流中傷害最大。應付賬款場景下,數百種發票格式使模板庫成為全職維護工作,而智慧體OCR處理新供應商的第一張發票無需設定。匯款通知和醫療報銷單據(EOBs)的格式因付款人而異,固定區域無法追蹤欄位位置。物流單據如提單、裝箱單和商業發票跨越國境、承運商和語言,沒有規範佈局,按結構而非座標讀取是唯一能應對如此多變化的方案。
模板OCR的時代正在終結。當文件種類少且穩定時,繪製幾個區域處理可預測的流是可行的。但如今供應商按自己的節奏重新設計,文件型別激增,佈局變化速度已超過維護模板的速度。用更多模板修補這個缺口是敗局,而最感痛苦的正是擁有最大模板庫的團隊。造成問題的架構無法解決問題,因為問題就是架構本身。