Reducto上週(9月1日)釋出r-1,這是基於重構架構的新解析模型系列的首個模型,以單次整頁解析取代公司過去多階段agentic OCR流程。Reducto稱r-1的準確率超過其最強的舊agentic模型,速度更快,成本最多可低6倍。r-1目前處於預覽階段,透過Reducto託管的V3 Parse API執行,並用配置開關啟用;不提供開放權重或可自行部署的本地checkpoint。平臺本身支援多租戶雲、客戶VPC、本地部署與隔離環境,按安全策略,較高服務層級具備SOC 2 Type II認證並支援HIPAA處理。
單次前向替代多級管線:過去的Parse把OCR、版面檢測、後處理分成獨立階段,還會按需疊加agentic視覺語言呼叫,每次額外模型呼叫都增加延遲。r-1則將文字、表格、圖形、版面、閱讀順序、格式和grounding合併到一次完整頁面掃描中;每個block都返回基於頁面座標的邊界框,方便把內容對回頁面位置。真正的產品賣點在於這種整合。做財報、保險理賠或合同的團隊通常要把檔案拆分到多個供應商,再自己加後處理才能達到可用準確率。r-1挑戰的正是這種編排成本,而不只是字元級準確率。
數字:Reducto給出的早期r-1預覽結果,是錯誤率比自家舊agentic管線低20%,並稱在內部評測中對複雜文件的表現超過常見hyperscaler產品和大型LLM,新聞稿將Amazon Textract、Azure Document Intelligence列為對標基線。價格方面,舊agentic模型因工作量不同每頁3到6美分;r-1則固定每頁1美分,所有費用包含在內,沒有功能倍率或額外積分成本,官方稱這是向統一產品標價轉變的一部分。需要提醒的是,20%的錯誤率下降是相對Reducto自己的舊管線,與雲廠商和LLM的直接比較也是廠商內部完成,沒有隨公告發布公開評測框架或資料集。
按文件說明,r-1在這一次整頁掃描中原生處理:電子文本、掃描件和手寫;結合整頁上下文讀取表格結構,包括合併單元格和巢狀表頭;一起解析多欄、頁首、頁尾、邊注和閱讀順序;檢測圖形並生成簡短描述;識別有語義的格式,如標題、列表、加粗、下劃線和刪除線;並用頁面相對邊界框完成grounding。Reducto特別點名的長尾場景是密集表格、特殊版式、低質量掃描、帶水印內容以及沒有固定模板的文件。刪除線漏讀可能使合同條款語義反轉,表格誤讀會讓agent拿到錯誤數字,這些邊緣情況在受監管的流程中尤為關鍵。
遷移路徑:r-1要求使用V3 API。Parse請求未帶上settings.model時仍會執行舊版Parse,不會靜默破壞。Studio中新建的pipeline預設使用r-1,程式碼示例是client.parse.run(input=upload.file_id, settings={"model":"r-1"})。Agentic處理並沒有消失:需要自定義提示詞或高階圖表抽取的工作流仍會把頁面送到agentic管線,由Reducto把agentic環節補充到r-1結果上,同時會增加延遲。遷移現有配置前應先查閱r-1配置相容性頁面,因為部分舊設定會被忽略或不支援。
Reducto還預告了接下來兩個方向:面向速度和成本敏感場景的r-1 mini,以及自動按頁路由、為每頁選擇合適模型的機制。從其他解析器遷移的機構可申請最多5000美元額度做並排對比。r-1已於預覽階段上線,可透過V3 Parse API使用settings.model:"r-1"呼叫。