Reducto上周(9月1日)发布r-1,这是基于重构架构的新解析模型系列的首个模型,以单次整页解析取代公司过去多阶段agentic OCR流程。Reducto称r-1的准确率超过其最强的旧agentic模型,速度更快,成本最多可低6倍。r-1目前处于预览阶段,通过Reducto托管的V3 Parse API运行,并用配置开关启用;不提供开放权重或可自行部署的本地checkpoint。平台本身支持多租户云、客户VPC、本地部署与隔离环境,按安全策略,较高服务层级具备SOC 2 Type II认证并支持HIPAA处理。
单次前向替代多级管线:过去的Parse把OCR、版面检测、后处理分成独立阶段,还会按需叠加agentic视觉语言调用,每次额外模型调用都增加延迟。r-1则将文字、表格、图形、版面、阅读顺序、格式和grounding合并到一次完整页面扫描中;每个block都返回基于页面坐标的边界框,方便把内容对回页面位置。真正的产品卖点在于这种整合。做财报、保险理赔或合同的团队通常要把文件拆分到多个供应商,再自己加后处理才能达到可用准确率。r-1挑战的正是这种编排成本,而不只是字符级准确率。
数字:Reducto给出的早期r-1预览结果,是错误率比自家旧agentic管线低20%,并称在内部评测中对复杂文档的表现超过常见hyperscaler产品和大型LLM,新闻稿将Amazon Textract、Azure Document Intelligence列为对标基线。价格方面,旧agentic模型因工作量不同每页3到6美分;r-1则固定每页1美分,所有费用包含在内,没有功能倍率或额外积分成本,官方称这是向统一产品标价转变的一部分。需要提醒的是,20%的错误率下降是相对Reducto自己的旧管线,与云厂商和LLM的直接比较也是厂商内部完成,没有随公告发布公开评测框架或数据集。
按文档说明,r-1在这一次整页扫描中原生处理:电子文本、扫描件和手写;结合整页上下文读取表格结构,包括合并单元格和嵌套表头;一起解析多栏、页眉、页脚、边注和阅读顺序;检测图形并生成简短描述;识别有语义的格式,如标题、列表、加粗、下划线和删除线;并用页面相对边界框完成grounding。Reducto特别点名的长尾场景是密集表格、特殊版式、低质量扫描、带水印内容以及没有固定模板的文档。删除线漏读可能使合同条款语义反转,表格误读会让agent拿到错误数字,这些边缘情况在受监管的流程中尤为关键。
迁移路径:r-1要求使用V3 API。Parse请求未带上settings.model时仍会运行旧版Parse,不会静默破坏。Studio中新建的pipeline默认使用r-1,代码示例是client.parse.run(input=upload.file_id, settings={"model":"r-1"})。Agentic处理并没有消失:需要自定义提示词或高级图表抽取的工作流仍会把页面送到agentic管线,由Reducto把agentic环节补充到r-1结果上,同时会增加延迟。迁移现有配置前应先查阅r-1配置兼容性页面,因为部分旧设置会被忽略或不支持。
Reducto还预告了接下来两个方向:面向速度和成本敏感场景的r-1 mini,以及自动按页路由、为每页选择合适模型的机制。从其他解析器迁移的机构可申请最多5000美元额度做并排对比。r-1已于预览阶段上线,可通过V3 Parse API使用settings.model:"r-1"调用。