對於每月處理數千份公用事業賬單的客服團隊來説,準確解析複雜的多頁文檔是一項挑戰。賬單格式不一、表格密集、版式多樣,使得快速提取準確信息變得困難,進而造成響應延遲、計費錯誤和客户不滿。隨着文檔量增長,這些問題會不斷累積,讓組織難以利用手中已有的數據。
Amazon Bedrock 與 Amazon Textract 集成提供檢索和生成能力。Textract 以高準確率抽取結構化與非結構化內容,Bedrock 提供生成式 AI,使組織從人工翻閲文檔轉向程序化查詢,從而大規模解鎖賬單中的可行洞察,帶來更快更準的客户交互。本文將演示如何與 PDF 和圖像格式的公用事業賬單對話、解析分析內容、標記相關表格,幫助 LLM 提取最有價值的信息。相關代碼已發佈在 GitHub。
客户服務團隊收到的賬單查詢涉及計費、用量、支付和客户服務等多個領域,源文件包括 PDF、DOCX、TXT、HTML 和 XLSX。最初團隊嘗試直接把賬單原樣輸入 RAG 模型,結果並不理想:LLM 會漏掉付款到期日、金額和賬號等關鍵細節,有時還會產生幻覺,給出錯誤或不相關內容;同時不同格式導致模型表現不穩定。這讓他們認識到,簡單加載原始文檔無法得到可靠準確的答案,必須對賬單進行預處理和增強。
該方案支持 PDF、DOCX、TXT、HTML、XLSX、PNG。Amazon Textract 可從多頁 PDF 中提取文本,包括複雜版面與嵌入圖像;能解析 Word 文檔中的表格、圖片和對象;能從 HTML 標籤及 Excel 單元格中讀取結構化數據;也能讀取普通文本和 PNG 圖片。通過集成 Amazon Textract 與 Amazon Bedrock,可以實現高級文本提取:Textract 預處理各類賬單,去除噪聲和不相關信息;然後利用上下文理解對數據做標註和打標,讓 LLM 更容易處理並生成準確響應。
部署方面,GitHub 倉庫提供 shell 腳本,運行 bash custom_kb_deployment_setup.sh 即可創建 AWS CloudFormation 棧。該棧會創建 Lambda 執行角色、Lambda layer、兩個 Lambda 函數、S3 存儲桶、OpenSearch Serverless 集羣、Amazon Bedrock Knowledge Bases 以及相應的 IAM 角色。部署完成後,需要在 S3 控制台找到名為 document--的桶,創建 raw_files 文件夾並上傳示例賬單。
上傳文件會自動觸發文檔解析 Lambda。Amazon Textract 作業處理原始文件並將結果保存到 parsed_files,隨後另一個 Lambda 將文件轉換為 TXT 格式,最終輸出到 parsed_kb_documents。接着在 Amazon Bedrock 控制台選擇知識庫、數據源並執行 Sync,等待同步完成。測試時,在文本知識庫配置中選擇 Amazon Nova Micro 模型,即可在右側文本框針對賬單提問。文中附帶的對比圖顯示,使用該自定義知識庫方案能得到更完整、準確的輸出,而不用該方案時模型容易遺漏關鍵信息或產生幻覺。
生產環境中部署 RAG 方案時,建議啓用 Amazon Bedrock Guardrails 過濾有害內容、阻斷敏感話題、對輸入輸出中的個人信息做脱敏,並通過 grounding validation 檢查模型回答是否來自檢索文檔,以減少幻覺。該方案尤其適合處理大量結構化文檔的組織,未來還可擴展支持更多文檔類型、集成更多 AWS 服務,或開發友好的前端界面,幫助用户更方便地與知識庫交互。