AWS发布使用Textract预处理复杂账单文档的Bedrock知识库定制方案

该方案将Textract的高精度文本提取与Bedrock生成式AI结合,帮助客服团队从PDF和图片等格式的公用事业账单中自动提取信息并回答查询,解决原始文档直接输入大模型时的信息遗漏和幻觉问题。

AI解读:这条新闻的实用价值在于:客服团队如果直接把PDF、图片等格式的账单塞给大模型做检索增强生成(RAG),常常会漏掉到期日、金额、账号等关键信息,甚至让模型一本正经地编造答案。AWS给出的解决思路是先用Textract做一次预处理——它能把PDF、Word、Excel、图片里的文字和表格干净地提取出来,并标好上下文;Bedrock知识库只接收经过清洗和标签化的文本,再回答用户的提问。这样相当于给大模型配了一个更可靠的“资料员”,降低幻觉发生的概率。受益最直接的是那些每个月要处理几千张格式不一的账单的企业,比如公用事业公司的客服或后台运营。部署不需要写代码,GitHub上有现成脚本,一条命令创建CloudFormation堆栈,自动生成Lambda、S3、OpenSearch Serverless和Bedrock知识库等资源。不过文章没有给出任何质量测评数据,比如错误率下降多少、响应提速多少,所以只能把它视为一种AWS官方推荐的最佳实践,而不是经过验证的基准测试。如果团队现在正被多格式文档的问答准确性困扰,可以考虑按这篇文章的框架做一次技术验证,用自己手头的账单样本对比一下预处理前后的回答质量,再决定是否投入生产。

AWS在机器学习博客发布一篇新方案文章,介绍如何用Amazon Textract预处理PDF、图片等格式的公用事业账单,再结合Amazon Bedrock知识库构建检索问答系统(RAG),以解决原始文档直接输入大模型时信息提取不全、产生幻觉的问题。

方案解决的问题

作者Rushabh Lokhande等人称,客户服务团队每月处理数千份格式不一致、表格密集的公用事业账单时,手动解析容易导致响应延迟和计费错误。客户最初尝试直接把账单原始文件放进RAG模型,但遇到了三类问题:LLM常遗漏到期日、付款金额、账号等关键信息;模型偶尔生成错误或无关内容,产生幻觉;PDF、DOCX、TXT、HTML、XLSX等不同格式导致模型表现不一致。

支持的文件类型与处理架构

文章称,该方案目前支持PDF、DOCX、TXT、HTML、XLSX和PNG六种文件类型。Amazon Textract负责从多页PDF(含复杂版式和嵌入图片)、Word文档(含表格和嵌入对象)、纯文本、HTML结构化内容、Excel单元格和表格、PNG图片中提取文本。

处理管线为:文件上传到S3桶的raw_files文件夹后触发document-parser Lambda函数,启动Textract任务;处理后的文件保存到parsed_files文件夹,再由另一个Lambda转换为TXT格式,最终输出到parsed_kb_documents文件夹,供Bedrock知识库同步和查询。

部署方式与测试配置

部署通过GitHub仓库中的shell脚本(custom_kb_deployment_setup.sh)完成,脚本创建CloudFormation堆栈,自动生成Lambda执行角色、两个Lambda函数、一个S3桶、一个OpenSearch Serverless集群、Bedrock知识库及对应IAM角色。

部署后需在S3桶中创建raw_files文件夹并上传示例账单。测试阶段,文章建议在Bedrock控制台选择文本知识库,并选用Amazon Nova Micro模型(需参考按区域可用模型列表)。

关于生产环境,作者建议启用Bedrock Guardrails过滤有害内容、屏蔽拒绝主题、编辑敏感信息,并通过接地验证(grounding validation)检测减少幻觉。

信息来源