模型Cohere Blog·原文 2026年8月27日本站收录 2026年9月8日

Cohere发布Parse文档解析模型:每千页1.5美元,称性能价格比领先

Cohere宣布其视觉语言模型Parse正式可用,可处理表格和图像并输出Markdown,强调在ParseBench上得分高于多家竞品。

AI解读:Cohere Parse是一款视觉语言模型,专门处理发票、合同等复杂企业文档,把PDF、图片中的表格和嵌入图像转成AI能直接使用的Markdown格式。对要搭RAG知识库或跑自动化流程的团队来说,旧方案要么是高精度但昂贵的大模型,要么是便宜但不稳定的OCR。Cohere给出的平衡点是每1000页1.5美元,比AWS Textract等超大规模厂商方案(约每千页10美元)低不少。在Cohere自己公布的ParseBench测试里,Parse平均79.2分,高于LlamaParse的78.3分和Mistral OCR 4的74.5分,但低于GPT-5.5等通用前沿模型——这是选择高精度还是低成本时的权衡。如果用量大,可以在Model Vault上部署,按Cohere说法,在满负荷利用率下推理成本比API再省61%;以每月处理1300万页的应付账款流程为例,用Vault比用API每月能省约1.2万美元。需要注意,这些基准数据来自Cohere自家评测,且测试不包含图表维度,所以选型时仍应拿自己的文档去实测。Parse已通过Cohere API、Model Vault、Microsoft Foundry和AWS SageMaker对外开放。

Cohere于2026年发布Parse,一个面向企业文档处理的经济型视觉语言模型。该模型能将复杂多模态文件转换为机器可读的结构化数据,支持文档索引、RAG和智能体检索等场景。Parse不仅能识别文本,还能处理表格和嵌入图像,并输出干净的Markdown文档用于下游处理。模型支持九种主要世界语言,客户可通过Cohere API以每1000页1.50美元的价格使用,或通过Model Vault进行安全、单租户推理部署。

性能与价格

Cohere表示,在其评估的模型中,Parse提供了最强的性能-价格权衡。在ParseBench基准测试中,Parse平均得分79.2,优于Mistral OCR 4的74.5分、Databricks AI Parse的72.4分和LlamaParse Cost Effective版本的78.3分。与AWS Textract和Google Document AI等超大规模厂商的文档智能解决方案相比,Parse的得分高出超过20分。

在吞吐量方面,Cohere称Parse每秒处理4.5页(在8个H100 GPU节点上每秒36页或每分钟2160页),大约是RedNote's dots.mocr吞吐量的1.4倍,在同GPU配置下是Chandra OCR 2的2.2倍。

  • Parse在ParseBench三个维度(表格、内容忠实度、语义格式)上的得分:79.2(平均),表格87.0,内容忠实度86.6,语义格式64.0。
  • 相比之下,GPT-5.5平均84.4分,Opus 4.8平均84.3分,Gemini 3.5 Flash平均81.8分。

部署与成本节省

Parse可通过Cohere API和Model Vault(用于托管推理的安全单租户平台)使用。Cohere建议在持续高吞吐的生产工作负载中使用Model Vault,因为在利用率提高时成本节省显著:在50% GPU利用率时,Model Vault比Cohere API推理成本降低23%;在满小时利用率时,节省可达61%。

以企业应付账款工作流为例,每月处理约1300万文档页,通过Model Vault部署Parse相比Cohere API每月可减少约1.2万美元推理成本,年度节省约14.4万美元。与每千页10美元的超大规模厂商方案相比,该单一工作流年节省约147万美元。

  • Parse已正式通过Cohere API、Model Vault、Microsoft Foundry和AWS SageMaker提供。

信息来源

Cohere Blog原始来源