Cohere 发布 Parse 5,可以从复杂的文档中高效地提取多模态信息
Cohere发布Parse 5多模态基础模型,旨在从复杂企业文档中高效提取结构化数据。该模型于2026年8月27日推出,拥有23亿参数,可将财务报告等PDF转换为规范Markdown格式,并输出精准边界框坐标。其架构包含基于SigLIP 2初始化的4亿参数视觉编码器,以及20亿参数的自研语言模型,支持8K令牌上下文窗口。在ParseBench基准测试中,Parse 5平均得分79.2,优于Mistral OCR和Google Gemini 3 Flash,但低于LlamaParse Agentic Plus的90.2分。该API可通过Cohere平台、Microsoft Azure AI Foundry及AWS SageMaker访问,并提供Hugging Face开放权重版本供本地测试。开发者社区反馈积极,认可其表格提取与阅读顺序优化能力,但也提出集成问题,如请求支持原生PDF输入。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
