LlamaIndex 发布 OpenDocRouter:一个 API 统一调用多种文档解析模型
Introducing OpenDocRouter: every document model under one API
LlamaIndex 推出 OpenDocRouter 平台,通过统一 API 将文档(PDF、PNG、JPEG 或 URL)解析为 markdown,接入 Claude Opus 5.5、Gemini 3 Flash、GPT-6 Luna 等 5 个前沿模型和 MinerU2.5-Pro、PaddleOCR-VL-1.6 等 5 个开源模型。
原文给出各模型在 ParseBench 上的质量与每千页成本对比,以及统一 layout 输出和按 token 计费细节,便于开发者选型。
OCR 模型非常多,而且每周都有更多新模型发布。在 HuggingFace 上快速搜索“ocr”就能看到成千上万个已发布的模型。此外,前沿实验室几乎每个月都在推出新的模型,这些模型也能很好地读取文档(尽管有时价格不菲)。使用这些模型进行文档解析通常都需要同样的几个步骤:设计提示词(如果适用)、处理速率限制、管理部署及相关成本,并在新模型发布时对其进行基准测试。
这正是我们 LlamaIndex 特别擅长的事情,今天我们推出 OpenDocRouter,以此分享这项工作。
什么是 OpenDocRouter?
OpenDocRouter 是一个使用最新开源和前沿模型进行文档 → markdown 解析的平台。每个模型都运行一套版本化的配方,包含提示词、处理和设置。使用该 API 非常简单:
curl https://https://www.opendocrouter.ai/v1/parse \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "opendatalab/mineru2.5-pro",
"document": { "url": "https://arxiv.org/pdf/1706.03762" },
"layout": true
}'该 API 接受 PDF、PNG、JPEG 或指向这些文件格式的 URL。该 API 允许你在同步响应(直接返回结果)和异步响应(创建一个需要轮询的任务)之间切换。同步响应最多支持 50 页。请求可以处理最多 500 页或 50MB 的输入。
每个模型都在 ParseBench 上从质量和成本两方面进行基准测试。在发布时,我们选择了一组覆盖我们基准测试各个角落的模型:
- 前沿模型:Claude Opus 5.5、Gemini 3 Flash、Gemini 3.8 Flash、GPT-5.6 Terra、GPT-6 Luna。
- 开源模型:Infinity-Parser2-Flash、MinerU2.5-Pro、TeleOCR、dots.mocr、PaddleOCR-VL-1.6

边界框与布局
每个模型对边界框和布局的保证各不相同。有些模型原生输出边界框,有些需要提示词,还有些完全做不到。
为了弥补这一差距,我们构建了一个可以应用于任何模型的定位引擎。在请求中设置 layout: True,即可生成带有定位边界框和按阅读顺序排列的布局元素的 markdown。这也意味着所有模型都会产生相同的布局类别:title、section_header、text、list_item、table、picture、chart、formula、caption、footnote、page_header、page_footer、code、form、key_value。

定价
OpenDocRouter 推出时采用纯基于 token 的计费方式,相当简单直接。创建账户,从 25 美元起充值额度,然后开始解析。启用布局会增加每百万 token 0.2 美元的费用,如果处理过程中任何页面失败,则不会收费。
截至 2026 年 10 月 7 日,我们的定价如下:
| 模型 | 输入($/1M) | 缓存输入($/1M) | 输出($/1M) | 每 1k 页成本(ParseBench) |
|---|---|---|---|---|
| Claude Opus 5.5 | $4.00 | $0.20 | $20.00 | $48.82 |
| Gemini 3 Flash | $0.50 | $0.05 | $3.00 | $19.67 |
| Gemini 3.8 Flash | $0.75 | $0.08 | $3.75 | $5.91 |
| GPT-5.6 Terra | $2.00 | $0.20 | $12.00 | $19.89 |
| GPT-6 Luna | $0.10 | $0.01 | $0.50 | $0.80 |
| Infinity-Parser2-Flash | $0.24 | - | $1.16 | $4.34 |
| MinerU2.5-Pro | $0.08 | - | $0.39 | $0.86 |
| TeleOCR | $0.25 | - | $1.22 | $2.70 |
| dots.mocr | $0.31 | - | $1.53 | $3.97 |
| PaddleOCR-VL-1.6 | $0.24 | - | $1.20 | $2.17 |
添加新模型
当我们可以提供的新模型发布时,我们有相应的流程可以快速将它们添加到 OpenDocRouter。我们会让它们通过 ParseBench 运行,并以此校准提示词、成本和其他设置,从而尽可能提供最佳用户体验。
我们还计划持续改进最受欢迎的模型:无论是通过更好的提示词、更好的托管以降低延迟,还是更多其他方面。
OpenDocRouter 与 LlamaParse 对比
我们将 OpenDocRouter 视为一个平台,用于快速托管最新模型,同时让开发者能够轻松在现有模型之间切换和路由,并且只为实际使用量付费。该 API 本身易于使用,同时提供对模型的广泛访问。
LlamaParse 是我们的托管文档平台。它内置了手工调优的解析层级、企业级管控、自托管部署,以及模式提取和索引等其他 API。
立即试用 OpenDocRouter
OpenDocRouter 现已上线,可供试用。浏览模型和文档,注册并生成 API 密钥,今天就解析你的文档。
来源:LlamaIndex:产品、工程与评测 · llamaindex.ai