LlamaIndex 解读 DeepSeek-OCR:视觉压缩如何在文档 AI 中超越传统 OCR
Beyond OCR: DeepSeek's New Vision Compression and How it Serves Document AI
LlamaIndex 发文解读 DeepSeek-OCR,指出其核心不是 OCR,而是把视觉作为文本信息的压缩算法:可将 1,000 个文本 token 压缩到 100 个视觉 token 并以 97% 准确率解码,10× 压缩下准确率仍高于 90%。
原文从文档解析实践角度拆解 DeepSeek-OCR 的压缩机制与局限,并给出压缩与解析两条演化路径的比较。
DeepSeek 最近发布了一篇新论文和一个模型,展示了我们对文档和上下文思考方式的转变。模型名称“DeepSeek-OCR”可能暗示了从图像中读取文本方面的改进,但他们的方法还围绕将视觉作为文本信息的压缩算法提出了创新与探索。
他们发现可以将 1,000 个文本 token 压缩到仅 100 个视觉 token,并以 97% 的准确率解码回来。在 10× 压缩率下,准确率仍保持在 90% 以上。
要让 LLM 和 AI 智能体获得最佳结果,取决于高效地提供相关上下文,并通过上下文工程走向成功。上下文窗口有上限,每一个 token 都很重要。DeepSeek-OCR 表明,我们可能完全想错了这个问题。
在本文中,我们将解释 DeepSeek-OCR 究竟是什么、它解决了哪些问题,以及这对 LlamaParse 等文档解析工具意味着什么。因为答案并不像“压缩取代解析”或“它们完美协作”那么简单。
ℹ️ 在研读 DeepSeek-OCR 时,我们发现 Sam Witteveen 的视频——DeepSeek OCR - More than OCR——极具洞见。感谢他帮助我们理解这篇论文。
立即探索我们的免费和付费方案。
DeepSeek-OCR 究竟是什么
当 DeepSeek 发布他们的“OCR”模型时,这个名字可以说低估了他们所构建的东西。他们构建了一个优化的视觉-文本压缩系统,将图像视为文本信息的紧凑表示。
✨ 洞见 #1:与其将文档转换为文本 token(昂贵),如果我们把它们保留为压缩的视觉表示(廉价)会怎样?
工作原理
DeepSeek 的 DeepEncoder 采用两阶段架构:
阶段 1:高分辨率感知 一个 SAM 模型(8000 万参数)通过窗口注意力处理文档,在高分辨率下捕捉精细的文本细节,同时不会导致内存使用量激增。
阶段 2:智能压缩 一个 16× 卷积压缩器减少 token,然后一个 CLIP 模型(3 亿参数)应用全局注意力来理解整个文档中的关系。
多分辨率压缩
他们根据你的需求提供不同的“缩放级别”:
- Tiny 模式:每页 64 个 token(20× 压缩)
- Small 模式:每页 100 个 token(10× 压缩)
- Base 模式:每页 256 个 token(约 4× 压缩)
- Large 模式:每页 400 个 token(约 2.5× 压缩)
- Gundam 模式:动态(复杂布局为 400-1,800 个 token)
作为对比:典型的 VLM 如 Qwen2.5-VL 每页使用 3,949 个 token。InternVL3 使用 6,790 个。DeepSeek-OCR 的 Base 模式仅用 256 个 token 就达到了有竞争力的准确率——减少了 15-26×。
✨ 洞见 #2:尽管这个新模型令人兴奋,但重要的是要注意其局限。在 20× 压缩率下,模型保持约 60% 的准确率。
这意味着,使用当今的模型和方法,输入中可保留的信息量存在一个“压缩极限”。论文在他们 10× 的示例中使用了 1,000 个 token,如果你一直在 GenAI 领域开发,就会知道 1,000 个 token 比现有 LLM 上下文窗口小得多。
视觉记忆范式
他们的论文提出了这种压缩架构的一个有趣应用:将近期上下文保留为高保真文本 token,但将较早的上下文逐步压缩为分辨率越来越低的视觉表示。就像人类记忆一样——近期的对话保持清晰,较早的则逐渐淡去但仍可访问。
传统的解析问题
在我们深入探讨这会带来什么改变之前,先来确立文档解析最初为何存在。
大多数有价值的信息存在于 LLM 无法原生消费的格式中:具有复杂布局的 PDF、跨页的表格、混合图表和文本的文档。你需要将这些转换为 LLM 能理解的形式:干净的文本、markdown、结构化 JSON、布局信息。除 LLM 之外的其他下游应用也能从这样的结构化输出中受益。
现有方法及其局限
纯 OCR 方法:
- 对其所“读取”的内容没有视觉理解(仅提取字符)
- 僵化的启发式规则,无法泛化到各种不同的输入
- 缺乏语义结构的保留
视觉语言模型(VLM):
- 能够同时看和理解
- 然而,需要调整提示词以确保它能够泛化
- 在文本量大或字符重复的页面上会遇到幻觉问题
- 每份文档使用数千个视觉 token
现实世界的文档,如带有长嵌套表格的财务报告、带图表的技术手册、格式错综复杂的法律合同,都暴露了这些局限以及围绕它们的痛点。
LlamaParse 目前如何解决这一问题
在 LlamaIndex,解析是我们工作的核心。LlamaParse 采用多智能体方法,结合 LLM 智能、VLM 和 OCR:本质上是运行协同工作的专用智能体:
- 视觉智能体:识别布局元素(表格、页眉、分栏)
- OCR 智能体:高精度提取文本
- 结构智能体:构建语义关系(“此表格属于第 2.3 节”)
- LLM 智能体:理解上下文和含义
- 综合智能体:输出干净、结构化的结果(markdown、JSON 等)
把它想象成一支专家团队,从不同角度审视你的文档,相互交叉核对彼此的工作以尽量减少错误。
关键在于,LlamaParse 产生结构化输出:表格以 JSON 表示、语义层级和布局元素。正是这种结构化表示使下游 AI 应用成为可能。
文档解析与记忆的未来
随着 DeepSeek-OCR 等模型的出现,随着技术成熟,我们可以想象两种可能的未来。
未来 1:“解析”成为一种压缩形式
对于许多应用(特别是检索增强生成(RAG)、文档问答和摘要)而言,DeepSeek-OCR 表明你可能根本不需要我们目前所谓的“解析”。
你可以想象这样的工作流程:
- 将 PDF 渲染为图像(以适当的分辨率)
- 使用 DeepSeek-OCR 风格的压缩进行编码
- 将压缩表示存储在向量数据库中(ColPali,有人用吗?)
- 直接针对视觉编码进行查询
- 让 VLM 按需解码相关部分
这就是“解析”变成某种根本不同事物的未来。视觉压缩端到端地处理文档摄取。然而,有一个前提条件,即这个未来只有在以下情况下才存在:
- 这类视觉模型可以扩展到现代上下文窗口的规模。对于大多数文档应用来说,1,000 个文本 token 的压缩量根本不够用。
- 你的用例不需要访问原始文件的实际内容或结构
未来 2:解析 + 压缩
并非所有应用都只需要理解。如果你正在构建的系统需要:
- 结构化数据提取(将表格提取为 JSON/Markdown/SQL 以供数据库使用)
- 语义层级(章节树、文档结构)
- 交叉引用(链接引文、脚注、附录)
- 精确文本操作(脱敏、编辑、合规检查)
……那么你仍然需要解析。因为压缩后的视觉表示无法为你提供机器可读的结构,只能提供高效的理解。
不过,DeepSeek-OCR 的压缩特性仍然可以加速解析。例如:
- 将提取的文本(如果有)和图像提供给一个“类似 DeepSeek-OCR 的 LLM”进行处理
- 利用压缩系数:在解析长文档时,你可以将文本输入替换为图像输入,同时保持整体文档的上下文
- 为需要结构化数据的应用存储结构化数据
- 使用视觉压缩进行高效检索/上下文处理
- 在需要精确性时提取结构化数据
这就是解析与压缩互补的未来:两者你都需要,但出于不同的原因。压缩可以节省 token,同时还能实现对长文档更好的解析。
这对 LlamaParse 意味着什么
老实说,我们认为 LlamaParse 及类似技术最可能的前进路径是让其技术栈融入类似 DeepSeek-OCR 的技术。但归根结底,这取决于你(这些工具的用户)正在构建什么。
如果你正在构建理解就足够的 RAG 系统,那么 DeepSeek-OCR 式的压缩和 ColPali 之类的模型可以比传统解析更高效地处理 80% 的用例——前提是底层技术持续扩展。
但如果你正在构建需要结构化数据的应用(数据库、层级结构、合规系统、精确提取),经典解析仍将不可或缺。压缩给你理解;解析给你结构。如果说有什么不同,那就是像 DeepSeek-OCR 这样的模型未来会改进现有的智能体式 OCR 流水线,比如 LlamaParse。
归根结底,我们的目标是提供最灵活、最准确的文档解析系统。
了解更多资源
对于想要深入了解 DeepSeek-OCR 方法的人:
- DeepSeek-OCR 论文 - 原始技术论文“DeepSeek-OCR: Contexts Optical Compression”,包含完整技术细节、基准测试和方法论
- DeepSeek-OCR 模型 - 在 Hugging Face 上发布的模型
- Sam Witteveen 的视频讲解 - 出色地剖析了为什么这关乎压缩而非传统 OCR
- LlamaParse 文档 - 进一步了解我们在智能文档解析方面的方法
对压缩和解析应如何协同演进有想法?我们很乐意听到你的声音。加入我们的 Discord 社区参与讨论,或在 Twitter/X 上联系我们。
来源:LlamaIndex:产品、工程与评测 · llamaindex.ai