简介
Chandra 是 Datalab 推出的先进文档理解模型,专注于把非结构化文档转成机器可读的结构化数据。它在 OCR 精度、版面分析与表格公式还原方面表现突出,尤其适合需要把海量 PDF 喂给大模型的场景。
核心功能
- 高精度 OCR:识别印刷体与手写内容
- 版面分析:还原多栏、表格与层级结构
- Markdown 输出:直接可用于 LLM 与 RAG
- 公式识别:提取 LaTeX 数学表达式
- 多语言支持:覆盖主流语言文档
适用场景
- 合同、发票与报告的数字化
- 科研论文与公式提取
- 企业知识库的文档预处理
优缺点
优点:
- 复杂版面解析能力强
- 输出结构清晰
- 与 RAG 流水线衔接顺畅
缺点:
- 超大规模处理需要付费
- 自部署对算力有一定要求
使用技巧
- 扫描件先用高分辨率输入以提升精度
- 处理前按文档类型选择合适模式
- 将输出 Markdown 直接接入向量库构建 RAG