Chandra
📊

Chandra

Chandra 是 Datalab 出品的高精度文档 OCR 与版面理解模型,能将 PDF、扫描件与手写内容转换为结构化 Markdown,精准还原表格、公式与阅读顺序。

📊 办公 🆓 免费增值 ★★★★★
访问官网
✓ 优点
  • 识别精度高
  • 擅长复杂表格与公式
  • 输出结构化便于 RAG
  • 提供本地部署选项
! 缺点
  • 大批量处理需付费
  • 部署有硬件要求
✦ 核心功能
  • 高精度 OCR 识别
  • 复杂版面还原
  • 表格与公式提取
  • 结构化 Markdown 输出
  • 支持手写内容

简介

Chandra 是 Datalab 推出的先进文档理解模型,专注于把非结构化文档转成机器可读的结构化数据。它在 OCR 精度、版面分析与表格公式还原方面表现突出,尤其适合需要把海量 PDF 喂给大模型的场景。

核心功能

  • 高精度 OCR:识别印刷体与手写内容
  • 版面分析:还原多栏、表格与层级结构
  • Markdown 输出:直接可用于 LLM 与 RAG
  • 公式识别:提取 LaTeX 数学表达式
  • 多语言支持:覆盖主流语言文档

适用场景

  • 合同、发票与报告的数字化
  • 科研论文与公式提取
  • 企业知识库的文档预处理

优缺点

优点:

  • 复杂版面解析能力强
  • 输出结构清晰
  • 与 RAG 流水线衔接顺畅

缺点:

  • 超大规模处理需要付费
  • 自部署对算力有一定要求

使用技巧

  • 扫描件先用高分辨率输入以提升精度
  • 处理前按文档类型选择合适模式
  • 将输出 Markdown 直接接入向量库构建 RAG