Superpowers
Superpowers是开源工具项目,主打An agentic skill。。
将 PDF 和 Office 文档转换为 LLM 可用的 Markdown/JSON,助力智能体工作流。
MinerU 是一个开源文档解析工具,核心目标是将 PDF 和 Office 文档转换为大语言模型(LLM)可直接使用的 Markdown 或 JSON 格式。它由 OpenDataLab 团队维护,托管于 GitHub,面向智能体(Agent)工作流、RAG 检索增强生成、知识库构建等场景。
PDF 和 Office 文档格式复杂,包含多栏排版、表格、公式、图片、页眉页脚等结构。直接送入 LLM 往往面临以下障碍:
MinerU 针对上述问题提供端到端的解析方案,输出结构清晰、语义完整的文本。
| 能力 | 说明 |
|---|---|
| 多格式支持 | PDF、DOCX、PPTX、XLSX 等 |
| 版面分析 | 识别标题、段落、列表、表格、图片区域 |
| 公式识别 | 将数学公式转为 LaTeX 表示 |
| 表格提取 | 保留表格结构,输出为 Markdown 表格或 HTML |
| OCR 支持 | 处理扫描版 PDF,支持多种语言 |
| 阅读顺序还原 | 按人类阅读逻辑排列多栏内容 |
| 输出格式 | Markdown、JSON,适配不同下游任务 |
pip install mineru
或从 GitHub 仓库克隆后按文档安装依赖。基本使用方式:
from mineru import MinerU
parser = MinerU()
result = parser.parse("document.pdf")
print(result.markdown)
具体安装步骤和参数配置建议参考仓库 README 和官方文档。
MinerU 适合需要将大量异构文档转为 LLM 友好格式的团队或个人。如果仅处理少量简单文本 PDF,轻量级解析库可能已足够;但面对多栏排版、公式密集或扫描件为主的文档时,MinerU 的版面分析和公式识别能力能显著降低后续清洗成本。
项目地址:https://github.com/opendatalab/mineru