pinyin
一款功能强大的中文转拼音 JavaScript 库,支持拼音音调、声母韵母、多音字、姓氏及分词匹配。
微软开源的 Python 工具,可将各类文件与 Office 文档转换为 Markdown 格式。
MarkItDown 是微软在 GitHub 上开源的一款 Python 工具,核心功能是将多种格式的文件转换为 Markdown 文本。与许多仅支持单一格式的转换脚本不同,它试图用统一的接口处理文档、表格、演示文稿、PDF、图片、音频等常见内容类型,降低在 LLM 训练、RAG 检索、文档归档等场景中处理异构文件的成本。
项目地址:https://github.com/microsoft/markitdown
MarkItDown 的设计目标之一是覆盖日常办公与内容处理中出现频率较高的文件类型。根据项目说明,主要支持范围包括:
| 类别 | 典型格式 |
|---|---|
| Office 文档 | Word(.docx)、Excel(.xlsx)、PowerPoint(.pptx) |
| 便携文档 | |
| 标记与文本 | HTML、XML、JSON、CSV、纯文本 |
| 图像 | JPG、PNG 等(提取 EXIF 元数据与可选 OCR) |
| 音频 | 提取语音转录文本 |
| 电子书 | EPUB |
| 压缩包 | ZIP(遍历内部文件) |
| 其他 | YouTube 链接、Outlook 邮件(.msg) |
这种覆盖面使它不仅可以作为格式转换器,也能作为多模态内容进入文本流水线的前置步骤。
安装基础版本:
pip install markitdown
如需 PDF、音频、图像等扩展能力,可安装带附加依赖的版本:
pip install 'markitdown[all]'
命令行转换示例:
markitdown path/to/file.docx > output.md
也可在 Python 代码中调用:
from markitdown import MarkItDown
md = MarkItDown()
result = md.convert("report.xlsx")
print(result.text_content)
MarkItDown 适合以下用途:
需要注意,复杂排版(如精细的 PDF 版式、嵌套表格、图表)在转换后可能出现信息损失或结构简化,实际效果依赖源文件与所启用的可选依赖。对于版式还原要求高的场景,建议在转换后人工校验关键内容。
MarkItDown 的价值在于用一个相对统一的接口,把多种文件类型收敛为 Markdown 文本,减少文档预处理环节的重复工作。若你的工作流涉及大量异构文件且下游以文本模型为主,它可以作为格式转换层的一个可选项;若对版式精度要求极高,则需结合具体文件评估转换质量。