先把文件变成 Markdown,再交给 AI 干活

今天给大家推荐一款 GitHub 超火的开源项目:MarkItDown。它能把 PDF、Word、Excel、PPT、图片、音频和网页文件,统一转成适合大模型阅读的 Markdown,目前已经有 16.95 万 Star

很多人做 AI 知识库或文档分析,第一步就卡住了:文件格式五花八门,复制出来结构全乱,表格、标题和图片说明全丢。模型再强,吃进去一堆乱码,也很难给出可靠结果。

MarkItDown 解决的就是这一步。它不是一个花哨的编辑器,而是一层轻量的“文件翻译器”:先把资料整理成 Markdown,再交给 LLM、RAG 或 Agent 使用。

它能转换哪些内容

MarkItDown 支持常见办公文档、PDF、网页、CSV、JSON、图片和音频。图片可以走 OCR,音频还能结合转写模型生成文本;遇到压缩包时,也能逐个读取里面的文件。

它的重点不是“把字抠出来”,而是尽可能保留标题层级、列表、链接、表格和图片描述。这样后面的模型拿到的是有结构的内容,不是一整段难以定位的纯文本。

最让人惊艳的是:它特别适合接到 Agent 前面

如果你经常把资料丢给 Codex、Claude Code 或本地知识库,MarkItDown 很适合做前置步骤。先统一把输入文件变成 Markdown,后面的 Agent 就能更稳定地搜索、总结、生成方案和写代码。

例如一份产品需求在 Word 里,一张流程图在 PDF 里,一段会议录音在音频文件里。以前要分别处理,现在可以先转成同一种 Markdown,再让 Agent 根据统一材料完成任务。

用法非常简单,让 Codex 帮你部署

安装后,最基础的用法就是把一个文件转成 Markdown:

markitdown 产品需求.docx > 产品需求.md

如果不想自己研究参数,直接下载项目后让 Codex 阅读 README,检查 Python 环境、安装依赖,并用一份测试文件跑通转换即可。完全不需要代码基础,也能先把“文件进 AI”这一步整理明白。

文件统一了,模型入口也该统一

MarkItDown 负责把资料变成模型能读的格式;当你后面还要接不同模型做总结、OCR 校对、检索和 Agent 自动化时,接口配置很容易又变得分散。

这类工作流可以把 Veco API 作为统一的 OpenAI 兼容入口:国内网络直接调用,热门新模型快速接入,多模型统一接口,也不用维护多个官方账号。高频测试更从容,无需固定订阅,按实际调用灵活使用。

需要时全网搜 Veco API 即可。先把文件格式统一,再把模型连接统一,AI 工作流才不会每一步都重新搭一遍。

使用前要知道的边界

复杂扫描件、排版特别重的 PDF,转换后仍然建议抽查。MarkItDown 帮你省掉格式搬运,但涉及敏感资料时,文件权限、脱敏和本地保存策略仍然要自己确认。

写在最后

MarkItDown 最有价值的地方,是把 AI 项目里最容易被忽略的输入环节变得可控。资料一旦结构化,后面的检索、总结、自动化和多 Agent 协作都会顺很多。

项目名是 microsoft/markitdown,全网搜索 MarkItDown GitHub 就能找到。建议先找一份真实文档,让 Codex 帮你跑一遍转换流程。

我是 VecoAI,如果你正在为 AI 大模型的 API 调用账单发愁,欢迎加群交流学习!

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐