将 PDF 转换为 Markdown 并保持结构完整


常见问题
标题和表格会保留下来吗?
是的 — 这就是本页的要点。标题变成 Markdown 标题,项目符号列表变成破折号,粗体和斜体会保留,表格以管道表形式出现。它不是一个重新排列了换行符的文本转储。
为什么我想要 Markdown 而不是纯文本?
因为结构是机器可读的。它是文件网站、静态网站生成器、笔记应用和语言模型都原生读取的格式,如果不涉及这些,它保持可读状态。
编号清单呢?
它们以普通破折号的形式出现。Word将编号与文本分开存储,因此数字本身不是我们可以跨越的内容。在编辑器中对它们重新编号只需一会儿。
它能转换 PowerPoint 演示文稿吗?
不会,而且是刻意如此。幻灯片是浮动文字方块,没有附加阅读顺序,所以我们产生的任何 Markdown 都只是猜测接下来会发生什么——而且它经常会出错到看起来像乱码的程度。如果您需要文字,请先将简报转换为 Word。
它能读取扫描的 PDF 吗?
是的。没有文字图层的 PDF 首先自动经过文字辨识,然后从辨识的文字建立 Markdown。
我文件中的图像会被保留吗?
不会。Markdown 将图像参考为单独的档案,这会传回单一 .md 档案,因此图片会被舍弃而非连结到不存在的内容。如果图像很重要,请转换为 Word。
我的文件可以有多大?
每个档案最多10 MB。超过20页的PDF会转换为前20页——付费帐户最多100页——结果会告诉你。
为什么转换为纯文本需要更长时间?
因为它在做更多的事情。在编写 Markdown 之前,文件会被正确布局,这就是使标题成为标题的原因——纯文字汇出跳过了该步骤,也跳过了结构本身。
需要注册账号吗?
否。您的第一次转换无需登录即可执行。
我可以转换后立即编辑内容吗?
是的。在句子中请求两者 — 例如,转换并翻译 — 您会获得一个完成的档案。