您的文件不会被存储在我们的服务器上。此工具完全在内存中运行,并将结果直接返回在同一响应中——与其他网站上的工具不同,之后不会在我们的服务器上留下 45 分钟的副本,因为根本不会生成任何副本。
ShinobiTools 团队 · 上次更新:2026 年 8 月
您想将 PDF 粘贴到维基、README 或任何读取 Markdown 的工具中——但又不希望每个标题都变成一个简单的段落。页面中明显大于其他文本的文本将变为 Markdown 标题;所有其他文本都保持为普通文本。
PDF 实际上并没有像 HTML 或 Markdown 那样对“标题”有明确的概念——它只知道每个字符的位置以及大小。将每一行的字体大小与页面本身的平均大小进行比较,是一种简单可靠的方法,可以区分哪些文本在视觉上看起来像标题,哪些是普通段落文本,而无需使用针对特定文档样式进行训练的布局模型。
表格、多栏布局和图像不会被重建——此工具提取的是文本内容,而不是视觉设计。对于高度依赖布局的文档,请将 Markdown 视为一个起点,用于进行清理,而不是一个完整的转换结果。
此工具完全在内存中运行,并将结果直接返回在同一响应中——之后不会在我们的服务器上留下任何副本,因为根本不会生成任何副本。
需要纯文本而不是 Markdown 格式吗?图像转文本 执行 OCR,并返回可复制的文本,不包含标题检测。如果从没有文本图层的扫描件开始,该怎么办?先使用该工具进行处理。如果希望在 PDF 文件本身中创建一个可点击的跳转到标题的列表,而不是单独的 Markdown 文件,该怎么办?PDF 书签 可以将其构建为文件的目录。如果只需要提取要点而不是结构,该怎么办?PDF 摘要 会读取相同的文本,并编写一个简短的摘要,而不是标题和列表。
将 PDF 文件拖放到指定区域。Markdown 内容将出现在下面的框中,您可以将其复制或下载为 .md 文件。
通过将每一行的字体大小与该页面中所有行字体大小的平均值进行比较。如果某一行明显大于页面的大部分文本,则将其识别为一级标题;其余内容都保留为普通文本。
不可以,它只处理一级标题。它区分“这一行在视觉上看起来像一个标题”和“这是正文”,它不会仅根据字体大小来推断完整的文档结构。
不会。该工具逐页读取文本内容;Markdown输出中不会重建表格、图像和多栏等布局元素。
只有当扫描文件已经包含文本层时,例如通过本网站提供的 OCR 工具生成的文本层。如果扫描的文件只是图像,没有底层的文本,那么该工具就无法从中提取任何内容。
每个文件最多处理 25 页。无需注册账户,不会添加水印,也没有每日使用上限。