PDFをMarkdownへ

PDF→Markdownは、テキスト抽出に構造ヒューリスティックを加えます。フォントサイズで見出しを判定し、リスト記号は箇条書きや番号付きに、折返された行は段落に再結合し、繰り返し現れるヘッダー・フッターは除去されます。LLMやメモアプリへの取り込みに便利です。

PDFerretのマスコット:働く準備ができた白いフェレット

PDFをドロップしてMarkdownを抽出

ファイルは巣穴の中:すべて端末上で処理され、アップロードされません。

使い方

  1. 1テキスト層のあるPDFをドロップ(スキャンは先にOCRを)。
  2. 2必要ならページ範囲を選択。
  3. 3「抽出」をクリックし、エディタでMarkdownを確認。
  4. 4クリップボードにコピーするか、.mdファイルをダウンロード。

よくある質問

Markdown出力の忠実度はどのくらいですか?

レイアウトの再構成ではなくヒューリスティックです。見出しは相対的なフォントサイズから、リストは行頭の記号から判定され、表や段組は通常の段落として出力されます。構造なしの素のテキストだけなら、PDF→テキストツールが正直な選択肢です。

LLMやAIツールに何が嬉しいのですか?

Markdownは見出し階層とリスト構造を保つため、言語モデルやメモアプリが生のテキストよりはるかに正確に解析できます。処理はすべて端末上で完結し、プライベートな文書がファイル生成のために外部へ出ることはありません。

スキャンPDFで結果が空ですが、どうすれば?

スキャンページにはテキストではなく画像しかありません。先にOCRツールで文字認識するか、検索可能PDFツールを使い、その結果からMarkdownを抽出してください。

関連ツール