PDFをドロップするだけで、段組順の再構成やヘッダ・フッタの自動除去を行います(完全ローカル処理・外部送信なし)。
PDFファイルをここにドロップ
またはクリックしてファイルを選択(クライアントサイドで完結・外部送信なし)
テキストのコピー&ペーストでは、PDF内の文字がどのようなレイアウト(段組やヘッダ位置)で配置されているかという座標情報が失われてしまいます。 PetaPDFの「PDF直読みモード」では、pdf.jsを利用して各テキスト要素のX・Y座標およびフォントサイズを直接解析。2段組の左右読み順の再構築や、全ページに共通して出現するヘッダ・フッタ・単独ページ番号の自動判定除去を実現しています。
PDF特有の行末改行を自動で判定し、文脈や段落(句点「。」や空行)を保ったままスムーズな1つの文章に繋ぎ合わせます。
各ページの上下に現れるタイトル行や「- 1 -」などの単独ページ番号を自動検出して除去。本文だけをスッキリ抽出します。
「日 本 語」のように文字間に挟まった変なスペースの削除や、「exam-ple」のような英単語ハイフン分割の結合、合字・濁点の結合を行います。
PDFファイルをそのままドロップすれば、pdf.jsの座標情報を使って2段組の左右順番を正しく再現し、ヘッダ・フッタも完璧に除去します。
| 崩れパターン | 実際の例(ビフォー) | PetaPDFでの整形後(アフター) |
|---|---|---|
| ぶつ切り改行 | これはテスト\nです。 | これはテストです。 |
| 英単語ハイフン分割 | exam-\nple | example |
| 日本語スペース混入 | 日 本 語 テキスト | 日本語テキスト |
| 単独ページ番号混入 | 本文です。\n- 1 -\n次の文です。 | 本文です。\n次の文です。 |
| 特殊な合字(ligature) | final result | final result |
| 不可視ゼロ幅文字 | テスト\u200Bデータ | テストデータ |
コピーしたPDF文章をテキストエリアにペタッと貼るか、PDFファイルを直接ドロップします。
「AIに貼る」「1行にまとめる」「原稿を整える」から目的に応じたモードを選ぶだけで自動反映されます。
「コピー」ボタンでクリップボードへ保存し、ChatGPTやClaudeなどのAIプロンプトに貼り付けます。
いいえ、送信されません。すべての処理はご利用のブラウザ内(クライアントサイド)のみで完結します。テキストデータやPDFファイルがネットワークを介して運営者のサーバーや外部サービスに送信されることは一切ありません。
スキャン画像や写真ベースのPDFにはテキスト層が含まれていないため抽出できません。現在はOCR(光学文字認識)機能に対応しておりません。
PDFデータはレイアウトを再現するため文字の位置(座標情報)で保持しており、一般的な文書のように行や段落の構造を持っていないためです。コピー時に不要な改行やスペースが混入します。
はい、会員登録不要かつ完全無料でご利用いただけます。