PDFからコピペした文章のぶつ切り改行・変なスペース・ヘッダフッタを一括修正
PDF特有の行末改行を自動で判定し、文脈や段落(句点「。」や空行)を保ったままスムーズな1つの文章に繋ぎ合わせます。
各ページの上下に現れるタイトル行や「- 1 -」などの単独ページ番号を自動検出して除去。本文だけをスッキリ抽出します。
「日 本 語」のように文字間に挟まった変なスペースの削除や、「exam-ple」のような英単語ハイフン分割の結合、合字・濁点の結合を行います。
PDFファイルをそのままドロップすれば、pdf.jsの座標情報を使って2段組の左右順番を正しく再現し、ヘッダ・フッタも完璧に除去します。
| 崩れパターン | 実際の例(ビフォー) | PetaPDFでの整形後(アフター) |
|---|---|---|
| ぶつ切り改行 | これはテスト\nです。 | これはテストです。 |
| 英単語ハイフン分割 | exam-\nple | example |
| 日本語スペース混入 | 日 本 語 テキスト | 日本語テキスト |
| 単独ページ番号混入 | 本文です。\n- 1 -\n次の文です。 | 本文です。\n次の文です。 |
| 特殊な合字(ligature) | final result | final result |
| 不可視ゼロ幅文字 | テスト\u200Bデータ | テストデータ |
コピーしたPDF文章をテキストエリアにペタッと貼るか、PDFファイルを直接ドロップします。
「AIに貼る」「1行にまとめる」「原稿を整える」から目的に応じたモードを選ぶだけで自動反映されます。
「コピー」ボタンでクリップボードへ保存し、ChatGPTやClaudeなどのAIプロンプトに貼り付けます。
いいえ、送信されません。すべての処理はご利用のブラウザ内(クライアントサイド)のみで完結します。テキストデータやPDFファイルがネットワークを介して運営者のサーバーや外部サービスに送信されることは一切ありません。
スキャン画像や写真ベースのPDFにはテキスト層が含まれていないため抽出できません。現在はOCR(光学文字認識)機能に対応しておりません。
PDFデータはレイアウトを再現するため文字の位置(座標情報)で保持しており、一般的な文書のように行や段落の構造を持っていないためです。コピー時に不要な改行やスペースが混入します。
はい、会員登録不要かつ完全無料でご利用いただけます。