本文へスキップ

紙とPDFを片づける。スキャンした山を、探せる状態にするまで

溜まった書類・領収書・説明書。読み取って、分けて、あとから探せるようにする手順。

ツールみっけ! 編集部2026年9月21日 更新7分で読めます

先に結論

順番があります。①スキャンする ②文字を読み取る(OCRmyPDF)③必要なら分割・結合する(PDFsam)④ためて探せるようにする(Paperless-ngx)。いきなり④から始めると、中身が読み取られていない書類が山になって、結局探せません。②を飛ばさないでください。

スキャンしてPDFにしたのに、あとから探せない。よくある失敗です。原因は、スキャンしたPDFの中身が「文字」ではなく「写真」だからです。この記事では、探せる状態にするまでの順番を書きます。

手順

  1. 1紙をスキャンする(複合機でもスマホでも可。300dpi以上、まっすぐ、明るく)
  2. 2文字を読み取る(OCRmyPDF をかける。見た目は変わらず、検索できるようになる)
  3. 3必要なら分ける・まとめる(PDFsam。両面スキャンの並べ直しもここ)
  4. 4ためる場所を作る(Paperless-ngx。タグを付けて、あとから言葉で探す)

② 文字を読み取る

OCRmyPDF

スキャンしたPDFを、文字で検索できるようにする

元の見た目をそのまま残し、裏側に文字の層を足します。フォルダごとまとめてかけられます。

無料日本語は一部WindowsMacLinux
くわしく見る →

Tesseract OCR

画像の中の文字を読み取る、いちばん広く使われている土台

上の内部で使われている読み取りの土台。写真1枚から文字を取りたいときはこちら。

無料日本語は一部WindowsMacLinux
くわしく見る →

③ 分ける・まとめる

どちらも自分のパソコン(またはサーバー)の中で処理します。契約書や請求書を、オンラインの変換サイトへ上げずに済みます。PDFsam は入れるだけ、Stirling PDF は Docker で立ち上げて、ブラウザから多機能に使う形です。

④ ためて、あとから探す

Paperless-ngx

読み取った書類を整理して、あとから言葉で探す

入れたPDFを自動で読み取り、日付や取引先を推測してタグを付けます。ここまで来ると、紙を探さなくなります。

無料日本語OKLinuxブラウザ
くわしく見る →

どこまでやるかの目安

やることかかる手間
年に数枚スマホで撮るだけほぼゼロ
月に数十枚OCRmyPDF をかけてフォルダ分け慣れれば数分
毎週たまるPaperless-ngx を立てる最初だけ半日
Q手書きの書類も読めますか?

Aほとんど読めません。ここで紹介している道具は印刷された文字を対象にしています。手書きは精度が大きく落ちるので、重要なものは自分で入力してください。

Q原本の紙は捨てていいですか?

A書類の種類によります。法律で原本の保存が必要なものがあります(契約書・一部の税務書類など)。捨てる前に、その書類の保存義務を確認してください。この記事は保存義務の判断には使えません。

Qスキャナがなくても始められますか?

A始められます。スマホのカメラで十分です。まっすぐ、明るく、影が入らないように撮れば、読み取りの精度はかなり出ます。

TOOLS

この記事で出てきたツール

NEXT

次に読むなら