本文へスキップ
Excel・データ#OCR#PDF#検索できるようにする

OCRmyPDF

スキャンしたPDFを、文字で検索できるようにする

見た目はそのままに、文字の情報だけを裏側に足します。コピーも検索もできるようになります。

GitHubのスター数 3.5万GitHub上の更新 2026年9月16日当サイトの確認日:2026年9月20日

まず、ここだけ見れば分かります

料金
無料ソフト自体に料金はかかりません
日本語
日本語は一部日本語の読み取りに対応していますが、言語データを別に入れる必要があります。
対応環境
Windows / Mac / Linux
準備の目安
設定が多い複数のソフトや接続先などを準備します。設定に慣れた人の手助けがあると進めやすい道具です。
計算用の部品
専用のGPUは必須ではありませんGPUは、画像やAIなどの計算にも使われる部品です。必要な性能や処理時間は、使う機能・設定で変わります。
必要なもの
Python が入っていること / Tesseract(文字を読み取る部品) / 日本語を読むための言語データ

自分に合う進め方を選ぶ

料金だけでなく、最初の準備と、使い続ける手間も比べてみましょう。

必要な人だけ:一緒に用意するものを確認 ↓

これは何?

スキャンしたPDFは、見た目は書類でも中身は写真なので、文字を選ぶことも検索することもできません。この道具は、写真から文字を読み取って、見た目を変えないまま「見えない文字の層」を裏側に足します。結果として、検索もコピーもできるPDFになります。

できること・できないこと

できること

  • スキャンしたPDFを検索できるようにする
  • 見た目を変えずに文字の情報を足す
  • 日本語を含む多くの言語を読み取る
  • 傾きを直し、余分な部分を切り落とす
  • フォルダごとまとめて処理する

できないこと

  • 手書き文字の正確な読み取り
  • 読み取りの間違いをなくすこと
  • 画面をクリックするだけの操作

こんな人に向いています

  • スキャンした書類を検索できずに困っている人
  • 契約書や領収書を電子化している人
  • 書類をAIに読ませたい人

こんなふうに使えます

  • 過去の書類を探せるようにする

    スキャンしてためた書類に一度かけておけば、あとから言葉で探せます。書類の山が資料になります。

  • 書類の自動仕分けの前処理にする

    文字が読める状態にしてから仕分けの道具に渡すと、分類の精度が上がります。

使いはじめるまで

OCRmyPDFを使うための案内

手順は上から順番に進めます。「入力例」がある場合は、どの画面へ入力するか、どの名前で保存するかを本文で確認してください。

上のリンクはOCRmyPDFの開発資料です。GitHubというサイト自体の見方は、共通のGitHub入門で説明しています。

この手順で出てくる言葉の意味
Python(パイソン)
プログラムを動かすためのソフトです。「Pythonが必要」とある道具は、先に対応する版のPythonを入れて使います。
  1. 1必要なものを入れる

    Python のほかに、文字を読み取る部品(Tesseract)と、日本語の言語データが要ります。公式の説明に、パソコンごとの手順があります。

  2. 2入れる

    この手順で使う入力例

    pip install ocrmypdf
  3. 3日本語を指定して実行する

    言語を指定しないと英語として読もうとして、結果が使いものになりません。ファイル名は実際のものに置き換えます。

    この手順で使う入力例

    ocrmypdf -l jpn scan.pdf out.pdf
  4. 4結果を確かめる

    できたPDFを開いて、文字を選択できるか、検索できるかを確かめます。読み取りの間違いは残ります。

つまずいたときはAIに手伝ってもらう聞き方を見てください。使っているパソコンと、どの手順で止まったかを伝えましょう。

いいところ・気になるところ

いいところ

  • 見た目を変えずに検索できるようになる
  • 日本語に対応している
  • まとめて処理できる
  • 無料で枚数の制限がない

気になるところ

  • 準備するものが多い
  • 文字入力での操作になる
  • 読み取りの間違いは必ず残る
COMBINE

一緒に使うと便利

このツールと組み合わせると、できることが増えるもの

一緒に使うと便利

Paperless-ngx

書類を自動で仕分ける道具

中で同じ読み取りの仕組みを使っています。書類を継続的にためるなら、こちらを先に立てたほうが手間が少なく済みます。

OCRmyPDFの開発情報・出典

GitHub上で公開されているOCRmyPDFのプログラムに関する情報です。スター数はGitHubで関心を示した数で、OCRmyPDFの利用者数を表すものではありません。

GitHubのスター数
34,809(2026年9月20日時点)
ライセンス
MPL-2.0
主な言語
Python
GitHub上の更新
2026年9月16日直近3か月以内に更新されています
開発資料(GitHub)
https://github.com/ocrmypdf/OCRmyPDF
当サイトでの確認日
2026年9月20日

スター数・ライセンス・主な言語・最終更新は、2026年9月20日に GitHub から自動で取得した値です。ライセンスの補足と、説明文・準備の目安の判定は当サイトが書いています。 ライセンスや料金は変わることがあるので、使う前に必ず公式の情報をご確認ください。

NEXT

次に見るなら

READ

このツールが出てくる記事

SIMILAR

似たツール

同じことができる、または一緒によく使われるもの