OCRmyPDF
スキャンしたPDFを、文字で検索できるようにする
見た目はそのままに、文字の情報だけを裏側に足します。コピーも検索もできるようになります。
GitHubのスター数 3.5万GitHub上の更新 2026年9月16日当サイトの確認日:2026年9月20日
まず、ここだけ見れば分かります
- 料金
- 無料ソフト自体に料金はかかりません
- 日本語
- 日本語は一部日本語の読み取りに対応していますが、言語データを別に入れる必要があります。
- 対応環境
- Windows / Mac / Linux
- 準備の目安
- ★★★設定が多い複数のソフトや接続先などを準備します。設定に慣れた人の手助けがあると進めやすい道具です。
- 計算用の部品
- 専用のGPUは必須ではありませんGPUは、画像やAIなどの計算にも使われる部品です。必要な性能や処理時間は、使う機能・設定で変わります。
- 必要なもの
- Python が入っていること / Tesseract(文字を読み取る部品) / 日本語を読むための言語データ
自分に合う進め方を選ぶ
料金だけでなく、最初の準備と、使い続ける手間も比べてみましょう。
必要な人だけ:一緒に用意するものを確認 ↓これは何?
スキャンしたPDFは、見た目は書類でも中身は写真なので、文字を選ぶことも検索することもできません。この道具は、写真から文字を読み取って、見た目を変えないまま「見えない文字の層」を裏側に足します。結果として、検索もコピーもできるPDFになります。
できること・できないこと
できること
- スキャンしたPDFを検索できるようにする
- 見た目を変えずに文字の情報を足す
- 日本語を含む多くの言語を読み取る
- 傾きを直し、余分な部分を切り落とす
- フォルダごとまとめて処理する
できないこと
- 手書き文字の正確な読み取り
- 読み取りの間違いをなくすこと
- 画面をクリックするだけの操作
こんな人に向いています
- スキャンした書類を検索できずに困っている人
- 契約書や領収書を電子化している人
- 書類をAIに読ませたい人
こんなふうに使えます
過去の書類を探せるようにする
スキャンしてためた書類に一度かけておけば、あとから言葉で探せます。書類の山が資料になります。
書類の自動仕分けの前処理にする
文字が読める状態にしてから仕分けの道具に渡すと、分類の精度が上がります。
使いはじめるまで
OCRmyPDFを使うための案内
手順は上から順番に進めます。「入力例」がある場合は、どの画面へ入力するか、どの名前で保存するかを本文で確認してください。
上のリンクはOCRmyPDFの開発資料です。GitHubというサイト自体の見方は、共通のGitHub入門で説明しています。
この手順で出てくる言葉の意味
- Python(パイソン)
- プログラムを動かすためのソフトです。「Pythonが必要」とある道具は、先に対応する版のPythonを入れて使います。
1必要なものを入れる
Python のほかに、文字を読み取る部品(Tesseract)と、日本語の言語データが要ります。公式の説明に、パソコンごとの手順があります。
2入れる
この手順で使う入力例
pip install ocrmypdf3日本語を指定して実行する
言語を指定しないと英語として読もうとして、結果が使いものになりません。ファイル名は実際のものに置き換えます。
この手順で使う入力例
ocrmypdf -l jpn scan.pdf out.pdf4結果を確かめる
できたPDFを開いて、文字を選択できるか、検索できるかを確かめます。読み取りの間違いは残ります。
つまずいたときはAIに手伝ってもらう聞き方を見てください。使っているパソコンと、どの手順で止まったかを伝えましょう。
いいところ・気になるところ
いいところ
- 見た目を変えずに検索できるようになる
- 日本語に対応している
- まとめて処理できる
- 無料で枚数の制限がない
気になるところ
- 準備するものが多い
- 文字入力での操作になる
- 読み取りの間違いは必ず残る
一緒に使うと便利
このツールと組み合わせると、できることが増えるもの
Paperless-ngx
書類を自動で仕分ける道具
中で同じ読み取りの仕組みを使っています。書類を継続的にためるなら、こちらを先に立てたほうが手間が少なく済みます。
OCRmyPDFの開発情報・出典
GitHub上で公開されているOCRmyPDFのプログラムに関する情報です。スター数はGitHubで関心を示した数で、OCRmyPDFの利用者数を表すものではありません。
- GitHubのスター数
- 34,809(2026年9月20日時点)
- ライセンス
- MPL-2.0
- 主な言語
- Python
- GitHub上の更新
- 2026年9月16日直近3か月以内に更新されています
- 開発資料(GitHub)
- https://github.com/ocrmypdf/OCRmyPDF
- 当サイトでの確認日
- 2026年9月20日
スター数・ライセンス・主な言語・最終更新は、2026年9月20日に GitHub から自動で取得した値です。ライセンスの補足と、説明文・準備の目安の判定は当サイトが書いています。 ライセンスや料金は変わることがあるので、使う前に必ず公式の情報をご確認ください。
次に見るなら
このツールが出てくる記事
似たツール
同じことができる、または一緒によく使われるもの
- Excel・データ編集部イチオシ
PDFをまとめる・分ける・容量を小さくする
Stirling-PDF
こんな人に → 無料のPDF変換サイトに機密ファイルを上げるのが不安な人
無料日本語OKLinuxブラウザWindows9.3万★★★準備あり9/18確認 - 仕事効率化面白い
読み取った書類を整理して、あとから言葉で探す
Paperless-ngx
こんな人に → 領収書や契約書が紙で山になっている人
無料日本語OKLinuxブラウザ4.5万★★★設定が多い9/18確認 - Excel・データ注目
PDFの文章や表を取り出して、再利用する
Docling
こんな人に → 決算資料や統計資料から表を抜いている人
無料日本語は一部WindowsMacLinux6.7万★★★準備あり9/18確認 - Excel・データ新着
段組みや数式の多いPDFを、崩さずに文章にする
MinerU
こんな人に → 論文や技術資料を大量に読む人
無料日本語は一部WindowsMacLinux8.0万★★★設定が多い9/20確認