本文へスキップ

手元の資料をAIに読ませる。形式ごとの正しいやり方

PDFをそのまま貼って失敗する前に。Word・PDF・紙・Webページ、それぞれの下ごしらえ。

ツールみっけ! 編集部2026年9月21日 更新8分で読めます

先に結論

そのまま貼るのではなく、先に文章として整えてください。整え方は元の形で変わります。Word や PowerPoint は MarkItDown、段組みのあるPDFは MinerU か Docling、スキャンした紙は OCRmyPDF、Webページは Crawl4AI。資料が増えて探せなくなったら、RAGFlow のような「ためて質問する」道具に移ります。

AIにPDFを貼ったら、まるで見当違いの答えが返ってきた。よくあることです。原因はたいていAIではなく、渡し方にあります。段組みや表のあるPDFは、そのまま読ませると行の順番が入れ替わり、別の文章になってしまいます。

まず、自分の資料がどれか確かめる

資料の状態使うもの難しさ
Word・Excel・PowerPointMarkItDownやさしい
文字で作られたPDF(コピーできる)Docling / MinerUふつう
スキャンしたPDF・写真(コピーできない)OCRmyPDFふつう
WebページCrawl4AI / Firecrawlふつう
どれか分からないPDFを開いて文字を選べるか試す
PDFの文字をマウスで選べるなら「文字で作られたPDF」、選べないなら「スキャン」です。

① いろいろな形式が混ざっているなら

MarkItDown

Word・PDF・音声などを、AIが読める文章にそろえる

Word・PowerPoint・PDF・音声まで、まとめて同じ形にします。迷ったらここから。Microsoft 製。

無料日本語は一部WindowsMacLinux
くわしく見る →

② 段組みや表のあるPDFなら

論文・報告書・パンフレットのように、レイアウトが複雑なものは専用の道具が要ります。読む順番を推定して、表は表として取り出してくれます。

③ スキャンした紙なら

紙をスキャンしただけのPDFは、中身がただの画像です。文字として読み取る処理(OCR)を先にかけます。かけたあとのPDFは、見た目は同じまま、検索とコピーができるようになります。

OCRmyPDF

スキャンしたPDFを、文字で検索できるようにする

元の見た目を残したまま、文字の層を足します。日本語も読めます。

無料日本語は一部WindowsMacLinux
くわしく見る →

Tesseract OCR

画像の中の文字を読み取る、いちばん広く使われている土台

その内部で使われている読み取りの土台。画像1枚から文字を取りたいときはこちら。

無料日本語は一部WindowsMacLinux
くわしく見る →

④ Webページなら

広告・メニュー・関連記事を取り除いて、本文だけを取り出します。ページをそのまま保存すると、AIが本文以外を読んでしまいます。

資料が増えてきたら

10本を超えたあたりから、毎回貼り付けるのが現実的でなくなります。ためておいて、質問すると関係する部分を探して答える形に移ります。

Q変換すると、表は残りますか?

A道具によります。MinerU と Docling は表を表として取り出そうとします。MarkItDown は形式の幅が広いぶん、複雑な表は崩れることがあります。大事な表は、変換後に必ず目で確かめてください。

Q社外に出せない資料でも大丈夫ですか?

Aここで紹介している変換の道具は、すべて自分のパソコンの中で動きます。資料は外に出ません。ただし、変換したあとに外部のAIへ貼れば、そこで外に出ます。最後まで外に出したくない場合は、手元で動くAIと組み合わせてください。

Qスキャンの精度が悪いときは?

A元の画像の質がほとんどすべてです。斜め・暗い・ピンぼけは、どの道具でも読めません。撮り直すのがいちばん速い解決です。300dpi以上、まっすぐ、明るく、が目安です。

TOOLS

この記事で出てきたツール

NEXT

次に読むなら