本文へスキップ
Excel・データ#Web取り込み#AIの下ごしらえ#本文抽出

Crawl4AI

Webページを、AIが読みやすい形で取り込める

広告やメニューを取り除いて、本文だけを取り出します。AIに読ませる材料づくりに向いています。

GitHubのスター数 8.4万GitHub上の更新 2026年9月18日当サイトの確認日:2026年9月20日

まず、ここだけ見れば分かります

料金
無料ソフト自体に料金はかかりません
日本語
日本語は一部日本語のページも扱えます。説明は英語です。
対応環境
Windows / Mac / Linux
準備の目安
設定が多い複数のソフトや接続先などを準備します。設定に慣れた人の手助けがあると進めやすい道具です。
計算用の部品
専用のGPUは必須ではありませんGPUは、画像やAIなどの計算にも使われる部品です。必要な性能や処理時間は、使う機能・設定で変わります。
必要なもの
Python が入っていること

自分に合う進め方を選ぶ

料金だけでなく、最初の準備と、使い続ける手間も比べてみましょう。

必要な人だけ:一緒に用意するものを確認 ↓

これは何?

Webページを取り込んで、AIが読みやすい文章にする道具です。ただ保存するのではなく、広告・メニュー・関連リンクといった本文でない部分を取り除きます。取り出したい項目を決めて、決まった形で抜き出すこともできます。

できること・できないこと

できること

  • ページの本文だけを取り出す
  • JavaScript で描かれるページも扱う
  • 複数のページをまとめて取り込む
  • 取り出したい項目を決めて、決まった形で抜く
  • AIが読みやすい形(Markdown)で出す

できないこと

  • 規約で自動取得を禁じているサイトからの取得
  • ログインが必要なページの取得(規約を必ず確認すること)
  • 取り込んだ内容の正しさの保証

こんな人に向いています

  • AIに読ませる材料を自分で集めたい人
  • 公開されている情報をまとめたい人
  • 毎回コピー&ペーストしている人

こんなふうに使えます

  • AIに読ませる資料を集める

    公開されている解説ページなどを取り込んで、AIに読ませる材料にします。取得先の規約は必ず先に確認してください。

  • 自分のサイトの内容を整理する

    自分で運営しているサイトなら、規約の心配なく丸ごと扱えます。

使いはじめるまで

Crawl4AIを使うための案内

手順は上から順番に進めます。「入力例」がある場合は、どの画面へ入力するか、どの名前で保存するかを本文で確認してください。

上のリンクはCrawl4AIの開発資料です。GitHubというサイト自体の見方は、共通のGitHub入門で説明しています。

この手順で出てくる言葉の意味
Python(パイソン)
プログラムを動かすためのソフトです。「Pythonが必要」とある道具は、先に対応する版のPythonを入れて使います。
  1. 1入れる

    この手順で使う入力例

    pip install -U crawl4ai
  2. 2初期設定をする

    ブラウザの部品を用意する手順が走ります。

    この手順で使う入力例

    crwl-setup
  3. 3取り込む前に、規約と robots.txt を見る

    ここを飛ばさないでください。技術的にできることと、やってよいことは別です。

  4. 41ページだけ試す

    いきなり大量に取りに行かないこと。相手のサーバーに負担をかけます。間隔を空ける設定も用意されています。

つまずいたときはAIに手伝ってもらう聞き方を見てください。使っているパソコンと、どの手順で止まったかを伝えましょう。

いいところ・気になるところ

いいところ

  • 本文だけをきれいに取り出せる
  • JavaScript で描かれるページも扱える
  • AIに渡しやすい形で出る

気になるところ

  • 取得先の規約と robots.txt の確認が必須
  • 説明が英語
  • 大量に取ると相手のサーバーに迷惑がかかる
GOOD TO KNOW

必要な人だけ:一緒に用意するもの

知っておきたい

robots.txt と、対象サイトの利用規約

自動でアクセスしてよいかを示す決まり

自動取得を禁じているサイトは多くあります。違反すると、アクセス遮断や法的な問題につながります。リンク先は robots.txt の読み方の公式解説です。

紹介先:developers.google.com(別のタブで開きます)

Crawl4AIの開発情報・出典

GitHub上で公開されているCrawl4AIのプログラムに関する情報です。スター数はGitHubで関心を示した数で、Crawl4AIの利用者数を表すものではありません。

GitHubのスター数
83,945(2026年9月20日時点)
ライセンス
Apache-2.0
主な言語
Python
GitHub上の更新
2026年9月18日直近3か月以内に更新されています
当サイトでの確認日
2026年9月20日

スター数・ライセンス・主な言語・最終更新は、2026年9月20日に GitHub から自動で取得した値です。ライセンスの補足と、説明文・準備の目安の判定は当サイトが書いています。 ライセンスや料金は変わることがあるので、使う前に必ず公式の情報をご確認ください。

NEXT

次に見るなら

READ

このツールが出てくる記事

SIMILAR

似たツール

同じことができる、または一緒によく使われるもの