WhisperX
会議の録音を「誰の発言か」に分けて文章にする
録音を「話した人1」「話した人2」のように分けて文章にします。複数人の会議の記録づくりに役立ちます。人の名前は自動では分からず、設定や結果の確認も必要です。
GitHubのスター数 2.4万GitHub上の更新 2026年8月30日当サイトの確認日:2026年9月18日
まず、ここだけ見れば分かります
- 料金
- 無料ソフト自体に料金はかかりません
- 日本語
- 日本語OK
- 対応環境
- Windows / Mac / Linux
- 準備の目安
- ★★★設定が多い複数のソフトや接続先などを準備します。設定に慣れた人の手助けがあると進めやすい道具です。
- 計算用の部品
- 専用のGPUは必須ではありませんGPUは、画像やAIなどの計算にも使われる部品です。必要な性能や処理時間は、使う機能・設定で変わります。
- 必要なもの
- Python・FFmpeg(導入方法は公式の説明を確認) / Hugging Face のアカウント・読み取り用トークン・話者分離モデルの利用同意 / 初回のモデル取得にはインターネット接続が必要
自分に合う進め方を選ぶ
料金だけでなく、最初の準備と、使い続ける手間も比べてみましょう。
比較記事:文字起こしはどっち? Whisper(無料・手元)と Notta(有料・ブラウザ) →必要な人だけ:一緒に用意するものを確認 ↓これは何?
Whisper に「話者の分離」と「時間合わせの精度向上」を足したものです。「話者1: 〜」「話者2: 〜」という形の文字起こしができます。
できること・できないこと
できること
- 話者ごとに分けて文字にする
- 単語ひとつずつに時間をつける(字幕の精度が上がる)
- Whisper より速く処理する
できないこと
- 話者の名前を当てること(「話者1」としか出ないので、手で名前を入れます)
- 声が似た人の正確な区別
こんな人に向いています
- 複数人の会議を議事録にする人
- 対談・インタビューを記事にする人
こんなふうに使えます
3人以上の打ち合わせを議事録にする
発言者が分かれているだけで、議事録の作りやすさがまったく変わります。
対談記事の素材にする
話者ごとに分かれたテキストは、そのまま記事の下書きになります。
使いはじめるまで
WhisperXを使うための案内
手順は上から順番に進めます。「入力例」がある場合は、どの画面へ入力するか、どの名前で保存するかを本文で確認してください。
上のリンクはWhisperXの開発資料です。GitHubというサイト自体の見方は、共通のGitHub入門で説明しています。
この手順で出てくる言葉の意味
- Python(パイソン)
- プログラムを動かすためのソフトです。「Pythonが必要」とある道具は、先に対応する版のPythonを入れて使います。
- CPU / GPU
- どちらもパソコンで計算する部品です。CPUは基本の処理を担当し、GPUは画像やAIなどの計算にも使われます。必要な種類や性能は、道具によって違います。
1公式の導入条件を確認して入れる
以下はWindowsのPowerShellで試す例です。PythonとFFmpegを先に用意し、録音のコピーを置いたフォルダで実行します。公式資料をもとにした案内で、当サイトで全手順の実機検証はしていません。
この手順で使う入力例
pip install whisperx2Hugging Face のトークンを用意する
公式READMEのSpeaker Diarization欄から、Hugging Faceの話者分離モデルのページを開いて利用条件に同意し、読み取り権限のトークン(利用を許可する鍵)を作ります。次の手順で入力します。トークンをスクリーンショットや質問文に載せないでください。
3短い録音で試す(Windows PowerShell)
最初の行でトークンの入力を求められます。入力文字は画面に表示されません。kaigi.mp3を録音のファイル名に置き換えます。下の例はGPUを使わない設定です。初回はモデルを取得し、結果は同じフォルダのkaigi.txtに保存します。話者の名前は自動では分からないので、録音を聞いて直してください。
この手順で使う入力例
$hfSecret = Read-Host "Hugging Faceのトークン" -AsSecureString $hfToken = ([System.Net.NetworkCredential]::new("", $hfSecret)).Password whisperx kaigi.mp3 --language ja --device cpu --compute_type int8 --diarize --hf_token $hfToken --output_format txt --output_dir . Remove-Variable hfToken, hfSecret
つまずいたときはAIに手伝ってもらう聞き方を見てください。使っているパソコンと、どの手順で止まったかを伝えましょう。
いいところ・気になるところ
いいところ
- 話者分離まで無料でできる
- 字幕の時間合わせが正確
気になるところ
- 準備の手順が多い
- GPUなしでも使えるが、録音の長さやパソコンによって時間がかかる
- 話者の区別は完璧ではない
一緒に使うと便利
このツールと組み合わせると、できることが増えるもの
Ollama
手元で動くAI
話者ごとに分かれた文章を渡し、議事録の下書きを作れます。必要なモデルを取得してローカルモデルを使う構成なら、録音や本文を外部AIへ送らずに処理できます。クラウドモデル・外部連携は使わず、社内ルールも確認してください。
WhisperXの開発情報・出典
GitHub上で公開されているWhisperXのプログラムに関する情報です。スター数はGitHubで関心を示した数で、WhisperXの利用者数を表すものではありません。
- GitHubのスター数
- 24,141(2026年9月20日時点)
- ライセンス
- BSD-2-Clause
- 主な言語
- Python
- GitHub上の更新
- 2026年8月30日直近3か月以内に更新されています
- 開発資料(GitHub)
- https://github.com/m-bain/whisperX
- 当サイトでの確認日
- 2026年9月18日
スター数・ライセンス・主な言語・最終更新は、2026年9月20日に GitHub から自動で取得した値です。ライセンスの補足と、説明文・準備の目安の判定は当サイトが書いています。 ライセンスや料金は変わることがあるので、使う前に必ず公式の情報をご確認ください。
次に見るなら
このツールが出てくる記事
似たツール
同じことができる、または一緒によく使われるもの
- 動画・音声定番
録音した会話を、読める文章にする
Whisper
こんな人に → 会議やインタビューを自分で文字にしている人
無料日本語OKWindowsMacLinux11万★★★準備あり9/18確認 - 動画・音声注目
会議の録音を文章に。待ち時間を短くしたい人に
faster-whisper
こんな人に → 録音を聞きながら文章を打つ手間を減らしたい人
無料日本語OKWindowsMacLinux2.5万★★★準備あり9/18確認 - AI・チャット編集部イチオシ
自分のパソコンで、AIに質問や文章の整理を頼む
Ollama
こんな人に → 社内資料をAIに投げたいが、外部サービスに出せない人
無料日本語は一部WindowsMacLinux18万★★★準備少なめ9/18確認