本文へスキップ
動画・音声#文字起こし#話者分離#議事録

WhisperX

会議の録音を「誰の発言か」に分けて文章にする

録音を「話した人1」「話した人2」のように分けて文章にします。複数人の会議の記録づくりに役立ちます。人の名前は自動では分からず、設定や結果の確認も必要です。

GitHubのスター数 2.4万GitHub上の更新 2026年8月30日当サイトの確認日:2026年9月18日

まず、ここだけ見れば分かります

料金
無料ソフト自体に料金はかかりません
日本語
日本語OK
対応環境
Windows / Mac / Linux
準備の目安
設定が多い複数のソフトや接続先などを準備します。設定に慣れた人の手助けがあると進めやすい道具です。
計算用の部品
専用のGPUは必須ではありませんGPUは、画像やAIなどの計算にも使われる部品です。必要な性能や処理時間は、使う機能・設定で変わります。
必要なもの
Python・FFmpeg(導入方法は公式の説明を確認) / Hugging Face のアカウント・読み取り用トークン・話者分離モデルの利用同意 / 初回のモデル取得にはインターネット接続が必要

自分に合う進め方を選ぶ

料金だけでなく、最初の準備と、使い続ける手間も比べてみましょう。

比較記事:文字起こしはどっち? Whisper(無料・手元)と Notta(有料・ブラウザ)必要な人だけ:一緒に用意するものを確認 ↓

これは何?

Whisper に「話者の分離」と「時間合わせの精度向上」を足したものです。「話者1: 〜」「話者2: 〜」という形の文字起こしができます。

できること・できないこと

できること

  • 話者ごとに分けて文字にする
  • 単語ひとつずつに時間をつける(字幕の精度が上がる)
  • Whisper より速く処理する

できないこと

  • 話者の名前を当てること(「話者1」としか出ないので、手で名前を入れます)
  • 声が似た人の正確な区別

こんな人に向いています

  • 複数人の会議を議事録にする人
  • 対談・インタビューを記事にする人

こんなふうに使えます

  • 3人以上の打ち合わせを議事録にする

    発言者が分かれているだけで、議事録の作りやすさがまったく変わります。

  • 対談記事の素材にする

    話者ごとに分かれたテキストは、そのまま記事の下書きになります。

使いはじめるまで

WhisperXを使うための案内

手順は上から順番に進めます。「入力例」がある場合は、どの画面へ入力するか、どの名前で保存するかを本文で確認してください。

上のリンクはWhisperXの開発資料です。GitHubというサイト自体の見方は、共通のGitHub入門で説明しています。

この手順で出てくる言葉の意味
Python(パイソン)
プログラムを動かすためのソフトです。「Pythonが必要」とある道具は、先に対応する版のPythonを入れて使います。
CPU / GPU
どちらもパソコンで計算する部品です。CPUは基本の処理を担当し、GPUは画像やAIなどの計算にも使われます。必要な種類や性能は、道具によって違います。
  1. 1公式の導入条件を確認して入れる

    以下はWindowsのPowerShellで試す例です。PythonとFFmpegを先に用意し、録音のコピーを置いたフォルダで実行します。公式資料をもとにした案内で、当サイトで全手順の実機検証はしていません。

    この手順で使う入力例

    pip install whisperx
  2. 2Hugging Face のトークンを用意する

    公式READMEのSpeaker Diarization欄から、Hugging Faceの話者分離モデルのページを開いて利用条件に同意し、読み取り権限のトークン(利用を許可する鍵)を作ります。次の手順で入力します。トークンをスクリーンショットや質問文に載せないでください。

  3. 3短い録音で試す(Windows PowerShell)

    最初の行でトークンの入力を求められます。入力文字は画面に表示されません。kaigi.mp3を録音のファイル名に置き換えます。下の例はGPUを使わない設定です。初回はモデルを取得し、結果は同じフォルダのkaigi.txtに保存します。話者の名前は自動では分からないので、録音を聞いて直してください。

    この手順で使う入力例

    $hfSecret = Read-Host "Hugging Faceのトークン" -AsSecureString
    $hfToken = ([System.Net.NetworkCredential]::new("", $hfSecret)).Password
    whisperx kaigi.mp3 --language ja --device cpu --compute_type int8 --diarize --hf_token $hfToken --output_format txt --output_dir .
    Remove-Variable hfToken, hfSecret

つまずいたときはAIに手伝ってもらう聞き方を見てください。使っているパソコンと、どの手順で止まったかを伝えましょう。

いいところ・気になるところ

いいところ

  • 話者分離まで無料でできる
  • 字幕の時間合わせが正確

気になるところ

  • 準備の手順が多い
  • GPUなしでも使えるが、録音の長さやパソコンによって時間がかかる
  • 話者の区別は完璧ではない
COMBINE

一緒に使うと便利

このツールと組み合わせると、できることが増えるもの

一緒に使うと便利

Ollama

手元で動くAI

話者ごとに分かれた文章を渡し、議事録の下書きを作れます。必要なモデルを取得してローカルモデルを使う構成なら、録音や本文を外部AIへ送らずに処理できます。クラウドモデル・外部連携は使わず、社内ルールも確認してください。

WhisperXの開発情報・出典

GitHub上で公開されているWhisperXのプログラムに関する情報です。スター数はGitHubで関心を示した数で、WhisperXの利用者数を表すものではありません。

GitHubのスター数
24,141(2026年9月20日時点)
ライセンス
BSD-2-Clause
主な言語
Python
GitHub上の更新
2026年8月30日直近3か月以内に更新されています
開発資料(GitHub)
https://github.com/m-bain/whisperX
当サイトでの確認日
2026年9月18日

スター数・ライセンス・主な言語・最終更新は、2026年9月20日に GitHub から自動で取得した値です。ライセンスの補足と、説明文・準備の目安の判定は当サイトが書いています。 ライセンスや料金は変わることがあるので、使う前に必ず公式の情報をご確認ください。

NEXT

次に見るなら

READ

このツールが出てくる記事

SIMILAR

似たツール

同じことができる、または一緒によく使われるもの