先に結論
WhisperXで録音を文章にし、話者ラベルを人が確認してから、Ollamaのローカルモデルへ本文を渡して要約します。ソフトやモデルの取得、話者モデルの利用同意には通信が必要です。録音や文章を外部AIへ送らずに処理するには、クラウド機能と外部連携を使わない構成を選びます。
ここでは、準備済みのモデルを自分のパソコンで動かす流れを紹介します。通信を一切使わずに導入できる手順ではありません。会社の録音を使う前に、録音とソフト導入のルールを確認し、まず個人情報を含まない短い音声で試してください。
全体の流れ
- 1必要なソフトを入れ、話者を分けるモデルの利用に同意する
- 2短い録音を文章のファイルにする
- 3聞き間違いと「誰の発言か」を直す
- 4ローカルのAIへ書き起こし本文と要約の指示を渡す
- 5元の録音と照らし合わせ、下書きを確認して保存する
先に準備するもの
- WhisperXが対応するPythonと、公式説明で必要とされるFFmpegなどの部品。下のWhisperX公式手順で自分の環境を確認します。
- Hugging Faceのアカウント、話者モデルの利用同意、モデル取得に使う読み取り用トークン。トークンは認証用の秘密の文字列です。
- Ollamaと、自分のパソコンで動くローカルモデル。外部送信を避ける場合は公式FAQのクラウド無効化設定を行い、Ollamaを再起動します。
- モデルを保存できる空き容量と、初回ダウンロードに使うインターネット接続。処理時間は録音の長さと機種で変わります。
WindowsのPowerShellで試す手順
以下の入力例はWindowsのPowerShell向けです。Mac・Linuxでは認証情報の入力方法などが異なるため、公式手順で読み替えてください。音声の文字起こしとAIによる要約は、このサイトの画面の中で実行する操作ではありません。
1短い音声を作業用フォルダへコピーする
自分で録った、公開しても困らない短いWAV音声を使います。新しい作業用フォルダへコピーし、名前をkaigi.wavにします。元の録音は残します。別の種類のファイルは、拡張子だけを.wavに変えても変換できません。エクスプローラーでこのフォルダを開き、上のアドレス欄にpowershellと入力してEnterを押します。
2Pythonの準備を確認してWhisperXを入れる
公式手順で対応するPythonなどを準備してから入力します。インストール中は通信します。エラーが出た場合は続けず、表示された内容と公式の対応条件を確認します。
この手順で使う入力例
python -m pip install whisperx3話者モデルの利用に同意し、認証用の文字列を用意する
下の公式資料からHugging Faceにログインし、pyannote/speaker-diarization-community-1の利用条件を確認して同意します。同じアカウントのAccess Tokensでモデルを読めるトークンを作ります。この文字列は記事・質問サイト・共有するスクリーンショットに載せないでください。
4認証して録音を文章にする
次の2行は1行ずつ実行します。1行目で尋ねられたら、用意したトークンを貼り付けてEnterを押します。入力した文字はそのまま表示されません。2行目は専用GPUを使わない例で、初回は必要なモデルを取得します。処理が終わるまで待ってください。成功すると、作業用フォルダのoutput内にkaigi.txtができます。
この手順で使う入力例
$hfToken = Read-Host "Hugging Face token" -AsSecureString whisperx "kaigi.wav" --language ja --model small --device cpu --compute_type int8 --diarize --hf_token ([System.Net.NetworkCredential]::new("", $hfToken).Password) --output_format txt --output_dir output5文章と話した人を確認する
outputフォルダのkaigi.txtをメモ帳で開きます。SPEAKER_00などは人名ではなく区別用のラベルです。録音を聞き、聞き間違い・数字・固有名詞を修正します。同じ人が複数のラベルになっていないかも確認し、必要なら人名に置き換えて保存します。
6Ollamaでローカルモデルとの会話を開く
クラウド機能を無効化してOllamaを再起動したうえで、PowerShellに次の行を入力します。このモデルをまだ取得していなければダウンロードを待ちます。>>>という入力待ち表示になったら、次の手順へ進みます。
この手順で使う入力例
ollama run gemma3:4b7要約の指示と、書き起こしの本文を一緒に入力する
ここからはPowerShellの指示ではなく、Ollamaの会話欄への入力です。>>>の後に半角の二重引用符を3つ(""")入力してEnterを押すと、複数行の文章を入れられます。「次の会議の書き起こしだけを使い、決まったこと・保留事項・担当者と期限をまとめてください。書かれていないことは不明としてください。」と入力します。続けて、メモ帳のkaigi.txtから本文をコピーして貼り付けます。最後の新しい行にもう一度"""を入力してEnterを押すと、本文も含めてAIへ渡せます。長い録音は内容の区切りごとに分けて試してください。
8元の文章と比べてから下書きを保存する
返ってきた要約をメモ帳などへコピーし、別のファイル名で保存します。数字・日付・担当者・決定事項を録音や書き起こしと照らし合わせ、抜けや誤りを直します。AIの答えだけで正式な議事録にしないでください。Ollamaの会話は /bye と入力して終了できます。
使うツール
- 動画・音声
会議の録音を「誰の発言か」に分けて文章にする
WhisperX
こんな人に → 複数人の会議を議事録にする人
無料日本語OKWindowsMacLinux2.4万★★★設定が多い9/18確認 - AI・チャット編集部イチオシ
自分のパソコンで、AIに質問や文章の整理を頼む
Ollama
こんな人に → 社内資料をAIに投げたいが、外部サービスに出せない人
無料日本語は一部WindowsMacLinux18万★★★準備少なめ9/18確認 - 動画・音声定番
録音の不要な音や部分を消し、聞きやすくする
Audacity
こんな人に → 録音した音声が聞きづらい人
無料日本語OKWindowsMacLinux1.9万★★★準備少なめ9/18確認
一緒に用意したいもの
会議の録音機材(ICレコーダーなど)
卓上に置いて会議を録る機材
録音が聞き取りづらい場合の選択肢です。まず手持ちの機器で置き場所を見直し、必要なら参加者の配置や接続方法に合うマイクを比べます。
紹介先:kakaku.com(別のタブで開きます)
広告・PR:紹介先で申し込むと、当サイトに紹介料が入ることがあります。
Q話者の名前は自動で入りますか?
A自動では分かりません。SPEAKER_00などのラベルを録音と比べて確認します。声が似ている場合や同時に話した箇所では、ラベルが間違うこともあります。
QGPUがないと使えませんか?
AWhisperXの公式手順にはCPUで実行する方法もあります。この記事の例もCPUを使います。処理時間と必要なメモリは機種や音声で変わるため、まず短いサンプルで確かめてください。
Q最初からネットを切って進められますか?
Aソフトやモデルの取得、Hugging Faceでの登録・利用同意には通信が必要です。取得済みモデルをローカルで動かす構成なら、録音や文章を外部AIへ送らずに処理できます。別アプリやクラウド機能の接続先も確認してください。
Q音声の処理が途中で止まりました
A認証エラーなら、同じHugging Faceアカウントで利用に同意したか、トークンに読み取り権限があるかを確認します。メモリや必要な部品のエラーなら公式手順へ戻り、まず短い音声で試します。質問するときにトークンは貼り付けないでください。
確認した公式資料
WhisperX公式の導入・使い方
モデルの取得、話者分離の認証、CPUでの実行例
提供元の説明です。利用する版と、ご自分のパソコンでの条件を確認してください。
紹介先:github.com(別のタブで開きます)
Hugging Faceの話者モデル
speaker-diarization-community-1の利用条件と同意画面
提供元の説明です。利用する版と、ご自分のパソコンでの条件を確認してください。
紹介先:huggingface.co(別のタブで開きます)
Hugging FaceのAccess Tokens
モデルの取得に使う認証用トークンの管理画面
提供元の説明です。利用する版と、ご自分のパソコンでの条件を確認してください。
紹介先:huggingface.co(別のタブで開きます)
Ollama公式FAQ
ローカルとクラウドの違い・クラウドを無効化する方法
提供元の説明です。利用する版と、ご自分のパソコンでの条件を確認してください。
紹介先:docs.ollama.com(別のタブで開きます)
Ollama公式CLIガイド
本文を複数行で入力する方法
提供元の説明です。利用する版と、ご自分のパソコンでの条件を確認してください。
紹介先:docs.ollama.com(別のタブで開きます)
この記事で出てきたツール
- 動画・音声
会議の録音を「誰の発言か」に分けて文章にする
WhisperX
こんな人に → 複数人の会議を議事録にする人
無料日本語OKWindowsMacLinux2.4万★★★設定が多い9/18確認 - 動画・音声定番
録音した会話を、読める文章にする
Whisper
こんな人に → 会議やインタビューを自分で文字にしている人
無料日本語OKWindowsMacLinux11万★★★準備あり9/18確認 - AI・チャット編集部イチオシ
自分のパソコンで、AIに質問や文章の整理を頼む
Ollama
こんな人に → 社内資料をAIに投げたいが、外部サービスに出せない人
無料日本語は一部WindowsMacLinux18万★★★準備少なめ9/18確認 - 動画・音声定番
録音の不要な音や部分を消し、聞きやすくする
Audacity
こんな人に → 録音した音声が聞きづらい人
無料日本語OKWindowsMacLinux1.9万★★★準備少なめ9/18確認


