本文へスキップ

自分の場所でAIを動かす。1人で試すところから、チームで使う形まで

Ollama で試したあとの話。速さが要るとき、人数が増えたとき、費用を測りたいとき。

ツールみっけ! 編集部2026年9月21日 更新9分で読めます

先に結論

1人で試す段階は Ollama で十分です。その先で困りごとが出たら道具を足します。速さが足りないなら llama.cpp の設定を詰めるか vLLM、複数人で使うなら LocalAI、使い方と費用を記録したいなら Langfuse、指示文の良し悪しを比べたいなら Promptfoo。いっぺんに全部入れないでください。

手元でAIが動いた。次に何をすればいいか分からない。そういう段階のための記事です。困りごとが起きてから足す、の順番で書きます。先に全部入れると、何が効いているか分からなくなります。

困りごと① 遅い

返事が遅い原因は、ほとんどが「モデルが大きすぎる」か「計算用の部品(GPU)を使えていない」かのどちらかです。まず小さいモデルに替えて、それでも遅いなら設定を見ます。

llama.cpp

手元でAIを動かす、いちばん下の土台

Ollama の内部でも使われている土台。直接使うと、性能を引き出す設定を細かく決められます。

無料WindowsMacLinux
くわしく見る →

vLLM

何人もが同時に使っても、待たされにくいAIの土台

同時にたくさんの質問をさばく用途に特化。1人で使うぶんには、かえって重くなります。

無料Linux
くわしく見る →

困りごと② 自分以外も使いたい

家族や同僚にも使わせたい、自分が作ったプログラムから呼びたい。この段階になると、外部のAIサービスと同じ呼び出し方に揃えておくと、あとが楽になります。乗り換えるとき、呼び出す側を書き直さずに済むからです。

LocalAI

外部のAIと同じ呼び出し方で、手元のAIを使える

外部サービスと同じ呼び出し方に揃えられます。文章だけでなく、音声や画像も扱えます。

無料LinuxWindowsMac
くわしく見る →

LiteLLM

複数のAIサービスを、1つの窓口から使い分けられる

複数のAIサービスへの呼び出しを1か所にまとめる中継。手元のAIと外部のAIを混ぜて使えます。

無料WindowsMacLinux
くわしく見る →

困りごと③ 画面がほしい

ターミナルでの会話はすぐ不便になります。ChatGPT のような画面をかぶせると、会話の履歴や資料の添付が使えるようになります。

困りごと④ 何にいくら使ったか分からない

人に使ってもらう段階になると、ここが効いてきます。「なぜか今日は答えが悪い」が起きたとき、記録がないと原因を追えません。指示文を変えたときの良し悪しも、感覚ではなく記録で比べます。

Langfuse

AIへの問い合わせと費用を、あとから追えるように記録する

問い合わせと答え、かかった費用と時間を記録します。

無料(有料版あり)Linuxブラウザ
くわしく見る →

Promptfoo

指示文を変えたとき、本当に良くなったかを比べられる

指示文を変えたとき、前より良くなったのかを並べて比べます。

無料WindowsMacLinux
くわしく見る →

どの段階で何を足すか

段階足すもの足さなくていいもの
1人で試すOllama だけそれ以外すべて
毎日使う画面(Open WebUI など)測定・中継
自分のプログラムから呼ぶLocalAI か LiteLLM測定
人に使ってもらうLangfuse
同時に何人も使うvLLM
QGPUがないパソコンでも動きますか?

A動きますが、遅くなります。小さいモデル(3B〜8B程度)なら実用になることもあります。まず小さいもので試して、待ち時間が許せるかを確かめてください。

Q外部のAIサービスと同じ賢さになりますか?

Aなりません。手元で動かせる大きさのモデルは、大手のサービスより性能が落ちます。手元で動かす価値は「賢さ」ではなく「情報が外に出ない」「使い放題」「ネットがなくても動く」の3つです。

Q全部入れておけば安心ですか?

Aむしろ逆です。動く部品が増えるほど、不具合の原因が分からなくなります。困ってから足すのが確実です。

TOOLS

この記事で出てきたツール

NEXT

次に読むなら