AI推論とは?学習済みモデルを動かす処理
学習はモデルの重みなどを調整する段階、推論は学習済みモデルを使う段階です。 IBM Researchは、学習済みモデルにデータを通し、予測や課題への結果を得る処理としてinferenceを説明しています。[1]
たとえば、問い合わせメールを担当部署へ振り分けるAIを考えます。過去のメールと正しい担当部署の組み合わせを使ってモデルを調整するのが学習です。新しいメールを入力し、担当部署の候補を出すのが推論です。
| 場面 | 目的 | 主に確認すること |
|---|---|---|
| 学習 | データを使ってモデルを調整する | 学習データ、評価結果、計算資源 |
| 推論 | 学習済みモデルで入力を処理する | 出力の品質、応答時間、処理量 |
| アプリの運用 | 結果を実際の仕事へつなげる | 権限、保存、承認、再実行など |
最後の行も分けると、AI導入の費用を見落としにくくなります。部署名をモデルが返す処理と、その部署へメールを転送する処理は同じではありません。転送先の確認や記録保存にかかる開発・運用も、アプリ全体では必要になります。

AI全体の定義や種類を先に確認したい場合は、AIとは何かの入門記事を参照してください。ここでは「モデルをつくること」と「使い続けること」を分ける視点に絞ります。
inferenceとreasoningの違い
日本語では、inferenceとreasoningの両方が「推論」と訳されることがあります。ただし、AIの説明を読む際には分けた方が理解しやすくなります。
| 言葉 | この文脈での意味 | 読むときの問い |
|---|---|---|
| inference | 学習済みモデルを実行して結果を得る処理 | どのモデルを、どの入力で動かすか |
| reasoning | 問題を解くために関係や手順をたどる能力・処理 | どのような問題を解こうとしているか |
reasoningを重視したモデルも、利用時にはinferenceを行います。一方、画像を分類する処理や短い文章を補完する処理を、すべて「長く考えるAI」と呼ぶわけではありません。NVIDIAも、推論時に時間や計算を増やして問題解決に取り組むtest-time scalingを、学習とは分けて説明しています。[2]
「推論コストを削減した」という発表を見るときは、同じ品質の出力を少ない計算で得たのか、考える量や出力量を減らしたのかを確かめます。処理を軽くした結果と、答えの品質が改善した結果は、別の評価です。
使うたびに学習するのか?入力と重みを分ける
通常の推論では、学習済みの重みを使って入力を計算します。会話で新しい情報を渡し、次の回答が変わったからといって、その場でモデルの重みが更新されたとは限りません。
たとえば「社内では製品Aを旧製品と呼ぶ」と会話の中に書けば、モデルはその入力を手掛かりに回答できます。次の質問にも会話履歴を添えれば、その情報を引き続き参照できる場合があります。これは、毎回の入力に情報があることと、学習によってモデル自体が変わることを区別する例です。
情報を入力に足すことと、学習で重みを変えることは別です。 追加学習、会話の保存、入力データの再利用も別の論点になります。利用するサービスがデータを保存するか、後の学習に使うかは、推論という仕組みだけでは判断できません。製品の設定や利用条件を別途確認する必要があります。学習方法や能力の限界については、AIが賢くなる仕組みの解説で扱っています。
LLMは入力と生成で仕事が違う
文章を生成するLLMでは、入力を読み込むprefillと、続くトークンを生成するdecodeを分けて考えられます。トークンはモデルが文字列を処理する単位であり、日本語の文字数と常に一致するものではありません。
NVIDIAの説明では、prefillで入力トークンを処理し、decodeでそれまでの文脈を踏まえながら出力を生成します。この区別を知っておくと、「短い答えを頼んだのに待ち時間が長い」という場面を調べやすくなります。[2]
| 利用場面 | 増えやすいもの | 確認する項目 |
|---|---|---|
| 長い資料を読み、短く要約する | 入力の処理量 | 資料・履歴・指示の入力トークン |
| 短い指示から長文をつくる | 出力の生成量 | 出力トークン、完了までの時間 |
| 多くの人が同時に使う | 同時処理と待ち行列 | 同時実行数、待ち時間、失敗率 |
同じモデルでも、こうした利用条件が違えば、待ち時間や必要な資源は変わります。「毎秒何トークン」という生成速度だけでは、入力を処理する時間や混雑時の待機を説明しきれません。
Hugging Faceの解説も、重みを保持するメモリに加え、入力が長くなる場合の処理やKVキャッシュを扱っています。モデルファイルがメモリに収まることと、必要な文脈長・同時実行数で快適に動くことは別です。[3]
推論費用を分けて計算する
APIの従量課金では、入力と出力の量を分けて見積もる方式があります。ただし、単価、キャッシュ、内部の推論に使うトークン、ツール利用などの扱いはサービスごとに異なります。実際の見積りには、その製品の料金表と利用記録が必要です。
ここでは算式だけを理解するために、架空の料金を置きます。単位は仮想の「ポイント」です。実在するAPIの価格や当社の利用実績ではありません。
| 仮定 | 値 |
|---|---|
| 実行回数 | 1,000回 |
| 1回の入力 | 2,000トークン |
| 1回の出力 | 500トークン |
| 入力単価 | 100万トークンにつき1ポイント |
| 出力単価 | 100万トークンにつき4ポイント |
入力は合計200万トークンなので2ポイント。出力は合計50万トークンなので2ポイント。合計は4ポイントになります。
算式は「実行回数×(1回の入力トークン×入力単価+1回の出力トークン×出力単価)」です。単価の分母をそろえ、100万トークン単位なら各トークン数を100万で割って計算します。
出力の短縮と再試行の影響
同じ仮単価で、条件だけを変えてみます。
| 条件 | 入力費 | 出力費 | 合計 |
|---|---|---|---|
| 基準:1,000回、入力2,000・出力500 | 2 | 2 | 4 |
| 出力を250へ半減 | 2 | 1 | 3 |
| 入力を4,000へ倍増 | 4 | 2 | 6 |
| 基準の処理を100回追加実行 | 2.2 | 2.2 | 4.4 |
金額の単位はすべてポイントです。最後の行は、追加した100回も入力・出力とも基準と同じ量を使う仮定です。通信エラーが必ず同額の料金を生む、という意味ではありません。
この表では、出力を半分にしても合計費用は4から3ポイントへ25%減るだけです。入力費が残るからです。利用者の操作回数とモデルの実行回数も、一致するとは限りません。キャッシュ、割引、検索・外部ツール、税、アプリ基盤の費用は含めていません。条件を省いた「1回いくら」は、使い方が変わると簡単にずれます。
実際の利用記録と照合するときは、次の順で確認します。
- 入力と出力を分ける。 会話履歴や参考文書も入力側へ含め、実際の使用量で集計する。
- 呼び出し回数を数える。 1回の操作で検索・生成・再試行が何回起きたかを確認する。
- 料金表の条件を合わせる。 キャッシュや追加機能、契約条件を見て、適用される単価で計算する。
- 品質を一緒に確認する。 安くなっても誤答の修正や再実行が増えるなら、業務全体の費用は別に評価する。
自社で動かせば無料になるか?API代以外も数える
手元のPCや自社サーバーでモデルを実行すれば、外部APIの呼び出し料金を払わない構成にできます。しかし、API料金がなくても、機材・電力・保守の負担は残ります。 IBM Researchも、端末やサーバーでモデルを動かす際の継続的なコストを説明しています。[1]

比較する際は、利用量が同じで、品質や待ち時間の条件もそろっているかを確認します。利用頻度の低いサービスに大きな専用機を用意すれば、実行していない時間の費用も負担します。反対に大量の処理を継続する場合は、その負荷を前提に自社運用を検討できます。どちらが安いかは、機材価格だけでは決まりません。
| 見積りの区分 | 入れる項目の例 |
|---|---|
| モデル関連 | 必要なら追加学習、評価、モデル更新 |
| 推論基盤 | API利用、または機材・ホスティング・電力 |
| アプリ運用 | 検索、保存、認証、監視、障害対応 |
| 品質の維持 | 評価データ、人による確認、再処理 |
これは費用を分類するための編集部の整理です。すべてのサービスで各項目が別請求になるという意味ではありません。重要なのは、APIの料金だけを全費用と呼ばず、同じ範囲の負担を並べることです。
手元の端末で使うモデルを検討する場合は、小型言語モデル(SLM)の比較・実測記事も参考になります。そこでの測定条件と、自分が処理する文章量・求める品質は分けて比較してください。
よくある質問
AI推論と学習は何が違うか?
学習はモデルの重みなどを調整する段階です。推論は学習済みのモデルに入力し、予測や回答を計算する段階です。運用中に追加学習を行う場合も、その処理は分けて考えます。
推論AIは「考えるAI」のことか?
必ずしも同じ意味ではありません。inferenceはモデルを実行する処理、reasoningは問題解決の能力や処理を指す文脈で使われます。reasoningを行うモデルも、実行時にはinferenceを行います。
会話を続けるとモデルが学習するか?
会話履歴が入力に含まれ、回答が変わることと、重みの更新は別です。保存や後日の学習利用については、使う製品の設定・条件を確認してください。
回答を短くすれば費用は半分になるか?
入力など他の費用が残るため、合計が同じ割合で下がるとは限りません。本稿の仮計算では出力半減で4から3ポイントになりました。実際の影響は課金方式と利用量によります。
推論には必ずGPUが必要か?
すべてのモデル・用途で必須というわけではありません。対応する実行環境と、求める応答時間・処理量によって選択が変わります。IBM Researchは、PyTorchがGPU以外にCPUなどの実行基盤にも対応すると説明しています。動作することと、業務で必要な速度を満たすことは分けて確認します。[1]
まとめ
- 学習が終わっても、モデルが新たな結果を生成するには推論の計算が必要です。学習費と運用費を別に捉えることが出発点になります。
- 入力の長さ、生成量、同時実行、追加実行を分けると、応答時間や費用が変わる理由を調べやすくなります。
- 外部APIと自社運用は、モデルの価格だけでは比較できません。同じ品質・利用量・運用範囲で総費用を見積もる必要があります。
出典・参考
- IBM Research「What is AI inferencing?」(2023年10月5日)
- NVIDIA「What’s the Difference Between Deep Learning Training and Inference?」
- Hugging Face「Optimizing LLMs for Speed and Memory」
資料確認日:2026年10月5日。費用表は編集部による架空条件の計算例で、製品価格・実測性能・請求実績ではありません。






