ファインチューニングとは?仕組みをわかりやすく
LLMは、インターネット規模の膨大なテキストで事前学習(Pre-training)された状態で提供されます。この事前学習には数千億〜数兆語のデータと莫大な計算資源が必要で、ゼロから行えるのは一部の巨大企業だけです。
ファインチューニングは、この学習済みモデルを出発点に、数百〜数万件程度の追加データで重み(パラメータ)を微調整します。ゼロから学ぶのではなく「すでに言葉を知っているモデルに、専門分野の作法を教える」イメージです。人間でいえば、大学までの教育を終えた新人に業界特有の書式や言い回しを研修で叩き込む工程に近いといえます。
追加データは通常「入力と模範出力のペア」として用意します。たとえば「問い合わせメール→自社トーンの返信文」のペアを数千件学習させれば、モデルは自社らしい返信の書き方そのものを内面化します。
RAGとの違い:知識はRAG、振る舞いはファインチューニング
「AIに自社のことを覚えさせたい」という要望は、実は2種類に分かれます。事実知識を参照させたいのか、振る舞いを変えたいのか、です。この区別がRAGとファインチューニングの使い分けに直結します。
| やりたいこと | 向いている手法 | 理由 |
|---|---|---|
| 最新の規程・価格を答えさせる | RAG | 文書差し替えで即更新でき、出典も示せる |
| ブランド特有の文体で書かせる | ファインチューニング | 文体はプロンプトで指示しきれない暗黙知のため |
| 厳密なJSON形式で必ず出力させる | ファインチューニング | 形式の一貫性はモデルに焼き込むほうが安定 |
| 社内文書について根拠つきで回答 | RAG | ファインチューニングでは出典を提示できない |
注意すべきは、ファインチューニングは知識の追加が苦手だという点です。追加学習した事実知識は既存知識と混ざって曖昧になりやすく、更新のたびに再学習が必要になります。「社内FAQを覚えさせたい」という要望の答えは、ほとんどの場合ファインチューニングではなくRAGです。
代表的な手法:フルとLoRA
ファインチューニングには、モデルの全パラメータを更新する「フルファインチューニング」と、一部だけを効率的に更新する「PEFT(パラメータ効率化学習)」があります。実務の主流は後者、なかでもLoRA(Low-Rank Adaptation)と呼ばれる手法です。
LoRAは、元のモデルの重みは凍結したまま、小さな追加モジュールだけを学習します。更新するパラメータが全体の1%未満で済むため、GPUメモリの消費と学習コストを桁違いに抑えられます。ローカルLLMのカスタマイズでも標準的な手法です。
また、OpenAIやGoogle、Anthropicなどの商用APIは、データをアップロードするだけでファインチューニングを実行できるマネージドサービスを提供しています。GPU環境を自前で持たなくても始められるため、参入障壁は年々下がっています。
費用感と必要なデータ量
費用はモデルの規模と手法で大きく変わりますが、目安を押さえておくと判断しやすくなります。商用APIのマネージドファインチューニングであれば、学習データ量に応じた従量課金で、小規模な実験なら数千円〜数万円から試せます。
一方で本当のコストはデータ整備にかかります。品質の高い「入力と模範出力のペア」を数百〜数千件用意する作業は、現場の専門家の時間を大量に消費します。経験則として、学習の計算費用よりデータ作成の人件費のほうが高くつくケースが大半です。
データ量の目安は、文体や形式の調整なら数百〜数千件、専門タスクの精度向上なら数千〜数万件です。量より質が重要で、誤りや矛盾を含むデータはそのままモデルの癖として焼き込まれてしまいます。この現象は過学習の問題とも密接に関わります。
ファインチューニングが不要なケース
実務では「ファインチューニングしたい」という相談の多くが、より安い手段で解決します。着手前に次の3段階を試すのが定石です。
- プロンプト設計:指示文に文体見本や出力例を数個入れる(Few-shot)だけで、体感品質が大きく変わることが多い。まずはプロンプトエンジニアリングで粘る
- RAG:知識の参照が目的ならRAGが本命。更新性と出典表示で勝る
- コンテキスト設計:長文の社内ガイドラインをそのまま指示に含める運用も、モデルの長文対応が進んだ現在は現実的。コンテキストエンジニアリングの考え方が参考になる
これらを尽くしてなお、応答の一貫性やトーンに課題が残るときが、ファインチューニングの出番です。順番を間違えると、高いコストをかけてプロンプト1行で済む改善を実装することになります。
ファインチューニングの進め方:5つのステップ
実施を決めた場合の標準的な工程を整理します。学習そのものより、前後の設計に時間をかけるのが成功パターンです。
ステップ1:目標と評価方法の定義。「何がどうなったら成功か」を数値で決めます。文体調整なら人間による見た目評価(ブラインドで新旧の出力を比較)、形式遵守ならパース成功率、といった具合に、学習前に測り方を固定しておきます。
ステップ2:学習データの整備。入力と模範出力のペアを作成します。既存の業務ログ(過去のメール対応、修正前後の原稿など)から抽出できると効率的です。矛盾するデータ・品質の低いデータを取り除く監修工程が、最終品質を最も左右します。
ステップ3:ベースモデルと手法の選定。商用APIのマネージド学習か、オープンウェイトモデル+LoRAかを選びます。データを外部に出せるかどうか、推論をどこで動かすかが分岐点です。
ステップ4:学習と検証。学習データの一部を検証用に取り分け、学習に使わなかったデータで品質を確認します。学習データでの成績だけを見て本番投入すると、過学習を見逃します。
ステップ5:本番展開と再学習の計画。モデルは作って終わりではありません。業務や商品が変われば模範出力も変わるため、データを継ぎ足して再学習するサイクル(四半期ごとなど)を最初から計画に入れておきます。
よくある失敗パターン
ファインチューニングのプロジェクトが失敗するとき、原因はおおむね3つに集約されます。
第一に、「知識を覚えさせる」目的で使ってしまうケースです。前述のとおり事実知識の追加はRAGの領分で、ファインチューニングで挑むと「覚えたはずの情報を微妙に間違える」モデルができあがります。要件定義の段階で知識と振る舞いを切り分けることが、最大の事故防止策です。
第二に、データの品質不足です。過去ログをそのまま学習させると、過去の担当者の癖・誤り・古い情報までモデルに焼き込まれます。「このデータの通りに振る舞ってほしいか」という目で全件を監修する手間を惜しむと、教えたくないものまで教えることになります。
第三に、ベースモデル更新への追従漏れです。ファインチューニングは特定バージョンのモデルに対して行うため、提供元が新モデルを出すたびに「新モデル素の性能 vs 旧モデル+追加学習」の再評価が必要になります。基盤モデルの進化が速い時期には、数カ月でファインチューニングの優位が消えることもあります。この動態は基盤モデルの記事で扱った提供構造の理解が役立ちます。
よくある質問(FAQ)
Q1. ファインチューニングとRAGは併用できますか?
できますし、高度な用途では併用が効果的です。たとえば「文体と出力形式はファインチューニングで固定し、事実知識はRAGで参照させる」構成は、金融機関の顧客対応AIなどで採用されています。役割分担を明確にするのが成功の条件です。
Q2. 自社データが少なくてもファインチューニングできますか?
数十件程度では効果が出にくく、むしろ特定パターンへの偏りを生むリスクがあります。データが少ない段階では、Few-shotプロンプトに見本を埋め込む方法のほうが安全で効果的です。データが数百件を超えたあたりから検討する、と考えてください。
Q3. ファインチューニングで元のモデルの能力は落ちませんか?
起こりえます。「破滅的忘却」と呼ばれる現象で、特定タスクに寄せた学習によって汎用能力が劣化することがあります。LoRAのような手法は元の重みを凍結するためこのリスクが比較的小さく、実務で好まれる理由のひとつになっています。
まとめ
ファインチューニングは、学習済みモデルを自社仕様に作り替える強力な手段ですが、万能薬ではありません。知識の参照はRAG、軽微な調整はプロンプト設計で解決し、文体・形式・一貫性という「振る舞い」の課題に絞って投入するのが費用対効果の高い使い方です。
機械学習の基礎から確認したい方は機械学習の入門記事を、AI全体の見取り図は親ガイドの「AIとは?定義・種類・仕組み・活用例」をご覧ください。
AIの最新動向をまとめて追いたい方は、ハブページのAIニュース2026|重要テーマ7分野を毎月更新もあわせてご覧ください。






