SLMとLLMの違い
SLMもLLMも、言語を処理するAIモデルです。「小型」と「大規模」の違いを読む際には、モデルのパラメータ数が手掛かりになります。パラメータは、学習で調整される重みなどの値です。1Bは10億、3.8Bは38億を表します。
IBMは、SLMをLLMより規模や対象範囲が小さいモデルとして説明し、数百万から数十億のパラメータを例に挙げています。ただし、本稿では「何B以下なら必ずSLM」という線を引かず、比較するモデル名と規模を具体的に示します。IBMのSLM解説
| 比較するときの軸 | 確認すること | 名前だけでは判断できないこと |
|---|---|---|
| 規模 | 総パラメータ数、構造 | 自分の用途の回答品質 |
| 保存形式 | FP16、8bit、4bitなど | 実行時に必要な総メモリ |
| 利用環境 | 対応ランタイム、機材 | 初回応答や生成の速度 |
| 用途 | 学習・評価の対象、言語 | 社内の実データへの適合性 |
「SLMだから簡単な仕事だけ」「LLMならどんな仕事でも正確」と二分すると、選定を誤ります。小型モデルで要件を満たせる課題もあれば、同じ小型モデルでも不得意な入力があります。必要なのは呼び名の比較だけでなく、自分が解かせたい仕事に対する確認です。
AI全体の定義はAI入門記事で扱っています。ここでは、モデルを実際の業務に組み込むときに、小ささをどう評価するかに絞ります。
モデルカードを読む
モデルカードは、開発者がモデルの概要、用途、評価、制約などを公開する資料です。紹介記事の「高性能」「軽量」をそのまま採用理由にせず、対象モデルの資料へ戻ると、何が確認できて何が未確認かを分けられます。
Phi-4-mini-instructの例
Microsoftのモデルカードでは、Phi-4-mini-instructは3.8Bパラメータで、128Kトークンのコンテキスト長に対応すると説明されています。一方、すべての利用目的に向けて設計・評価されたものではなく、言語間の性能差も考慮して用途ごとに評価するよう注意しています。Microsoftのモデルカード
ここから「長い入力に対応する仕様」と「どの入力でも同じ品質で答える保証」は別だとわかります。日本語が対応言語に含まれていても、自社の略語、製品名、帳票の読み取りを問題なく処理できるかは、別に確かめる必要があります。
同じファミリーでも仕様は異なる
GoogleのGemma 3モデルカードでは、1B・270Mと4B・12B・27Bで、コンテキスト長の記載が異なります。前者は32K、後者は128Kです。モデルファミリーの紹介にある最大値を、すべてのサイズの仕様として読み替えないことが重要です。GoogleのGemma 3モデルカード
この2例は公式仕様の読み方を示すもので、両製品の実測ランキングではありません。「最新だから」「小さいのにスコアが高いから」と選ぶ前に、次の項目を控えておきます。
| 控える項目 | 理由 |
|---|---|
| 正確なモデル名・版 | mini、instruct、reasoningなどを取り違えない |
| パラメータ数とモデル構造 | 規模と計算の特徴を把握する |
| 入力形式とコンテキスト長 | 文書や画像などの要件を照合する |
| 評価条件と限界 | 公表スコアの意味と適用範囲を確認する |
| 利用条件と対応環境 | 配布形態や実行方法の制約を確認する |
重みの容量を計算する
モデルの重みは、数値の集合として保存されます。同じパラメータ数でも、値を何bitで表すかによって容量が変わります。Hugging Faceの解説では、FP16やbfloat16の重みを保持する容量の目安を、パラメータ数から計算しています。重みとメモリの解説
以下は編集部による理論計算です。すべての重みを一律のbit数で保存すると仮定し、「パラメータ数×bit数÷8」でバイト数を求めました。GBは10億バイトとして表記しています。
| 仮定したパラメータ数 | 16bitの重みのみ | 8bitの重みのみ | 理想的な4bitの重みのみ |
|---|---|---|---|
| 1B | 2GB | 1GB | 0.5GB |
| 3.8B | 7.6GB | 3.8GB | 1.9GB |
| 8B | 16GB | 8GB | 4GB |
この表は、特定の配布ファイルの容量、最低VRAM、ロード成功の実測結果ではありません。量子化に必要な補助情報、異なる精度で残す部分、実行時の作業領域などを含めていないためです。3.8B・4bitの理論値が1.9GBでも、「メモリ2GBの端末なら動く」という結論にはなりません。
量子化は、数値の表現を軽くする方法です。モデルの規模を表すパラメータ数と、保存に使うbit数は異なる軸になります。「8Bを4bitにしたら4Bモデルになる」といった読み替えはできません。
実行時には何が加わるか?
文章を生成するモデルでは、重みだけでなく、文脈の計算を再利用するKVキャッシュや、実行時の作業領域なども使います。Hugging Faceは、入力が長い場合のメモリや、キャッシュの構造が推論効率へ与える影響を説明しています。LLMの実行効率
図は確認項目の模式図で、面積比が実際の容量比を表すものではありません。GPUの専用VRAMと、CPU・GPU等が共有するユニファイドメモリでは、環境の見方も異なります。別の機材で測った数値を、そのまま自分のPCの必要容量に置き換えないでください。
量子化で重みを軽くしても、速度が必ず上がるとは限りません。対応する計算方式や機材によっては速度との交換条件が生じ、回答品質への影響も確認対象になります。小さくなったファイルだけを成果にせず、使う状態での結果を見ます。
端末と社内運用の確認表
小型モデルを検討する理由は、単なるモデルの購入価格や利用単価に限りません。接続環境、待ち時間、データの扱い、運用担当者の負担もあります。次の表は編集部が作成した検討票です。特定のモデルの適合性を保証するものではありません。
| 想定する使い方 | 最初に確認すること | 不十分な場合の選択肢 |
|---|---|---|
| 個人の端末で文章を整理する | 実際の文書での品質、メモリ、待ち時間 | 入力を分ける、用途を限定する |
| 通信なしで使う | 初回準備後も外部接続が必要か | 依存する処理を洗い出し、構成を変える |
| 社内で複数人が使う | 同時実行、権限、更新・障害対応 | 待ち行列やサーバー構成を検討する |
| 定型項目を抽出する | 欠落、誤抽出、出力形式の崩れ | 検証処理と人への差戻しを加える |
| 長い資料の内容を調べる | 文脈長、取りこぼし、根拠の確認 | 文書検索や分割方法も含めて評価する |
ローカル実行でも、アプリが外部APIを呼んだり、ログを外部へ送ったりする構成なら、モデルの実行場所だけでデータの扱いを判断できません。「小型」「社内」「オフライン」を同じ意味として使わず、処理全体を確認します。
また、モデルを導入する担当者が、その後の更新や問い合わせ対応も担うのかを決めておきます。利用開始時に動かす作業と、部署で継続利用できる状態を保つ作業は別です。小型モデルを使うことが、運用の負担まで自動的に小さくするわけではありません。
同じMacで実測する
編集部は2026年9月14日、Qwen3の0.6Bと4Bを同じMacで実行しました。いずれもMLXコミュニティによる4bit量子化版です。SLM全体と大規模LLM全体の比較ではなく、規模の異なる2モデルを選んだ限定的な検証です。
- 機材はApple M3 Max・統合メモリ64GB、macOS 26.6.2。Python 3.12.14、MLX 0.32.2、MLX LM 0.31.3、Transformers 5.17.0を使用しました。
- 速度・メモリは架空の作業記録を繰り返した128/2,048トークンの入力で測定。出力上限128、temperature 0、prefill step 512、チャットテンプレートなし、試行間の文脈キャッシュ再利用なしです。
- 各条件でウォームアップ後に3回測り、別プロセスで入力長の順序を反転して再実行しました。表は計6回の中央値です。AC電源を使用しましたが、他アプリは停止していないため、負荷を完全に隔離した結果ではありません。
| モデル・入力token | 初回tokenまで | 生成速度 | MLXピークメモリ |
|---|---|---|---|
| 0.6B・128 | 0.095秒 | 403.0 token/s | 0.499GB |
| 0.6B・2,048 | 0.347秒 | 345.0 token/s | 1.137GB |
| 4B・128 | 0.182秒 | 129.6 token/s | 2.633GB |
| 4B・2,048 | 1.579秒 | 115.7 token/s | 3.173GB |
初回tokenまでの時間は、モデル読込・トークン化を除いた生成処理の開始から計測しました。生成速度はライブラリの計数値です。MLXピークメモリはMLXが管理する割当の最大値で、OSや他アプリを含む全体使用量、最低VRAMではありません。
今回、0.6Bの配布重みは約0.335GBでしたが、長い入力のMLXピークは約1.137GBでした。重みの容量と、生成中のメモリを別に確認する理由がここにあります。表から他機種の必要容量や速度を算出することはできません。
速くても、そのまま使えない
速度試験とは別に、日本語の架空メモから担当者・締切日・状態をJSONで抽出する6問を用意しました。締切の訂正、担当未確定、情報の欠落も含め、出力を見る前に正解を固定しました。
Qwen3の非thinking推奨設定に合わせ、temperature 0.7、top_p 0.8、top_k 20、min_p 0を使用しました。チャットテンプレートでthinkingを無効にし、出力上限256、seed 42/43/44で各問を実行。ウォームアップを除いた18回答を、別プロセスでもう一度測りました。Qwen3の公式設定
| 確認項目 | 0.6B | 4B |
|---|---|---|
| 加工なしでJSONとして読めた回答 | 2回とも0/18 | 2回とも18/18 |
| 形式・3項目がすべて正解と一致 | 2回とも0/18 | 2回とも16/18 |
0.6Bは、JSONだけを求めてもMarkdownのコードフェンスで囲みました。内容が合う例もあるため、この表を「回答内容の正解率0%」とは読みません。一方、レビュー担当を作業担当と取り違えたり、nullを文字列にしたりする誤りもありました。
4Bでも、担当を打診しただけの人物を確定担当者として埋める回答が残りました。JSONとして読み込めることと、業務上正しいことは別です。どちらも6問を繰り返した小規模な試験であり、日本語能力全般の点数ではありません。自社で使う際は、実データに近い課題と、誤りを人へ戻す条件を設ける必要があります。
よくある質問
SLMは何の略か?
Small Language Modelの略で、小型言語モデルや小規模言語モデルと訳されます。比較的少ないパラメータで言語を処理するモデルを指す呼び方です。
SLMはLLMより精度が低いか?
モデルの規模だけでは個別の仕事の精度は決まりません。対象の言語、学習や調整、評価する課題をそろえて確認します。本稿の仕様表から性能の優劣を判定することはできません。
4bitなら必要メモリも4分の1か?
16bitとの比較で、理想的な重みの容量は4分の1になります。しかし、補助情報やキャッシュ、実行時の作業領域は別なので、総メモリが同じ割合で減るとは限りません。
日本語対応なら社内業務で使えるか?
対応言語の表記と、固有名詞や社内文書を正しく扱えることは別です。実際の業務に近い評価用データで、誤りや欠落を確認する必要があります。
小型ならオフラインで使えるか?
モデルの大きさだけでは決まりません。実行環境に加え、認証、検索、外部ツール、ログ送信などの依存関係を確認します。必要なファイルの準備と、実行中の通信も分けて確認してください。
まとめ
- SLMは規模を表す呼び方で、業務への適合性の保証ではありません。モデルカードで用途と制約を確認することが出発点です。
- パラメータ数、重みの保存形式、実行時のメモリは別の軸です。理論上の重み容量だけからPCの最低要件を決めないことが重要です。
- 今回の実測では、速度、JSON形式、抽出内容の正しさが別の評価軸だと確認できました。小ささを目的にせず、誤りを検知して人へ戻せる条件まで含めて選びます。
出典・参考
- IBM:What are Small Language Models?
- Microsoft:Phi-4-mini-instruct model card
- Google:Gemma 3 model card
- Hugging Face:Optimizing LLMs for Speed and Memory
- Qwen:Qwen3-4B model card
- MLX Community:Qwen3-0.6B-4bit
- MLX Community:Qwen3-4B-4bit
- MLX LM:公式リポジトリ
実測日:2026年9月14日。主要公式資料の再確認日:2026年9月21日。重み容量の表は理論計算、Qwen3の表は上記条件の編集部実測です。モデルrevisionは0.6Bが73e3e38d981303bc594367cd910ea6eb48349da8、4Bが4dcb3d101c2a062e5c1d4bb173588c54ea6c4d25。専用GPUの最低VRAMと実業務での品質保証は検証していません。






