Mellum2.1とは? 仕様を一表で整理
Mellum2.1は、JetBrainsが開発したMixture of Experts(MoE)型のコーディングモデルです。MoEは、すべてのパラメーターを毎回使うのではなく、入力に応じて一部の「専門家」を選んで動かす設計です。Mellum2.1は64の専門家のうち8つを選び、120億の総パラメーターに対して25億を稼働させます。[2]
| 項目 | 公開仕様 | 採用判断で見る点 |
|---|---|---|
| モデル構造 | 120億パラメーター、稼働25億のMoE | メモリ容量だけでなく実測速度を確認 |
| コンテキスト長 | 131,072トークン | 大規模リポジトリ全体が必ず収まる意味ではない |
| ライセンス | Apache License 2.0 | 商用利用は可能だが、社内の配布・表示要件を確認 |
| 主な用途 | コード編集、課題解決、ツール利用 | 補完専用ではなくエージェント型の評価が必要 |
| 実行基盤 | vLLMなど | 公式のホステッドAPIではなく自社運用が中心 |

「オープンウェイト」は、重みを取得して自分の環境で動かせるという意味です。学習データ、学習コード、再現手順まで全面的に公開されたことと同義ではありません。JetBrainsのモデルカードは重みと設定を公開し、ライセンスをApache 2.0としていますが、完全な再学習可能性を示す資料ではありません。[2]
従来モデルと何が違う? 小型でもエージェント作業を狙う
従来の小型コードモデルは、入力の続きを書く補完性能で語られがちでした。Mellum2.1は、リポジトリを読み、ツールを呼び、修正を試し、テスト結果を受けて直す一連の作業を学習・評価の中心に置いています。JetBrainsは、実在するリポジトリを使った強化学習を行い、数百万回のサンドボックス実行と数千の環境を用意したと説明しています。これは開発元の説明であり、環境や件数を第三者が監査した結果ではありません。[1]
同社が同一パイプラインで測った主な結果は次の通りです。
| 評価 | Mellum2.1 | 比較対象として掲載されたQwen3.5-9B | 読み方 |
|---|---|---|---|
| SWE-bench Verified | 47.0 | 50.0 | 実リポジトリの課題修正では近いが下回る |
| Terminal-bench 2.0 | 17.4 | 21.7 | 端末操作を含む課題では差がある |
| LiveCodeBench | 82.0 | 75.4 | コード生成課題では上回る |
この表はJetBrainsの自己評価であり、モデル選定の最終順位ではありません。第三者のベンチマーク集BenchLMでは、2026年10月10日の確認時点で、Mellum2.1について表示可能な結果は667枠中7件にとどまり、総合順位やカテゴリ順位は出ていません。[3] 「47.0」という一点だけを本番導入の根拠にするのは早計です。
ローカル実行で何が変わる? データ境界と運用責任
ローカル実行の最大の利点は、コードやログを外部のモデルAPIへ送らずに処理できる余地が生まれることです。機密性の高いリポジトリ、顧客ごとに分離が必要な環境、通信が制限された開発拠点では有力な選択肢になります。一方で、モデルを置くだけでは安全になりません。
導入前に、少なくとも次の境界を決める必要があります。
- モデルが読めるリポジトリと秘密情報の範囲
- 実行できるコマンド、外部通信、書き込み先
- 生成した差分を人が承認する工程
- 推論ログの保存期間とアクセス権
- モデル更新時の再評価基準

自社運用では、外部APIの従量課金をGPU調達・電力・監視・障害対応へ置き換える面があります。利用量が少ない段階では、ホステッドAPIの方が総コストを抑えやすいこともあります。既存のAPI型モデルを比較したい場合は、Claude Haiku 5.5の料金と使い分けも判断材料になります。
導入の候補になるのは誰? 3つの判断軸
Mellum2.1が向くのは、単に「小さいモデルが欲しい」組織ではありません。次の三つがそろう場合に検証価値が高まります。
- 外部送信できないコードがあり、オンプレミスや専用クラウドでの推論が必要
- 自社の課題セットを用意し、正答率と失敗の種類を継続評価できる
- GPU、サンドボックス、権限管理を運用する担当者がいる
反対に、数人の開発チームが週に数回だけ使う場合や、幅広い言語・設計相談まで一つのモデルへ任せたい場合は、大規模なホステッドモデルの方が導入は簡単です。Mellum2.1の価値は、単発の最高点よりも、管理できる環境で十分な品質と速度を出せるかにあります。
比較対象として、Mistral Large 4の公開範囲と料金も確認すると、「公開ウェイト」「API」「総合モデル」の違いを整理しやすくなります。同じオープンウェイトでも、パラメーター規模、目的、推論基盤、サポートの条件は別です。
試すなら、公開ベンチマークより自社課題を先に作る
検証では、過去に人が解決した20〜50件の課題を用意し、同じ条件で比較するのが現実的です。結果は「成功・失敗」だけでなく、変更ファイル数、テスト通過率、危険なコマンド、レビュー時間、再試行回数に分けます。
評価の順番は次の通りです。
- 読み取り専用で調査・説明課題を試す
- 隔離環境で小さなバグ修正を任せる
- テスト生成や定型移行へ範囲を広げる
- 人の承認なしに実行できる操作を最後に検討する
JetBrainsは高速性を強調していますが、手元のGPU、量子化方式、同時実行数で速度は変わります。モデルカードはBF16の重みを公開しています。必要メモリや量子化後の品質について、すべての構成に共通する保証値は示されていません。[2]
まだ確認できないこと
2026年10月10日時点で、長期運用時の障害率、日本語の指示や日本語コメントを含むコードでの品質、企業導入の実績は十分に公開されていません。JetBrainsはGGUF、Ollama、LM Studio向けの提供や複数トークン予測ヘッドについて今後の対応を示していますが、発表時点の予定と、実際に安定提供されている機能は分けて確認する必要があります。[1]
- 日本語の課題説明と日本語コメントを含むコードの正答率
- 量子化後の性能低下と必要GPUメモリ
- 長時間・多人数で使ったときの障害率と運用費
- 実企業での継続利用と、人のレビュー時間の変化
したがって、いま決められるのは「本番の標準モデル」ではなく「自社課題で比較する候補に入れるか」です。3〜8週間後には、第三者ベンチマークの増加、量子化版の品質、各実行基盤の正式対応を見直す価値があります。
まとめ
- Mellum2.1は総120億・稼働25億のMoEで、ローカルのコーディングエージェントを狙うオープンウェイトモデルです。
- 開発元の評価では小型モデルとして高い結果を示しますが、第三者評価はまだ少なく、公開値だけで本番採用は決められません。
- 読者が持ち帰るべき判断は、モデルの順位ではなく、データを外へ出さない価値と、自社で推論基盤・権限・評価を運用できるかです。
出典・参考
- JetBrains「Mellum2.1 Gets to Work: A Fast, Open Model for Coding Agents」 2026年10月8日
- JetBrains「Mellum2.1-12B-A2.5B-Thinking Model Card」 確認日2026年10月10日
- BenchLM「Mellum2.1-12B-A2.5B-Thinking」 確認日2026年10月10日






