AIが賢くなる仕組みは、学習と回答時の工夫に分けられる
同じAIでも、指示の書き方を変えたり、資料を渡したりすると、答えがよくなることがある。ここで起きた変化は、開発元が新しいモデルを訓練することとは違う。
AIの進歩を理解するには、まずモデル内部の数値を更新する「学習」と、学習済みのモデルを使って答えを出す「推論」を分けるとわかりやすい。GPT-3の研究でも、モデルを追加訓練せず、入力にいくつかの例を添えるだけで多様な課題に対応できることが示された。[1]
| 能力を伸ばす方法 | 何を変えるのか | 身近な場面に置き換えると |
|---|---|---|
| 事前学習 | 大量のデータでモデルの土台をつくる | 多くの文章に触れて、言葉や関係性を覚える |
| 事後学習 | 指示に沿う答え方や問題の解き方を訓練する | 例題や添削で、答えの出し方を改善する |
| 推論時の計算 | 回答する際の検討や候補比較を増やす | 即答せず、途中の計算を確かめる |
| 検索・道具の利用 | 回答に使える情報や操作を増やす | 資料や計算機を使って問題を解く |
後半二つは、モデル内部の数値を更新しなくても実行できる。表のたとえは役割をつかむためのもので、人間とAIの学習が同じ仕組みだという意味ではない。以下、それぞれを具体的に見ていこう。
事前学習では、予測の間違いを使って内部の数値を調整する
文章を生成するLLMの代表的な学習方法は、文章の続きを予測することだ。たとえば「朝起きて歯を」の後に続く表現を予測し、実際の文章とのずれが小さくなるように調整する。実際の処理単位は必ずしも単語ではなく、文字や語の一部を含む「トークン」である。[1]
内部では、情報の伝わり方を決める「重み」などの数値が使われる。これらがパラメータだ。学習の流れは、大きく三つに分けられる。
- 予測のずれを計算する。 予測した結果を実際の文章と比べる。
- 改善する方向を求める。 どの数値をどちらに動かせば、ずれが小さくなるかを計算する。
- 数値を少しずつ更新する。 調整を繰り返し、予測の誤差を減らしていく。
多層のニューラルネットワークでは、改善する方向の計算に誤差逆伝播法(バックプロパゲーション)が広く使われる。[2]
重要なのは、文章をそのまま保管するだけでなく、別の入力にも使える規則性を獲得することだ。文法、語と語の関係、文章の構成などが予測に役立つ。ただし、続きをうまく予測できることだけで、出力する内容の正しさまで保証されるわけではない。GPT-3の論文も、成果とともに苦手な課題を報告している。[1]
大きいAIほど賢くなるのか?
モデルの規模、データ量、計算量を増やすと、一定の条件では予測の誤差が規則的に小さくなる。この関係を調べたのが「スケーリング則」の研究だ。ただし、言語モデルの予測誤差が改善するという観測を、知能が無限に伸びる証明と読み替えることはできない。[3]
規模だけを増やしても効率がよいとは限らない。DeepMindが2022年に発表したChinchillaは、700億パラメータと、比較対象のGopherの2,800億より小さかった。それでも、同程度の学習計算量で学習データを4倍に増やすことで、幅広い評価課題でGopherを上回った。[4]
この実験が教えるのは「小さいモデルが必ず勝つ」ということではない。モデルの大きさと、何をどれだけ学ばせるかの釣り合いが重要だということだ。パラメータ数だけを見ても、使いたい仕事での性能は決められない。

事後学習では、役立つ答え方と問題の解き方を磨く
大量の文章を学んだだけのモデルが、利用者の意図に沿って答えるとは限らない。そこで事前学習の後に、望ましい回答例や評価を使って追加訓練する。これが事後学習だ。
OpenAIのInstructGPT研究では、人が書いた回答例で訓練した後、複数の回答を人が順位付けしたデータを使い、好まれる出力へ近づけた。人間の評価を利用する強化学習は「RLHF」と呼ばれる。[5]
研究内の人間評価では、13億パラメータのInstructGPTの回答が、1,750億パラメータのGPT-3より好まれた。対象は同研究の質問群であり、あらゆる能力で小さいモデルが上回ったという意味ではない。[5]
数学やプログラミングでは、人の好みとは別に、正解やテスト結果を評価に使える。解答を試し、よい結果につながる出力を増やすよう訓練することで、解き方の改善を促せる。
2025年のDeepSeek-R1の報告は、その一例だ。研究用のR1-Zeroでは、事前学習済みモデルに強化学習を施し、自己検証などの振る舞いが現れたと報告された。一方で、読みづらさや言語の混在も生じたため、R1では回答例を使う訓練などを組み合わせている。「自力で学ぶAI」も、事前学習の土台や、よい結果を判定する仕組みを必要としている。[6]
ここで改善しているものにも注意したい。「人に好まれる」「指示を守る」「計算の答えが正しい」は、それぞれ異なる目標だ。一つの評価がよくなったからといって、すべての間違いが減るとは限らない。
回答時にも賢さは変わる。考える計算量と外部の道具
学習を終えた後でも、回答をつくる際の処理によって結果は変わる。たとえば、次のような工夫がある。
- 問題を分ける。 複雑な問いを、取り組みやすい小さな問題に分解する。
- 候補を比べる。 複数の解答をつくり、よりよいものを選ぶ。
- 計算を確かめる。 途中の計算や結果を検証する。
OpenAIは2024年のo1に関する報告で、強化学習に使う計算量と、回答時に使う計算量の両方を増やすと、評価した課題で性能が改善したと説明した。AIME 2024という数学試験では、問題ごとに一つの回答を生成した場合と、多数の回答から選ぶ場合で結果が異なっている。同じモデル名でも、どれだけ計算し、何回試せるかによって成績は変わる。[7]
長く出力させれば、どんな問題でも正確になるという話ではない。余分な検討は待ち時間や計算コストを増やすため、速さと精度のどちらを求めるかによって使い方も変わる。
検索できるAIは、モデル自体が学び直したのか?
社内規定について質問したとき、AIが最新の規定ファイルを検索して回答する場合を考えよう。これは、ファイルの内容をモデル内部に再学習させることとは別の方法だ。
関連資料を検索して生成に利用する仕組みは、RAG(検索拡張生成)と呼ばれる。2020年のRAG論文は、学習済みの言語モデルと、Wikipediaを検索する仕組みを組み合わせ、知識を必要とする課題で評価した。[8]
計算機やコード実行環境を利用できれば、文章として計算結果を予測する以外の手段も使える。ただし、誤った資料を選んだり、道具に渡す条件を間違えたりすれば、最終回答も誤りうる。見るべき対象は、モデル単体に加えて、参照資料や道具を含むシステム全体になる。

会話するたびにAIは学習しているのか?
会話中に「もう少し短く」と頼むと、次の回答は短くなる。しかし、それだけでモデルの重みが書き換わったとはいえない。直前のやり取りを入力の一部として使い、回答を調整できるからだ。
Googleの公式教材も、入力に指示や例を加える方法は、パラメータを変えずにモデルの能力を引き出すものとして説明している。[9]
「AIが覚えた」と感じる場面でも、次の三つは分けて考えたい。
- その場で参照する。 会話や渡された情報を、今回の回答に使う。
- 好みを保存する。 保存した情報を、後の回答で参照する。
- モデルを再訓練する。 学習によって、モデル内部のパラメータを更新する。
利用データが将来の訓練に使われるかは、サービスや契約・設定によって確認すべき別の問題だ。
大きなAIの出力を教材として、小さなAIを訓練する「蒸留」という方法もある。これは会話内で例を見せるだけの方法と違い、別のモデルの学習に使う。AIの進歩には、最高性能を伸ばす方向だけでなく、必要な性能をより少ない計算で使えるようにする方向もある。[9]
AIはどこまで賢くなるのか?正答率だけでは測れない
今回参照した研究から、AIの知能の最終的な上限や、AGIの実現年を確定することはできない。 判断の前に必要なのは、何ができたら「賢い」と呼ぶのかを具体化することだ。
AGIは、一般に幅広い知的課題に対応できる汎用人工知能を指す。ただ、一つの数学試験やプログラミング課題で高得点を取ることと、未知の仕事を幅広くこなすことは同じではない。
Google DeepMindは2026年3月、推論や記憶に加え、学習、注意、計画などを担う実行機能、自分の認知を監視するメタ認知、社会的認知など、10の能力から評価する枠組みを提案した。これはAGI達成の宣言ではなく、何をどう測るかを整備する取り組みだ。[10]

「長い仕事ができる」の意味にも注意が必要
評価機関METRは、人間の専門家がどれほどの時間を要する課題を、AIが完了できるかを測っている。「50%の時間軸」は、AIが50%の確率で成功すると推定される課題の長さを、人間の作業時間で表したものだ。AIがその時間ずっと動いたことを意味しない。主な対象もソフトウェア、機械学習、サイバーセキュリティの課題に限られる。[11]
「人間なら数時間かかる課題を解けた」は有用な成果だ。しかし、成功率50%を、失敗が許されない仕事の安定運用と同一視することはできない。社内事情を知る担当者の数時間と、前提情報を限定した評価課題の数時間にも違いがある。
METRの2026年1月の改訂は、評価の難しさも示す。課題を170件から228件に増やすなどの見直しで、モデルの推定値は変動した。また、人間なら8時間以上かかる31課題のうち、人間の所要時間を実測できていたのは5課題で、残りは推定だった。伸びる傾向だけでなく、測定条件や不確実性も一緒に読む必要がある。[12]
複雑になれば、急に解けなくなることもある
Appleの研究者らが2025年に公表した研究では、難しさを調整できるパズルを使い、当時の推論モデルを評価した。一定の複雑さを超えると正答率が崩れ、推論に費やす量も減る現象を報告している。[13]
この結果を「AIは一切推論できない」「将来も改善しない」と一般化することはできない。対象モデル、パズル、出力条件の下で観測された結果だからだ。それでも、簡単な課題での成功を、そのまま長い手順や未知の条件へ延長できないことは、実用上の重要な論点になる。
AIがAIを改良すれば、際限なく進歩するのか?
AIが開発の一部を助ける実例はある。Google DeepMindが2025年に発表したAlphaEvolveは、言語モデルがプログラムを提案し、自動評価で実行結果を確かめ、よい候補を次の探索へつなげる仕組みだ。同社はAIの学習処理やデータセンター運用の効率改善に使ったと報告している。[14]
ここからいえるのは、AIがAI開発に役立つ改善案を生み出せることだ。人が用意する評価や計算資源なしに、自分の能力を際限なく高め続けられるという証拠ではない。
今後を見通すうえでは、次の三つを分けると、期待と事実が混ざりにくい。
| 見通し | 現時点での読み方 |
|---|---|
| 特定の問題を、より正確に解く | 学習や推論時の工夫で改善した実験例がある |
| 複数の工程をつなぎ、仕事を完了する | 完了できる課題の範囲と、失敗率の両方を評価する必要がある |
| 幅広い未知の仕事を、自律的にこなす | 一つの試験の高得点では証明できず、評価方法も発展途上 |
これは未来の到達年を予言する表ではない。これまで見た研究を、何が確認され、何を引き続き確かめるべきかという観点で整理したものだ。
仕事で使うなら、文章の流暢さに加えて、次の三点を自分の業務のサンプルで確かめたい。
- 正確さ: 渡した資料にない数字を、勝手に足していないか。
- 対応力: 途中で条件が変わっても、対応できるか。
- 実際の時短: 確認と手直しまで含めて、作業時間が減るか。
こうした基準を持てば、AIの進歩を日々の判断につなげられる。
よくある疑問
AIの学習と、人間の勉強は同じなのか?
例やフィードバックから改善する点には共通する見方ができる。ただし、ここで説明したLLMの学習は、計算によって重みなどの数値を調整する処理だ。人間の脳の働きや経験全体と同一視はできない。[2]
AIが賢くなると、意識も生まれるのか?
課題を解く能力と、主観的な経験としての意識は別の問いだ。意識研究をAIへ応用した2023年の研究も、複数の理論から指標を検討している。会話が自然であることや試験に強いことだけを、意識がある証拠にすることはできない。[15]
小さいAIにも進歩の余地はあるのか?
ある。追加訓練や蒸留によって、特定の課題への適応や効率を改善できる。ただし、軽量化には性能との引き換えもある。「最も大きいAIか」より、自分の用途で必要な品質・速度・費用を満たすかを見ることが大切だ。[9]
基礎用語をさらに確認したい場合は、機械学習の仕組みとAGIの基本解説も参照してほしい。
まとめ
- AIの進歩には複数の経路がある。 データによる事前学習、答え方を磨く事後学習、回答時の計算や道具の活用を分けると、何が改善したのかを理解しやすい。
- 賢さは、モデルの大きさや一つの試験だけでは決まらない。 得意な課題、成功率、使える資料、計算条件をそろえて比較する必要がある。
- 将来の上限やAGI実現年は、今回の研究からは断定できない。 仕事への影響を見るなら、任せられる工程と、確認・手直しを含めた実際の成果を確かめたい。
出典・参考
- Tom B. Brownら「Language Models are Few-Shot Learners」(2020年5月28日初稿)
- Google for Developers「Neural Networks: Training using backpropagation」
- Jared Kaplanら「Scaling Laws for Neural Language Models」(2020年1月23日初稿)
- Jordan Hoffmannら「Training Compute-Optimal Large Language Models」(2022年3月29日)
- Long Ouyangら「Training language models to follow instructions with human feedback」(2022年3月4日)
- DeepSeek-AI「DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning」(2025年1月22日、v1)
- OpenAI「Learning to reason with LLMs」(2024年9月12日)
- Patrick Lewisら「Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks」(2020年5月22日初稿)
- Google for Developers「LLMs: Fine-tuning, distillation, and prompt engineering」
- Google DeepMind「Measuring progress toward AGI: A cognitive framework」(2026年3月17日)
- METR「Task-Completion Time Horizons of Frontier AI Models」(2026年10月1日確認)
- METR「Time Horizon 1.1」(2026年1月29日)
- Parshin Shojaeeら「The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity」(2025年6月7日初稿)
- Google DeepMind「AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms」(2025年5月14日)
- Patrick Butlinら「Consciousness in Artificial Intelligence: Insights from the Science of Consciousness」(2023年8月17日初稿)
カバー:AIによる問題解決を表現したイメージ。Jesper Lindborg / Google DeepMind(Visualising AI)。出典:Unsplash。Unsplash Licenseに基づきトリミング・WebP化。






