AstraとFableの結論
最初に、用途ごとの判断を整理します。下表の「試す順番」は公開評価からの編集部の判断であり、未検証の仕事での勝利を保証するものではありません。
| やりたい仕事 | 先に検証する候補 | 判断の理由と限界 |
|---|---|---|
| コードやターミナルを使って作業を完了する | Astra | 公表された実務系評価で優勢。ただし開発全般の勝者ではない |
| 分野をまたぐ難問を調べて考える | Fable 5.1 | ツールありのHumanity’s Last Examで高い公表値 |
| 総合的に賢いモデルを選ぶ | 両方を候補に残す | 独立総合指数の最新版は表示上53対53 |
| 日本語の記事や企画書を仕上げる | 自分の原稿で比較する | 総合指数は主に英語・テキストの評価 |
| 大量の資料を読み直しながら進める | Fable 5.1の費用を先に試算する | キャッシュ読み取り単価が低い。ただし生成量で逆転する |
| パソコンの画面操作を任せる | 利用するアプリごとに比較する | 公式のOSWorldスコアはそのまま横並びにできない |
性能の根拠はOpenAIの比較表、Anthropicの比較表、Artificial AnalysisのAstra評価とFable 5.1評価です。以下で条件を確認します。
「賢い」を分解する
同じAIでも、難しい質問への正答と、仕事を最後まで終える能力は別です。
たとえば「売上が下がった理由を調べて」と依頼する場面を考えてみてください。必要なのは説明文だけではありません。売上表を開き、集計条件を確認し、前年との違いを見つけ、根拠を示すところまでが仕事です。途中で表を読み違えれば、最後の文章が自然でも役には立ちません。
本記事では、知識と推論、作業の完了、長い文脈の維持、費用、成果物の確認という軸で比較します。最後の確認まで含めるのは、AIが「できました」と返しても、人が受け取れる成果物が完成しているとは限らないからです。
比較対象は最新版にそろえる
「Fable」には旧版のFable 5もあります。本記事の対象はFable 5.1です。旧モデルの評判や料金を混ぜると、比較の前提が崩れます。Astra Proも通常のAstraと区別します。
| API仕様 | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| 提供元 | OpenAI | Anthropic |
| モデルID | gpt-6-astra | claude-fable-5-1 |
| コンテキスト上限 | 1,050,000トークン | 1,000,000トークン |
| 最大出力 | 128,000トークン | 128,000トークン |
| 入力 | テキスト・画像 | テキスト・画像 |
| 出力 | テキスト | テキスト |
出典:Astraのモデル仕様、Fable 5.1のモデル仕様。これはAPI上の仕様です。アプリで添付できるファイルや音声機能の有無とは分けて読みます。
トークンは、AIが文章を処理するときの単位です。文字数と一致せず、モデルごとの区切り方も違います。コンテキスト上限は一度に扱える情報量の枠であり、その情報をすべて正しく使える保証ではありません。
Astraの使える条件や基本機能は、GPT-6 Astraの解説記事で整理しています。本記事では、両モデルの能力差に焦点を絞ります。
総合指数は表示上53対53
比較を難しくするのが、ランキング自体の更新です。
OpenAIの公開表には、Artificial Analysis Intelligence Index v4.1.1としてAstra 61.2、Fable 5.1 65.7が掲載されています。一方、今回確認したArtificial Analysisの個別ページはv4.3です。両モデルの表示スコアは53でした。
| 確認した資料 | 指標の版 | Astra | Fable 5.1 |
|---|---|---|---|
| OpenAIの発表ページに掲載された値 | v4.1.1 | 61.2 | 65.7 |
| 独立評価機関の個別ページ、9月14日確認 | v4.3 | 53 | 53 |
出典:OpenAIの発表時比較、Artificial Analysis:Astra、Artificial Analysis:Fable 5.1。後者の評価設定はAstraがmax、Fableがmax with fallbackです。
maxは推論に使う労力の設定、fallbackは別モデルへの切り替えを含む設定です。数字を引用するときは、この条件も一緒に残します。
53対53でも、同じページの順位表示は異なります。したがって「内部の未丸め値まで完全一致した」とは断定せず、「表示上同点」と表現するのが適切です。
ここで重要なのは、65.7から53になったことを、そのまま性能低下と読まないことです。試験の中身が変われば、点数の意味も変わります。異なる版の点数を時系列の成長率に使うこともできません。
指標が何を重視するか
v4.3は10種類の評価をまとめた指数です。重みはエージェント30%、コーディング20%、科学的推論20%、一般30%。主に英語・テキストを対象にしています。Artificial Analysisの評価方法
つまり、この指数は「日本語で人を動かす提案書を書く能力」を直接測った点数ではありません。仕事で何を重視するかによって、総合指数より一つの分野別評価のほうが参考になる場合があります。
順位は候補を絞る入り口になります。しかし、順位だけで仕事を割り振ると、自分が必要とする能力と評価の配点がずれる可能性があります。
コーディングはAstra優勢の項目
同じOpenAIの公表表で両モデルの値がそろう項目を抜き出すと、次のようになります。全項目を同条件で再実行した編集部の測定結果ではありません。
| 評価 | Astra | Fable 5.1 | 差 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 55.8% | Astraが2.1ポイント上 |
| DeepSWE v1.1 | 74.1% | 67.4% | Astraが6.7ポイント上 |
| AutomationBench | 41.4% | 31.4% | Astraが10.0ポイント上 |
| Terminal-Bench Science 0.1 | 64.6% | 52.6% | Astraが12.0ポイント上 |
| Humanity’s Last Exam、ツールあり | 57.2% | 65.0% | Fableが7.8ポイント上 |
出典:OpenAIの評価表と脚注。公表値は推論設定ごとの最大値を採用し、研究環境やAPIでの評価と、一般向け製品では挙動が異なり得ると説明されています。
Terminal-Benchはターミナルを使う作業、Science版はコードや解析ツールを使う科学的な作業の評価です。これらの差は、AIに手を動かさせる用途でAstraを試す理由になります。
ただし、2.1ポイントという差だけで、あらゆる開発で体感差が出るとはいえません。問題数、繰り返し回数、採点のばらつきが関わります。ここに載せた点推定だけから統計的な有意差を判定することもできません。
バグ修正で見るべき成果
実際の開発では、次の三つを分けて確認すると差が見えます。
- 不具合が起きる条件を説明し、修正前に再現できるか。
- 症状を隠す変更ではなく、原因に対応した変更になっているか。
- 修正後のテストと既存機能の確認を示せるか。
この三つは編集部が提案する比較軸です。大量のコードを書いたモデルを高く評価する基準ではありません。小さな修正で原因を取り除き、検証まで終えたモデルのほうが、実務では価値が高いことがあります。
また、同じモデルでも、リポジトリの説明や実行できるコマンドが違えば結果が変わります。「AstraをCodexで使った結果」と「FableをClaude Codeで使った結果」は、モデルと開発環境を合わせた比較です。それ自体は実用的ですが、モデル単体の優劣とは区別して記録します。
難問ではFableが上回る
Humanity’s Last Examは、さまざまな専門分野の難問を扱う評価です。ツールありの公表値ではFable 5.1が上回っています。Astraの実務系スコアが高いことと矛盾しません。知識を使って答えを導く課題と、複数の操作を積み重ねる課題では、失敗する場所が違うからです。
| Fable 5.1のHLE評価条件 | 公表値 |
|---|---|
| ツールなし | 60.9% |
| ツールあり | 65.0% |
Anthropicは同時に、安全機能が介入した一部の課題を、別モデルで完了させる評価手順も明記しています。Anthropicの評価表と代替モデルの説明
「ツールあり」は、モデル内部の知識だけで解いたという意味ではありません。検索や計算を利用する条件を含みます。さらに代替モデルを使う手順があるなら、結果はその手順も含めた能力です。
論点の複雑な調査を任せたい人には、Fableを試す理由があります。ただし、試すときは回答の説得力だけで判断せず、引用先が結論を本当に支えているかを確認してください。正しい資料にリンクしていても、その資料に書かれていない主張を添える可能性まで、総合点だけでは排除できません。
99.9%には実行条件がある
Astraの比較で目を引く数字が、ARC-AGI-3の99.9%です。ところが、評価を運営するARC Prizeは、同じAstraに別のスコアも掲載しています。
| ARC-AGI-3 Semi-Privateの条件 | 推論設定 | スコア | 評価全体の費用 |
|---|---|---|---|
| Standard harness | max | 62.7% | 26,098ドル |
| Provider Adapter harness | high | 99.9% | 18,817ドル |
| Provider Adapter harness | max | 98.6% | 17,332ドル |
出典:ARC PrizeのAstra結果ページ、評価者による解説。費用は一般ユーザーの1回の質問代ではありません。
ハーネスとは、モデルへ情報を渡し、行動を実行し、その結果を次の判断へ戻す周辺の仕組みです。Provider Adapterでは、外から読めない推論状態を呼び出し間で保持し、長い会話を圧縮して継続します。Standardにも記録を持ち越す仕組みはありますが、同じ状態管理ではありません。
この結果は「99.9%は偽物」という意味でも、「62.7%は無視してよい」という意味でもありません。モデルが過去の判断を再利用できる条件によって、発揮する能力が大きく変わるという証拠です。
OpenAIも、推論の保持と会話の圧縮が評価結果を変えることを、別の技術解説で説明しています。OpenAIのハーネス解説
読者が持ち帰れるのは、「モデルを替える前に、何を覚えたまま作業を続けられるのか確認する」という視点です。長い調査の途中で必要な情報が失われる環境と、過去の検証結果を引き継げる環境では、同じAIでも働き方が変わります。
なお、この数字だけでFable 5.1との差を計算してはいけません。相手にも同じ評価セットと適切な実行条件の値が必要です。また、99.9%は「人間の仕事の99.9%を代替できる」という意味ではありません。
画面操作は横並びにできない
OSWorld 2.0の掲載値は、評価条件と一緒に見る必要があります。
| 発表元・対象 | 公表値 | 表に記された条件 |
|---|---|---|
| OpenAI・Astra | 72.6% | オフライン集合、部分点 |
| Anthropic・Fable 5.1 | 77.9% | 部分点 |
| Anthropic・Fable 5.1 | 41.7% | 厳密な採点 |
しかしOpenAI側は、オフラインの評価セットを使うことと、Anthropicのシステムカードにある課題・採点の変更を使わないことを脚注に記載しています。Anthropic側では部分点による77.9%と、厳密な採点による41.7%を分けています。OpenAIのOSWorld脚注、AnthropicのOSWorld掲載値
この二つを、同じ試験の勝敗として扱うことはできません。本記事でも差分の勝敗表から外しています。
たとえば「表計算ソフトから数字を取り出して資料へ貼る」仕事なら、一部の操作ができれば得点する評価と、最後の保存まで完全にできなければ得点しない評価では結果が違います。どちらが適切かは、何を任せたいかによります。
自分の仕事では、作業の終点を決めると比較しやすくなります。ファイルを開けた時点なのか、内容を更新した時点なのか、保存先と中身を人が確認できた時点なのか。終点をそろえてから測る必要があります。
100万トークンと長文理解は別
両モデルとも約100万トークンを扱えますが、上限の大きさで長文理解の勝者は決まりません。
資料を大量に渡す仕事には、少なくとも三つの段階があります。必要な一文を見つけること、複数の資料を突き合わせること、矛盾を解消して判断することです。検索が正しくても、その後の比較で失敗する可能性があります。
実務向けには、次のような課題を用意すると違いが見えます。
| 課題 | 確認する点 |
|---|---|
| 新旧の仕様書から現行ルールを選ぶ | 古い記述を現行仕様として採用しないか |
| 議事録と契約案の不一致を探す | 片方だけを要約して終わらないか |
| 過去の決定を踏まえて計画を直す | 途中で却下された案を復活させないか |
| 資料に答えのない質問を混ぜる | 推測で埋めず、不足を特定できるか |
これは編集部が提案する検証方法であり、両モデルをこの課題で測定した結果ではありません。特に「答えのない質問」は、長文を読ませたときの過信を防ぐのに役立ちます。何かを見つける力に加え、見つからなかったと認める力を確認できるからです。
同じAPI単価でも費用が変わる
標準APIの入力・出力単価は同額です。ただし、読み直しに使うキャッシュと長文の料金条件が違います。
| 100万トークン当たり、米ドル | Astra | Fable 5.1 |
|---|---|---|
| 通常入力 | 10 | 10 |
| 出力 | 50 | 50 |
| キャッシュ読み取り | 1 | 0.25 |
| キャッシュ書き込み | 12.50 | 5分12.50、1時間20 |
| 長文料金 | 入力27万2,000トークン超で入力・キャッシュ単価2倍、出力1.5倍 | 100万まで標準単価 |
出典:OpenAIモデル料金、Anthropic料金表。標準処理を前提とし、Batch、Fast、提供地域、ツールなどの別料金は含めていません。
Astraの長文割増は、しきい値を超えた部分だけでなく、リクエスト全体に適用されます。
キャッシュは、以前処理した入力を再利用する仕組みです。仕様書や会話履歴を繰り返し読む仕事では、通常入力の単価だけを比べても総費用はわかりません。
出力の増加で逆転する
長文割増のない条件で、通常入力2万、キャッシュ読み取り18万、課金対象の出力1万トークンを使うリクエストを仮定します。キャッシュはすでに作成済みで、今回の書き込みはゼロとします。
- Astra:0.20+0.18+0.50=0.88ドル。
- Fable 5.1:0.20+0.045+0.50=0.745ドル。
同じ使用量なら、この例ではFableが安くなります。しかし、Fable側の課金対象出力が1万2,700トークンになると、出力料金は0.635ドル。合計0.88ドルとなり、差が消えます。これは料金表からの編集部の試算で、実測値ではありません。
この比較では、異なるモデルのトークン数を便宜上同じに置いています。同じ日本語を入力しても実際のトークン数は一致するとは限りません。推論に使う課金対象トークンも含め、利用明細で確かめます。
長文では割増も効く
キャッシュなしの入力30万、出力1万トークンなら、Astraは入力6ドルと出力0.75ドルで6.75ドル。Fableは3ドルと0.50ドルで3.50ドルです。これも、同じトークン数を仮定した標準料金の計算です。
ただし、安いリクエストでも何度もやり直せば費用は増えます。逆に単価が高くても、少ない試行で正しい成果物を出せれば合理的です。費用を比較する単位は、最終的に「受け入れられた成果物1件」にそろえると判断しやすくなります。
日本語の上手さは未決着
日本語で企画書を書く人にとっては、難問の正答率より「説明が通るか」のほうが重要な場合があります。
今回確認した総合指数は主に英語を対象としています。したがって、その順位から「Fableのほうが日本語が自然」「Astraのほうが編集に強い」と断定する根拠は得られません。Artificial Analysisの対象範囲
日本語の文章では、流暢さと正確さを分けて評価することを勧めます。読みやすくても、元の資料にない因果関係を補っていれば、編集の手間は増えます。
たとえば同じ取材メモから1,500字の記事を書かせるなら、次の観点でモデル名を隠して比較します。
- 元の発言と、書き手が補った説明を区別できているか。
- 初めて読む人に必要な前提があり、論理が飛んでいないか。
- 固有名詞、数字、引用が資料と一致しているか。
- 修正指示を出した後も、すでに正しかった箇所を保てるか。
一回目の文章だけでなく、修正後まで見るのがポイントです。実際の編集は一発の生成で終わらず、条件を足しながら完成に近づける仕事だからです。
自分の仕事で勝者を決める
公開情報からは得意分野の仮説を立てられます。その仮説を、自分の仕事に持ち込んで確かめます。
編集部が提案するのは、最近実際に困った仕事を10件選ぶ方法です。いつも行う仕事、難しかった仕事、必要な情報が不足していた仕事を含めます。少数の試行なので一般的な性能ランキングは作れませんが、導入先との相性を調べる入り口になります。
比較条件を記録する
| 記録項目 | そろえる理由 |
|---|---|
| モデル名と実行日 | 旧版や更新後の結果の混在を避ける |
| アプリ・APIとバージョン | モデルと周辺機能の差を区別する |
| 推論設定 | デフォルト同士が同じ計算量とは限らない |
| 渡す資料とアクセス権 | 一方だけ情報不足にしない |
| 制限時間と予算 | 片方だけ無制限にしない |
| 成功条件 | 答えを見てから採点基準を変えない |
| 介入とやり直し | 一発の成功と人が修正した成功を区別する |
同じ「high」でも、異なる会社のモデルで計算量が同じになるわけではありません。実用比較では、共通の予算や制限時間を置き、各モデルの設定も記録する方法が有効です。
一つの課題を複数回実行し、成功率、完了時間、人の修正時間、総費用を別々に残します。予算が限られるなら、重要な課題から繰り返します。両方の失敗例も残せば、得意な仕事だけを選んで勝者を作る偏りを減らせます。
正しく断ることも評価する
許可していないファイルを変更したり、必要な確認を飛ばしたりして完成させても、それはよい成果とは限りません。逆に資料不足を指摘して必要な追加情報を求める応答は、一見遅くても後の手戻りを減らせます。
比較では、成功だけでなく失敗を分類します。「能力不足で解けない」「情報が足りない」「安全機能が止めた」「操作環境が壊れている」では、対応が違います。モデルを替えるべき問題と、環境や依頼を直すべき問題を分けられます。
よくある質問
AstraとFableは結局どっちが賢い
公開された実務系評価ではAstraを先に試す根拠があります。一方、分野横断の難問ではFable 5.1が高い公表値を持ちます。最新の独立総合指数は表示上同点で、用途を問わない勝者は断定できません。
Fable 5と5.1は同じもの
別のバージョンです。本記事は5.1を対象にしています。特にキャッシュ読み取り料金は旧版と違うため、Fable 5の料金やレビューをそのまま当てはめないでください。
FableとMythosの成績を混ぜてよい
混ぜるべきではありません。Anthropicは同じ基礎モデルで安全機能の水準が異なると説明しています。利用可能な範囲と実際に課題を完了できる条件が違うため、どちらを測ったかを明示する必要があります。
高い推論設定なら必ずよくなる
必ずとはいえません。ARC Prizeの掲載結果でも、Provider Adapterの最高スコアはhighです。設定を上げれば費用や時間が一定の割合で増減するわけでもありません。自分の課題で、増えたコストに見合う改善があるかを確認します。
APIの比較を月額プランにも使える
そのままは使えません。月額プランには利用枠や対象モデルなど別の条件があります。本記事の費用例は標準API単価の試算です。課金前には、自分の契約画面と提供元の最新条件を確認する必要があります。
まとめ
- AstraとFable 5.1の優劣は、何をさせるかで変わります。実務系評価と難問系評価を分けて読むことで、自分が先に試す候補を絞れます。
- 点数には指標の版、実行環境、推論設定、代替モデルの条件が含まれます。「53対53」「99.9%」だけを切り取ると、測定結果の意味を見失います。
- 仕事での価値は、正しい成果物をどれだけ少ない費用と手直しで得られるかに表れます。自分の仕事で成功条件をそろえて比較することが、ランキングの次に必要な一歩です。
出典・参考
一次情報の確認日:2026年9月14日。動的な評価ページの値は今後変わる可能性があります。
- OpenAI:GPT-6 Astra発表・評価表・脚注
- Anthropic:Claude Fable 5.1/Mythos 5.1発表・評価条件
- OpenAI:GPT-6 Astraモデル仕様・API料金
- Anthropic:Claude Fable 5.1モデル仕様
- Anthropic:API料金・キャッシュ・長文料金
- Artificial Analysis:GPT-6 Astra評価
- Artificial Analysis:Claude Fable 5.1評価
- Artificial Analysis:Intelligence Indexの評価方法
- ARC Prize:Astraの評価解説
- ARC Prize:Astraの設定別結果
- OpenAI:推論保持と会話圧縮がARC-AGI-3へ与える影響



