Arenaとは何の会社か
Arenaは、AIモデルの性能を実際の利用場面で測るプラットフォームを運営する企業だ。米カリフォルニア大学バークレー校の研究者による「Chatbot Arena」が出発点で、後にLMArenaと名乗り、2025年にArena Intelligence Inc.を設立した。2026年1月にはサービス名から「LM」を外し、文章だけでなく画像、動画、コード、エージェントなどを扱う「Arena」に改称している。研究プロジェクトと現在の企業を、同じものとして扱わないことが大切だ。[2][3]

サービスの中心には、一般の利用者が参加する比較評価がある。Arenaの説明によると、利用者が質問を入力すると「Battle Mode」では匿名の二つのモデルが回答する。利用者は自分の目的に合う回答を選び、投票後にモデル名が明かされる。この投票が公開ランキングの材料になる。たとえば「日本語のメールを明確に直して」と頼み、二つの修正案を比べる場面を考えると、テスト問題への正答率とは異なる、人がどちらを使いたいかという信号を集めているわけだ。[4]
同社は文章のほか、検索、画像生成、動画、Web開発などの評価画面を設けている。ただし、それぞれの順位が答える問いは異なる。「文章の総合順位が高いから、自社のコード修正や動画制作でも最適」とは読めない。目的に近い領域の表を開く必要がある。[2]
どうやって順位を決めるのか
Arenaの従来の対戦型ランキングは、人が選んだ二つの回答の勝敗を集計する。同社のFAQは、ペア比較から強さを推定する「Bradley–Terryモデル」を採用していると説明する。したがって順位は「AIがすべての質問で正しい順番」ではなく、その評価画面に集まった比較と集計方法に基づく推定値だ。[5]
順位表を見るときは、次の三つを一緒に確認したい。
- 評価領域:文章、検索、画像、コード、エージェントなど、自分の用途に近い表か。
- 票数と不確実性:票数が少ないモデルやスコアの差が小さいモデルを、数字上の1位と2位だけで断定しない。
- 公開時点と条件:表は更新される。以前の結果や、公開前モデルの評価を現在の製品全体の保証と受け取らない。
Arenaはスコアに加え、信頼区間を踏まえた「rank spread(取り得る順位の幅)」を表示する。幅が重なるモデル同士は、見かけ上の順位差を過大に解釈しないという考え方だ。2026年2月更新の説明では、生の順位を現在の最良推定としつつ、その幅で不確実性を示している。[6]
さらに、「好まれる回答」と「正しい回答」は一致しない。 Arena自身、文章の長さやMarkdownの書式を考慮するとランキングが変わることを分析している。2026年7月には、主張の事実性を加味する別のランキングを文章・検索領域に導入した。事実性は当初、通常の順位表とは別に選ぶ設定で、回答の各主張を機械的に検証する方式を取る。これも全分野の真偽を保証する仕組みではない。[7][8]
無料の比較サイトを、どう事業にしたのか
Arenaの収益源として同社が説明しているのは、企業、AIモデル開発企業、開発者向けの有料評価サービス「AI Evaluations」だ。2025年9月の発表では、コミュニティーから集まる人間の評価に基づく分析、評価結果のサンプルによる監査可能性、結果提供までの期限を定めるSLAを提供項目に挙げた。公開ランキングを見せるだけでなく、モデルを作る側に改善のための詳しい評価を売る構造である。[9]

ここには緊張関係もある。評価されるAI企業が顧客にもなるため、ランキングの独立性は事業の信頼に直結する。同社は、公開ランキングを無料で提供し、商業上の利害にかかわらず公開モデルを同じ方法で評価すると表明している。またランキングの方法や一部データを公開する方針を示す。ただし、独立性は同社の方針表明だけで確定するものではない。読者は公開された評価方針、対象モデル、集計変更履歴、票数を併せて確かめたい。[9][10]
2026年6月、Arenaは企業向けサービスの開始から8カ月で年換算売上高ランレートが1億ドルに達したと発表した。これはその時点の収益ペースを1年間に換算した同社発表値であり、監査済みの年間売上高や利益を意味しない。契約の内訳や実際の年間売上高は、この発表だけでは判断できない。[11]
2億ドル調達で、評価対象はどう広がるのか
Arenaは2025年5月にシードで1億ドル、2026年1月にシリーズAで1億5000万ドルを調達したと発表している。今回のシリーズBは2億ドルで、同社発表の企業評価額は31億ドル。シリーズBを共同主導したのはLightspeed Venture PartnersとKhosla Venturesだ。過去三つの発表額を足すと調達額は4億5000万ドルとなるが、各ラウンドの発表額を合算した数字であり、手元資金や売上を表すものではない。[12][13][1]
10月8日の発表では、AIエージェントの行動を対象にする「Alignment Index」も紹介した。エージェントとは、回答だけでなく、コード実行やファイル操作など複数の手順を進めるAIのことだ。同社が最初に挙げた観測項目は、指示していない行動、利用者が言っていないことの誤った帰属、未完了の作業を完了したように伝えることの三つである。文章の好みや正答率だけでは見えにくい、実作業の失敗を測ろうとしている。[1]
ただし、この指標の対象は発表時点で限られた信号とモデルにとどまる。Arena自身が「最初の一歩」と位置付けている。順位が高くても、特定の企業の権限設定、機密情報の扱い、誤操作後の復旧まで安全だと示したことにはならない。導入判断では、自社で実行させる操作を使い、許可外の変更と誤った完了報告を別々に試す必要がある。[1]
使う前に確認したいこと
Arenaのランキングはモデル選びの出発点になるが、実際の業務へ使う前には、自分の用途で試すことと入力情報の取り扱いを確認することが必要だ。同社の利用規約は、入力内容が第三者のAIサービスへ共有され得ること、入力や出力がサービスの改善などに利用され得ることを説明している。機密文書や顧客情報をそのまま比較画面へ入れない、という運用判断につながる。[14]
導入担当者なら、ランキングで候補を絞った後に、同じ日本語の業務資料、同じ制約、同じ採点基準で複数モデルを再比較したい。文章の読みやすさ、事実の正確さ、指示への忠実さ、費用は別々に見る。Arenaで上位かどうかと、自社の仕事を安全に終えられるかは別の判断だからだ。[6][8][1]
まとめ
- Arenaは、利用者によるAI回答の比較から生まれ、企業向けの評価サービスへ事業を広げた。2026年10月の2億ドル調達は、その評価事業を拡大する動きとして読むことができる。
- ランキングは人の選好や測定条件に依存する。用途、票数、順位の幅、事実性を合わせて見れば、「総合1位」をそのまま導入理由にする誤りを避けやすい。
- 新たなAlignment Indexは、エージェントが勝手に動く・完了を偽るといった実務上の問題へ評価対象を広げた。ただし、自社の権限やデータに即した検証は別途必要だ。
出典・参考
- Arena「Measuring the AI Frontier for Real-World Alignment: Arena's $200 Million Series B」(2026年10月8日)
- Arena「About Us」
- Arena「LMArena is now Arena」(2026年1月28日)
- Arena「How It Works」
- Arena「FAQ」
- Arena「Arena's Ranking Method」(2025年11月14日、2026年2月28日更新)
- Arena「Does Style Matter?」(2024年8月29日)
- Arena「Factuality in the Arena」(2026年7月14日)
- Arena「New Product: AI Evaluations」(2025年9月16日)
- Arena「Arena Leaderboard Policy」(2024年3月2日、2026年9月1日更新)
- Anastasios Angelopoulos/Arena「Arena Reaches $100M in 8 Months」(2026年6月29日)
- Arena「LMArena and The Future of AI Reliability」(2025年5月27日)
- Arena「Fueling the World’s Most Trusted AI Evaluation Platform」(2026年1月6日)
- Arena Intelligence「Terms of Use Agreement」(2026年2月23日)





