Webエンジニア向けプログラミング解説動画をYouTubeで配信中!
▶ チャンネル登録はこちら

【ITニュース解説】Meta AIRA จากสนามซ้อมสู่เหรียญทอง Kaggle: ไล่ทีละตัวเลขว่าเกิดอะไรขึ้น

2026年09月26日に「Dev.to」が公開したITニュース「Meta AIRA จากสนามซ้อมสู่เหรียญทอง Kaggle: ไล่ทีละตัวเลขว่าเกิดอะไรขึ้น」について初心者にもわかりやすく解説しています。

作成日: 更新日:

ITニュース概要

MetaのAI開発「AIRA」は、Kaggleコンペで金メダルを獲得した。AIの性能はモデルだけでなく、優れた訓練環境、思考の指示、探索戦略、そして複数のAIが協力する分散システムによって大きく向上することを示した。AI開発において、土台となる環境や設計が極めて重要だとわかる。

ITニュース解説

Metaが推進するAI研究プロジェクト「AIRA」は、AIエージェントがどのように課題解決能力を高め、最終的に世界的なプログラミング競技会Kaggleで金メダルを獲得するに至ったかを示す、注目すべき事例だ。この一連の道のりは、AIモデルそのものの能力だけでなく、そのAIが活動する「環境」や「思考プロセス」がいかに重要であるかを教えてくれる。

まず、AIエージェントの能力を測るための基準である「MLE-bench」について説明する。これはOpenAIが開発したベンチマークで、Kaggleで実際に行われたプログラミング課題75問を収集したものだ。AIエージェントはこれらの課題、関連データ、そして作業に与えられた時間を元にコードを作成し、結果を提出する。その結果はKaggleが実際に使ったテストデータで評価され、人間が銅メダル以上を獲得する基準を満たせた課題の割合、つまり「メダル獲得率」が主な指標となる。AIRAプロジェクトの研究の多くは、このMLE-benchの中でも難易度が比較的低い22問からなるサブセット「MLE-bench lite」を使って行われた。

AIRAプロジェクトの最初の段階では、既存の高性能AIエージェントである「AIDE」を、Metaが新しく開発した訓練環境「AIRA-dojo」に移行させることから始まった。この際、AIDEのAIモデル自体には一切変更を加えていないにもかかわらず、そのメダル獲得率はMLE-bench lite上で35.2%から45.9%へと10.7ポイントも向上した。この劇的な改善は、AIモデルの頭脳そのものが賢くなったわけではなく、モデルがプログラムを作成し、実行するための「環境」が改善されたことによるものだ。具体的には、システムのセットアップがより整い、必要なソフトウェアの準備がスムーズになり、エージェントが無駄なトラブルに時間を取られることが減った。これは、陸上選手が同じ能力であっても、整備されたトラックで、しっかりと紐を結んだ靴を履いて走れば、より速いタイムを出せるのと同じような状況である。この結果は、AIモデルの性能を最大限に引き出すためには、その実行環境の最適化が極めて重要であるという教訓を示している。

次に、AIRAプロジェクトではAIエージェント自身の「思考プロセス」と「探索戦略」の改善に取り組んだ。 「オペレーター」とは、エージェントが課題を解決するための具体的な指示や思考の手順をまとめたものだ。AIDEには元々、最初の解決策を書き出す「Draft」、壊れたコードを直す「Debug」、使える解決策を良くする「Improve」、過去の学習をまとめる「Memory」という主要なオペレーターがあった。MetaのAIRAチームはこれらのオペレーターを三つの観点から改良した。一つは、状況に応じてAIへのヒントの難易度を調整すること。例えば、まだ選択肢が少ない初期段階では簡単な作業をさせ、多くの選択肢が広がった段階ではより複雑な作業をさせるようにした。二つ目は、オペレーターごとに最適なメモリ管理を行うこと。Draftの際には同時に生成された他の解決策を参考に重複を避ける一方、Debugの際には過去にどのような修正が行われたかを参考にするといった具合だ。三つ目は、AIが回答を出す前に十分に思考する「考える時間」を与え、その思考の過程を最終的な結果から切り離すことだった。これらのオペレーター改善により、DeepSeek-R1という同じ基盤モデルを使っても、メダル獲得率は39.8%から45.5%に向上した。

「検索ポリシー」とは、AIエージェントが課題解決のためにどの道筋を進むかを選択する戦略のことだ。チームは三つの戦略を試した。一つは「Greedy」(グリーディー)と呼ばれる、その時点で最も良いと思われる選択肢を単純に進む方法。二つ目は「MCTS」(モンテカルロ木探索)で、複数の選択肢を深く探索し、統計的な確率に基づいて最適な経路を見つける方法。三つ目は「Evolutionary」(エボリューショナリー)で、複数の解決策を生成し、良い部分を組み合わせて進化させる方法だ。この段階での最良の組み合わせは、改良されたAIRAのオペレーターとGreedy戦略を、o3という基盤モデルと組み合わせたもので、MLE-bench lite上で47.7%という当時の新記録を達成した。MCTSやEvolutionaryのような複雑な戦略も有効ではあるが、オペレーターが適切に設計されていない場合は、その効果は限定的であることも示された。さらに、AIエージェントに与える思考時間と基盤となるインフラの改良によって、エージェントのアルゴリズム自体は変更せずに、メダル獲得率を55.0%まで向上させることも可能であった。

プロジェクトの次の段階である「AIRA2」では、AIエージェントの実行基盤が大きく進化を遂げた。これまでのAIRAが単一のGPU(グラフィック処理装置)上で時間を区切って処理を分割していたのに対し、AIRA2では8つのGPUを使い、複数の「子エージェント」が互いに待つことなく並行して作業を進める「分散処理」アーキテクチャを採用した。また、評価基準も多様化され、「MLE-bench-30」という、難易度の幅が広い30問の課題セットと、「AIRS-Bench」という、研究課題スタイルの20問が追加された。主要な評価指標も、AIエージェントがKaggleの人間参加者のリーダーボードでどれくらいの順位に相当するかを示す「Percentile Rank」(パーセンタイルランク)に変更された。Gemini 3.0 Pro Previewという基盤モデルを使用し、24時間という制限時間内で平均71.8のパーセンタイルランクを達成し、72時間まで時間を延長すると76.0に向上、さらに改良版では81.5を記録した。 AIRA2では「アブレーションスタディ」という手法を用いて、システムを構成する各要素が全体の性能にどれだけ貢献しているかを詳細に分析した。これは、システムの特定のコンポーネントを取り除いたときに、性能がどう変化するかを調べることで、そのコンポーネントの重要性を評価する方法だ。分析の結果、子エージェントシステムを外した場合の性能低下は比較的小さかったが、「HCE(Hidden Cheating-prevented Evaluation)」、つまり固定されたデータセットで、正解が隠された状態での評価サイクルを取り除いた場合に、パーセンタイルランクが71.8から56.8へと最も大きく低下した。これは、AIエージェントが学習を進める上で、正確で信頼性の高い評価信号、つまり「どの方向性が正しいのか」を明確に教えてくれるフィードバックがいかに重要であるかを示している。単に多くのAIを並行して動かすことよりも、その学習を導くための正確な評価メカニズムが決定的に重要であるという教訓が得られた。

そして、プロジェクトの集大成である「AIRA3」は、2026年9月上旬にKaggleの実際の競技会に投入された。NVIDIAが主催するこのコンペティションでは、約4000チームが参加する中、AIRA3は8位に入賞し、見事に金メダルを獲得した。特筆すべきは、この勝利がMetaが開発したAIモデルではなく、GPT 5.5とClaude 4.8という他社の高性能AIモデルを組み合わせて実現された点だ。Metaはエージェントの訓練システムと実行環境を提供し、基盤となるAIモデルは外部の最新技術を利用した。 AIRA3のアーキテクチャには、興味深い特徴がある。それは、システム全体を指揮する「中央の司令塔」が存在しない点だ。代わりに、複数のAIエージェントがそれぞれ独立した環境で作業を進め、共通の「掲示板」のような場所を通じて、自分たちが発見した仮説や結果を共有し合う。この仕組みは、一人のリーダーが全てを指示するのではなく、複数の専門家が各自の役割をこなしつつ、定期的に会議を開いて情報を共有し、協力して問題を解決するような、分散型のチーム構造に近い。このアプローチは、小規模な開発チームであっても、大規模な中央制御システムを構築することなく、優れた訓練環境とエージェント間の効率的な情報交換の仕組みを整えることで、高度なAI研究システムを構築できる可能性を示唆している。

これらのAIRAプロジェクトの各段階を追うことで、AIエージェントの性能向上は、強力なAIモデル単体で決まるものではないことが明確になる。その性能は、AIが活動する「環境」の質、エージェントの「思考プロセス」の洗練度、最適な解決策を見つけるための「探索戦略」、そして複数のAIエージェントが協力して並行作業を行う「分散処理」と、その学習を適切に導く「信頼できる評価メカニズム」といった、多岐にわたる要素を総合的に最適化することで達成される。特に、最初の段階で35.2%から45.9%へと向上したメダル獲得率や、o3モデルで47.7%という記録を達成したことは、AI開発における環境やアプローチの重要性を具体的な数字で示している。AI研究と開発においては、単に最先端のAIモデルを追い求めるだけでなく、そのモデルをいかに効果的に活用し、性能を引き出すかという視点が極めて重要である。

関連コンテンツ

関連IT用語