【ITニュース解説】Darwin-180B-RSI: VIDRAFT's Recursive Self-Improvement MoE Model Claims Five Leaderboard Tops
2026年09月30日に「Dev.to」が公開したITニュース「Darwin-180B-RSI: VIDRAFT's Recursive Self-Improvement MoE Model Claims Five Leaderboard Tops」について初心者にもわかりやすく解説しています。
ITニュース概要
韓国VIDRAFTが開発したAIモデル「Darwin-180B-RSI」が、数学や科学などの推論能力でHugging Faceの主要リーダーボード5つで1位を獲得した。再帰的自己改善技術を活用し、高い性能を実現。オープンモデルとして公開されており、今後の応用が期待される。
ITニュース解説
VIDRAFTという韓国のAIスタートアップが開発した「Darwin-180B-RSI」というAIモデルが注目されている。このモデルは、数千億ものパラメータを持つ大規模なAIでありながら、効率的なアーキテクチャと独自の学習方法を取り入れ、数学、科学、一般的な推論、そしてマルチモーダルな理解といった様々な分野のベンチマークで高い性能を発揮したと報告された。システムエンジニアを目指す上で、このような最新のAIモデルの技術とそれがもたらす可能性を理解することは重要である。
Darwin-180B-RSIは、既存の高性能AIモデル「Qwen3.8-Flash-Next」を土台に構築されている。ゼロから全てを学習させるのではなく、「選択的モデルマージ」という技術で既存モデルの優れた部分を取り込み、そこに独自の改善を加えることで開発された。これにより、効率的に高性能なモデルを構築している。このモデルの総パラメータ数は1800億と非常に大きい。パラメータとは、AIモデルが学習によって獲得する知識や能力の量を表す数値で、一般的にこの数が多いほど、モデルは複雑な問題を理解し推論する能力が高まるとされる。しかし、これだけのパラメータを持つモデルを動かすには膨大な計算資源が必要となるため、Darwin-180B-RSIは「Mixture-of-Experts(MoE)」という特殊なアーキテクチャを採用している。
MoEアーキテクチャでは、モデル全体が多数の「エキスパート」と呼ばれる小さな専門家モデルの集まりとして構成される。Darwin-180B-RSIの場合、512のエキスパートが存在する。通常のAIモデルは、全てのパラメータが入力された情報を処理するが、MoEモデルでは、入力情報(例えばテキストの一部分)に応じて、その処理に最適なごく一部のエキスパートだけが選択されて活性化される。具体的には、推論のたびに512のエキスパートの中から10のエキスパートのみが使われる。これにより、1800億という全パラメータをメモリに読み込む必要はあるものの、実際に計算に使うパラメータ数は大幅に削減され、大規模なモデルでありながら推論にかかる計算コスト(FLOPs)や遅延を抑えることができる。これは、モデルを実際に運用する上での経済性や応答速度に大きく貢献する重要な工夫である。また、このモデルは一度に約26万トークンという非常に長い文脈を理解できる能力を持つ。トークンとは、単語や文字の一部といったテキストの最小単位のことで、長い文脈を理解できるということは、複雑な文書全体の意味を捉えたり、長いコードを解析したりする能力が高いことを意味する。
Darwin-180B-RSIのもう一つの核となる技術が、「再帰的自己改善(RSI)」という学習ループである。これは、モデルが自分自身で賢くなっていくための学習方法だ。基本的な流れは、まずモデルが推論問題に対する複数の候補となる解決策を生成する。次に、これらの解決策が、事前に用意された検証可能な正解データと比較され、自動的にその正しさが評価される。ここで重要なのは、人間による評価ではなく、コンピューターが客観的に正解を判断できる点である。そして、正しいと確認された解決策のみが次の学習サイクルに利用され、モデルをさらに洗練させるためのデータとして使われる。この「生成→検証・フィルタリング→再学習」というサイクルを何度も繰り返すことで、モデルは自身の正確な出力から学び、徐々に推論能力を高めていく。このアプローチは、人間が手作業で正解データを用意したり、人間の好みを反映する報酬モデルを構築したりする従来の学習方法とは異なり、自動で学習データを生成・改善できるため、特に数学や科学のような明確な正解が存在する分野での性能向上に有効である。
VIDRAFTは、Darwin-180B-RSIが複数の権威あるベンチマークで非常に高いスコアを達成したと報告している。例えば、数学の国際的な競技会であるAIME 2026とHMMT 2026では100%という完璧なスコアを記録したとされている。他にも、大学院レベルの科学に関する質問応答ベンチマーク「GPQA Diamond」で94.44%、多分野の専門知識を測る「MMLU-Pro」で88.12%、そして画像とテキストの両方を理解する「MMMU-Pro」で79.48%といった高いスコアを達成したという。これらの結果がもし実際のタスクでも再現されるのであれば、このモデルは様々な「推論」が必要なアプリケーションにおいて非常に強力なツールとなる可能性がある。
しかし、これらの素晴らしいスコアには重要な注意点がある。これらの数値はVIDRAFT自身が報告したものであり、現時点では第三者機関による独立した検証は行われていない。ベンチマークのスコアは特定のテストデータセットにおける性能を示すものであり、実際の運用環境や、まだモデルが遭遇したことのない新しい種類の問題に対して、同様の性能を発揮するとは限らない。そのため、このモデルを実際のシステムに組み込むことを検討するシステムエンジニアは、必ず自分たちの手持ちのテストデータや、具体的な業務課題を用いてモデルの性能を評価し、その実用性を確認する必要がある。
Darwin-180B-RSIは「オープンモデル」として提供される予定であり、AIモデルの共有プラットフォームであるHugging Faceを通じて利用できるようになる見込みである。Hugging Faceのツールを使えば、モデルの重みを検索し、ダウンロードすることが可能になるだろう。自己ホスト、つまり自分たちのサーバーでこのモデルを動かすことを考えている場合、MoEアーキテクチャの特性を理解しておく必要がある。前述の通り、推論時に活性化されるエキスパートはごく一部だが、モデルの全てのパラメータ(1800億)をメモリに展開する必要があるため、それなりのメモリ容量を持つハードウェアが必要となる。しかし、「量子化」という技術を使ってモデルのサイズを小さくしたり、「エキスパートオフロード」というメモリ管理の工夫を用いたりすることで、より少ない資源でも運用できる可能性もある。具体的な運用要件は、Hugging Faceのモデルカードに記載される公式情報で確認することが推奨される。
Darwin-180B-RSIは、AIモデルの自己改善能力と効率的なアーキテクチャ設計の可能性を提示する、非常に興味深い進化である。特に、モデルが自ら学び、成長していく「再帰的自己改善」のアプローチは、将来のAI開発において重要な鍵となるかもしれない。このような最先端の技術動向を理解することは、システムエンジニアとしてAIを活用した新しいシステムやサービスを設計・開発する上で不可欠な知識となるだろう。