【ITニュース解説】Fastest LLM 2026: Mercury 2.5 Beats Luna and Haiku
2026年09月22日に「Dev.to」が公開したITニュース「Fastest LLM 2026: Mercury 2.5 Beats Luna and Haiku」について初心者にもわかりやすく解説しています。
ITニュース概要
2026年9月、LLM「Mercury 2.5」が最速モデルとして登場し、音声エージェントなど高速な応答が必要なシステム開発で強みを発揮する。汎用チャットや長文処理にはGPT-5.6 Lunaが適しており、用途に合わせたモデル選定が重要だ。
ITニュース解説
大規模言語モデル(LLM)の世界では、AIがどれだけ早く、どれだけ正確に、そしてどれだけ安くテキストを処理できるかが、その実用性を大きく左右する。2026年9月現在、この分野で特に注目を集めているのは、イノベーション・ラボ(Inception Labs)が開発した「Mercury 2.5」という新しいモデルである。このニュース記事では、Mercury 2.5を始めとする主要なLLM(GPT-5.6 Luna、Gemini 3.5 Flash-Lite、Claude Haiku 4.5)の性能を比較し、それぞれどのような用途に適しているかを解説している。
まず、LLMの性能を語る上で欠かせないのが「トークン」という単位だ。これはAIがテキストを扱う際の最小単位で、だいたい数文字から単語一つ分に相当する。AIの速度は「1秒あたりに処理できるトークン数(tok/s)」で表され、価格は「100万トークンあたりの費用」で示されることが多い。
この比較において、Mercury 2.5は速度の面で圧倒的な優位性を示している。イノベーション・ラボ自身は1秒あたり1,107トークンという速度を報告しているが、これは最適なハードウェアでの最大値であり、実際の利用環境に近い第三者機関の計測(OpenRouterのデータ)では1秒あたり440トークンという値が出ている。それでも、これは他の追随を許さない最速の数字である。Mercury 2.5の価格は、入力が100万トークンあたり0.20ドル、出力が0.75ドルで、これも競合と比較して非常に競争力がある。
Mercury 2.5がこれほど高速である理由は、その技術的なアプローチにある。一般的なLLM、例えばGPT-5.6 LunaやClaude Haiku 4.5のようなモデルは「自己回帰型」と呼ばれ、テキストをトークン一つずつ順番に生成していく。そのため、出力するテキストが長くなるほど処理時間も長くなるという特性がある。しかし、Mercury 2.5は「拡散型(diffusion LLM)」という新しいタイプのモデルであり、これは生成したいテキストのブロック全体を並行して推測し、複数のステップで徐々に洗練させていく方式を取る。これにより、出力の長さに関わらず高速な処理が可能となり、驚異的なスループット(単位時間あたりの処理量)を実現しているのだ。イノベーション・ラボは2024年にスタンフォード大学、UCLA、コーネル大学の研究者によって設立され、MicrosoftやNVIDIAなどから大規模な投資を受けている新進気鋭の企業である。
Mercury 2.5の速さは、特に「遅延が許されない作業」、つまり応答速度が非常に重要な場面で真価を発揮する。例えば、音声エージェントのようにユーザーの問いかけに瞬時に答える必要があるシステムや、プログラミングアシスタントがコードの提案を短い時間で繰り返すようなエージェントシステム、あるいはリアルタイムでの検索結果生成などだ。Mercury 2.5はOpenAIのAPIと互換性があり、ツール呼び出しや並列でのツール実行、構造化された出力といった機能もサポートしているため、既存の多くのシステムに容易に組み込むことができる。
一方で、他の主要なLLMもそれぞれの強みを持っている。
GPT-5.6 Lunaは、速度こそ1秒あたり129トークンとMercury 2.5には及ばないものの、入力が100万トークンあたり0.20ドル、出力が1.20ドルという価格設定で、何よりも「コンテキストウィンドウ」が非常に大きい点が特徴だ。コンテキストウィンドウとは、AIが一度に読み込んで理解できるテキストの量を示すもので、Lunaは「長文」に対応できる。そのため、人間が結果を読む一般的なチャットアプリケーションや、長文の資料をまとめて処理する必要がある作業には、Lunaの成熟したエコシステムと大規模なコンテキスト能力が依然として最適な選択肢となる。
Gemini 3.5 Flash-Liteは、Googleのエコシステムで開発を進める場合に有力な選択肢となる。1秒あたり382トークンという速度はMercury 2.5に次ぐ速さで、GoogleのVertex AIなどのサービスと連携しやすいという利点がある。価格は入力が100万トークンあたり0.30ドル、出力が2.50ドルであり、速度は速いが、出力トークンあたりの価格はMercury 2.5の約3.3倍と高めである。
Claude Haiku 4.5は、1秒あたり約82トークンと最も遅く、価格も入力が100万トークンあたり1.00ドル、出力が5.00ドルと最も高価だ。このモデルはスループット(処理量)を追求する用途ではなく、開発元のAnthropic社が重視する「指示への忠実な追従」という特性に特化している。AIに厳密な指示を与え、その通りに動作させたい特定のシナリオで、価格が高くてもその品質を優先する場合に選ばれる。
このように、各モデルには速度、価格、コンテキストサイズ、そしてAIの振る舞いという点で異なる特性があるため、利用する目的によって最適なモデルは変わってくる。
システムエンジニアとしてMercury 2.5の導入を検討する際には、いくつかの注意点がある。 まず、公表されている1,107トークン/秒という速度はあくまでベンダーの最適化された環境での数値であり、実際の利用環境(OpenRouterによる観測では440トークン/秒)とは異なる可能性が高い。そのため、自身のアプリケーションやプロンプトで実際に試してベンチマークを取ることが重要となる。 次に、Mercury 2.5には提供開始時の80%割引キャンペーンがあったが、これはすでに終了しており、現在は定価である入力0.20ドル/出力0.75ドルで計算する必要がある。 また、Mercury 2.5の品質が競合と同等であるというベンダーの主張も、自身の具体的なワークロードで検証することが望ましい。特に、Mercury 2.5の比較対象として挙げられている競合モデルが、古いバージョンである可能性も考慮する必要がある。 そして、Mercury 2.5のコンテキストウィンドウは26万トークンと、エージェントが短いやり取りを繰り返すような用途には十分だが、GPT-5.6 Lunaのような長文処理に特化したモデルと比べると小さいという点も理解しておくべきだ。
新しいLLMを自身のプロジェクトに適用する際には、以下の手順で評価すると良いだろう。 まず、Mercury 2.5のAPIはOpenAI互換であるため、既存のOpenAIクライアントのベースURLとAPIキーを変更するだけで簡単に試すことができる。イノベーション・ラボは無料で1億トークンのAPI利用枠を提供している。 次に、実際に運用中のプロンプトを200個程度選び、Mercury 2.5を含む複数のモデルで実行し、最初の応答までの時間、全体処理時間、生成されたトークン数を記録する。この際、平均値だけでなく、P50(中央値)やP99(99パーセンタイル値、つまりほとんどのユーザーが体験する遅延)といった指標で評価することが、ユーザー体験の観点からは重要である。 生成された出力の品質も、既存の評価基準で比較する。Mercury 2.5は安価な価格帯での品質同等を謳っているが、それが自身の用途で通用するかどうかを確認する。 最後に、入力トークンと出力トークンの比率を考慮した上で、それぞれのモデルの定価に基づきコストを再計算する。入力が多いRAG(Retrieval-Augmented Generation)のようなアプリケーションと、長い文章を生成するアプリケーションとでは、コストの評価が大きく変わる可能性があるためだ。ツール呼び出しや並列呼び出し、構造化出力などの機能が自身のスキーマ(データの構造)に正確に対応しているかも、明示的に確認する必要がある。
結論として、Mercury 2.5は拡散型という革新的な技術により、特に応答速度が求められるエージェントシステムやリアルタイムアプリケーションにおいて、速度とコストの両面で大きなメリットをもたらす可能性がある。しかし、GPT-5.6 Lunaのような大規模なコンテキストを扱う汎用モデルや、Claude Haiku 4.5のような特定の品質に特化したモデルも、それぞれのニッチな市場で価値を発揮し続ける。システムエンジニアとして、自身のプロジェクトの要件に最も合致するLLMを選択するために、それぞれのモデルの特性を深く理解し、実際にテストを行いながら最適な解を見つけ出すことが不可欠である。