Webエンジニア向けプログラミング解説動画をYouTubeで配信中!
▶ チャンネル登録はこちら

【ITニュース解説】El día que todos nuestros agentes dejaron de funcionar

2026年09月30日に「Dev.to」が公開したITニュース「El día que todos nuestros agentes dejaron de funcionar」について初心者にもわかりやすく解説しています。

作成日: 更新日:

ITニュース概要

プレゼン中にAIエージェントが急停止。原因は外部AIモデルのリソース枯渇だった。サービス提供元が停止してもシステムが止まらないよう、複数のAIモデルやプロバイダを状況に応じて自動で切り替える仕組みを導入。これにより、単一への依存を避け、安定したサービス提供が可能になった。

ITニュース解説

とある企業Kanvasでの出来事だ。彼らは重要なプレゼンテーションの最中に、開発したAIエージェントが全て突然機能しなくなるという事態に直面した。前日のテストは全て成功しており、製品を動かすシステム内部には何の異常も見られなかったため、担当者は非常に困惑した。すぐさま調査を行った結果、Googleから「429 RESOURCE_EXHAUSTED」という新しいタイプのエラーが報告されていることが判明した。このエラーは、AIモデルへの利用が一時的に急増した際に、そのモデルを提供している外部のサービスが「リソース(計算能力やメモリなど)を使い果たしてしまった」ために発生した問題だった。

この出来事は、Kanvasがこれまで長年システム開発で培ってきた「システムが常に動き続けること」という、いわゆる「高可用性」の考え方に、新たな課題を突きつけた。Kanvasはこれまで、自社でコントロールできるシステムの核となる部分、例えばアプリケーションのプログラムコード、データを保存するデータベース、他のシステムと連携するためのAPI(データのやり取りをする窓口)、そしてこれら全てを動かすためのインフラストラクチャ(サーバーやネットワークなどの基盤)については、非常に厳重な対策を講じてきた。もしシステムの一部に問題が発生しても、すぐに原因を特定し、別のシステムに処理を引き継がせたり、アクセスが増えた際には自動的にサーバーの数を増やして対応したり、システムの状態を常に監視して異常があればすぐに対処したりと、さまざまな技術を使ってシステムが止まることなく安定して動き続けるよう努めてきたのだ。これらの対策は、システム開発において「システムがいつでも使える状態にあること」を保証する「高可用性」を実現するためのものだった。

しかし、近年急速に発展しているAIの技術を自社の製品に深く組み込むようになってから、Kanvasはこれまでの高可用性の考え方では対応しきれない新たな問題に直面した。AIエージェントの賢い機能は、外部のAIプロバイダーが提供する高度なAIモデルに大きく依存している。たとえKanvas自身のインフラやAPI、データベースといったシステムが完璧に稼働していても、もしその外部のAIプロバイダーのサービスが停止したり、今回の事件のように彼らのリソースが枯渇してしまった場合、KanvasのAIエージェントはたちまち機能しなくなってしまうのだ。これは、システムの重要な一部が自分たちの管理下にない、つまり「ブラックボックス」となってしまうことを意味する。これまでのシステムでは、問題があれば自分たちで調査し、解決策を実行できたが、外部サービスに依存する部分については、そのサービス提供元の信頼性を信じるしかない状況になってしまう。今回の事態は、その「信頼」だけでは不十分であり、外部依存がシステム全体の可用性における新たな弱点となりうることを痛感させる結果となった。

この深刻な問題に対して、Kanvasのチームは「ルーティング」という概念を導入して解決を図った。具体的には、「フォールバック」という戦略をこのルーティング機能に組み込んだ。フォールバックとは、「もし最初の方法がうまくいかなかったら、次に用意しておいた別の方法を試す」という考え方だ。

新しい仕組みでは、AIエージェントに対するリクエスト(ユーザーからの要求や命令など)がシステムに送られてくると、まず「メインとなるAIモデルA」を使って処理を試みる。もしモデルAが何らかの理由で利用できなかったり、エラーを出したりした場合でも、そのリクエストは途中で失敗することなく、そこで処理が中断されることもない。システムは自動的に「次に利用可能なAIモデルB」へと処理を切り替えて、再度リクエストの処理を試みる。さらに、もしモデルAとモデルBが同じAIプロバイダー(サービス提供元)のモデルであり、そのプロバイダー全体に問題が発生しているような状況、つまり複数のモデルが同時に使えないような場合であれば、システムはさらに賢く判断し、「全く別のAIプロバイダーCが提供するモデルD」へと処理を移して、リクエストが成功するまで試行を続けることができるようになった。

この仕組みは、目的地へ向かう際に複数の経路を用意しておくようなものだと考えるとわかりやすい。もしメインの道が渋滞していたり、工事で通れなかったりしても、すぐに別の道に切り替えることで、必ず目的地にたどり着ける可能性が高まる。Kanvasのシステムは、この「複数の道(AIモデルやプロバイダー)」を事前に用意し、もし最初の道が使えなかった場合に、自動で別の道を選ぶ「ルーティング」の機能を持つようになったのだ。これにより、特定のAIモデルやプロバイダーに障害が発生したとしても、システム全体が停止することなく、AIエージェントの機能を安定して提供できるようになった。

今回の経験から、Kanvasが学んだ最も重要な教訓は、「システムが常に安定して動き続ける状態(高可用性)を真に実現するためには、たった一つのAIモデルや、たった一つのプロバイダーに全てを依存させてはいけない」ということだ。

彼らは現在、同じプロバイダーから複数のAIモデルを利用できるようにするだけでなく、全く異なる複数のプロバイダーが提供する様々なモデルを組み合わせて利用できるような体制を整えている。これにより、もしある特定のプロバイダーが問題を起こしても、すぐに別のプロバイダーのモデルが代替として機能できるようになり、システム全体の停止リスクを大幅に低減できる。

この新しいアプローチは、Kanvasにさらに新たな可能性をもたらした。これまで大手の閉鎖的なAIモデルに頼りがちだったが、今後はより多様な選択肢を柔軟に試せるようになる。例えば、費用が安価なオープンソースのAIモデルや、特定の用途に特化した代替プロバイダーのモデルなど、さまざまな種類のAIモデルを組み合わせて利用できるようになるのだ。これにより、AIエージェントの種類や用途に応じて、最も適したモデルやプロバイダーを選び、最適なパフォーマンスとコスト効率を実現できる可能性がある。Kanvasはこのルーティング機能を既にシステムに実装し、現在、テスト段階に入っている。彼らはこれからも、開発の現場で直面する課題と、それらをどう解決していくかの経験を積極的に共有していく予定だ。

関連コンテンツ