【ITニュース解説】Four Levels of Using an LLM: From Chat to Agents
2026年09月21日に「Dev.to」が公開したITニュース「Four Levels of Using an LLM: From Chat to Agents」について初心者にもわかりやすく解説しています。
ITニュース概要
LLMの利用には4つのレベルがあり、チャット利用から高度なエージェント構築まで複雑性が増す。レベル1はチャット、レベル2はAPI呼び出し、レベル3は事前に手順が書けるワークフロー、レベル4はLLMが動的に次ステップを決めるエージェントだ。エージェント構築にはループや実行環境の所有者に応じた4つの方法がある。どのレベルを選ぶかは要件と、予測困難性やテストの難易度を考慮し決定する。
ITニュース解説
大規模言語モデル(LLM)は、ChatGPTのようなチャット形式で使うだけでなく、システムに組み込んで様々な作業を自動化できる。この解説では、LLMの活用方法を4つのレベルに分け、特に「エージェント」と呼ばれる高度な自動化システムを構築する際の具体的なアプローチについて詳しく説明する。システムエンジニアを目指す人にとって、LLMをどのようにシステムに組み込むか、その選択肢とそれぞれの特徴を理解することは非常に重要である。
LLMの利用には、大きく分けて4つのレベルがある。まずレベル1は、プロバイダーが提供するチャットインターフェースをそのまま利用する方法だ。ChatGPTやClaude、Geminiといったサービスを、個人が必要な時に開いて使うのがこれに当たる。これは最も手軽な利用方法であり、他のレベルに劣るものではなく、目的が異なるだけである。もし、自動で動作するシステムを構築したい場合は、レベル2からスタートすることになる。
レベル2は、単一のAPI呼び出しで完結するシステムを指す。これはLLMに一度指示を送り、その結果を受け取るだけで済むような、比較的シンプルなタスクに適している。例えば、特定のテキストを要約したり、質問に答えたりするような用途が該当する。
レベル3は「ワークフロー」と呼ばれる利用方法で、LLMと複数のツールを連携させるが、その連携手順(コードパス)は事前に開発者が完全に記述する。例えば、入力された情報を分類し、その分類に応じて異なる処理経路に振り分けるようなシステムがこれに該当する。モデルは選択肢の中から次のステップを選ぶが、その選択肢自体やそれぞれの経路はコードで明確に定義されているため、実行されるパスを事前に全て描くことができる。複雑な処理を自動化しつつも、予測可能性を保ちたい場合に適している。
そして最も高度なのがレベル4、「エージェント」である。エージェントは、LLMが実行時に自ら次に何をすべきか、どのツールを使うべきかを動的に判断し、タスクの達成方法を制御するシステムである。ワークフローと異なり、エージェントの実行パスは事前にコードに書かれていない。モデルがその場の状況に応じて計画を立て、実行し、必要に応じて計画を修正しながらタスクを進める。これにより、非常に複雑で予測困難なタスクにも対応できるようになるが、その分、システムの動作を事前に完全に予測することが難しくなるという側面もある。
ワークフローとエージェントの境界線は、「実行が始まる前に、考えられる全てのパスをコードで書き出せるかどうか」で判断できる。もし全てのパスを事前に設計できるなら、それはワークフローだ。しかし、実行するまで具体的なパスの形が決まらないような場合は、エージェントとなる。
エージェントを導入すべきかどうかは、いくつかの質問で判断できる。まず、タスクが複雑すぎて手順を事前に書き出せないか。次に、その結果が構築にかかる時間とコストに見合うか。さらに、その仕事がLLMの得意な分野か。そして最後に、適切なガードレール(安全装置)を設けても、その仕事をLLMに委譲する価値があるか、ということだ。もしこれらの質問のどれか一つでも「いいえ」であれば、よりシンプルなワークフローに留まる方が賢明だとされている。特に、データの削除や金銭の請求といった取り消しが難しい操作を伴う場合は、人間によるレビューのステップを組み込むなどのガードレールが必須となる。ガードレールを設けた上で、それでもなお自動化のメリットが大きい場合にのみ、エージェントを選択すべきである。
エージェントを構築すると決めた場合、その実装方法も複数ある。ここからは、特に複数の人が使うシステムや外部に提供するシステムを想定した、エージェント構築の4つの方法を解説する。
1つ目は「ハンドロールループ」だ。これは、開発者自身がLLMとのやり取りを駆動するループ(いつ停止するか、どのツールをどの順序で呼び出すか、エラーが発生した時にどうするか、何を記録するかなど)の全てを自分で記述する方法である。システム全体を完全に制御したい場合に選ばれる。
2つ目は、プロバイダーのSDK(ソフトウェア開発キット)に組み込まれた「ツールランナー」を利用する方法だ。この場合、開発者はLLMに提供するツールの具体的な処理内容(ツールボディ)だけを記述し、LLMとの対話サイクル(ラウンドトリップ)はSDKが自動で処理する。特定のツールだけを使わせたい場合や、各ステップで承認プロセスやエラー処理を挿入したい場合に適している。
3つ目は「エージェントSDK」と呼ばれる方法だ。これは、ファイルアクセス、コマンド実行、検索といったコーディングエージェントが持つ既存の機能をパッケージ化したもので、開発者はプロンプトと設定を記述するだけで、これらの組み込みツールを活用できる。ファイル操作やコマンド実行が伴う作業をLLMに丸ごと委譲したい場合に、開発の手間を大幅に削減できる。ツールランナーと似ているが、エージェントSDKはあらかじめ多くの強力なツールを含んでいる点が異なる。
4つ目は「マネージド」だ。これは、開発者がエージェントの設定(構成)を記述し、その実行とインフラの管理を全てプロバイダーに委ねる方法である。開発者がインフラの運用に関わりたくない場合や、実行ごとにクリーンな環境が必要な場合、あるいは定期的なスケジュールで実行したい場合に非常に有用だ。
これらの方法を選ぶ際には、コストについても考慮が必要だ。自分のサブスクリプション内でLLMを利用している間は月額料金に含まれることが多いが、API経由で外部のユーザーにサービスを提供する場合、利用量に応じた課金体系に移行することが一般的だ。エージェントは1つのタスクを完了するためにLLMを何度も呼び出すため、想定以上にコストが増大する可能性がある。そのため、実際に運用する前に、代表的なジョブを実行して入力・出力トークン数を測定し、月間の実行回数を掛けて費用を概算しておくことが重要である。そして、適切なモデルを選び、費用の上限を設定し、利用状況を可視化する仕組みを導入することが強く推奨される。
まとめると、LLMの活用は、手軽なチャットから高度な自動化エージェントまで多様なレベルがある。どのレベルを選ぶかは、タスクの要件と複雑性、そして開発者がどこまで制御したいかによって決まる。特にエージェントを構築する際には、タスクの性質、費用対効果、そして安全性(ガードレール)を慎重に検討し、最適な構築方法(ハンドロールループ、ツールランナー、エージェントSDK、マネージド)を選択することが、成功するシステム開発の鍵となる。