Webエンジニア向けプログラミング解説動画をYouTubeで配信中!
▶ チャンネル登録はこちら

【ITニュース解説】We configured residential proxies on our MCP server. They did nothing. Six releases later.

2026年09月29日に「Dev.to」が公開したITニュース「We configured residential proxies on our MCP server. They did nothing. Six releases later.」について初心者にもわかりやすく解説しています。

作成日: 更新日:

ITニュース概要

CrawlForge MCPサーバーは、CloudflareなどによるWebサイトのスクレイピングブロック回避機能を大幅強化した。6回のリリースで、通常のフェッチからステルスブラウザまで段階的に試す機能を追加。プロキシの活用やクッキー再利用も改善し、誠実な方法でデータ取得の成功率を高めた。

ITニュース解説

システムエンジニアを目指す初心者の皆さんにとって、インターネット上の情報を自動で収集する「ウェブスクレイピング」は、非常に興味深い技術の一つでしょう。しかし、現代のウェブサイトは、悪意のあるアクセスや過度な負荷から自身を守るために、さまざまな「ボット対策」を導入しています。特に「Cloudflare」のようなサービスは、ウェブサイトへのアクセスが人間によるものか、それともプログラムによるものかを厳しくチェックしています。この記事は、この強固な「壁」を、CrawlForge MCPサーバーというツールがいかにして突破できるようになったか、その進化を解説します。

以前は、ウェブサイトから情報を取得しようとすると、Cloudflareのようなボット対策サービスによって簡単にブロックされてしまうことが多くありました。単純なプログラムでウェブページを取得しようとすると、そのアクセス元IPアドレスがデータセンターのものであると判断されたり、ブラウザがウェブサイトと安全な通信を始めるための最初のやり取り(TLSハンドシェイク)がブラウザらしく見えなかったり、あるいはウェブページ上に表示される「私はロボットではありません」のような確認画面(インタースティシャル)が、JavaScriptというプログラムを動かさないと突破できないため、プログラムでは対応できませんでした。その結果、必要な情報ではなく、アクセスを拒否するエラーコードや、チャレンジ画面だけが表示されることが一般的でした。CrawlForge MCPサーバーも、かつてはこれらの壁に直面し、信頼性の高いデータ取得が困難でした。

しかし、最近の6回のリリースを通じて、CrawlForge MCPサーバーはこれらの課題を克服するための大きな進化を遂げました。その核となるのは、「ワンコール、スリートライ」というユニークなデータ取得の仕組みです。これは、単一のデータ取得要求に対して、必要に応じて三つの異なる段階を順に踏んで試行し、最も効率的かつ効果的な方法で情報を獲得しようとするものです。

最初の段階は、最も基本的なデータ取得方法である「プレーンフェッチ」です。これは、ウェブサイトに直接アクセスして情報を取得しようと試みるシンプルな方法で、成功すれば最小限のコストで済みます。しかし、もし最近そのウェブサイトでアクセスがブロックされた履歴がある場合、無駄な試行を避けるためにこの段階はスキップされることがあります。

プレーンフェッチが失敗し、ウェブサイトの壁に阻まれた場合、次に「impit」という新しいステップが導入されました。これは、ウェブブラウザ自体を起動することなく、Google Chromeがウェブサイトと安全な通信を始める際のやり取りを模倣する技術です。これにより、データセンターからのアクセスであっても、より人間らしい通信に見せかけることができます。この段階では、依然としてCrawlForgeという正直な名前を名乗りながらも、Chromeのような振る舞いをすることで、Cloudflareなどのボット対策を通過できる可能性が高まります。実際に、このimpitのステップだけで、これまでアクセスできなかったウェブサイトから情報を取得できるケースが増えました。

impitのステップでも突破できなかった場合、最終手段として「ステルスブラウザ」が起動されます。これは、実際のウェブブラウザ(Camoufoxと呼ばれるFirefoxベースのもの、またはChromium)をプログラムで操作し、人間がブラウザを使っているかのように振る舞わせるものです。このステルスブラウザでは、さらにいくつかの高度な工夫が凝らされています。

その一つが「クリアランスジャー」という機能です。これは、Cloudflareなどのボット対策を一度突破した際にウェブサイトから発行される特別なクッキー(cf_clearanceや__cf_bmなど)を、CrawlForge MCPサーバーが一時的に保存し、次回同じウェブサイトにアクセスする際に再利用するというものです。これにより、一度クリアしたチャレンジを、次にアクセスするたびに再度解く必要がなくなり、データ取得の速度と効率が大幅に向上しました。このクッキーは厳重に管理され、他のユーザーのログイン情報などが混ざり合うようなことはありません。

また、ステルスブラウザでは、Cloudflareの「Turnstile」のような、クリックするだけで人間であることを証明するタイプのチャレンジが表示された場合、自動的にそのチェックボックスをクリックして通過する機能も追加されました。これにより、プログラムが人間の行動を模倣し、より多くのウェブサイトの壁を突破できるようになりました。

ウェブサイトにアクセスする際に使用する「プロキシ」の管理も改善されました。プロキシとは、自分のコンピューターから直接ウェブサイトにアクセスするのではなく、一度別のサーバーを経由してアクセスすることで、自身のIPアドレスを隠したり、地理的な場所を変更したりする技術です。これまで、ユーザーが独自に用意したプロキシ設定が、必ずしも期待通りに機能しないという課題がありました。しかし、最新のバージョンでは、これらの問題が解消され、設定されたプロキシが確実に利用されるようになりました。特に、ユーザー名とパスワードによる認証が必要な住宅用プロキシ(一般的な家庭のインターネット回線からアクセスしているように見せかけるIPアドレスを持つプロキシ)も、適切に機能するよう改善されています。これにより、より人間らしいアクセス元からデータを取得できるようになり、ボット対策を回避する確率が高まりました。

データ取得が失敗した場合の「再試行」の仕組みも賢くなりました。以前は、ウェブサイトの壁に阻まれると、そのページからのデータ取得は諦めてしまうことがありました。しかし、今では、チャレンジに遭遇したり、エラーが表示されたりした場合、自動的にステルスブラウザを使った複数の再試行が行われるようになりました。これにより、プログラムが自律的に問題を解決し、より多くの情報を確実に取得できるようになりました。

CrawlForge MCPサーバーは、これらの技術を導入するにあたり、単にデータを取得できると主張するだけでなく、実際にどのように機能するかを厳密に「測定」することにこだわっています。さまざまなボット対策が施されたウェブサイトに対して、実際の動作を検証する専用のテストツール(ベンチマーク)が用意されており、どのステップでどのような結果が得られたか、また、ウェブサイトがプログラムによるアクセスを検知するための情報(フィンガープリント)が漏洩していないかなどが詳細に確認されています。例えば、ブラウザが自分を「画面表示なしで動いている状態」と認識させるような情報が漏れないようにするなど、細部にわたる対策が施されています。

重要なのは、これらの進化が、決して不正な行為を目的としたものではないということです。CrawlForge MCPサーバーは、「CAPTCHAを自動で解決する」ような高度な偽装や、「偽のチャレンジトークン」を生成するような行為は行いません。常に正直なユーザーエージェント情報(アクセスしているプログラムの名前)を提示し、ウェブサイトが「アクセスしてはいけない」と指定しているページの情報(robots.txt)を尊重します。そして、データ取得の各ステップがどのように行われたか、すべて「監査ログ」に記録されるため、どのような動作が行われたかを後から確認できます。

システムエンジニアを目指す皆さんにとって、このような技術は、単に情報を取得するだけでなく、インターネットがどのように動作し、いかにして防御されているかを深く理解するための貴重な教材となるでしょう。特に、自身のサーバーでCrawlForge MCPサーバーを運用し、自身のプロキシと組み合わせることで、ウェブサイトのIPアドレス評価によるブロックを回避し、より安定したデータ取得環境を構築できる可能性があります。ウェブスクレイピングは、技術的な挑戦と倫理的な配慮が常に求められる分野であり、このCrawlForge MCPサーバーの進化は、その両方に対応しようとする努力の結晶と言えます。

関連コンテンツ

関連IT用語

関連ITニュース