Webエンジニア向けプログラミング解説動画をYouTubeで配信中!
▶ チャンネル登録はこちら

【ITニュース解説】Cyberxdefend analysis-How Attackers Target AI Memory, Learning

2026年10月01日に「Dev.to」が公開したITニュース「Cyberxdefend analysis-How Attackers Target AI Memory, Learning」について初心者にもわかりやすく解説しています。

作成日: 更新日:

ITニュース概要

AIのメモリや学習機能がサイバー攻撃の標的になっている。一度不正なデータが書き込まれると、AIはそれを記憶・学習し、永続的に悪用される危険がある。ChatGPTへの攻撃事例も確認され、AIの継続学習が新たなセキュリティリスクを生んでいるため、対策が急務だ。

ITニュース解説

現代のAI、特に「エージェント型AI」と呼ばれる、自律的に学習し行動する能力を持つシステムは、私たちの生活やビジネスに革新をもたらしつつある。しかし、その進化の裏側で、AIのセキュリティに対する新たな脅威が急速に浮上している。AIが過去の経験を記憶し、それに基づいて学習し続ける「継続学習」という機能は、AIをより賢く便利にする一方で、攻撃者にとっての新たな標的となっているのだ。かつては解決済みと考えられていたAIの「記憶」の仕組みや、「使用を通じてスキルを学ぶ」というプロセス、さらにはAIの根本的な「学習の重み」といった部分が、今、サイバー攻撃の最前線となっている。

従来のAIは、一度セッションが終わるとその間のやり取りを忘れる「ステートレス」なモデルが多かった。しかし、継続学習を行うAIは、ユーザーとの会話や、自らが行ったタスクの経験を記憶し、次回の動作に生かす。この「記憶する」能力こそが、攻撃者にとって永続的な悪意ある情報を埋め込む絶好の機会を与えてしまう。セキュリティの国際的な基準を提供するOWASPは、このような永続的な攻撃を「メモリとコンテキストの汚染(ASI06)」として、通常のプロンプトインジェクションとは異なる新たな脅威と位置づけている。一度AIの記憶に不正な情報が書き込まれると、それはセッションをまたいで残り続け、AIの行動を永続的に歪める可能性があるのだ。

具体的にどのような攻撃が行われているのか、見ていこう。まず、AIの「記憶」が標的となった事例が多数報告されている。 2024年には、ChatGPTの記憶機能を悪用した「SpAIware」と呼ばれる攻撃が発覚した。これは、Webページやドキュメントに隠された不正な指示をAIがユーザーの好みとして記憶し、セッションを超えて保持し続けるというものだ。そして、その記憶された指示が会話データを攻撃者のサーバーに密かに送信するという、情報漏洩のリスクをはらんでいた。OpenAIはこの情報漏洩経路を修正したが、記憶ストレージを操作するプロンプトインジェクション自体は依然として未解決の問題だと認めている。 2026年1月には、「ZombieAgent」という概念実証攻撃が登場した。これはメールの添付ファイルを介して、AIエージェントの長期記憶に悪意あるルールを永続的に植え付け、間接的なプロンプトインジェクションをセッションを超えて持続させるものだった。 さらに、2025年後半には「MINJA」や「MemoryGraft」といった攻撃が研究された。これらは無害に見えるコンテンツ、例えばソフトウェアの「README」ファイルなどに悪意のあるエントリを仕込み、数週間後にAIエージェントがその「成功した経験」を呼び出してコピーすることで、システムを汚染するという、潜伏期間を持つ巧妙な手口だった。 2026年4月の「eTAMP」は、メモリに直接アクセスすることなく、クロスセッション、クロスサイトでのAIシステム侵害を初めて示した攻撃である。これは、AIが稼働する環境自体に不正な情報を埋め込むことで、AIの記憶を間接的に汚染するという、より広範な影響を持つ手法だ。 そして2026年7月には「OpenClaw」という攻撃が報告された。これは、実際のGmail連携を通じてテストされ、攻撃ペイロードの半分以上がスパムフィルターをすり抜けることに成功した。研究者たちはこの問題を公開したが、現時点では具体的な対策がまだ講じられていないという。

次に、AIが「使用を通じてスキルを学ぶ」プロセスを狙った攻撃がある。 2026年5月の「MemMorph」は、AIエージェントがツールを選択する際に、技術的な事実やポリシーを装った偽の記録を記憶に植え付けることで、AIの判断を偏らせるというものだ。わずか3つの不正な記録で、最大85.9%もの確率でAIが誤ったツールを選ぶように誘導できることが示された。これは、AIが経験から学習し、適切な行動を選択する中核的な意思決定ループ自体を攻撃するものである。 同じく2026年5月の研究では、「遅延型ポイズニング」が指摘された。これは、2,614もの多段階攻撃の軌跡を分析した結果、一部の汚染は初期の段階では通常の挙動と区別がつかず、ずっと後のインタラクションになって初めてその悪意が発現するという危険性を示している。

さらに深く、AIモデルの根幹である「重みレベル学習」を標的とした攻撃も現れている。AIの「重み」とは、学習によって調整される数値のことで、AIの知識や能力の基盤となるものだ。 2026年の「P-Trojan」は、AIが継続的にファインチューニング(追加学習)をしても、そのバックドアが消滅せずに残り続けるように設計された。Qwen2.5やLLaMA3といった大規模言語モデルにおいて99%以上の高い永続性を維持しながら、通常のタスク精度には影響を与えないという、極めて発見しにくい攻撃である。 2025年の「FAB」は、一見無害に見えるAIモデルが、ユーザーによるファインチューニングの過程で、隠された悪意のある動作を「オンにする」という、巧妙なバックドア攻撃だ。

これまでに特定された主要な攻撃や研究は約11件に上る。そのうち3件は実際にChatGPTやGmailといった実稼働システムに対してデモンストレーションされたものであり、残りは研究レベルの概念実証だ。現時点では、これらの手法を用いた明確な犯罪キャンペーンは確認されていないが、数週間にわたって潜伏するよう設計された攻撃が存在することを考えると、単にまだ発見されていないだけかもしれない。

これらの攻撃が示す共通のパターンは明確だ。AIが継続学習の能力を高め、より賢く、自律的になるほど、そのセキュリティリスクは「一時的な悪影響」から「一度書き込まれたら永遠に悪用され続ける」ものへと変化している。AIの「記憶」機能が最初に攻撃対象となったのは、それが最初に製品として搭載されたからに過ぎない。MemMorphがツールの選択を標的にしているように、次に狙われるのは「使用を通じたスキルの学習」だろう。そして、最終的には「重みレベル学習」も同様に標的となるのは時間の問題である。

このような状況は、AIシステムを設計する上で重要な意味を持つ。例えば、あるAIエージェントが、特定の決定を下した際に得られた結果(フィードバック)を受け取って学習する仕組みを持つ場合、攻撃者がそのフィードバックを偽造できれば、AIの意思決定メカニズムを不正に訓練できてしまう。これはMemMorphの攻撃パターンと似ており、AIの学習プロセスそのものが攻撃面にさらされることを意味する。

このような脅威に対して、AIシステムの設計段階から堅牢な防御策を組み込むことが不可欠だ。例えば、ユーザーごとにAIの記憶領域を分離する「ユーザーごとの領域」の確保、不正な情報が記憶に書き込まれた際に一定期間前の状態に戻せる「履歴に基づいたロールバック」機能、そしてAIの異常な挙動を検知して停止させる「サプライズゲート」のような仕組みが考えられる。

CyberXDefend社が問いかけているように、「もしAIが変化したり、予期せぬ行動をとったり、あるいは操作されたりした場合、私たちは何が起こったのかを正確に把握し、調査できるのか?」という問いは、今後のAIセキュリティにおいて極めて重要だ。継続学習とAIセキュリティは、今日認識されている以上に、はるかに密接な関係にあると言えるだろう。システムエンジニアを目指す皆さんにとって、AIの機能進化とセキュリティリスクは常に隣り合わせであることを理解し、両面から知識を深めていくことが求められている。

関連コンテンツ

関連IT用語