Webエンジニア向けプログラミング解説動画をYouTubeで配信中!
▶ チャンネル登録はこちら

【ITニュース解説】Keeping One Character Consistent Across a Whole Article's AI Illustrations

2026年10月06日に「Dev.to」が公開したITニュース「Keeping One Character Consistent Across a Whole Article's AI Illustrations」について初心者にもわかりやすく解説しています。

作成日: 更新日:

ITニュース概要

AIで記事のイラストを生成する際、キャラクターやスタイルがバラバラになる課題をInkDooは解決する。具体的なキャラクター仕様をプロンプトに使い回し、主要な動作をさせ、スタイル要素を固定。可変部分を最小限にすることで、記事全体で一貫したAIイラストを生成する仕組みだ。

ITニュース解説

近年、AIを活用してイラストを生成する技術が注目されている。しかし、複数のイラストをまとめて生成しようとすると、キャラクターの見た目やイラストのスタイルに一貫性がなく、バラバラに見えてしまうという課題がある。例えば、ブログ記事全体に使うイラストをAIに任せると、同じキャラクターのはずなのに画像ごとに顔や服装が違ったり、絵柄が統一されていなかったりして、全体の印象がちぐはぐになってしまうことがある。

このような問題を解決するために開発されたのが「InkDoo」というツールだ。このツールは、記事の内容に基づいて、すべて同じキャラクターが登場する手描き風の解説イラストセットを生成する。この一貫性を実現するために、いくつかの工夫が凝らされている。

まず、InkDooのイラスト生成プロセスは、大きく分けて三つの段階からなる。これは「パイプライン」と呼ばれる一連の処理の流れだ。 第一段階では、記事の文章を「プランナー」と呼ばれる大規模言語モデル(LLM)が読み解く。LLMはテキストを分析し、どのアイデアを図示するべきか、各イラストをどの段落の後に配置するか、そして各シーンの具体的な内容を記述したデータ(JSON形式)を生成する。JSONは、プログラム間で情報をやり取りするための構造化されたデータ形式で、システムエンジニアにとっては馴染み深いものだ。 第二段階では、プランナーが生成したシーン記述に基づいて、「画像モデル」が実際にイラストを描画する。この際、厳格な「プロンプトテンプレート」という指示文のひな形が使われる。プロンプトとはAIに対する指示文のことで、テンプレートを使うことで、AIが描くイラストの基本的なスタイルを固定している。 第三段階では、「エクスポーター」と呼ばれる部分が、生成されたイラストのウェブ上のURLを記事の適切な位置に埋め込む。最終的にMarkdown形式(簡単な記法で文書を作成できる形式)やHTML形式のデータが出力される。この三つの段階すべてにおいて、イラストの一貫性を保つための仕組みが組み込まれている。

一貫性を保つための具体的な工夫の一つは、キャラクターの記述方法にある。キャラクターの見た目を曖昧な表現ではなく、非常に具体的で「数えられる」仕様として詳細に記述する。そして、その記述をそのまま、すべてのイラスト生成プロンプトに貼り付けるのだ。例えば、「かわいい耳」ではなく「二つの小さな三角の耳」のように、具体的な数や形を明記する。「中身は白、黒で塗りつぶさない」といった否定的な指示も、モデルが間違った解釈をしないように繰り返して記述する。また、キャラクターに「怠け者に見えるが意外と有能、無表情」のように三つの単語で性格を与えることで、デザインそのものを変えずにポーズに変化を持たせることも可能になる。

次に、キャラクターに「仕事」をさせるという点も重要だ。キャラクターを単なる背景の飾りではなく、各イラストの核心的な動作(例:引っ張る、運ぶ、ふるいにかける、押す)を実行させるように指示する。これにより、キャラクターは常に認識可能な程度の大きさで描かれることになる。キャラクターが小さく描かれたり、背景に溶け込んだりすると、その特徴が失われ、一貫性が保ちにくくなるため、このルールは一貫性維持に大きく貢献する。

さらに、スタイルの要素を内容とは別に固定するというアプローチも取られている。すべてのイラストプロンプトには、同じ「視覚的なDNA」ブロックが含まれている。これは、「純粋な白背景、ミニマルな黒い手描き風のゆらゆらした線画、少なくとも35%の余白、三色のみで書かれた手書きのメモ」といった、イラスト全体の基本的なスタイルを規定する部分だ。この三色(オレンジ、赤、青)にもそれぞれ役割が決められており、オレンジは主要な流れ、赤は重要な警告、青は補足情報に使うといったルールがある。グラデーションや影、プレゼンテーション資料のような表現は避けるように指示することで、スタイルの一貫性を強固にしている。一方、画像ごとに変わるのは「テーマ」「構造の種類」「核となるアイデア」「構図」「短いラベル」といったごくわずかなフィールドだけだ。このように、変化する要素を最小限に抑え、構造化することで、イラストセット全体がひとつのシリーズとして認識されるようになる。

ユーザーが独自のキャラクターの参照画像をアップロードできる場合、プランナーと画像モデルの間で情報伝達の非対称性が生じる。画像モデルは参照画像を直接見ることができるが、テキストベースのプランナーLLMは画像を見ることができないため、テキスト情報のみで処理する必要がある。このため、カスタムキャラクターには二つの記述が用意される。一つは画像モデル向けの「参照画像に示された通りにキャラクターを描く」という指示で、もう一つはプランナー向けの、ユーザーが入力した名前や見た目の説明に基づくテキストだけの記述だ。これにより、両方のAIが適切にキャラクターを扱えるようになる。

また、キャラクターの切り替えを再計画なしで行える工夫もなされている。InkDooでは、プランニングには費用がかからないが、画像生成にはクレジットが必要となる。ユーザーが途中で別のキャラクターを選んだ場合でも、再プランニングで追加の費用が発生しないように、プランナーが生成したシーン記述内のキャラクター名を、新しいキャラクター名に単純に置換する。例えば、「モチが溢れた受信箱の上に座っている」というシーンは、キャラクター名を「ドゥー」に置き換えるだけで、「ドゥーが溢れた受信箱の上に座っている」となり、改めてAIに指示を出す必要がない。

生成されたイラストを記事の適切な位置に配置するためには、画像の挿入位置を正確に指定する必要がある。プランナーは、各イラストを挿入すべき段落の最初の約20文字を「アンカー」として返す。エクスポーターは、記事のテキストをブロックに分割し、このアンカーと照合することで、指定された場所に画像を埋め込む。段落番号のようにAIが数え間違いを起こしやすい方法ではなく、実際のテキストの一部を基準にすることで、より頑健な配置が可能になる。

その他にも、運用上の課題への対応も行われている。例えば、画像生成には時間がかかるため、長時間かかる処理はバックグラウンドジョブとして実行し、クライアント側は定期的に状況を確認する。もし処理が失敗したり滞ったりした場合は、自動的にクレジットが返金される仕組みだ。また、セットの中の一枚だけが意図しないイラストになった場合でも、その一枚だけをプロンプトを編集して再生成できる機能も備わっている。手書きのメモが記事の言語に合わせて(中国語の記事には中国語のメモ)表示されるように、多言語対応も考慮されている。

これらの工夫から得られる重要な教訓は次の四点だ。 第一に、一貫したキャラクターを複数のAI画像で使いたいなら、キャラクターを具体的で数えられる視覚的仕様として記述し、その記述文字列をすべてのプロンプトで再利用すること。 第二に、キャラクターを単なる装飾ではなく、画像内で主要な動作を実行させることで、常に認識できる十分な大きさで描かれるようにすること。 第三に、スタイルの基本要素を固定したブロックとして扱い、画像ごとに変化する変数を少なく、かつ構造化すること。 第四に、プランナーが見ることができない参照画像がある場合は、そのテキスト版の記述(テキストツイン)を用意すること。

これらの技術的なアプローチは、AIを活用したシステム開発において、単に生成能力を高めるだけでなく、その結果物の一貫性と品質を管理するための、具体的な設計思想と実装方法を示している。

関連コンテンツ

関連IT用語

関連ITニュース