Webエンジニア向けプログラミング解説動画をYouTubeで配信中!
▶ チャンネル登録はこちら

【ITニュース解説】Qwen-Image 2.1 on a 48 GB Mac: ComfyUI tests and real examples

2026年09月23日に「Dev.to」が公開したITニュース「Qwen-Image 2.1 on a 48 GB Mac: ComfyUI tests and real examples」について初心者にもわかりやすく解説しています。

作成日: 更新日:

ITニュース概要

Mac上でQwen-Image 2.1の画像生成・編集能力を検証した。美しい画像を生成しつつ、背景変更や透過処理、テキスト生成など細かい指示への対応や処理速度、商用利用ライセンスに課題が確認された。

ITニュース解説

Qwen-Image 2.1は、画像を生成するだけでなく、既存の画像を編集する機能も一つのモデルに統合した最新のAIモデルだ。この記事では、このQwen-Image 2.1が、48GBのメモリを搭載したMacBook Proという現実的な環境で、どれだけ実用的に使えるのかを詳しく検証している。単に見た目がきれいな画像を生成できるかだけでなく、デザイン作業で本当に役立つ素材を、安定して、そして効率的に作成できるかが評価の重要なポイントとなる。

筆者が検証に使ったのは、Apple M5 Proチップを搭載し、48GBのユニファイドメモリを持つMacBook Proだ。この環境で、ComfyUIというAIワークフロー管理ツールを使い、Qwen-Image 2.1のモデルを動作させている。モデルは、メモリ消費を抑えるために最適化された「量子化版」を使用している。70億ものパラメータを持つこのモデルは、理論上でも14GB以上のメモリを必要とするため、Macの限られたリソースで動かすには、このような最適化が不可欠となる。MacのGPUはNVIDIAのCUDAとは異なるMPS(Metal Performance Shaders)という技術を使用しており、一般的なベンチマークの数値がそのまま当てはまるわけではないことにも注意が必要だ。

このモデルを利用する上で、非常に重要な注意点がある。Qwen Research License Agreementというライセンスに基づいて提供されており、これは非商用目的(研究や評価など)に限定されている。つまり、このモデルで作成した画像を、顧客の仕事や有料のプロダクトに直接使うには、別途商用ライセンスを取得する必要がある。ビジネスでの利用を検討している場合は、開発に時間やコストをかける前に、必ずライセンスの条件を確認するべきだろう。

実際のテストでは、20種類の画像生成を試みた。具体的には、基本的な画像生成、背景を透過したアセットの作成、既存の画像の編集、ポスターデザイン、そして高解像度画像の生成などである。それぞれの生成にかかる時間を計測した結果、1024x1024ピクセルの画像を生成する場合、一度目の実行(バックエンド起動後最初)では156.0秒、その後連続して実行すると平均で143.5秒かかった。さらに高解像度の1536x1536ピクセルになると、平均で343.5秒と、かなりの時間を要することが分かった。生成された画像は、指示の配置、正確なテキスト、色の維持などで失敗することもあったが、画像自体は多くの場合説得力のある見た目だった。

基本的な画像生成のテストでは、「クリーム色のマグカップが森林グリーンのノートの隣にある」という指示を出した。生成された画像はどれも見た目はきれいで説得力があったが、4枚中1枚しか「隣にある」という指示を正確に守れなかった。残りの3枚ではマグカップがノートの上に置かれてしまったのだ。これは、AIが美しい画像を生成できても、細かい位置関係などの指示を正確に理解するのが難しい場合があることを示している。

透過画像のアセット生成も試みられた。細かい針葉樹の枝の画像を、背景を透明にしてPNG形式で出力するように指示したところ、生成された画像は確かに背景が透明で、ウェブページに重ねて配置できる品質だった。しかし、画像の隅にはわずかながら透明度が完全にゼロではない部分が残ることもあった。実用上は問題ないことが多いかもしれないが、完璧な透過が求められる場合は、後処理が必要になる可能性もある。

画像編集のテストでは、生成したマグカップの画像を使い、「背景だけをクリーム色のスタジオ風に変更し、マグカップの色や形は変えない」という指示を出した。結果として、背景は指定通りに変わったものの、マグカップ本体の色が少し暖かくなったり、縁の位置がわずかにずれたりした。見た目には違和感がなくても、「製品の色は変えない」という厳密な指示には従えなかった。これは、AIによる編集が完全に元の画像を保持するわけではないことを示している。厳密な編集が求められる場合は、元画像と編集後の画像を比較し、必要に応じて手作業で修正する工程が重要となるだろう。

テキスト生成のテストも行われた。ポスターに特定の3行のテキストを正確に入れるよう指示したが、3枚中1枚しか指示通りのテキストを正確に生成できなかった。他の2枚は、一部のフレーズを重複して生成してしまったのだ。AIモデルは美しい文字を生成できる一方で、指定された文章を正確に、かつ重複なく配置するのには課題があるようだ。実用的なポスターや広告など、正確なテキスト情報が不可欠な場面では、画像生成AIで文字を生成するよりも、イラストだけを生成し、後からレイアウトツールでテキストを重ねる方が確実である。

高解像度の画像生成では、1536x1536ピクセルで生成すると、1024x1024ピクセルに比べて処理時間が大幅に増えることがわかった。また、解像度を上げても、画像の内容が必ずしも良くなったり、指示への忠実度が上がったりするわけではなかった。むしろ、高解像度にしたことで、低解像度では守られていたはずの構図指示が破られるケースも確認された。

これらの結果から、画像生成AIをシステムエンジニアの業務、例えばデザイン素材作成ツールとして使う上でいくつかの教訓が得られる。単に「生成速度」や「見た目の美しさ」だけでモデルの性能を評価するのではなく、「指示への忠実度(第一通過率)」や「完成までに必要な総時間(手動での修正時間を含む)」という視点での評価が重要となる。生成が速くても、指示に合致せず何度もやり直しが必要であれば、かえって総時間がかかってしまうことになる。

また、複数の参照画像をAIに与える場合は、それぞれの画像が「何のための指示なのか」を明確に伝える工夫が必要だ。AIはまだ人間の意図を完全に汲み取れるわけではないため、具体的な役割(例:この画像は色合いの参考、この画像は構図の参考)を割り当てることで、より意図に近い結果を得られる可能性がある。

最終的に、このQwen-Image 2.1はMacBook Pro上で十分な性能を発揮し、印象的な画像を生成できることが示された。しかし、それを実際の業務で「役立つアセット」として活用するには、モデルの限界を理解し、ライセンスを確認し、指示の出し方を工夫し、生成された画像を厳しく検証し、必要に応じて手動で修正する工程をワークフローに組み込むことが不可欠だ。単なる画像生成ツールとしてではなく、デザインやマーケティングのプロセス全体にどう組み込むかという視点を持つことが、AIを最大限に活用するための鍵となるだろう。

関連コンテンツ

関連IT用語

関連ITニュース