日本語画像生成の品質とライセンスを分けて評価する
今回やったこと
画像生成モデルを業務に使う判断では、絵の品質や生成速度だけでなく、ライセンスと出力の扱いも確認する必要がある。検証記録では、日本語の見出しや図解ラベルを生成できるモデルを試した後、非商用条件が収益サイトでの利用に合わないと判断して、モデルと関連ファイルを削除している。品質が高いことと、運用に採用できることは別の判定にした事例である。
ここに記す個別の実測値は、検証概要に基づく。モデルの現行ライセンスや配布状態を一般化するものではなく、当時の試行についての記録として扱う。
文字品質がよくても採用条件は満たさない
検証対象のQwen-Image-2.1は、日本語の見出し、サムネイル、図解ラベル、縦書き吹き出しの生成品質が良く、RGBA透過にも対応していた。ComfyUI v0.37.0の標準ノード TextEncodeQwenImage21 で動作し、Turbo 6stepでは1枚あたり約38秒という記録がある。一方で、Turbo LoRAを標準の LoraLoader で適用しないという制約も確認された。
プロンプトの書き方にも差が出た。透過の指示はプロンプトの先頭に置くと機能したが、末尾では白背景になった。stickerという語を入れると、透明を示す市松模様そのものを画像に描く結果になったという。生成物を目で確認するだけでなく、透過チャンネルが本当に残っているか、背景が意図どおりかを出力ファイルで検査する必要がある。
採用を止めた決定要因はライセンスだった。記録ではQwen Research Licenseが非商用のみで、同時に試したViggle Turbo LoRAも同条件だった。収益を得るサイトへ混ざる事故を避けるため、2026年9月26日にモデル、関連するカスタムノード、生成PNGを削除した。画像の見た目がよいという評価を、商用利用可能という意味に読み替えなかった。
代替候補も同じ条件で比較する
代替として試したMing-Image 0.1 Designは、記録上MITライセンスで商用利用可能だった。しかし、日本語文字の誤りが残り、3シード中2回で「ローカル」が「ローガル」になり、「ひとり旅」が「ことり旅」、「プロンプト」が「プロメジト」と出た。24stepでも改善しなかったため、文字を含む素材には採用しなかった。絵としての品質がよいこと、商用利用できること、日本語文字が実用水準にあることを別々の軸で判断した。
記録には、テキストエンコーダーのINT8量子化版がCPUで動いたこと、パッチなしで動作したこと、頼んでいない動画サービスのロゴが描かれる傾向も残されている。またモデルの32GBファイルも同日に削除された。こうした点はモデル比較の条件として有用だが、特定の実行環境や当時のバージョンに依存するため、別環境での再現性を保証する値としては扱えない。
画像モデルの評価表を作るなら、最低限、次の項目を別列で記録すると判断を混ぜずに済む。
| 評価軸 | 確認する内容 |
|---|---|
| 表現品質 | 日本語の誤字、構図、意図しないロゴや模様 |
| 技術条件 | ノード、量子化、速度、VRAMやファイルサイズ |
| 出力仕様 | 透過チャンネル、背景、サイズ、保存形式 |
| 利用条件 | モデル本体と追加LoRAそれぞれのライセンス |
| 運用判断 | どの用途に採用し、何を削除・保留したか |
やってみてわかったこと
モデル選定は「最もきれいな画像を出したもの」を選ぶ作業ではない。出力を使う場所に対して利用条件が合うか、必要な形式を安定して出せるか、日本語を含む場合に誤字を許容できるかを同時に満たす必要がある。ライセンスが合わない時点で候補から外す判断は、後工程で画像を差し替えるコストや権利確認のやり直しを避ける。
検証時は、モデルカードやライセンス本文を保存し、モデル本体と追加学習データの条件を個別に確認する。代表的なプロンプトを複数回生成し、画像の見栄えだけでなく透過や文字を検査する。そのうえで採用・不採用の理由と削除対象を台帳へ残せば、後から同じモデルを誤って持ち込む可能性を下げられる。この記録で確認できる結果は当時の環境に限られるため、再導入を検討する場合はライセンスと現行配布条件を改めて確認する必要がある。
更新履歴
- 2026-09-29: 起稿。具体的な試験条件と結果は検証記録に基づく。