Ganyu Zou氏らの研究チームは2026年10月8日(現地時間)、テキスト-画像生成 (T2I) における従来のプロンプト最適化の限界を指摘し、構造化されたデザイン空間サンプリングによるロゴ生成手法「DOGS (Design-space prompting with an Originality-aware GFlowNet Sampler)」を発表した。この手法は、認識性、美的感覚、そして既存のロゴとの独自性を高め、商標権侵害リスクを大幅に低減する。

研究チームは、テキスト-画像生成におけるプロンプト最適化が、主に言語空間でのテキスト書き換えとして追求されてきたと指摘する。しかし、ロゴ作成のような構造化された視覚デザインタスクでは、短いユーザー指示ではほとんどのデザイン決定が未指定のままとなり、リレーショナルな事前知識がエンコードできない上、保護されたマークが複製される非制御チャネルを残すため、この言語空間の定式化は不向きであると論じている。

これに対し、研究チームはロゴ生成のプロンプトを構造化されたデザイン空間内でのサンプリングとして再定義し、「DOGS」として具体化した。DOGSは、実世界のロゴの大規模なコーパスから、経験的な共起を記録する型付けされたグラフ構造のデザイン文法を採掘する。その後、GFlowNetサンプラーが、認識性、美的感覚、コーパス相対的な独自性を組み合わせた最終報酬に比例する確率でデザイングラフを生成する。

このシステムでは、各スロットが閉鎖されたデザインレベルの語彙からのみ要素を抽出し、侵害を誘発する、または有害なトークンは解析中に削除される。さらに、独自性報酬は既存のロゴとの近接性にペナルティを課し、設計段階で商標権侵害の回避を組み込んでいる。このアプローチにより、著作権侵害のリスクを低減しつつ、より独創的なロゴ生成を可能にする。

2つのオープンソースレンダラーと9つのベースライン手法との比較評価の結果、DOGSはより認識可能で美的、実質的により多様で、商標権侵害の傾向がはるかに低いロゴを生成することが示された。この研究は、BMVC 2026に採択されている。


参考: arXiv cs.CV — 2026年10月9日 13:00 (JST)

原文ハイライト

"DOGS produces logos that are more recognizable and aesthetic, substantially more diverse"

この記事をシェア
X はてブ LinkedIn