Key points are not available for this paper at this time.
テキストから画像へのモデルは、ユーザーが自然言語を通じて画像生成プロセスを指導できることにより、新しいレベルの創造的柔軟性を提供します。しかし、これらのモデルを使用して、多様なプロンプト間で同じ対象を一貫して描写することは依然として難題です。既存のアプローチは、特定のユーザー提供の対象を説明する新しい単語を教えるためにモデルをファインチューニングしたり、モデルに画像条件を追加したりします。これらの方法は、対象ごとの長期最適化や大規模な事前トレーニングを必要とします。さらに、生成された画像をテキストプロンプトと整合させるのが難しく、複数の対象を描写するのにも苦労します。ここでは、事前トレーニングされたモデルの内部活性を共有することにより、一貫した対象生成を可能にするトレーニング不要のアプローチ、ConsiStoryを紹介します。画像間の対象の一貫性を促進するために、対象駆動型の共有注意ブロックと対応に基づく特徴注入を導入します。さらに、対象の一貫性を維持しつつレイアウトの多様性を促すための戦略を開発します。ConsiStoryをさまざまなベースラインと比較し、単一の最適化ステップを必要とせずに対象の一貫性とテキストの整合性において最先端の性能を示します。最後に、ConsiStoryは多対象シナリオに自然に拡張でき、一般的なオブジェクトに対するトレーニング不要のパーソナライズを可能にします。
Tewel et al. (Fri,) はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: