エッジでのAIアート:Txt2Img開発進捗報告

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

Midjourneyは広く一般に試されてきましたが、AI生成画像にはいくつかの問題が指摘されています。例えば、驚きの感覚から、Midjourneyで生成される画像は通常「クリーミー」で均質すぎるスタイルに偏りがちであること、また無料ユーザーの場合は画像がコミュニティに公開され、有料ユーザーでも画像が他の目的で「盗用」される可能性を排除できないことなどです。

Stable Diffusionはオープンソースのエコシステムから生まれ、プラグイン機能とユーザーの創造力の組み合わせにより、より多くの応用シナリオが探求できます。Midjourneyのように単に説明文から画像を生成するだけで満足せず、スタイルデザイナーとして扱うことで、楽しさと価値ある体験が始まります。

コミュニティでは、日本の漫画スタイル向けのChilloutMix、中国の水墨画スタイル向けのMoXin、さらには映画スターの顔を模倣したモデルなど、多くの高度にスタイライズされたモデルが探求されています。これらのトレーニングモデルを読み込むことで、より高度なカスタマイズが可能な画像生成ができます。商用利用の段階に進むと、市場の焦点はMidjourneyからStable Diffusionへと移ると考えられます。

Stable Diffusion環境をセルフホストしたい場合に必要なものは?

ハードウェア準備

1. WindowsパソコンできればWindowsパソコンが望ましく、Macはグラフィックカードドライバーで問題が起きやすいです。2. 6GB以上のNVIDIA GPUトレーニングを行う場合は最低12GBのビデオメモリが必要です。

3. メモリは16GB以上8GBでも動作しますが、コミュニティの優れたモデルを読み込むのは難しいです。構築手順と注意点。

1. Python環境をインストール。インストール時に「Add Python to PATH」にチェックを入れてください。

2. git環境をインストール

3. CMDで以下のコマンドを実行しstable-diffusionをダウンロードgit clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git

4. stable-diffusion web-uiを起動ファイルマネージャーでダウンロードしたwebui-user.batを管理者権限なしで実行

5. 前のステップの指示に従いIPアドレスを開くとユーザーインターフェースが表示されます– 上記の手順でエラーがあればGPTに相談して解決可能です。

小さな目標を設定 – 少数の画像で小さなモデルをトレーニング

理解すべき重要な概念

メインモデル

– 出力スタイルに影響するメインモデル。イラストではオリジナルのv1.5モデルを使用。

– civitaiで満足のいくモデルをダウンロードし、指定の場所…/stable-diffusion-webui/models/Stable-diffusionに配置可能。

プロンプトワード – 生成したい画像のテキスト説明を入力。例:「風化した中国の父親が飯碗を持っている」など。

サンプリングステップ – 一般的にステップ数が多いほど精緻になるが待ち時間も長くなる。通常20~40に設定。

縦横サイズ – 512×512が妥当なサイズ。特別な比率が必要なら変更可能。

生成 – 生成ボタンをクリックして実行。満足できなければ何度か試す。

シード – 現在の構図が良ければ、次回も同じシードを使うために画像を保存。

高度なオプション

Extra – チェックボックスをクリックして拡張オプションを開く。差分強度を上げると画像のディテールが増す。画像が単調なら値を上げるとよい。

モデルにスタイルを付加 – 生成ボタン下の赤い「show extra Networks」をクリックして追加パネルを展開。ミニモデルはcivitaiからダウンロード可能、または自分でトレーニングも可能。

– ハイパーネットワークは汎用的で、LoRAはポートレート生成に適している。

– ミニモデルはmodelsフォルダ内の対応フォルダに配置し、選択可能。

– 「スタイル」を選択すると、そのパラメータがプロンプトに追加され、後ろの数値は濃度を表す。

ミニ目標達成のための操作(トレーニング)

1. トレーニングセットの準備

– 約20枚の画像で良い小さなスタイルモデルがトレーニング可能。最初は特定スタイルの5枚でも十分。トレーニングセットの画像サイズはすべて同一である必要あり。2. ハイパーネットワークの作成 – トレーニング時に名前を入力してハイパーネットワークを作成。

3. 画像の前処理 – このステップでAIがトレーニング画像からテキスト説明を生成。– 前処理画像でトレーニング画像のフォルダと出力先フォルダを指定。– トレーニング画像のアスペクト比を調整。– サイズが異なる場合はBirmeで一括変更可能。– BLIPオプションにチェックを入れ、前処理ボタンをクリック。

各トレーニング画像の隣にtxtファイルが生成され、対応画像の説明が記載される。説明に誤りがあれば手動で修正可能。– 説明の正確さがトレーニング効果に影響。

4. トレーニング –作成したハイパーネットワークを選択。学習率は0.00005を入力。初期トレーニングは4つのゼロが適切で、後半は徐々に減らす。– テキスト説明と画像のディレクトリを指定。画像サイズを調整。2000ステップを選択。一般的に2000ステップのトレーニングは10シリーズGPUで1時間、30シリーズGPUで30分程度。「Training Hypernetwork」ボタンをクリックして開始。

5. 効果の確認トレーニング開始後、プレビューウィンドウで進行状況を確認可能。

トレーニング結果は…/stable-diffusion-webui/textual_inversion/date/…に保存され、ハイパーネットワークフォルダに結果がある。imagesフォルダにはトレーニング過程の画像が保存される。画像を見て適切なトレーニング結果を判断可能。

ハイパーネットワークフォルダ内の.pt拡張子ファイルがトレーニングスタイルモデル。– 例えばステップ1400の結果が良ければ、その.ptファイルをmodels/hypernetworksに移動してスタイルとして使用。

トレーニング結果を使って画像生成。「txt to img」や「img to img」で先ほどトレーニングしたスタイルを選択し生成。スタイルが弱ければファクターを上げる。

楽しんでください!

最近の最新動向と私の理解

最近、Stable DiffusionはDeepFloyd IFという新モデルを導入し、批判されてきたAI描画の一連の問題を大幅に改善しました。例えば、AI生成画像の空間関係の問題、手足に複数の指があるキャラクター、複雑な論理関係を表現できない点などです。率直に言って、画像AIの未来はオープンソースとプライベート展開にあると私は考えています。

人間社会は視覚レベルで多様かつ異なっており、特定のスタイルや傾向を持つツールだけでは広範囲をカバーできません。人間同士の美的感覚の違いはトレーニングセットの違いに起因し、人間とAIの間に差はありません。プライベート展開でトレーニングを行い美的独立性を確保することで、「独立性」がより大きな「多様性」を取り戻すことができます。

Zimaキャンペーンハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.