RunPod とは

RunPod は、クラウド GPU の処理能力を短時間だけ借りられるサービスです。

同じようなサービスはいくつかありますが、価格と使いやすさのバランスが最も良いように思います。

モデルの学習は、ただ画像生成する場合に比べて、高い処理能力と VRAM が必要な上、数十分から数時間単位で GPU を動かし続けることになります。

簡単な LoRA を作るだけなら数百円でできるため、気軽に使ってみてください。

今回は、RunPod で AI Toolkit を起動し、作成した LoRA をダウンロードするまでの流れを紹介します。

モデルごとの細かい学習設定やデータセットの作り方に関しては、それぞれ別記事で扱おうと思います。


全体の流れ

  1. RunPod のアカウント作成・クレジットの購入
  2. Pod を作る
  3. AI Toolkit の画面を開く
  4. Dataset をアップロードする
  5. Job を作る
  6. 学習を実行する
  7. LoRA ファイルを回収する
  8. Pod を止める

1. RunPod のアカウント作成・クレジットの購入

アカウントを作る

RunPod にアクセスし、Sign Up からアカウントを作成します。

クレジットを購入する

RunPod は、先にクレジットを購入して使う形です。

LoRA の学習を試すだけなら、10ドルほどで十分です。

  • 右上の + ボタンをクリック
  • $150以下にしたいときは Other を選択
  • 金額を入力して Go to Checkout に進む

使う必要はないですが、私の紹介リンクです。ここから登録して 10 ドル以上のクレジットを買うと、少し追加でもらえます。

RunPod の紹介リンク


2. Pod を作る

Pod とは?

RunPod にはいくつかの機能がありますが、今回は Pod だけ分かれば大丈夫です。

Pod は、クラウド上にある、カスタムできるレンタル PC のようなものです。

どの GPU を使うか、どれくらいの容量を確保するかを選んで借りる、という形です。

今回は、AI Toolkit が使える Pod を作り、ブラウザから AI Toolkit の画面を開いて LoRA を学習します。

Template を選ぶ

サイドバーから Pods を開き、Deploy をクリックします。

  • Search templates で AI Toolkit を検索
  • AI Toolkit - ostris - ui - official を選択
    • AI Toolkit の作者である Ostris 氏が作ったテンプレートです。
    • 同名のテンプレートが数多く出てくるので気をつけてください。

Template を選んだら、Set overrides から設定を少しだけ変更します。

  • Environment Variables を開く
  • AI_TOOLKIT_AUTH の値を、自分だけが分かるパスワードに変更

ここで設定した値は、AI Toolkit を開くときに使います。デフォルトのままだと、誰でも password で開けてしまうので、別の値を使いましょう。

GPU を選ぶ

Compute の欄には、多くの GPU が並んでいます。

どれを選べばよいか迷ってしまいますが、まず見るべきなのは VRAM です。

VRAM が足りないと、学習中に Out of Memory が出て処理できません。

基本的には高い GPU のほうが学習も速くなりますが、料金が二倍でも、二倍速いわけではありません。おサイフと残り時間と相談ですね。

私がよく使うのは、RTX A5000 と A40 です。

GPU VRAM メモ
RTX A5000 24GB 安く使えるのが良いところです。ただし、台数が少なく、時間によっては空いていないことがあります。
A40 48GB 48GB の VRAM を比較的安く使えます。24GB では足りないときはこちらを使います。

Deploy Pod

あとは Deploy Pod をクリックすると、Pod が作成されます。

この時点でクレジットの消費が始まります。データセットの準備などは前もって済ませておきましょう。


3. AI Toolkit の画面を開く

Pod が作られるまでしばらく時間がかかります。待ちましょう。

Pod が準備できると、🟢Ready の表示になり、AI Toolkit を開くためのリンクが表示されます。

HTTP Service をクリックすれば、AI Toolkit が表示されるはずです。

パスワードが求められたら、先ほど AI_TOOLKIT_AUTH に設定した値を入力します。

ここからは大まかにですが、AI Toolkit でのモデル学習の流れを見ていきます。


4. Dataset をアップロードする

学習に使う画像と caption file を AI Toolkit にアップロードします。

  • Dataset タブを開く
  • 右上の New Dataset をクリックする
  • dataset の名前を付ける
  • 画像と .txt ファイルをドラッグアンドドロップする

画像と、それに対応する caption file が読み込まれていれば OK です。


5. Job を作る

AI Toolkit では、Job と呼ばれる学習設定を作ってから、それを起動する、という流れで学習します。

ComfyUI でいう workflow のようなものですね。

ここで、base model、学習率、先ほど読み込んだ dataset などを設定します。

設定が完了したら、右上の Create Job をクリック

学習前であれば、何度でも設定し直せます。


6. 学習を実行する

Job ができたら、学習を実行します。

  • 右上の実行ボタン(▶)をクリック

エラーが出ず、Progress bar が進んでいれば、基本的には上手く動いています。

学習は途中で停止して、再開することもできます。

停止したあとにパラメータを書き換え、再度実行することもできますが、パラメータによっては壊れるので、よく分からないうちは、0 からやり直したほうがよいでしょう。


7. LoRA ファイルを回収する

設定にもよりますが、AI Toolkit は学習中に定期的に LoRA を出力してくれます。

上手く学習できているかは、実際に ComfyUI などで生成してみるしかありません。Loss Graph は、正直あまり参考にならないのです。

  • Checkpoints の欄に出力された LoRA が並びます
  • ダウンロードボタンをクリックして保存する

基本はこれで以上です。

Pod を削除すると、アップロードした dataset や作成された LoRA も削除されます。必要なファイルは、忘れずにダウンロードしておきましょう。
設定がすべて書かれた config file も、見返すために保存しておくとよいです。


8. Pod を止める

RunPod は起動している間、作業していなくても料金がかかります。

もったいないので、忘れずに止めましょう。

  • RunPod の画面に戻る
  • 動かしている Pod を開く
  • Stop で Pod を止める
  • 必要なファイルをすべて回収できていることを確認

Stop しただけでは、GPU の課金は止まりますが、Volume disk の storage 料金は残ります。

もう AI Toolkit を閉じてよければ、完全にシャットダウンする Terminate を行います。

  • Terminate で Pod を削除する

具体的なモデルの学習

ここでは主に、RunPod から AI Toolkit を起動するまでの部分を解説しました。

具体的に AI Toolkit でモデルを学習する流れに関しては、以下の記事を参考にしてください。