【AI】超低予算VTuber化について【セルフ受肉】
実は超低予算セルフ受肉(バ美肉)を遂げて配信活動を行っております。
「チャンネル登録と高評価、よろしくお願いします!」
やったこと&現在の配信環境について紹介
VTuberイラスト(立ち絵、ガワ)
まず、どうやって用意した?
AIイラスト生成
はい、これはもちろんAIイラストですね。
これまで培ってきた技術でStableDiffusionで作成。
アクセとか小物はDALLE3にやらせます。
これらの使い方についてはこの記事には特に書きません。
ControlNetとか駆使して上手いことやりましょう。
【StableDiffusion】オススメ拡張機能や便利ツール - 水を得たさかな
【StableDiffusion】WebUI1.6にして拡張機能とか整理 - 水を得たさかな
【StableDiffusion】雑な指示絵からイラストを生成 - 水を得たさかな
#さかなかおるART pic.twitter.com/8iNd7ZrlG2
— 🐟✏️ (@Sakana3ai) 2023年11月22日
ちなみにこのキャラ(ガワ1号機)は、私の幻塔のキャラを元にLoRAを作成をしたので、ファンアートなんかも自分で好きに生成でき、これって結構な強みだよなと思いました。
【StableDiffusion】ゲームのスクショからLoRA作成 - 水を得たさかな
#さかなかおるART pic.twitter.com/Yl2GgVS5wh
— 🐟✏️ (@Sakana3ai) 2023年11月24日
シンプルイズべすと#さかなかおるART pic.twitter.com/kVl5OjwPc1
— 🐟✏️ (@Sakana3ai) 2023年11月26日
イラストに動きをつける
金も技術もない人間が、一瞬で簡単な動きをつける方法。
だれでもVTuber
まず最初に使用していたのが、この「だれでもVtuber」というツールです。
画像を4枚用意するだけで、以下のような、まばたきや音声認識による口の開閉ができる簡易的なVtuberツール。
表情差分の作成はAIイラスト生成者の皆なら朝飯前だよね。
てst pic.twitter.com/lAxEFkQnbO
— 🐟✏️ (@Sakana3ai) 2023年11月19日
特に難しいことはなく、ヘルプのとおり画像を4枚ほおりこんで開始ボタンを押すだけです。
Talking Head Anime
1枚のイラストを一瞬でLive2Dのように動かすことができる「Talking Head Anime」という技術があります。
現在、これを用いてガワ2号機を動かしています。
配信用初号機もう捨てたらしい#さかなかおるART pic.twitter.com/TNew75IQI3
— 🐟✏️ (@Sakana3ai) 2023年12月17日
環境構築がやや面倒です。以下の動画を参考にしてください。
こういった面倒な手順を省いて利用できる、あわいろさんが作成された「Talking Head Anime 3 SW」というものがあります。
・モーションキャプチャの対応アプリ増
— あわいろ (@pale_color) 2023年12月5日
・VMC Protocol受信に対応
・複数のイラストを簡単に切り替え
・カメラが正面になくても補正可
・高解像度(1024px)対応
・NvidiaのGPUない環境でも動くの追加
・ポート番号変更で複数同時起動可
ダウンロードはこちらから 無料です!https://t.co/MKYDifIRLL
ポストにも書いてあるとおり、元から改良され、さらに「複数のイラストを簡単に切り替え」「カメラが正面になくても補正可」「高解像度(1024px)対応」などに対応。
また、事前に画像をレンダリングしておき、GPU負荷を下げることができる機能が魅力的ですね。
Talking Head Anime のコツ
Talking Head Animeですが、上手く動かすには設定に多少コツが要ります。
いやコツというか、正確にはREADMEに書いてあることをきちんと読みましょう。
https://github.com/pkhungurn/talking-head-anime-3-demo

自分も最初にこれを確認せずにやっていたので上手く動きませんでした。試しに使ってみたという人の動画を観ても、これを守っていないことが多いです。
画像の大きさ、そして、デフォルトの口の形は「あ」です。
これを守りましょう。
iFacialMocap
顔の動きのキャプチャには、iPhoneで利用できる「iFacialMocap」を使用しているのですが、デフォルトの状態では口の開閉がしづらいという感じでした。
軽い口の動きでもイラストの口の開閉が上手くいくように、iFacialMocap側のモーションウェイトを調整しましょう。
以下のサイトが参考になります。
特に口の開閉に関わってくる部分は、jawOpen、mouthSmile、mouthDimpleなどですね。
さらに手っ取り早い無料のガワ
そんな準備すらも必要なくVTuber配信する方法。
世の中には無料で使用できるガワが存在しています。
例えば、BOOTHでフリーのLive2Dのモデルを検索して、評価が高いものを見てみましょう。
このあたりをVTube Studioで動かしたら形だけはすぐに用意できますね。
そうは言ってもフリーのガワってどうなの?って?
先ほど並べたフリーのガワ、興味のない人は無料かどうかなんてわからないと思いませんか?私に紹介されて初めて見たものもあったのではないですか?
おそらく視聴者なんてそんなものなので、配信活動をしたいなら無料のガワでもなんでもよいので形だけ整えてさっさと配信したらいいと思いますね。
そもそも、結局は中身が勝負になってくるので、配信してなんぼである程度勝負できるようになってからしっかりすればよいのではないかと私は思います。
VC Clientの設定
バ美肉要素ですね。RVCを用いたボイチェンです。
これは以前に別の記事で紹介しています。
配信するための設定(変換遅延をごまかす)
今回はこれに加えて、VC Clientを使いつつ配信をするための設定を紹介します。
RVCの音声変換の質を高めるためにはCHUNK数を非常に高くする必要がありますね。

しかしながら、質を高くするほど処理に時間がかかり、変換された音声が出力されるまでに時間が掛かってしまいます。
動画コンテンツの場合は、動画と音声を別で撮っておき、後で編集でタイミングを合わせればよいですが、配信は遅延がありすぎて出来るわけがありません。
そこで私は普段、もものせさんの以下の動画を参考に、OBSを2つ立ち上げる方法でこの変換にかかる遅延をごまかしています。
ひとつのOBSから仮想カメラでもうひとつのOBSに映像を送って、その間にVCclientの変換にかかる時間分の遅延を設定して、映像と音声を合わせているわけですね。
ただこの方法、軽いゲームだったら良いと思うのですが、私が普段プレイしている愛すべきクソゲー幻塔とかだと、PCに非常に負荷かかかるうえに、MAPとかUIを開くとかでGPU負荷が大幅に変わってくるんですねこのポンコツゲームは。
そうすると、遅延を固定値で吸収することが難しくて音声と映像がずれまくってしまうことがあり、これが配信の質を下げる要因で困っています。
だって、驚くべきことが起こったときに、リアクションが遅れたりしまっているとか。これは配信としておもんないですよね。
1か月ほど配信してみて、やっと私の環境でリアクションがずれたりせず、配信の質と音声変換の質の両方が保てる設定が見えてきたところです。
RVC メリット・デメリット
メリットについては、
- 女の子の声で視聴者が嬉しい。
- コンプレックスがある地声をごまかすことができる。
とかですよね。まぁ自分の場合は地声を出すことに全く抵抗はないのですが、コンテンツとして今更出すことができなくなってしまいました。
抑えておきたいのは主にデメリットの方で、実際に配信してみてウザいと感じるのは、
- 歌えない。
これは配信で突発的にメロディーを口ずさめないということですね。
これは暇なときに歌っていたい私にとっては大問題です。
そもそもRVCのモデルが歌唱に対応していないのは論外として、今のモデル*私だとTUNE10くらいが普通の会話をするのに丁度よいのですが、歌う場合は、オク下で歌ってTUNEを12にする。または、原キーで歌ってTUNEを0にするなどしないと、キーがずれてしまうんですね。

配信中にTUNEの数値をいじれば歌えるのですが、これが面倒です。
- コラボができない(かも)
視聴者とのリアルタイムなコミュニケーションはもちろん、他者とのコラボレーション配信ができませんね。これは上を目指そうという方には大問題だと思います。
特にDiscordの通話とか、音声の変換に何秒もかかってたらできるわけないですよね。
という問題がありますが、先日「Parakeet.VC」という、わずか0.1秒で音声変換ができるボイスチェンジャーが発表されました。
実際に試したところ、音声の変換は確かに爆速なものの音質の方がまだちょっとという感じなのですが、AI技術の進化は速いので、音声変換に時間が掛かってしまうという課題は、待っていれば解消されるかもしれませんね。
今後の課題
このへんなんとかしたいところ。
圧倒的スペック不足
マジで困っているんだが、どうしようもない。
RTX3060ではもうどうにもならない感じ。
私の環境で、「OBS1 + OBS2 + VC Client + Talking Head Anime + CastCraft(コメント読み込んだりするやつ)+ 幻塔みたいな高負荷のGame」
これらを同時に起動してまともに動くわけないんすよね。限界です。
とにかくいろんな負荷を極限まで下げているのですが、Talking Head Animeは512*512pxで10FPSでしか動きません。
RTX4000番台とそれを動かせるPCがほちい。
ガワのアップデート
これも待っていればTalking Head Animeみたいな技術が進化して、Live2D不要になるのかもしれませんが、現状はとっととLive2Dに移行してくださいといった感じです。
Live2Dをお勉強するか、VRoidをお勉強して3Dに移行するかしたいところです。
他人に金を払って依頼するほどのことはしたくない。そもそもコミュ障だから依頼とかできません。
幻塔以外の配信コンテンツくれ
幻塔以外の配信コンテンツをくれ!!!
【園芸】2023年12月号
今年は秋らしい秋をすっ飛ばしてすっかり冬に。
さすがに少し肌寒いくらいになってきた pic.twitter.com/aYxm83vV23
— さかなかおる🌿 (@Sakana3k) 2023年11月11日
もう冬の定番の時期
今年はツワブキが奇麗に咲いている気がします。
ホウジャクくん
— さかなかおる🌿 (@Sakana3k) 2023年11月14日
今あまり良い花がなくて見かけなかったんだけど
そうかい、ツワブキは好きかい pic.twitter.com/KIylGE6R3G
園芸植物としてはツワブキはマイナーらしい。
カーメン君もポストしていましたが日陰でも咲くし、この時期たいへんきれいです。
あと食べられる。
ツワブキって日陰でもしっかり咲くから
— カーメン君@園芸超人 (@masterKahmen) 2023年11月24日
結構好き
品種もたくさんあるからもっと注目されても良いはずなのに。
最近園芸店での流通があまりありませんね pic.twitter.com/dITzTQHFP8
ツワブキに似た園芸植物としてリグラリアというのがあるので、それもオススメですね。
今年は冬の定番もガッツリ買いました。
ビオラ、葉ボタン、プリムラ、アリッサム。
やっぱりこのへんですね。
フロント部分、妹用の花壇
— さかなかおる🌿 (@Sakana3k) 2023年11月14日
冬の定番で埋め尽くしました
学級花壇としては良い感じでしょ? pic.twitter.com/frx5S7qGS9
プリムラはいろいろあるけど、なんか自分はマラコイデスが好きなんですよね。
プリムラ マラコイデス
— さかなかおる🌿 (@Sakana3k) 2023年11月28日
やっぱり自分はジュリアン、ポリアンサよりも、シネンシスやマラコイデスの方が好きなんだよなぁ pic.twitter.com/UviFRMvztw
シクラメンも欲しくて買ってしまいました。
シクラメンはやや出べそ植えにするのがポイント。
また花柄つみがちょっと特殊で、ねじって引っこ抜くようにするのが気持ちいいんですよね。
やっぱりシクラメン欲しくてひとつ買っちゃった
— さかなかおる🌿 (@Sakana3k) 2023年11月21日
ちゃんと株元が少し高くなるようにしてあるよ pic.twitter.com/ndOQ0Jwt50
去年からの子たちも元気
これは私の園芸師匠からわけて頂いたオキザリスのバーシカラーなんですよね。
そういえば、オキザリス バーシカラーが今年も咲いてたよ! pic.twitter.com/JeggTgUQ1l
— さかなかおる🌿 (@Sakana3k) 2023年11月16日
とか大事っぽいようなことを言いつつ、半地植え(レイズドベッドの中)で屋外放置だったのですが、無事に夏を越えたようです。
また、去年なんかの寄せ植えに入っていた八重のアネモネの球根を3個取っておいたのですが、それも植えてやったら2個は芽を出していて普通に成長して咲きそうな雰囲気です。
後はこれからの時期、去年たくさん植えつけたクリスマスローズが咲くかどうか楽しみです。
後は同じくキンポウゲ科で私が大事に育てているオキナグサたち。無事に夏は越えたぞ。来年みんな咲いてくれるかなぁ。
さらに春~初夏に向けてアリウムやチューリップの球根も仕込んでいるので楽しみしかない。
アジュガ再チャレンジ
アジュガが上手く育たない!
今年の夏が暑すぎたのもあるけど、春植えしたのはだいぶやられてしまいました(上手く育ってるのもあるけど)
秋植えで再チャレンジです。
アジュガで埋め尽くしたい(願望)木陰
— さかなかおる🌿 (@Sakana3k) 2023年11月14日
春にも同じこと言ってたんだけど、春植えしたのは夏が暑すぎて一部しか残らなかったんだよね
まぁ今年がやばすぎたのはあるけど
さらに土壌改良して秋植えで再チャレンジする
他の場所で育ってるやつも少し拝借して pic.twitter.com/srzBMHwCyP
バラの近くにアジュガはダメは間違い?
ちなみに先日、「アジュガはチュウレンジハバチを引き寄せるのでバラの近くに植えるのはNG」と聞いたことがあるという旨のポストをしていたところ、それは誤情報であると指摘されました。
一部の界隈では根強く言われていますよねこれ。私も先輩から聞いてそう思っていたのですが、どうやら違うらしい?です。
アジュガに集まるのはチュウレンジハバチではなくカブラハバチであり、バラには卵を産み付けません。
なお、このカブラハバチはアブラナ科の植物を食草とするので、本来気をつけるべきはこっちということらしい。
そこまで言及していませんが、前に見たガーデコジャパンの動画でも、アジュガを植えても薔薇の食害は見られなかったという検証結果があります。
私も調べた感じ、「バラの近くにアジュガを植えてはいけない」と決定づけるほどの根拠はないとするのが妥当な見解かと思いました。
畑の様子
畑は本当にすばらしい状態ですね。
ネギ、ダイコン、ブロッコリーやカリフラワーが採れてます。
大根びっくりするくらい育っててやばい
— さかなかおる🌿 (@Sakana3k) 2023年11月11日
家庭園芸にしては良く出来すぎなくらいでしょ
セニョールスティックも気がついたら育ってたので摘心
美味しそうだ pic.twitter.com/56zfVMz5v7
カリフラワー出来てきた
— さかなかおる🌿 (@Sakana3k) 2023年11月25日
カリフラワーは買うと高いから育てるのが本当に良いわ
てかなんで高いのかと思ってたけど、単純に需要がないから供給も少ないらしい pic.twitter.com/g6ftuANYop
ふへへ
— さかなかおる🌿 (@Sakana3k) 2023年11月28日
カリフラワーを収穫してしまった
ネギと大根も取り放題だ pic.twitter.com/Ntlt2SaiYB
ニームや木酢散布しかしていないので、これって「無農薬野菜」を名乗ってもいいんですよね?
ニームや木酢、定期的な散布をきちんとすれば確かに効果はありますね。
なお別にナチュラル思考とかではないのです。
別に天然志向じゃないけど、頻繁に庭や畑を見回りしたり、木酢ニームを散布したり、堆肥づくりすること自体が趣味だから無農薬である程度うまくいってる
— さかなかおる🌿 (@Sakana3k) 2023年11月28日
逆にそこ興味なくて無農薬だ!無肥料だ!とかやるのやめた方がいいよね
アスパラガスも冬を感じ取って枯れ始めました。完全に枯れたら刈り取って冬越しの準備をしてあげよう。
なお今年は畑でやろうとか言っていたローゼルは完全に失敗しました。
今年は畑で育ててるローゼル
— さかなかおる🌿 (@Sakana3k) 2023年8月15日
この時期こんなもんだっけ
ローゼルは種取るの面倒だけどジャムにすると美味いんだこれが pic.twitter.com/6g3W319JWQ
本当にひとっつも花が咲かなかったですね。
原因は日照不足だと思われる。ご覧のとおり塀のそばだし。
さらにはローゼルは短日植物なので、となりのアパートが夜も明るくてそれがダメだった可能性も高い。
やっぱガンガンに日の当たる表で育ててあげるしかないんだよなぁ。
はぁ、ローゼルのジャム作りたかった。
【StableDiffusion】雑な指示絵からイラストを生成
AIイラストでも線画を用意し、雑なバケツ塗りで色を指示することで、希望どおりの絵に近づけるのが非常に楽にできるということがわかった。
以下のイラストを例にそのやり方をメモしておく。
秋#AIイラスト #AIart pic.twitter.com/wP39wxwiCU— 🐟✏️ (@Sakana3ai) 2023年11月9日
友達がいないため、「こうできないか?」というのを対話型AIと相談して1人でやっているので、もっと効率の良いツールや方法があると思う。むしろ教えてほしい。
線画の用意

元となる絵を用意する
絵心のある人間は、まず希望の線画を描くところから始めればよいが、絵描きではない自分がいったいどうやって線画を用意するのか。
その辺のイラストをトレスしたら、それは問題になってしまう。
しかし、今はあるだろ。「DALL-E3」とか。
DALL-E3では、StableDiffusionのような難しいプロンプトや設定は必要なく、自然言語のみで希望の構図を生成することができる。
GPT4ユーザーであれば、欲しい構図になるように対話形式で少しづつ寄せていくこともできてしまう。
StableDiffusionに染まりきっていた自分は、一瞬「ズルいのではないか」とか馬鹿なことを考えたが、目的は良いイラストを生成することであって、わざわざStableDiffusionだけで完結する必要はない。OpenPoseを使うのも、GPT4&DALL-E3で自然言語で狙った構図を出すのも同じだろう。
DALL-E3はStableDiffusionに比べて動きがある(魂がこもっている)絵を出力しやすく、これを使わない手はない。
線を抽出する
DALL-E3が出力した絵から一体どうやって線画を用意するのか。
一応、「線画」と指示して白黒の絵を用意させているが、ここは別に白黒である必要はない。とりあえず欲しいのは構図だけ。

まずDALL-E3が出力した絵を、ControlNetのLineartにかける。
個人的にPreprocessorは「lineart_realistic」が一番良さそうだと感じている。

黒背景に白線の時点で手直し
今まで色つきのイラストにLamaCleanerをかけたり、画像編集ソフトで編集しまくっていたが、この時点で手直した方が圧倒的に楽。
後でこれがLineartの入力になるので、この「黒背景に白線」の時点で直す。
とりあえずこれは、特別こうしたいとかないのでキレイにしただけ。

ここまでくれば、これをLineartの入力にして、「ControlNet is more important」で生成すれば毎回同じ構図でイラストを生成できる。
ただ、StableDiffusionではプロンプトでどんだけ指示しても色塗りが上手くいかず、「もう自分で色塗りして指示できないのか?」と考えたのがここから先。
色指示絵の用意

白黒を反転させる
色付きの絵を用意するため、まず白黒を反転させる。
invertとかでやってくれ。

二値化する
AIが出してきた白黒は、同じような色の集合体であって、人間には白一色に見える部分も微妙にカラーコードが異なる「限りなく純白っぽい色」が集合しているだけである。
これだとただのペイントみたいなツールでは塗りつぶしが使えなかった。
これを何とかできないのかとAIに相談してみたところ、「二値化」で完全な白と黒にすればよいらしい。

やり方は、自分はAIに相談したらPythonのコードが出てきたのでそれを実行しているだけなのだが、調べていたら同じことができる無料サイトもあった。
塗りつぶしする
後は塗りつぶしツールで希望の色を付けていくだけなのだが、これがまたうまく行かない。
線が途切れ途切れになっているせいで、色が変なところまでぶちまけられてしまう。
これも「という感じで困っているのだが、何とかできないか?”無料ツールで”」とAIに相談したところ、無料でなんとかできるツールを発見した。
このMediBang Paintの「隙間閉じ」機能を使うと、多少の隙間があっても上手いこと塗りつぶしてくれるのだ。
バケツツールを使いこなそう!隙間や漏れが出来ない方法 | MediBang Paint – 無料のイラスト・マンガ制作ツール

イラストの生成
ここまでやったら、色付きの絵をi2iにぶち込んで、黒背景に白の線画を、ControlNetにぶち込む。
lineartのPreprocessorはnone、「ControlNet is more important」にチェックを入れると、構図もほぼ同じものがいくつも生成できる。
後は好きなモデルを選んで、プロンプトは補助的に入れる。塗りに関する指示とか。
さらに線で描いてない口とかは、smileと入れればsmileにしてくれるし、なかなか面白い。


これで何枚か生成したのを適当に持ってくると、こんな感じ。
だいたい同じような雰囲気のイラストが出る。
(looking at viewerとか入れたわけではないのだが、目線が正面を向いてしまった)
というように、AIに遊びを持たせているので若干違いが出るが、大体同じ色合いと同じラインで出る。
後はそれぞれの絵から良い部分だけ持ってきて継ぎはぎしてしまえばいい。
こうして出来上がったものがこちら。
このように力技で元絵に寄せているわけだ。
おまけ
背景をつけたりする
切り抜きツールでマスクを作成してInpaint uploadで背景を別生成しちゃうよ。

アップスケールする
Tiled Diffusion&VAEでアップスケール。
これはDenoising strengthを0.3、Upscalerは大体いつもR-ESRGAN 4x+ Anime6Bとか使ってるよ。

効果をつける
画像編集ソフトで盛っていけ。
おわり
— 🐟✏️ (@Sakana3ai) 2023年10月29日
AIでもまず線画を用意して、色も塗り潰しツールで雑に雰囲気を指示して、それをAIに絵にしてもらえばいいよねという
— 🐟✏️ (@Sakana3ai) 2023年10月30日
なお自分は絵描きじゃないので線画の修正や色塗りもAI補助のもと作業#AIイラスト pic.twitter.com/yvubaajEI7
DALL·E3で出した動きのあるイラストをStableDiffusionで指示して着色してアップスケールしただけという
— 🐟✏️ (@Sakana3ai) 2023年11月4日
正直これチートすぎて、オリジナルの良い感じのイラスト出すだけならポンポンできてしまう
これはFlat2LoRAを1とその他いろいろ pic.twitter.com/W90uCn5Fm9
【StableDiffusion】ゲームのスクショからLoRA作成
マイナーゲームゆえに絵師様のファンアートもほとんど存在しない「幻塔」のキャラクターLoRAを、ゲーム内で撮影したスクリーンショットから作成したよ。
なお、LoRA学習について特に詳しいわけではないので、ただこうやってるよというだけのまとめだよ。

学習素材の用意
今回は、AIサーバント「レイヤ」を学習する。
ただでさえファンアートの少ない幻塔で、新登場で、しかも主要キャラクターでもなく、ただ戦闘を補助してくれるペットのようなキャラクターなので、当然ファンアートは存在しない。
スクリーンショットの撮影
とりあえず、スクリーンショットを撮りまくる。
後で背景を除去することを考えて、出来る限り背景が一色の場所を探して撮影。

トリミングする。

今更だが、後ろ姿の画像はおそらく分けて学習させないといけないと思う。
きちんとやればの話だが、幻塔の3Dはアニメ調で、かつ、非常に良く出来ているので、後ろ姿の学習もさせられるというのは良い。普通のイラストでわざわざ後ろ姿を描いているものは少ないため、頑張ればこれは逆に良いものが作れそうではある。
背景を除去する
素材画像の背景を除去する。
ここは「Transparent-Background」というコマンドライン操作の背景切り抜きツールで、バッチ処理で自動で全部やってもらう。
GitHub - plemeri/transparent-background: This is a background removing tool powered by InSPyReNet (ACCV 2022)
「transparent-background --source "画像のフォルダ" --type white --dest "出力先フォルダ"」
これを実行、自動でキャラクターを切り抜き、背景を白にさせる。

参考資料
サイズを合わせる
学習素材の画像のサイズを統一する。今回はすべて768*768pxに調整。
素材をきれいにする
ここは面倒だが1枚1枚チェック、うまく切り抜けなかった部分を修正したり、学習の邪魔になってしまう要素を消したりする。
これは「LamaCleaner」を使っているよ。

また、画像編集ソフトを使用して明るさを調整したり、画質の悪いものは画質を上げたりする。線がハッキリしないものはシャープさを上げると良さそうだ。
名前を連番にする
これは必要なのかよくわかっていないが、一応素材画像は001からの連番にしている。
自分はこの「お~瑠璃ね~む」とかいうやつを使用して一括で変更している。
Beefway - Download - AllRename

キャプションファイルを作成する
「Dataset Tag Editor」を使って、学習素材画像のタグを一括で変更する(使い方は自分で調べて)
GitHub - toshiaki1729/stable-diffusion-webui-dataset-tag-editor: Extension to edit dataset captions for SD web UI by AUTOMATIC1111

タグを抽出し、学習させる要素のタグを削除する。
まぁここは面倒だし、ぶっちゃけ変わらないとか聞くので、背景以外はすべて学習させるという意味で、雑に「simple background, white background」以外すべて削除。
そしてトリガーワードを追加。今回は「LeiaToF」とした。

学習開始
「Kohya's GUI」を使って学習させる。
正直ここからの設定項目は自分もよくわかっていないので使い方の説明はないぞ。
多くの人がすでにまとめてくれているから勉強頑張ろう。一緒に。
とりあえず、素材画像のフォルダ名称を「繰り返し回数_名称」に変更し、所定の場所に配置。最終的に画像枚数は15枚、正規化画像は無し。
Source modelには「AnyLoRA」を使用。
Train batch sizeは1、繰り返し回数1*画像枚数15に対してEpoch数を300で、とりあえずステップ数4500になるように調整した。
各種パラメータ(重要そうなとこ)
- Mixed precision と Save precision:bf16
- LR Scheduler:constant
- Optimizer:AdamW8bit
- Learning rate:0.0001
- Max resolution:768,768
- Network_Alpha/Network_Rank = 0
- Clip skip:2
参考資料
終わり
完成したLoRAファイル
最終的に出来上がったものがこちら。
Tower of Fantasy レイヤ Leia LoRA https://t.co/Q6EzoW8Xzc#幻塔 #ToF pic.twitter.com/R7RkppTSd2
— 🐟✏️ (@Sakana3ai) 2023年11月5日
同じくAIサーバントの雪絨ちゃんも作成し、試しにcivitaiに公開してあるよ。
AIサーバント(雑)
— 🐟✏️ (@Sakana3ai) 2023年11月5日
Snowy LoRAhttps://t.co/UFXTocybIS
Leia LoRAhttps://t.co/D5aiP5BJ93#幻塔ART #ToFanmade pic.twitter.com/7gmivBLvrG
自分の手元には学習途中で吐き出させたファイルもあるわけだが、どのくらいの学習強度のものが欲しいのかは人によりけりでわからんので、とりあえず強度0.7で使用したときにある程度は自由が利くくらいのものをシェアしてある。
また、自分が公開したLoRAを使用して画像を生成してくれた人のプロンプトを確認して思い出したのだが、「LoRA Block Weight」という拡張機能がある。
初めて見たときは意味わからなくて使っていなかったが、これがまたかなり使える。
細かい調整はlbwでしてほしい。
おまけ(生成した作品)
※エロあるよ(笑)
雪絨ちゃん#幻塔ART #ToFanmade pic.twitter.com/1AvNUVeWp0
— 🐟✏️ (@Sakana3ai) 2023年11月3日
レイヤ
— 🐟✏️ (@Sakana3ai) 2023年11月8日
私がつくりました#幻塔ART #ToFanmade pic.twitter.com/wBVWELiY9A
雪絨 Snowy ToF#幻塔ART #ToFanmade pic.twitter.com/zSWPTcD5n8
— 🐟✏️ (@Sakana3ai) 2023年11月8日
【園芸】グリーンアドバイザー合格してました
9月に試験があり、先日合格発表でしたが、無事合格してました。
グリーンアドバイザー合格してました
— さかなかおる🌿 (@Sakana3k) 2023年10月17日
グリーンアドバイザーです😤 pic.twitter.com/Hsr4dPoI0y
グリーンアドバイザーとは
公益社団法人日本家庭園芸普及協会が認定する資格で、植物の育て方や園芸の楽しさを伝えることができる人に与えられる資格です。特に家庭園芸に詳しい人です。
2023年度は、4月から申し込みが始まり、9月に試験という流れでした。
国家資格ではない民間資格なのですが、試験は年に一度しかないです。
9月までの間、申し込みが完了すると送られてくるテキストと、協会が実施する講習動画でみっちり勉強し、CBT方式の試験に合格して協会に登録するとグリーンアドバイザーです。
どうもこの方式、今年から始まったらしく、2023年度から全国で受けられるようになってたみたいですね。
受験料
ちなみに受験料は、40,700円(学生だと半額)。
試験に合格すると協会の5年分の登録料10,450円がさらにかかるので、実質51,000円ですね。
資格のメリット
一番は園芸の知識をきちんとつけられるということだと思います。
園芸店や生花店、ホームセンターなどでの接客業や、普段の家庭園芸でその知識を存分に活かすことができます。
所持していると、ホームセンターなど場所によっては給与が上がると書かれていることもある資格です。採用にも有利に働くと思われます。
実際、「グリーンアドバイザーを持ってる人だったら安心して苗の管理を任せられるな」と私も思います。
出題範囲や勉強方法
2023年度 グリーンアドバイザー講習・試験の詳細|グリーンアドバイザー|公益社団法人 日本家庭園芸普及協会から引用。
植物に関する生理学的基礎知識/現代生活と花・緑/種子・球根・苗の基礎知識/植物分類/植物の特性/播種・定植の方法/繁殖・交配の方法/用土・肥料の基礎知識/病害虫と薬品の基礎知識/園芸用品・用具の基礎知識/園芸作業/花壇・コンテナ・鉢物栽培の基礎知識/園芸デザインと飾り方 など
とにかく園芸に関することオールジャンルです。まさにホームセンター向けの資格でなんでも問われます。自分は観葉、ラン類、水草などをあまり知らなくて困りました。
また、ページに書かれていますが、「試験の出題範囲は、テキスト、講義動画の内容を原則とするが、一般的な植物に関する知識を問う問題も出題されることがあります。」
まぁ、まずは一部だけですが公開されている問題の例を見てみるのが良いと思います。
グリーンアドバイザー認定試験問題の一例
これ、「テキストにあったか?」という問題も出てます。
自分が受けた試験でも「いや、どこに書いてあった?」となったりしました。
がしかし、それらは普段から園芸をしている人であればわかる一般的な知識で、園芸趣味の人は逆にこの問題例を見て、「簡単だな」と思ったのではないでしょうか。
(ぶっちゃけ自分も簡単だなと思いましたが、実際の試験は80問で、「いや例より難しくね?」と感じたので注意です。)
アドバイス
試験問題は、テキストだけでなく、普段から園芸に取り組んでいるかどうが問われる良い問題だなと思いました。
勉強方法としては、座学だけでなく、毎月ホームセンターや園芸店にかよって季節の花を把握したり、観葉、多肉、ラン、水生植物、果樹花木、野菜苗、ついでに山野草や盆栽、すべての植物に興味を持って目を向けるのが良いと思いましたね。
特に季節の定番は大事。自分の場合、問われた植物の花期は把握してたので、そこから推測して植え付け時期や剪定時期や花芽分化の時期を解いた問題が何問かありましたが大体あってました。
合格率
ぶっちゃけ試験はそんなに簡単ではなかったし、テキストの内容はさらに難しく、植物学,園芸学といった内容になってきます。
がしかし、これまでの例年の合格率は80%以上あるらしく、謎です。
自分は9割は取れたと思いますが、試験は落とすためにあるのではなく、あくまで確認問題で6割くらい正解できていればOKなのでしょうか。
また、これまでは方式が違って全国では受けられなかったようなので、本当に園芸が趣味な人だけが申し込んでいたのでしょうか。
今年の合格率を見てみたいですね。
試験当日
「ちゃんと勉強してきたし落ちるわけないわ」という気持ちで乗り込みましたが、試験は年に一度しかないということで、試験前は若干緊張しました。
受験するテストセンターによるのかもしれませんが、自分が申し込んだところはかなり厳重なセキュリティでした。基本的に私物は何も持ち込めませんでした。ハンカチも持ち込む前と後で表裏を確認させられました。
入室した後はPCでポチポチして問題を解くだけでしたが、試験問題が若干難しくてビビりましたね。
グリーンアドバイザーの試験受けたんだけど、普通に難しいよねこれ?
— さかなかおる🌿 (@Sakana3k) 2023年9月20日
HPの問題例は簡単にしてるってわけか!?
当然内容は言えないけど、普通にわからん!てやつと2択まではいけるんだけどなーってやつが何問かあってビビっちゃいましたね
でも出て速攻で調べたら割と合ってたからいけてるはず
おわり
自分は完全に趣味で資格取得を頑張ってみましたが、これでグリーンアドバイザーです。
ハーブセラピストと併せて、だいぶ植物のプロフェッショナルっぽくなってきました。
私も働いてましたが、ぶっちゃけ園芸店って管理が適当、植物のこと聞いてもわからない人が働いてることが多いです(もちろん店によります。)
自分はとにかくそれが気に食わない。
植物のことを愛しているので、ちゃんと管理してあげたいという気持ちから勉強も頑張れました。というかまだ勉強し続けています。
受験料は約5万円とかかりますが、送られてくるテキストにはそれくらいの価値があります。2023年度版となっているので、情報もしっかりと更新されているようだし、受験した人ではテキストをバイブルにしているという人も多く見かけます。
また、この資格を通じて植物が大好きな人と繋がれるところも良いですね。
なんにしても、園芸が大好きな人、園芸に携わる仕事をしている人は申し込んで損はない資格だと思いました。
【VC Client】RVCで誰でも理想のボイスに
VC Clientで誰でも理想のボイスに
VC Clientとは
VC Clientは、従来のボイスチェンジャーと比べて非常に高い精度を持つAIボイスチェンジャーで、少し前から話題になっている。
RVC(Retrieval-based-Voice-Conversion)という事前に音声を学習させたモデルと、このVC Clientを使って、自分の声をほぼリアルタイムで学習した声に変換することが可能。
RVCテスト
VC Clienthttps://t.co/44flPNgHhk
RVC女声データ「友-yuu-」https://t.co/gG87fDZYIl pic.twitter.com/yjsGduUNPT— さかなかおる✏️ (@Sakana3ai) 2023年10月2日
お歌もいける無料モデルhttps://t.co/M91iPNdOSs
俺の歌を聴け() pic.twitter.com/wGSupoa50L— さかなかおる✏️ (@Sakana3ai) 2023年10月2日
RVCモデル
VC Clientを利用するにはRVCのモデルが必要になるが、BOOTHなどで無料で配布されているものがいくつかある。
また、自分でモデルを作成することも可能。
RVCはオープンソースで公開されていて、それなりのPCと知識があれば、誰でも学習済みモデルを作ることができてしまう。
今のところ音声学習は無法地帯と化しているので、自分で学習済みモデルを作成する場合は、問題のない音声データを利用し、問題のない範囲で使用することが求められることに注意。
VC Clientのインストールと設定
まずVC Clientの入手はこちらのgithubから
とりあえず説明を読んで、下にスクロールしていって、hugging faceから最新のものを入手。
このあたりのダウンロード方法については、Youtubeに説明動画がいくつもあったので、わからなければそれを見るとよい。
ダウンロードして解凍してインストールが完了すると、以下のような画面。

VC Client 各種設定値
基本的な使い方は画面上部に並んでいるモデルを選択して「Start」ボタンを押すだけだが、まずは各種設定を行う。
詳しく知りたい場合はヘルプを読んだ方がはやい。
voice-changer/tutorials/tutorial_rvc_ja_latest.md at master · w-okada/voice-changer · GitHub
TUNE
とりあえずTUNEを設定する。
一般男性の地声を女声に変換する場合は大体10~14くらいで試すとよい。
INDEX
数値が高いほどRVCモデルの声に近づくということみたい。
とりあえずみんな1にしてるから1にしてる。
F0 Extractor
僕もわからないのでAIに簡単にまとめてもらったよ。
- dio
リアルタイムでボイスチェンジャーを使いたいときや、音声の品質があまり気にならないときにオススメです。dioは、高速で処理できるので、遅延が少なく、すぐに声を変えることができます。しかし、dioは、音が小さいところやうるさいところで間違えやすいので、変えた後の声が不自然に聞こえることがあります。 - harvest
音声の品質を重視するときや、静かな環境でボイスチェンジャーを使いたいときにオススメです。harvestは、きれいにピッチを検出できるので、変えた後の声が自然に聞こえます。しかし、harvestは、処理に時間がかかるので、遅延が多くなります。 - crepe
色々な音声に対応できるときや、正確さとロバストさを求めるときにオススメです。crepeは、コンピューターが学んだ知識を使ってピッチを推定するので、音声の種類や環境に関係なく正しく検出できます。crepeは、dioよりも品質が高く、harvestよりも速度が速いです。 - rmvpe
ポリフォニック音楽のボーカルの声を変えたいときや、高い精度と低い遅延を求めるときにオススメです。rmvpeは、コンピューターが学んだ知識を使ってポリフォニック音楽から歌手の声のピッチを推定するので、他の音楽の影響を受けません。rmvpeは、crepeよりも精度が高く、遅延が少ないです。
これだとrmvpeが一番良いってことにならないか?
まぁ、変換した自分の声や遅延をデバイスで聴いてみて決めたらいいと思う。
自分が試した感じは微妙な違いだけどcrepeが良いかなって思う。
S. Thresh
この閾値より小さい音は変換しないよ。
CHUNK、EXTRA
どっちも値がデカイほど変換の質は良くなるけど、その分だけ遅延が増えるよ。
これを使って他人と会話したり実況したりすること考えると、スペックによるだろうけど、自分の場合はCHUNK:256くらいまでかなって感じだったよ。
モデルの追加
入手したり自己学習したモデルの追加は右上にある「編集」ボタンを押して、空いている空きスロットにアップロードすればよい。

その他については、まぁ触ればわかると思うよ!
仮想オーディオデバイスの準備
例えば変換した声でDiscordで通話したいとか。
このような場合、Discord限らず、変換した声を何か他のものに渡すための仮想オーディオデバイスが必要になる。
オススメの仮想オーディオデバイスは「VB-CABLE」
以下から無料でダウンロードできる。
とりあえずインストールしてもらったら、CABLE InputとCABLE outputという仮想オーディオデバイスが利用可能になる。
ここが若干ややこしいのだが、「VC ClientのoutputにCABLE Input」、変換した音声を入力したいもの(今回はDiscord)「DiscordのinputにCABLE output」を設定する。

こういうことや。
ちなみに自分がDiscordで試した感じ、音声処理設定の「エコー除去」をOFFにした方がよい。
ユーザー設定>音声・ビデオ>音声処理設定
感想とかコツ
それなりのPCは要る
まずゲーム実況とかする場合、特にグラボを酷使するようなゲームだとつよつよPCでないと変換が追いつかなくなる可能性がある。自分はRTX3060のVRAM12GBでゲーム側の設定を落とすなどしていけるようになった。
自分で学習させたりすることも考えると、やはりVRAM12GB以上はほしい。
RTX3060はAI界隈では神とされている。
【悲報】
— さかなかおるGame (@Sakana3g) 2023年10月3日
幻塔が重すぎてRVCと両立できなさそう
これじゃ美少女実況もVCもできません pic.twitter.com/5s5pZk8NVT
ボイチェン適正
ボイチェン適性が無いとダメという話があるように、かつてのボイチェンでは元の声もそれなりに重要であったが、RVCではそれが改善された!
完全に別人になっちゃった。話題のAIボイチェン「RVC」を体験してみた - やじうまの杜 - 窓の杜
というようなことがこの記事に書いてあるのだが、そうだろうか?
実際に使ってみたり、使用している人の動画を観てみたりすると、RVCでも元の声質がモデルに合っているかどうかが重要だし、特に滑舌が重要だとわかる。
AIでも滑舌はなんとかできなくて泣ける。滑舌を鍛えよう。
声の高さも、元々が高い方がTUNEの値を低くできて自然な感じがする。
また、女の子っぽい喋り方というものがある。
一番は男は抑揚がなく単調に喋るので、抑揚に波をつけて喋ると女の子っぽい。
後は口先だけで喋るとか、語尾の感じとか、っていうのがかつてボイチェンを使わない女声を練習したことがある自分が知っていることだ。
でも、ダウナー系の女の子のモデルだと抑揚が無いのが逆にマッチしたりするし、適性っていうのはそういうこと。
【VC Client】
— さかなかおる✏️ (@Sakana3ai) 2023年10月12日
おじさんのRVC講座(適当)
可愛らしい喋り方とは? pic.twitter.com/lRZGVNE9iZ
RVCテスト
— さかなかおる✏️ (@Sakana3ai) 2023年10月15日
勇者
歌唱:俺
まず入力が上手い pic.twitter.com/Lax9rt21l1