<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Style-Bert-Vits2 on Xainome Blog</title>
    <link>https://xainome-blog.pages.dev/tags/style-bert-vits2/</link>
    <description>Recent content in Style-Bert-Vits2 on Xainome Blog</description>
    <generator>Hugo</generator>
    <language>ja-JP</language>
    <lastBuildDate>Wed, 18 Dec 2024 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://xainome-blog.pages.dev/tags/style-bert-vits2/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>AIVMGeneraterでAivisSpeechでも使えるようにしたよ！</title>
      <link>https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/</link>
      <pubDate>Wed, 18 Dec 2024 00:00:00 +0000</pubDate>
      <guid>https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/</guid>
      <description>&lt;h2 id=&#34;aivmgeneraterを使えるようになるまで&#34;&gt;AIVMGeneraterを使えるようになるまで&lt;/h2&gt;
&lt;p&gt;前回Style-Bert-VITS2を使って音声合成モデルを作りました。今回は作ったモデルをAivis Speechでも使えるようにしようと思います。&lt;/p&gt;
&lt;p&gt;AIVMGeneraterでは自作した音声合成モデルをAivis Speechで使えるようにします。以前までは音声合成モデルさえあればAIVMGeneraterで変換できるようになってました。しかし、今は使えなくなってます。そのため、.onnxファイルを作って変換する必要があります。&lt;/p&gt;
&lt;p&gt;ただ、Style-Bert-VITS2を使えるのであればできますので諦めずやっていきましょう！&lt;/p&gt;
&lt;h3 id=&#34;style-bert-vits2をdevブランチへ切り替え&#34;&gt;Style-Bert-VITS2をdevブランチへ切り替え&lt;/h3&gt;
&lt;p&gt;まずはStyle-Bert-VITS2をdevブランチへ切り替えます。デフォルトだとmainブランチになってますので、これをdevブランチへ切り替えます。ターミナルからコマンド実施でもよいですが、VSCodeを使っているのであれば以下の方法で切り替えて実施できます。&lt;/p&gt;
&lt;p&gt;まずはGitのタブを選択しましょう。それからソース管理の設定から&amp;quot;チェックアウト先&amp;quot;を選択します。&lt;/p&gt;
&lt;p&gt;&lt;img alt=&#34;AIVMGenerater_Style-Bert-VITS2_ブランチ切り替え&#34; loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/images/image-16.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;そうすると真ん中あたりにこんな感じでブランチやリモートブランチが出てきます。ここからorigin/devを選択しましょう。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/images/%E3%82%B9%E3%82%AF%E3%83%AA%E3%83%BC%E3%83%B3%E3%82%B7%E3%83%A7%E3%83%83%E3%83%88-2024-12-12-162355.png&#34;&gt;&lt;/p&gt;
&lt;h3 id=&#34;onnxファイルの作成&#34;&gt;onnxファイルの作成&lt;/h3&gt;
&lt;p&gt;そうすると中のファイルなどが変わっていると思います。以下を確認してみましょう！&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&amp;ldquo;convert_onnx.py&amp;quot;が存在しているかどうか&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;requirements.txtにonnx系のライブラリが記述されているかどうか&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img alt=&#34;AIVMGenerater_Style-Bert-VITS2_devブランチのファイル&#34; loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/images/%E3%82%B9%E3%82%AF%E3%83%AA%E3%83%BC%E3%83%B3%E3%82%B7%E3%83%A7%E3%83%83%E3%83%88-2024-12-12-162440-1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/images/%E3%82%B9%E3%82%AF%E3%83%AA%E3%83%BC%E3%83%B3%E3%82%B7%E3%83%A7%E3%83%83%E3%83%88-2024-12-13-121326-3.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;上記が確認出来たらrequirements.txtで一括再インストールをしてconvert_onnx.pyを実行しましょう。私の環境でのコマンドだと以下のような感じですね。この辺は適宜自身の環境に合わせて変えてください。&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;py -3.10 -m pip install -r requirements.txt
py -3.10 convert_onnx.py --model model_assets/{モデル名}
例：py -3.10 convert_onnx.py --model model_assets/10minmodel
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;そうするとモデルファイル内に.onnxファイルができてると思います。モデルごとにできるので少し容量を使っちゃいますが…&lt;/p&gt;
&lt;p&gt;&lt;img alt=&#34;Style-Bert-VITS2_onnxファイル&#34; loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/images/%E3%82%B9%E3%82%AF%E3%83%AA%E3%83%BC%E3%83%B3%E3%82%B7%E3%83%A7%E3%83%83%E3%83%88-2024-12-12-223554.png&#34;&gt;&lt;/p&gt;
&lt;h3 id=&#34;aivmgeneraterの設定&#34;&gt;AIVMGeneraterの設定&lt;/h3&gt;
&lt;p&gt;.onnxファイルが出来たら&lt;a href=&#34;https://aivm-generator.aivis-project.com/&#34;&gt;こちら&lt;/a&gt;のページからAIVMGeneraterを使います。使い方はシンプルでモデルに関するファイルをアップして、サンプルボイスもアップして変換するだけです。&lt;/p&gt;
&lt;p&gt;メタデータ編集では製作者や説明を記載出来ます。この辺はなくても大丈夫です。私は一応記載しましたが。それからモデルの公開ですね。今回は公開しませんが、公開したい場合はライセンスを選びましょう。&lt;/p&gt;
&lt;p&gt;ACML 1.0 と ACML-NC-1.0 の違い&lt;strong&gt;営利目的の利用を許可&lt;/strong&gt;するかどうかです。ACML 1.0は許可しますが、ACML-NC-1.0は非営利目的のみとなっています。パブリックドメインは著作権フリーで、カスタムライセンスはライセンスを自作することになります。&lt;/p&gt;
&lt;p&gt;ACML 1.0かACML-NC-1.0のどちらかを選べば特に問題ないかと思います。&lt;/p&gt;
&lt;p&gt;&lt;img alt=&#34;AIVMGenerater_設定&#34; loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/images/image-17-660x1024.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;それからアイコン、スタイル説明、サンプルボイスを追加しましょう。サンプルボイスは実際にモデルを使った時の音声を貼っておきます。&lt;/p&gt;
&lt;p&gt;アイコンはデフォルトだと卵型の形になります。公開する場合は設定しておきましょう。スタイルは何もなければノーマルになります。公開するスタイルに合わせて書き換えましょう。&lt;/p&gt;
&lt;p&gt;設定が完了したら、変換をします。そうすると変換が完了したファイルがダウンロードされます。許可を求められた場合は許可しましょう。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/images/%E3%82%B9%E3%82%AF%E3%83%AA%E3%83%BC%E3%83%B3%E3%82%B7%E3%83%A7%E3%83%83%E3%83%88-2024-12-13-101125.png&#34;&gt;&lt;/p&gt;
&lt;h3 id=&#34;aivis-speechへの取り込み&#34;&gt;Aivis Speechへの取り込み&lt;/h3&gt;
&lt;p&gt;ダウンロードが完了したら、Aivis Speechに取り込みます。まずはAivis Speechを起動します。&amp;ldquo;設定&amp;rdquo; &amp;gt; &amp;ldquo;音声合成モデルの管理&amp;quot;を選択します。そしたら右上の&amp;quot;インストール/更新&amp;quot;を選択して.aivmxファイルを選択します。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/images/%E3%82%B9%E3%82%AF%E3%83%AA%E3%83%BC%E3%83%B3%E3%82%B7%E3%83%A7%E3%83%83%E3%83%88-2024-12-13-102254-1024x574.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;ファイルを選択したら右下の&amp;quot;インストール/更新&amp;quot;を選択しましょう。このような画面になったらインストール完了です。後は自由に使えるようになります。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/aivmgenerater-aivisspeech/images/%E3%82%B9%E3%82%AF%E3%83%AA%E3%83%BC%E3%83%B3%E3%82%B7%E3%83%A7%E3%83%83%E3%83%88-2024-12-13-102425-1024x574.png&#34;&gt;&lt;/p&gt;
&lt;h3 id=&#34;終わりに&#34;&gt;終わりに&lt;/h3&gt;
&lt;p&gt;今後ですがもう少しモデルの作成を試してみたいなと思います。10minmodelを作りましたが、お試しで作った物なので。使ってみた感じつまずいたり、うまく喋れてない部分がありました。なので、データの再集録からですね。&lt;/p&gt;
&lt;p&gt;それからスタイルもいくつか使ってみたいですね。本来Audibuleスタイルで作りましたが、せっかくなら感情表現もできるキャラクター用も作ってみたいですし。&lt;/p&gt;
&lt;p&gt;ここまでできれば色んな音声合成モデルを作れるようになります。皆さんもぜひ試してみてください。唯一の難点はローカルでモデル作成しているときPCが使えないということですね。Colabを使えばいいと思いますが、あれだと数日かかりそうですし。ではでは。&lt;/p&gt;</description>
    </item>
    <item>
      <title>音声合成モデルをStyle-Bert-VITS2を使って作ってみたよ</title>
      <link>https://xainome-blog.pages.dev/posts/2024/12/voice-synthesis-style-bert-vits2-tutorial/</link>
      <pubDate>Sun, 15 Dec 2024 00:00:00 +0000</pubDate>
      <guid>https://xainome-blog.pages.dev/posts/2024/12/voice-synthesis-style-bert-vits2-tutorial/</guid>
      <description>&lt;h2 id=&#34;音声合成モデルの作成&#34;&gt;音声合成モデルの作成&lt;/h2&gt;
&lt;p&gt;&lt;a href=&#34;https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/&#34;&gt;前回&lt;/a&gt;Style-Bert-VITS2を試しに使ってみることをやってみました。今回は実際にモデルを作ることをやろうと思います。&lt;/p&gt;
&lt;p&gt;まずは音声の収録ですね。こちらに関しては自身でいろいろ試してみるしかないですね。とりあえずノイズキャンセリング付きや単一指向性マイクなどがいいかもしれません。後は収録時に詰まったり、変な発声になったりせず滑らかに読むことですね。無音は多少なっても大丈夫なので。&lt;/p&gt;
&lt;p&gt;次に音声データセットの作成です。こちらは前回やったので飛ばします。収録した音声を勝手に10秒程度に切り分けてくれますので。&lt;/p&gt;
&lt;h3 id=&#34;文字おこし時のエラー対処&#34;&gt;文字おこし時のエラー対処&lt;/h3&gt;
&lt;p&gt;私は文字おこしで以下のエラーが出たので&amp;quot;pip install tf-keras&amp;quot;で対処しました。&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;RuntimeError: Failed to import transformers.models.whisper.modeling_tf_whisper because of the following error (look up to see its traceback):
Your currently installed version of Keras is Keras 3, but this is not yet supported in Transformers. Please install the backwards-compatible tf-keras package with `pip install tf-keras`.
. エラーメッセージが空の場合、何も問題がない可能性があるので、書き起こしファイルをチェックして問題なければ無視してください。
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;その次はこのようなエラーが出ました。&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;site-packages\transformers\pipelines\audio_utils.py&amp;#34;, line 37, in ffmpeg_read
    raise ValueError(&amp;#34;ffmpeg was not found but is required to load audio files from filename&amp;#34;) from error
ValueError: ffmpeg was not found but is required to load audio files from filename
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;その場合は以下の手順で対応しました。私はwindowsかつVS Codeなのでmacとかは別になります。Gitでクローンする方法でも大丈夫です。&lt;/p&gt;</description>
    </item>
    <item>
      <title>StyleBertVITS2を使って自身のデータセットを作成してみるよ</title>
      <link>https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/</link>
      <pubDate>Mon, 02 Dec 2024 00:00:00 +0000</pubDate>
      <guid>https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/</guid>
      <description>&lt;p&gt;&lt;a href=&#34;https://xainome-blog.pages.dev/posts/2024/11/ai-voice-synthesis-aivisspeech-review/&#34;&gt;前回&lt;/a&gt;Aivis Speechを触ってみたので自身の音声合成モデルを作ってみたいなと思い調べてみました！StyleBertVITS2は音声合成がメインになると思います。他にも学習やデータセットの作成もできます。というわけでStyleBertVITS2を使っていきます！&lt;/p&gt;
&lt;h2 id=&#34;stylebertvits2のインストール&#34;&gt;StyleBertVITS2のインストール&lt;/h2&gt;
&lt;p&gt;というわけでまずはStyleBertVITS2のインストールからですね。基本的には&lt;a href=&#34;https://github.com/litagin02/Style-Bert-VITS2&#34;&gt;Github&lt;/a&gt;に載ってますのでその通りで問題ないと思います。&lt;/p&gt;
&lt;p&gt;ただ、私は仮想環境作るのが面倒なタイプでpythonのversion別(3.10と3.12)でしか管理してないのでそれに合わせたコマンド使用しています。プロジェクトが複数存在しないのであれば、使わなくていいかなと思う派です。思想は人それぞれなので。&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;# 各種ライブラリのインストール
git clone https://github.com/litagin02/Style-Bert-VITS2.git
cd Style-Bert-VITS2
py -3.10 -m pip install &amp;#34;torch&amp;lt;2.4&amp;#34; &amp;#34;torchaudio&amp;lt;2.4&amp;#34; --index-url https://download.pytorch.org/whl/cu118
py -3.10 -m pip install -r requirements.txt
# モデルのダウンロード
py -3.10 initialize.py
# エディター画面の表示
py -3.10 server_editor.py --inbrowser
または
py -3.10 app.py
&lt;/code&gt;&lt;/pre&gt;&lt;h3 id=&#34;stylebertvits2_server_editorpyの実行&#34;&gt;StyleBertVITS2_server_editor.pyの実行&lt;/h3&gt;
&lt;p&gt;server_editor.pyを実行した場合は以下のような画面になります。その前に利用規約に同意しましょう。特に性的や政治的、フェイク系はやめましょうという感じですね。&lt;/p&gt;
&lt;p&gt;&lt;img alt=&#34;StyleBertVITS2_server_editor.py&#34; loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/images/image-1024x618.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/images/image-1-1024x716.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;この辺は音声合成モデルを使用するという感じですね。やってることはAivis Speechと同じような感じだと思います。&lt;/p&gt;
&lt;h3 id=&#34;stylebertvits2_apppyの実行&#34;&gt;StyleBertVITS2_app.pyの実行&lt;/h3&gt;
&lt;p&gt;こちらではモデルの作成などは出来なさそうなので、もう一方のプログラムを実行してみます。app.pyのほうですね。&lt;/p&gt;
&lt;p&gt;&lt;img alt=&#34;StyleBertVITS2_app.py&#34; loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/images/image-2-643x1024.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;こちらであればデータセット作成、モデルの学習、マージもできそうなのでこっちを使ってみます。&lt;/p&gt;
&lt;h3 id=&#34;スタイルの作成方法&#34;&gt;スタイルの作成方法&lt;/h3&gt;
&lt;p&gt;まずはスタイルの作成をする必要がありますがデータが必要になります。必要なデータは1時間ほどあれば十分だと思いますが、数十分でもできそうな気はしています。試してないので何とも言えませんが…&lt;/p&gt;
&lt;p&gt;もし10秒程度のwavファイルが360個ほどあれば十分なのでその時はスタイルの作成を行ってください。説明にもありますが、Dataフォルダとは別で配置しておくとスタイルの管理も楽なので別フォルダを作っておくと良いかもしれません。1スタイルなら適当な配置でもよさそうです。&lt;/p&gt;
&lt;p&gt;&lt;img alt=&#34;StyleBertVITS2_スタイル作成&#34; loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/images/image-4-1024x705.png&#34;&gt;&lt;/p&gt;
&lt;h3 id=&#34;wavファイルの準備&#34;&gt;wavファイルの準備&lt;/h3&gt;
&lt;p&gt;次はデータセットがない場合ですね。もし自身の声を使用しない場合はどこからかwavファイルをダウンロードする必要があります。状況によっては環境音や音楽を削除するなどの対応も必要かと思います。ただ、今回は自身の声で作成する想定なのでこの工程は省きます。&lt;/p&gt;
&lt;p&gt;もし、細かい音声データを大量には持ってないけど、数十分~1時間のwavファイルがある場合はデータセットの作成を行いましょう。&lt;/p&gt;
&lt;p&gt;&lt;img alt=&#34;StyleBertVITS2_データセット作成&#34; loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/images/image-5-930x1024.png&#34;&gt;&lt;/p&gt;
&lt;h3 id=&#34;データセットの作成&#34;&gt;データセットの作成&lt;/h3&gt;
&lt;p&gt;まずはinputフォルダにデータを入れます。録音などの環境がまだ整ってないので一旦前回使用したwavファイルを使ってみます。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/images/image-6.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;次はモデル名を決めましょう。私はまだ本格的にやらないので適当に&amp;quot;test&amp;quot;にしました。秒数の設定などは一旦デフォルトにしています。この辺は好きなように設定すると良いです。&amp;ldquo;成功すればスライスが完了しました。&amp;ldquo;というメッセージが出て所定のフォルダに出力されます。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/images/image-7-1024x434.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;大体10秒近くの音声ファイルが出力されます。これでスタイル作成の準備が整ったのでスタイル作成をして学習という流れになります。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/12/stylebertvits2-tutorial/images/image-8.png&#34;&gt;&lt;/p&gt;
&lt;h3 id=&#34;終わりに&#34;&gt;終わりに&lt;/h3&gt;
&lt;p&gt;ここまで書いてきましたが、私の方でまだデータの準備ができていません。&lt;/p&gt;
&lt;p&gt;一人で話して録音する分には問題ないです。ただ、マイクがゴミだったのでまともなマイクを使って収録したいと思います。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
