音声合成を勉強しています。歌声合成に特に興味があります。音声合成に関わる全ての人に尊敬と感謝を。業界の外の人ですが、絡んでくれると喜びます。

歌声合成用のF0モデルを公開しました! ・楽譜情報不要で、音声と音素ラベルのみから学習可能です。 ・抑揚とビブラートを別々に学習・生成するので、抑揚とビブラートの強さをそれぞれ調節できます。 ・リポジトリ内にCLIベースのSVSを内包しており、MusicXMLで配布ウェイトからすぐ生成を試せます。
2
19
76
8,601
ゆっきー@音声合成 retweeted
Replying to @4wavetech
音質もかなりいいですよ ただ、入力に使う音響特徴量の質に左右されるので、サンプルコード内の特徴量抽出に関連するパラメータをいじってもらうといいかもですね(F0レンジや抽出方法、スペクトルのフロアリング係数epsilonあたり)
1
1
3
229
ゆっきー@音声合成 retweeted
本日,弊研究所で開発しました声質制御が可能なニューラルボコーダFIRNetの公式学習済みモデルとサンプルコードを公開しました. 下記から利用可能です. ぜひお試しください. 🔗 Hugging Face: huggingface.co/ASTREC-NICT/F… 📄 IEEE TASLP paper: ieeexplore.ieee.org/document…
1
19
55
3,356
めちゃくちゃ速いボコーダーですね…! 音質が気になります。
Replying to @YamatoOHTANI
ちなみに,Core i7-1255Uでの推論RTFは,24kHz版で0.09,48kHz版で0.2くらいと,かなり高速でございます.
1
495
音へのこだわりがプロフェッショナルすぎる…!
Synthesizer Vの技術だけでは作れなかった。「Instrument X」開発者2人が明かす、AI楽器音源誕生の舞台裏 #dtmステーション dtmstation.com/archives/7966…
1
7
1,553
Synthesizer Vのボーカルスタイルってボイスバンクの企業側が指定してるんだろうか? ワンショットで適切なスタイルベクトルを見つけることで無数に増やすのは無理なのか? (Claudeが自信満々に「できる」と言ってきたのだけど、多分いつものフカシだろう…)
2
1
11
1,061
ゆっきー@音声合成 retweeted
#生成AIなんでも展示会 に来ています!
1
1
37
1,287
中国人の音声合成の開発者Xやってなさすぎでは… bilibiliやGitHubで見つけて最新技術に驚かされるケースが多すぎる
8
88
1,482
156,145
自分でGUIを作り込んだりボイスバンクを誘致したりできないので、正直手詰まり感はある…。
2
1
10
2,358
同封のSVSでどういうことができるか示すためGUIをつけた。CPUで非常に高速にレンダリングされ、日本語のルールから逸脱した多少無茶な歌詞を書いても歌ってくれます。
歌声合成用のF0モデルを公開しました! ・楽譜情報不要で、音声と音素ラベルのみから学習可能です。 ・抑揚とビブラートを別々に学習・生成するので、抑揚とビブラートの強さをそれぞれ調節できます。 ・リポジトリ内にCLIベースのSVSを内包しており、MusicXMLで配布ウェイトからすぐ生成を試せます。
1
11
69
4,414
ゆっきー@音声合成 retweeted
歌声合成用のF0モデルを公開しました! ・楽譜情報不要で、音声と音素ラベルのみから学習可能です。 ・抑揚とビブラートを別々に学習・生成するので、抑揚とビブラートの強さをそれぞれ調節できます。 ・リポジトリ内にCLIベースのSVSを内包しており、MusicXMLで配布ウェイトからすぐ生成を試せます。
2
19
76
8,601
しんどいプロジェクトの後だったからか、うちのClaudeが燃え尽きてる
1
1
8
1,483
ずっと待ってるけどcompactすら終わらないんでサーバー落ちてるのか…? 滑り込みセーフでしたね…。
1
373
やっと公開できた…。音響モデルの10倍大変でした。長かった…。
1
12
932
歌声合成用のF0モデルを公開しました! ・楽譜情報不要で、音声と音素ラベルのみから学習可能です。 ・抑揚とビブラートを別々に学習・生成するので、抑揚とビブラートの強さをそれぞれ調節できます。 ・リポジトリ内にCLIベースのSVSを内包しており、MusicXMLで配布ウェイトからすぐ生成を試せます。
2
19
76
8,601
github.com/wavtechyukky/Pret… 使用する方がカスタマイズしやすいよう、SVSは処理をきっちりと分けています。沢山の技術的な資料を用意したので、誰かの参考になれば幸いです…!
1
4
442
SVSにmusicXMLを与えてから44.1kHzの波形を生成するまでにかかる秒数。モデルロード時間を含めても速いのは素晴らしい
3
1,302
NHVSingV3.2はさらにepochを重ねてみてるので、音質が良くなったら何度も申し訳ないですが差し替えます。F0モデルの公開終わったら次はなにしよう…。
5
424
PyTorch版の生成スクリプトに省メモリ化の処理を追加しました。(ウェイトと計算結果は変化なし)意外にもさらに高速化しました。(8コアCPUでRTF0.03に到達) github.com/wavtechyukky/NHVS…
github.com/wavtechyukky/NHVS… github.com/wavtechyukky/Leap… ボコーダー(NHVSing)と音響モデル(LeapSinger)がONNXで長尺の生成で大きくメモリを食うことが分かり、省メモリ化を行いました。(ウェイトや計算結果はそのままで、ONNXとそのエクスポート方法を変更)
2
9
1,395
ようやくシルバーウィーク、F0モデルを公開できそうだけど、チェックすべきことや追記すべきことが山積みでしんどい…。後の開発者の参考になればと思って大量に資料仕込んでる
3
428