音声合成を勉強しています。歌声合成に特に興味があります。音声合成に関わる全ての人に尊敬と感謝を。業界の外の人ですが、絡んでくれると喜びます。

Filter
Exclude
Time range
-
Minimum likes
音質を求めたボコーダーの研究は終わってしまったんだろうな…。論文もないけどやたら音質のいいNSF-HiFiGAN、論文の記述がぼかされてるけど実績のあるRefineGAN、高サンプリングレートでは俺の魔改造実装しかないNHV、これらはTTSでもすごく強いはず
16
1,116
Interspeechの論文、Claudeに100本くらいピックアップしてもらって全部要約してもらってる。怠惰ですなあ…。PDFの翻訳ツール使ってなんとか読み解きながら、自分で要約をノートアプリとかにまとめてた時代が懐かしい…。
5
786
Replying to @Felipe_S_Silv
ありがとうございます! 将来的には音素ラベルしかないデータセットをさらに学習させてみたいですね。日本語の数個のデータセットでしか試していないこともあり、デフォルト設定で常に完璧に動くかは懸念があります。
1
18
ゆっきー@音声合成 retweeted
Replying to @4wavetech
音質もかなりいいですよ ただ、入力に使う音響特徴量の質に左右されるので、サンプルコード内の特徴量抽出に関連するパラメータをいじってもらうといいかもですね(F0レンジや抽出方法、スペクトルのフロアリング係数epsilonあたり)
1
1
3
255
ゆっきー@音声合成 retweeted
本日,弊研究所で開発しました声質制御が可能なニューラルボコーダFIRNetの公式学習済みモデルとサンプルコードを公開しました. 下記から利用可能です. ぜひお試しください. 🔗 Hugging Face: huggingface.co/ASTREC-NICT/F… 📄 IEEE TASLP paper: ieeexplore.ieee.org/document…
1
19
62
3,539
Replying to @ayousanz
度々すみません…! 試験運転中ではありますが、ボコーダーのv3.2にさらにエポック数を増やして学習を重ねたウェイトをF0モデルのリポジトリに置いています。より音質が高くなるかもしれないのでぜひ試していただければ…! github.com/wavtechyukky/Pret…
1
1
33
Replying to @aman0_kei
本当に詳しいですね…! うーん、歌唱スタイルを色々変えれるボイスバンクって面白いんじゃないかと思ったのですが、すでにあるんですね…。
1
47
Replying to @YamatoOHTANI
ありがとうございます! 48kHzのJSUTコーパスの150〜300Hz程度の音声を使い、音量を-17dBに正規化、epsilonはデフォルトの1e-7でよい音質になりました。
53
Replying to @aman0_kei
15個…! それだけあったら楽しそうですね! 実際にはスタイルベクトルってあまり機能しないことが多い中(自分の実験方法では)、3、4個のスタイルでもちゃんと実装できてるのは凄いことなのかもしれません。(こないだF0モデル作ったら、波音リツsoftと通常波音リツのF0はほぼ同じに学習されました)
1
97
めちゃくちゃ速いボコーダーですね…! 音質が気になります。
Replying to @YamatoOHTANI
ちなみに,Core i7-1255Uでの推論RTFは,24kHz版で0.09,48kHz版で0.2くらいと,かなり高速でございます.
1
562
音へのこだわりがプロフェッショナルすぎる…!
Synthesizer Vの技術だけでは作れなかった。「Instrument X」開発者2人が明かす、AI楽器音源誕生の舞台裏 #dtmステーション dtmstation.com/archives/7966…
1
7
1,668
Replying to @KRTK_12
個人的に今注目しているのは、声質よりもF0やイントネーションのスタイルです。ひとつの声質であらゆるジャンルの歌い方を実現するスマートな方法はないかと考えています。よくよく考えたら、ラップモードがあるくらいだから不可能ではなさそうですが、やらないということは難しいんでしょうね。
1
78
Synthesizer Vのボーカルスタイルってボイスバンクの企業側が指定してるんだろうか? ワンショットで適切なスタイルベクトルを見つけることで無数に増やすのは無理なのか? (Claudeが自信満々に「できる」と言ってきたのだけど、多分いつものフカシだろう…)
2
1
11
1,122
ゆっきー@音声合成 retweeted
#生成AIなんでも展示会 に来ています!
1
1
37
1,290
Replying to @taisan11_
外国人サイドにも弊害が大きすぎるんでなんとかしてほしいですね…。
11
10,527
Replying to @x9cge7t
明明插画家们大抵都在 X 上。语言的壁垒也很巨大。
9
10,148
Replying to @Xiao_ye_P
无论是学术界还是个人开发界,中国显然都是圣地。让人有一种错觉:不是他们在 X 上孤立,而是我们与中国隔绝了。
1
3
59
14,923
中国人の音声合成の開発者Xやってなさすぎでは… bilibiliやGitHubで見つけて最新技術に驚かされるケースが多すぎる
8
88
1,485
156,422
Replying to @Felipe_S_Silv
自作勢の方ですか! もし不満点などあればお気軽にフィードバックいただければ…! 音程が良くなりすぎる以外、話者再現性は結構高いと思います!
1
52
Replying to @roku10shi
自分もOpenUTAU対応できたらいいなと…! DiffSingerの方が今のところ品質が高すぎるので、特に音響モデルの話者再現性を上げてから検討したいと思っています。これから何しようと思っていましたが、学習ツールを作るのはありですね…!
2
192