カカオは独自に開発したオムニ人工知能(AI)モデル『カナナ-オ(Kanana-o)』の音声生成技術を高度化した。単に人間のように自然に読み上げるだけでなく、利用者の自然言語指示に従って話し方や感情、速度、音量まで制御できるように性能を改善した。
カカオは4日、テックブログを通じてカナナ-オの音声生成技術を公開した。この新しいモデルは、利用者が望む発話方法を自然言語で入力すると、それを反映して音声を生成することが特徴である。
例えば、「とても速く読んで」「低い声で読んで」「悲しい声で読んで」「慶尚道の方言で読んで」といった指示を理解し、速度や音量、音の高さはもちろん、感情や抑揚まで反映する。
また、「スポーツ中継のように」「アナウンサーのように」「絵本を読むように」といった役割に基づく指示も実行できる。「トーンを下げて速く悲しい声で読んで」といった複数の条件を同時に含む複合命令も処理する。韓国語を中心に学習したが、英語の音声生成でも同様の発話指示を実行できる点も特徴である。
性能も改善された。カナナ-オは発話指示の実行能力を評価する韓国語ベンチマーク『InstructTTSEval』で94.50点を記録し、GPT-4ミニTTS(91.10点)を上回った。
音声生成の速度と効率も向上した。カカオは独自に開発した音声トークナイザー『LM-SPT』を適用した。この技術は音声を少ないトークンで圧縮して表現し、AIが処理するデータ量を減らし、音声生成の速度を向上させる役割を果たす。
LM-SPTは、さまざまな音声言語モデルの韓国語・英語の音声理解および生成性能を比較した評価で優れた性能を記録した。
* この記事はAIによって翻訳されました。
亜洲日報の記事等を無断で複製、公衆送信 、翻案、配布することは禁じられています。
