イレブンラボジャパン合同会社(本社:米国ニューヨーク州、CEO:Mati Staniszewski、以下イレブンラボ)は、新しいモデルアーキテクチャを採用した音声合成(Text to Speech)モデル「Eleven v4」の提供を開始しました。同社のモデルの中で、最も高い感情表現力を備えています。あわせて、同じ研究成果を約100ミリ秒の応答速度で利用できる、リアルタイム向けの「Eleven v4 Turbo」も提供します。
動画広告のナレーション、オーディオブックの登場人物、海外向けコンテンツの吹き替えでは、言葉の正確さに加えて「どう話すか」が作品の印象を左右します。「Eleven v4」は文章の文脈や演出意図を捉え、声のトーン、間、感情、キャラクター性を表現。台本を読み上げるだけでなく、声で『演じる』ためのモデルです。
[画像: https://prcdn.freetls.fastly.net/release_image/160611/70/160611-70-b52a7a6b7b5ac0061fefd40ac218a581-1619x1520.jpg?width=536&quality=85%2C75&format=jpeg&auto=webp&fit=bounds&bg-color=fff ]
Artificial Analysis「Text to Speech Leaderboard(Provider Voices)」で1位となった「Eleven v4」
演じる音声、環境音や効果音も生成
ドラマティックな場面から穏やかな語り、緊迫したせりふ、コミカルな掛け合いまで、同じ声のまま、場面に応じた幅広い表現ができます。[タグ]と呼ばれる感情表現に関するプロンプトで指定することもできますが、その前にまず台本のテキストそのものを読み取ります。文章が含んでいる感情や状況に沿って、話し方が自然に変わります。
環境音や効果音も、インラインタグで演技に組み込めます。たとえば「[door slams](ドアが閉まる)」「[rain](雨)」などを台本に指定すると、場面に合わせた音の表現を生成できます。
複数話者の会話は、会話全体をひとつの文脈として生成します。発言の重なりや間が、やりとりそのものから生まれるため、テイクをつなぎ合わせたような不自然さが残らないのも特徴です。
声のトーンや感情を、テキスト上で直接指定
台本の中に「インラインタグ」を書くことで、感情、テンポ、間、リアクション、効果音を直接指定できます。「[laughs](笑う)」「[whispers](ささやく)」「[long pause](長めの間)」といったタグを、1つのせりふに複数連ねた場合でも、「Eleven v3」より格段に安定して反映されます。
また、制作の途中で1文だけを作り直すことも可能です。作り直した部分と前後との境目は、聞いても分からない水準で自然になじみます。また発音記号(IPA)への対応も改善し、読み方の難しい固有名詞や人名を正しく発音させやすくなりました。
日本語の表現力も向上。多言語展開を支える音声品質へ
「Eleven v4」は90以上の言語に対応します。日本語は、ブラジルポルトガル語、標準中国語、広東語などとともに、前モデルからの品質改善に重点を置いた言語のひとつです。改善の特徴は発音の「正確さ」だけにとどまりません。リズム、感情、話し方の自然さといった「その言語らしさ」の部分にまで及んでいます。
また、声と話し方を切り離して扱えるのも、今回の特徴です。これまで、ある言語の話者の声で別の言語の台本を読ませると、もとの言語の特徴が話し方に残ることがありました。
「Eleven v4」では標準で、声はその人のまま、話し方は台本の言語のネイティブに切り替わります。たとえば日本語の音声を基に英語の台本を読ませる場合も、声の特徴を保ちながら、英語として自然な発音に近づけられます。
結果は元の音声や言語によって異なります。ひとつの声を保ったまま、さまざまな言語圏に向けたコンテンツを作れるようになっています。
リアルタイム対話のための「Eleven v4 Turbo」
「Eleven v4 Turbo」は、Eleven v4の表現力を低遅延で利用できるモデルです。最初の音声が出るまでのモデル推論時間は中央値で約100ミリ秒で、通信や大規模言語モデルによる回答生成の時間は含みません。顧客サポート、予約、営業などの音声エージェントやライブアシスタントでの利用を想定しています。「Eleven v4」と「Eleven v4 Turbo」の使い分け
- じっくり作り込むコンテンツには「Eleven v4」
- リアルタイムのやりとりには「Eleven v4 Turbo」
このように使い分けてご利用いただけます。両モデルは同じ表現機能を備えます。Eleven v4 Turboは音声品質との小さなトレードオフを伴う一方、対話に適した低遅延を実現します。
「Eleven v4 Turbo」は『ElevenAgents』で利用可能に
大規模言語モデル(LLM)が回答を生成している途中から、テキストを順次流し込んで音声化を始められるため、応答の待ち時間を短くできます。「Eleven v4 Turbo」は、提供開始の初日から『ElevenAgents』で利用できます。通話の途中で相手が話す言語を切り替えても、同じ声のまま、切り替わった言語で応対を続けます。
ボイスクローンの再現性を向上
話者の声を再現するボイスクローン機能も向上しました。短い音声サンプルから声を再現する「インスタントボイスクローン」では、約10秒の音声からでも、声質や話し方の特徴をこれまで以上に忠実に捉えられるようになりました。
また、話者の声をより精緻に再現し、特にその話者が普段使用する言語での音声生成に適した「プロフェッショナルボイスクローン」も、引き続き利用できます。
なお、話者が普段使用しない言語で音声を生成する場合には、言語によって声の特徴やアクセントの再現度に差が生じることがあります。用途や対象言語に応じて、実際の音声を確認しながらご利用ください。
長尺コンテンツでも、一貫した声質を維持
オーディオブックやポッドキャストなどの長尺コンテンツでは、複数回に分けて音声を生成した際に、声質や話し方にばらつきが生じることがありました。「Eleven v4」では、複数回の生成をまたいでも話者の声や話し方の印象を保ちやすくなり、長いコンテンツでも一貫性のある音声を制作できます。「Eleven v4」「Eleven v4 Turbo」の提供方法
「Eleven v4」は『ElevenCreative』とAPIで、「Eleven v4 Turbo」は『ElevenAgents』とAPIでご利用いただけます。詳細と試用方法:https://elevenlabs.io/v4オーディオブック、ナレーション、キャラクターボイス、動画のボイスオーバー、吹き替えやローカライズ、教育コンテンツ、そして音声エージェントまで、「何を伝えるか」だけでなく「どのように伝えるか」が重要となる幅広い用途を想定しています。
安心・安全な音声AIの利用に向けた取り組み
音声AIやボイスクローン技術の普及に伴い、第三者へのなりすましなど、不正利用への対策も一層重要になっています。イレブンラボは、安心・安全に音声AIを利用できる環境の整備を、技術開発の重要な前提と位置づけています。
ボイスクローンの作成には、声の利用に必要な権利や許可が求められます。特にプロフェッショナルボイスクローンは、本人が自分の声を作成・確認する仕組みです。
また、ボイスクローン作成時のVoice CAPTCHAによる確認や、不正利用が確認されたアカウントへの対応など、悪用防止のための対策を講じています。
イレブンラボについて
イレブンラボは、2022年に設立された、テクノロジーとの関わり方を変革するAI研究・プロダクト企業です。企業向けの音声・チャットエージェントプラットフォーム「ElevenAgents」、コンテンツの制作・編集を支援する「ElevenCreative」、開発者がAIオーディオ基盤モデルを利用できる「ElevenAPI」を提供しています。音声合成、音声認識、会話型AIなどを通じて、企業、開発者、クリエイターによる新たなコミュニケーション体験の構築を支援。現在の企業評価額は110億米ドルを超え、プラットフォームは、Fortune 500企業の80%以上を含む数千社に利用されています。イレブンラボ日本語サイト
https://elevenlabs.io/ja
イレブンラボ 日本語版LinkedIn
https://www.linkedin.com/company/elevenlabs-japan/
イレブンラボ 日本語版X(旧Twitter)
@ElevenlabsJapan
イレブンラボジャパン公式note
https://note.com/elevenlabs_japan
プレスリリース提供:PR TIMES

