イレブンラボは、新しいモデルアーキテクチャを採用した音声合成モデル「Eleven v4」の提供を開始した。

「Eleven v4」は、文章の文脈や演出意図を捉え、声のトーン、間、感情、キャラクター性を表現するモデル。台本を読み上げるだけでなく、声で「演じる」ためのモデルとしており、オーディオブック、ナレーション、キャラクターボイス、吹き替えやローカライズなどでの利用を想定している。「笑う」「ささやく」といったインラインタグを書くことで、感情、テンポ、間、リアクション、効果音を直接指定できる。

90以上の言語に対応し、日本語は前モデルからの品質改善に重点を置いた言語のひとつ。日本語の音声を基に英語の台本を読ませる場合も、声の特徴を保ちながら英語として自然な発音に近づけられる。

あわせて、音声エージェントやライブアシスタントで利用できるリアルタイム向けの「Eleven v4 Turbo」も提供する。