動画ナレーションにはGemini TTSとElevenLabsのどちらを使う?同じ台本で比較

同じ英文をGemini TTSとElevenLabsで音声化。原音声、実測時間、設定を公開し、動画ナレーションの選び方と料金比較の注意点を説明します。

オリーブグレーの背景に巻尺の線画。コーラル色の縦線とGemini TTS vs ElevenLabsの文字。

ナレーションモデルを選ぶときは、許容できる音声、実際に利用するAPI経路で使える設定、そして動画に合わせるために必要な作業を確認しましょう。文字単価と音声トークン単価を比べても、完成したナレーションのどちらが安いかは分かりません。異なる台本を使った比較では、同じ作業にどちらの音声が適しているかも判断できません。

2026年10月10日、1つのオリジナル英語台本をOfox経由で elevenlabs/eleven_v4 と google/gemini-3.8-flash-tts に送信しました。どちらのリクエストも成功しました。ElevenLabsの音声ファイルは10.00秒、Geminiのファイルは9.76秒です。以下から、両方のオリジナルファイルをダウンロードできます。これらは各設定で1回ずつ生成した結果であり、自然さ、対応言語、本番運用の信頼性を順位付けしたものではありません。

万能の勝者ではなく、用途から考える

10秒の商品紹介動画と、オーディオブック、ライブ音声アシスタント、多言語の研修コースとでは、求める条件が異なります。ここで比較するのは、動画用にあらかじめ用意したナレーションです。リクエスト前に台本が決まっており、音声ファイルが返され、公開前に編集者が確認する想定です。

ストリーミング会話、音声クローン、感情表現の幅、あるいはどちらかのカタログにあるすべての音声を検証したものではありません。また、管理された条件での試聴パネルによる評価でもありません。生成物とその技術的特性は確認しましたが、発音や話し方に関する要件は、実際のファイルを聴いてご自身で評価してください。

そこで、役に立つ問いは「次の具体的な成果物では、どちらの設定から試すべきか」です。両方のモデルが台本どおりに話せる場合でも、既存の音声制作パイプライン、希望する声、編集にかけられる時間、検証済みの料金によって答えは変わります。

同一の台本と、実際に使った2つの設定

どちらのリクエストでも、同じUTF-8ファイルから前後の空白を取り除いて読み込んだ、以下のオリジナル英語テキストを使いました。

A clear product video starts with a clear brief. Show the real interface, explain one useful task, and check the exported video before sharing it.

文言は変更せず、どちらも速度1.0を指定しました。ゲートウェイ経由で各プロバイダーが提供する選択肢が異なるため、音声と出力プリセットは異なります。したがって、これは声質とエンコード方式を固定してモデルだけを比較する実験ではなく、実用上の設定を比較するものです。

設定Ofox経由のElevenLabsOfox経由のGemini
モデルelevenlabs/eleven_v4google/gemini-3.8-flash-tts
音声JBFqnCBsd6RMkjVDRZzbKore
リクエストした形式mp3_22050_32wav
指定した速度1.01.0
実際のファイル長10.00 s9.76 s
ダウンロードしたファイルのバイト数40,456476,186
クライアントでの経過時間2.861 s4.949 s
HTTP結果200200

経過時間はネットワークの状態を含む、1回のクライアントリクエストで測定した値です。音声の最初のバイトが届くまでのストリーミング遅延を測定したものではありません。ファイルサイズの差は、主に圧縮MP3とWAVというリクエスト形式の違いによるもので、大きなファイルのほうが音声品質に優れていることを示すものではありません。

正規化する前にオリジナルファイルを聴く

ElevenLabsのMP3とGeminiのWAVをダウンロードできます。テスト一式には台本、クライアント、設定、メタデータが含まれているため、サンプルから認証情報をコピーしなくてもテストを再現できます。

ElevenLabsの生成音声

Geminiの生成音声

出所を確認できるよう、これらのオリジナルファイルはそのまま保管してください。試聴用に音量を正規化したコピーを作成する場合は、別の名前を付け、別ファイルとして記録してください。音量の違いは好みに影響するため、公平に聴き比べるには再生音量をそろえるとよいでしょう。ただし、ダウンロードしたファイルを加工したことを明示せず、APIから得た未加工の出力として説明してはいけません。

ヘッドホン、または視聴者が動画を聴く実際のデバイスで確認してください。「API」、ブランド名、日付、重要な操作が明瞭に聞き取れるかをチェックします。最もよく聞こえる2秒だけを選ぶのではなく、フレーズ全体を文脈の中で試してください。短いサンプルでは魅力的に聞こえる声でも、実際の台本では編集に手間がかかることがあります。

この記事では自然さのスコアを付けていません。明確な試聴手順と実際の評価記録なしに数値を付けると、根拠のない精密さを装うことになるためです。裏付けのない「こちらのほうがよく聞こえる」という主張に頼らず比較できるよう、ファイルを公開しています。

同じ台本でのテストを再現する

Ofoxのキーを設定し、Pythonの requests、FFmpeg、ffprobe をインストールしたら、テスト一式を展開し、新しい出力ファイル名を指定して各プロバイダーに1回ずつリクエストします。

python3 audio_api.py speech --engine elevenlabs \
  --text comparison.txt --output my-elevenlabs.mp3
python3 audio_api.py speech --engine gemini \
  --text comparison.txt --output my-gemini.wav

このコマンドを実行すると、実際のリクエストが2回送信されます。公開済みのサンプルを確認するだけなら、実行する必要はありません。サンプルファイルはすでに同梱されています。クライアントは、指定した出力ファイルがすでに存在する場合は処理を停止し、エラーは音声ファイルとは別に保存します。結果が不明な場合にPOSTを自動で再試行するループは使いません。

Ofoxのモデルページでは、関連する連携を確認できます:ElevenLabsとGemini TTS。ペイロードを変更する前に確認してください。ネイティブのElevenLabs音声合成ドキュメントとGoogleのTTS概要も参考になりますが、各アダプターを通じてパラメーター一式がそのまま使えるとは限りません。

一方の設定でエラーが起きた場合は、音声品質の優劣を決める前に、その問題を解決してください。以前の試行ではElevenLabsの経路から上流のクォータエラーが返りましたが、復旧後に提示しているファイルを生成できました。この運用上の事象はモデルの音声品質が劣ることを示しませんし、その後に成功したからといって長期的な稼働率の比較ができるわけでもありません。

0.24秒の長さの差が編集にどう影響するか

今回のファイルでは、ElevenLabsのほうがGeminiより0.24秒長く、Geminiの録音時間9.76秒を基準にすると2.46%の差です。動画のカット位置が厳密な場合には影響することがありますが、これはごく小さな、特定の設定での観測結果です。別の生成、音声、言語、文では異なる可能性があります。

映像がちょうど10秒で終わる場合は、最後の単語と、その後の無音部分を確認してください。コンテナの再生時間だけでは、最後の単語がいつ終わったかは分かりません。ElevenLabsのサンプルをScribeで別途文字起こししたところ、最後の単語の終端は9.78秒でした。このタイミングを、確認せずにGeminiのファイルにも当てはめないでください。

長めのプレゼンテーションでは、1行の修正で録音全体を作り直さずに済むよう、シーン単位でナレーションを構成しましょう。台本の区切り、音声テイク、シーンの長さをまとめて保存します。文を再生成した場合は、古いファイルの長さを当てにせず、その文のタイミングと字幕の同期を再計算してください。

動画のナレーション制作ワークフローでは、音声の長さを測定し、MP4と組み合わせる方法を説明しています。Scribeで字幕を作るチュートリアルでは、実際の単語タイミングから字幕を作成する方法を扱っています。どちらのモデルも、音声の長さが既存のタイムラインにそのまま収まることを保証するものではありません。

試聴と編集に役立つ評価基準

プロバイダーを選ぶ前に、短い評価シートを作成してください。確認者が実際に判定できる基準を使い、問題があれば該当する時間範囲も記録します。これにより、曖昧な好みが再現できない制作基準になるのを防げます。

基準具体的な確認項目保存する記録
台本への忠実さ単語の省略、繰り返し、変更がないか元のテキストと音声の該当区間
発音ブランド名、略語、日付が明瞭か該当するフレーズと確認者のメモ
話す速さ発話を途中で切らずにシーンに収まるか測定した長さとシーンのタイミング
間間の取り方が意図した意味に合っているか編集画面上のキュー境界
編集の手間採用可能と判断するまでに何回修正が必要か記憶ではなくテイクの記録
出力形式書き出した動画が対象環境で再生できるか実際の書き出し・プレーヤーでの確認

社内でブラインド比較を行うなら、試聴用コピーからプロバイダー名を隠し、再生条件をそろえたうえで、確認者に評価理由を記録してもらいましょう。その後で設定を開示します。確認者が2人だけ、あるいは文が1つだけの場合は、そのサンプル数を明記してください。その結果を市場全体の好みとして説明してはいけません。

文字起こしによる確認は役立ちますが、限界もあります。Scribeは句読点を除き、ElevenLabsのサンプルから意図した単語を復元しました。これは、この明瞭なサンプルでテキストを復元できたことを裏付けますが、聴感上の品質スコアではありません。また、Geminiの未文字起こしのテイクについて、それだけで何かが分かるわけでもありません。

比較するのは単位の異なる料金ではなく、採用できるナレーションのコスト

現在のOfoxカタログでは、これらのモデルに異なる料金項目が表示されています。ElevenLabsには文字数ベースの入力項目があり、Gemini TTSにはテキスト入力と音声出力のトークン項目があります。この違いは、単純に数値を比べても意味がない理由を示しています。ダウンロードした音声のリクエストごとの確定請求額を示すものではありません。

これらのリクエストを個々の請求台帳の記録と照合していないため、表には「実際のコスト」や削減率を記載していません。カタログに表示された料金、ウォレット残高の変化、確定したリクエスト料金は、それぞれ異なる証拠です。共有ウォレットの残高は無関係な処理によっても変わる場合があり、バイナリー形式の音声レスポンスに、課金対象となるすべてのカウンターが含まれているとも限りません。

ご自身で評価する場合は、リクエストIDと対応する使用量記録を使ってください。ゲートウェイの課金定義に沿ってテキスト量を数え、関係するトークン数は返却値または記録値で確認し、適用される料金の時点と丸め処理を検証します。プロバイダーの料金と、Ofoxアカウントに請求される料金は分けて記録してください。

採用されなかったテイクも含めて計算しましょう。たとえば、プロバイダーAでは1つの文を採用するまでに3回のリクエストと手作業での修正が必要で、プロバイダーBでは1回で済むなら、使える音声を得るためのコストは1回分の料金だけでは比較できません。実用的な記録シートでは、次のように整理できます。

accepted_narration_cost = sum(verified charges for all takes)
editing_minutes = time spent reviewing and repairing those takes
acceptance_rate = accepted takes / generated takes

この数値を報告する際は、対象とする音声の範囲と評価ルールも記載してください。リクエスト時間のミリ秒を請求額に換算したり、ダウンロードしたバイト数を音声出力トークンの代わりに使ったりしてはいけません。課金データがない場合は、コストを未検証としたうえで、運用面と生成物に基づいて比較するのが適切です。

どちらの設定から評価すべきか?

既存のプロジェクトですでに特定のElevenLabs音声を使っている場合は、互換性のある経路から始め、実際の台本でテストしましょう。使い慣れた声を維持すれば編集上の変更を減らせることがあります。ただし、ここでのサンプルは、すべてのアカウント固有の音声やクローン音声をOfox経由で利用できることを証明するものではありません。

公開済みのOfox Gemini多言語ワークフローを拡張する場合は、検証済みのGemini設定から始めると、台本と組み立て用ツールの一貫性を保てます。次に別のプロバイダーを比較するのは、互換性のある音声を使いたい、あるいは特定の発音要件を満たせないなど、具体的な理由がある場合にしましょう。慣れていることは実装上の利点ですが、音声があらゆる用途で優れている証明にはなりません。

既存の音声が決まっていない新規プロジェクトでは、実際の台本に含まれる最も難しい用語を入れた短い文章をテストしてください。両方の出力を同じシーンで使い、検証済みの予算内で評価基準を満たすほうを選びます。予備の設定も残し、頼る前に実際の動作を確認してください。

ライブアシスタント、音声クローン、特殊な言語、厳格な放送品質が必要な場合は、別途評価を行ってください。この英語の動画ナレーション例から、それらの機能があるとは判断できません。用途を広げるには、比較タイトルの表現を強めるのではなく、追加の根拠が必要です。

テストを再現可能なワークフローにする

元のテキスト、モデル識別子、音声、形式、生成ファイル、評価結果を1つの記録としてバージョン管理してください。モデルの別名が変わった場合や音声を切り替えた場合は、新しい設定として扱います。過去に成功したテイクを、今日のモデル名で黙って付け替えてはいけません。

まとめて生成する前に、小さなテスト予算と中止条件を決めておきます。経路が結果不明のタイムアウトを返した場合は、何十回もむやみに再試行せず、状態を調べてください。両方の選択肢が要件を満たすなら、新しい根拠が切り替えコストを正当化するまでは、維持しやすい最もシンプルなワークフローを使いましょう。

次に有用なテストは、裏付けのない機能の主張を長々と並べることではなく、実際の台本で最も難しい文や、別の対象言語でのテストであることが多いでしょう。このサンプルは、確認可能な2つの出発点と、ナレーションの成功条件を決める方法を示しています。

よくある質問

このテストでは、どちらのモデルのほうがよく聞こえましたか?
管理された条件での試聴パネルは実施しておらず、主観的なスコアも付けていません。どちらのオリジナルファイルも公開しているので、ご自身の基準で発音や話し方を評価できます。
このリクエストではElevenLabsの処理が先に終わりました。こちらのほうが速いのでしょうか?
今回の1回のリクエストでは、ElevenLabsのクライアント経過時間のほうが短く測定されました。設定ごとに1回ずつのリクエストでは、一般的な遅延の優劣や、ストリーミング時に音声が届き始めるまでの性能は判断できません。
Geminiのファイルはなぜ大きいのですか?
テストではGeminiにWAVを、ElevenLabsに圧縮MP3のプリセットを指定しました。エンコード方式とコンテナの選択がファイルサイズに大きく影響するため、サイズだけでは音声品質を比較できません。
どちらのほうが安いですか?
今回のリクエストについては、リクエスト単位の確定請求額との照合をしていません。安いワークフローだと主張する前に、比較可能な課金単位と、採用できる音声を得るまでに必要なすべてのテイクを比べてください。