Synthesizer
パラメータ
vendorstringTTS ベンダーの名前。'default' を指定するとアプリケーションのデフォルトを使用します。
voicestringTTS に使用する音声の名前。'default' を指定するとアプリケーションのデフォルトを使用します。
enginestring(Google 固有) standard、neural、generative、または long-form を指定できます。
genderstring(Google 固有) MALE、FEMALE、NEUTRAL を指定できます。
labelstringTTS ベンダーに関連付けられたラベル。
languagestringTTS の言語コード。'default' を指定するとアプリケーションのデフォルトを使用します。
optionsobjectTTS のベンダー固有オプション。サポートされるプロパティは後述を参照してください。
ベンダー固有オプション
modelstring音声合成に使用するモデル。指定すると Gemini TTS が有効になります。例: gemini-2.5-flash-preview-tts。
apiModestring使用する Google TTS の API モードを制御します。指定可能な値:
tts: 標準の Google Cloud TTS 音声(デフォルト)。live: より高品質な出力のためにストリーミングモードを使用する HD 音声。gemini: AI を活用した音声合成である Gemini TTS。
モードは設定に基づいて自動的に選択されます。options.model が指定されているか、音声認証情報に model_id が設定されている場合は Gemini TTS が使用されます。HD 音声が選択されている場合は live モードが使用されます。それ以外の場合は標準の tts モードが使用されます。
promptstring音声の生成方法を指示するために TTS モデルに送信するプロンプト。合成音声に求めるトーン、感情、話し方のスタイル、または文脈を指定するために使用します。このパラメータは Gemini TTS を使用する場合(apiMode: "gemini" または model が指定されている場合)にのみ適用されます。
cartesia
voice_modestringembedding または id (Cartesia ドキュメントを参照)
embeddingstring音声の埋め込み (embedding) (Cartesia ドキュメントを参照)
emotionstring感情を指定します(Cartesia ドキュメントを参照)
speednumber数値または名前付きの指定子(例: "slow")(Cartesia ドキュメントを参照)
elevenlabs
stabilitynumber音声設定の stability を定義します(Elevenlabs ドキュメントを参照)
similarity_boostnumber音声設定の similarity boost を定義します。(Elevenlabs ドキュメントを参照)
use_speaker_boostboolean音声設定の use speaker boost を定義します。このパラメータは V2 以降のモデルで利用できます(Elevenlabs ドキュメントを参照)
stylenumber音声設定の style を定義します。このパラメータは V2 以降のモデルで利用できます。(Elevenlabs ドキュメントを参照)
model_idstring使用するモデルの識別子(Elevenlabs ドキュメントを参照)
playht
voice_enginestring音声の合成に使用する音声エンジン。(Playht ドキュメントを参照)
qualitystringdraft、low、medium、high、premium (Playht ドキュメントを参照)
seednumber0 以上の整数。null または未指定の場合はランダムなシードが使用されます。生成される音声の再現性を制御するのに役立ちます。 他のすべてのプロパティが変わらなければ、固定のシードは常にまったく同じ音声ファイルを生成するはずです(Playht ドキュメントを参照)
temperaturenumber0 以上 2 以下の浮動小数点数。null または未指定の場合はモデルのデフォルトの temperature が使用されます。temperature パラメータはばらつきを制御します。低い値ほど予測しやすい結果になり、高い値ほど実行ごとの変動が大きくなるため、音声がベースラインの音声と似なくなる可能性があります。(Playht ドキュメントを参照)
emotionstring音声に適用する感情。voice_engine が Play3.0-mini、PlayHT2.0、または PlayHT2.0-turbo に設定されており、かつ音声がそのエンジンを使用している場合にのみサポートされます。(Playht ドキュメントを参照)
voice_guidancenumber1 から 6 までの数値。低い値にすると、選択した音声が他の音声と比べてどれだけ独特かが抑えられます。高い値にするとその個性が最大限に引き出されます。voice_engine が Play3.0-mini、PlayHT2.0、または PlayHT2.0-turbo に設定されており、かつ音声がそのエンジンを使用している場合にのみサポートされます。(Playht ドキュメントを参照)
style_guidancenumber1 から 30 までの数値。低い値にすると、選択した感情の強さが抑えられます。高い値にすると非常に感情豊かな表現になります。voice_engine が Play3.0-mini、PlayHT2.0、または PlayHT2.0-turbo に設定されており、かつ音声がそのエンジンを使用している場合にのみサポートされます。(Playht ドキュメントを参照)
text_guidancenumber1 から 2 までの数値。生成される音声が入力テキストにどれだけ忠実に従うかに影響します。低い値にするとより流暢な音声になりますが、入力テキストから逸脱する可能性が高くなります。高い値にすると生成される音声が入力テキストにより正確になり、発話される単語が指定したテキストと密接に一致するようになります。voice_engine が Play3.0-mini または PlayHT2.0 に設定されており、かつ音声がそのエンジンを使用している場合にのみサポートされます。(Playht ドキュメントを参照)
rimelabs
pauseBetweenBracketsbooleantrue に設定すると、山括弧で囲まれた単語の間にポーズを追加します。括弧内の数値はポーズの長さをミリ秒単位で指定します。 例: "Hi. \<200> I'd love to have a conversation with you." は、最初の文と2番目の文の間に 200ms のポーズを追加します。Rimelabs ドキュメントを参照
phonemizeBetweenBracketsbooleantrue に設定すると、波括弧で囲まれた単語の音素を指定できます。Rimelabs ドキュメントを参照
inlineSpeedAlphastring角括弧で囲まれた単語に適用する速度の値をカンマ区切りで列挙したもの。値が \< 1.0 なら発話が速くなり、> 1.0 なら遅くなります。例: "This sentence is [really] [fast]" に inlineSpeedAlpha "0.5, 3" を指定すると、"really" が遅く、"fast" が速くなります。Rimelabs ドキュメントを参照
speedAlphanumber発話速度を調整します。1.0 より小さい値はデフォルトより速く、1.0 より大きい値はデフォルトより遅くなります。Rimelabs ドキュメントを参照
reduceLatencyboolean応答のレイテンシを削減します。その代償として、数字や略語の発音が誤る可能性があります。Rimelabs ドキュメントを参照
murf
stylestring音声の話し方のスタイル。例: Conversational (Murf ドキュメントを参照)
ratenumber発話速度を調整します。(Murf ドキュメントを参照)
pitchnumber音声のピッチを調整します。(Murf ドキュメントを参照)
variationnumberペース、ピッチ、強調の変動量を制御します。(Murf ドキュメントを参照)
xai
音声: eve (デフォルト)、ara、leo、rex、sal。
サポートされる言語: auto、en、ar-EG、ar-SA、ar-AE、bn、zh、fr、de、hi、id、it、ja、ko、pt-BR、pt-PT、ru、es-MX、es-ES、tr、vi。
speednumber発話速度を制御します。0.7 以上 1.5 以下の数値。デフォルトは 1.0 です。
optimize_streaming_latencynumberレイテンシ最適化のレベル。0 (デフォルト、最適化なし)、1、または 2 (最大限のレイテンシ削減)。
text_normalizationbooleanテキスト正規化を有効にします(より自然な発話のために数字、日付、略語を展開します)。デフォルトは false です。
with_timestampsboolean音声と共に単語レベルのタイムスタンプを返します。ストリーミング TTS のパスでのみサポートされます(ワンショットの say 合成では無視されます)。デフォルトは false です。
注意: xAI TTS は、ワンショット合成(say Function 経由)と低レイテンシのストリーミング TTS の両方をサポートしています。xAI STT に使用するものと同じ xAI API キーの認証情報を使用します。
verbio
engine_versionstring使用するエンジンのバージョン。(Verbio ドキュメントを参照)
whisper
model_idstring使用する TTS モデル。(Whisper ドキュメントを参照)