Wipple CPaaS
メニュー
Function リファレンス / Synthesizer

Synthesizer

パラメータ

vendorstring必須

TTS ベンダーの名前。'default' を指定するとアプリケーションのデフォルトを使用します。


voicestring必須

TTS に使用する音声の名前。'default' を指定するとアプリケーションのデフォルトを使用します。


enginestring

(Google 固有) standard、neural、generative、または long-form を指定できます。


genderstring

(Google 固有) MALE、FEMALE、NEUTRAL を指定できます。


labelstring

TTS ベンダーに関連付けられたラベル。


languagestring

TTS の言語コード。'default' を指定するとアプリケーションのデフォルトを使用します。


optionsobject

TTS のベンダー固有オプション。サポートされるプロパティは後述を参照してください。


ベンダー固有オプション

google

modelstring

音声合成に使用するモデル。指定すると Gemini TTS が有効になります。例: gemini-2.5-flash-preview-tts。


apiModestring

使用する Google TTS の API モードを制御します。指定可能な値:

  • tts: 標準の Google Cloud TTS 音声(デフォルト)。
  • live: より高品質な出力のためにストリーミングモードを使用する HD 音声。
  • gemini: AI を活用した音声合成である Gemini TTS。

モードは設定に基づいて自動的に選択されます。options.model が指定されているか、音声認証情報に model_id が設定されている場合は Gemini TTS が使用されます。HD 音声が選択されている場合は live モードが使用されます。それ以外の場合は標準の tts モードが使用されます。


promptstring

音声の生成方法を指示するために TTS モデルに送信するプロンプト。合成音声に求めるトーン、感情、話し方のスタイル、または文脈を指定するために使用します。このパラメータは Gemini TTS を使用する場合(apiMode: "gemini" または model が指定されている場合)にのみ適用されます。


cartesia

voice_modestring

embedding または id (Cartesia ドキュメントを参照)


embeddingstring

音声の埋め込み (embedding) (Cartesia ドキュメントを参照)


emotionstring

感情を指定します(Cartesia ドキュメントを参照)


speednumber

数値または名前付きの指定子(例: "slow")(Cartesia ドキュメントを参照)


elevenlabs

stabilitynumber

音声設定の stability を定義します(Elevenlabs ドキュメントを参照)


similarity_boostnumber

音声設定の similarity boost を定義します。(Elevenlabs ドキュメントを参照)


use_speaker_boostboolean

音声設定の use speaker boost を定義します。このパラメータは V2 以降のモデルで利用できます(Elevenlabs ドキュメントを参照)


stylenumber

音声設定の style を定義します。このパラメータは V2 以降のモデルで利用できます。(Elevenlabs ドキュメントを参照)


model_idstring

使用するモデルの識別子(Elevenlabs ドキュメントを参照)


playht

voice_enginestring

音声の合成に使用する音声エンジン。(Playht ドキュメントを参照)


qualitystring

draft、low、medium、high、premium (Playht ドキュメントを参照)


seednumber

0 以上の整数。null または未指定の場合はランダムなシードが使用されます。生成される音声の再現性を制御するのに役立ちます。 他のすべてのプロパティが変わらなければ、固定のシードは常にまったく同じ音声ファイルを生成するはずです(Playht ドキュメントを参照)


temperaturenumber

0 以上 2 以下の浮動小数点数。null または未指定の場合はモデルのデフォルトの temperature が使用されます。temperature パラメータはばらつきを制御します。低い値ほど予測しやすい結果になり、高い値ほど実行ごとの変動が大きくなるため、音声がベースラインの音声と似なくなる可能性があります。(Playht ドキュメントを参照)


emotionstring

音声に適用する感情。voice_engine が Play3.0-mini、PlayHT2.0、または PlayHT2.0-turbo に設定されており、かつ音声がそのエンジンを使用している場合にのみサポートされます。(Playht ドキュメントを参照)


voice_guidancenumber

1 から 6 までの数値。低い値にすると、選択した音声が他の音声と比べてどれだけ独特かが抑えられます。高い値にするとその個性が最大限に引き出されます。voice_engine が Play3.0-mini、PlayHT2.0、または PlayHT2.0-turbo に設定されており、かつ音声がそのエンジンを使用している場合にのみサポートされます。(Playht ドキュメントを参照)


style_guidancenumber

1 から 30 までの数値。低い値にすると、選択した感情の強さが抑えられます。高い値にすると非常に感情豊かな表現になります。voice_engine が Play3.0-mini、PlayHT2.0、または PlayHT2.0-turbo に設定されており、かつ音声がそのエンジンを使用している場合にのみサポートされます。(Playht ドキュメントを参照)


text_guidancenumber

1 から 2 までの数値。生成される音声が入力テキストにどれだけ忠実に従うかに影響します。低い値にするとより流暢な音声になりますが、入力テキストから逸脱する可能性が高くなります。高い値にすると生成される音声が入力テキストにより正確になり、発話される単語が指定したテキストと密接に一致するようになります。voice_engine が Play3.0-mini または PlayHT2.0 に設定されており、かつ音声がそのエンジンを使用している場合にのみサポートされます。(Playht ドキュメントを参照)


rimelabs

pauseBetweenBracketsboolean

true に設定すると、山括弧で囲まれた単語の間にポーズを追加します。括弧内の数値はポーズの長さをミリ秒単位で指定します。 例: "Hi. \<200> I'd love to have a conversation with you." は、最初の文と2番目の文の間に 200ms のポーズを追加します。Rimelabs ドキュメントを参照


phonemizeBetweenBracketsboolean

true に設定すると、波括弧で囲まれた単語の音素を指定できます。Rimelabs ドキュメントを参照


inlineSpeedAlphastring

角括弧で囲まれた単語に適用する速度の値をカンマ区切りで列挙したもの。値が \< 1.0 なら発話が速くなり、> 1.0 なら遅くなります。例: "This sentence is [really] [fast]" に inlineSpeedAlpha "0.5, 3" を指定すると、"really" が遅く、"fast" が速くなります。Rimelabs ドキュメントを参照


speedAlphanumber

発話速度を調整します。1.0 より小さい値はデフォルトより速く、1.0 より大きい値はデフォルトより遅くなります。Rimelabs ドキュメントを参照


reduceLatencyboolean

応答のレイテンシを削減します。その代償として、数字や略語の発音が誤る可能性があります。Rimelabs ドキュメントを参照


murf

stylestring

音声の話し方のスタイル。例: Conversational (Murf ドキュメントを参照)


ratenumber

発話速度を調整します。(Murf ドキュメントを参照)


pitchnumber

音声のピッチを調整します。(Murf ドキュメントを参照)


variationnumber

ペース、ピッチ、強調の変動量を制御します。(Murf ドキュメントを参照)


xai

音声: eve (デフォルト)、ara、leo、rex、sal。

サポートされる言語: auto、en、ar-EG、ar-SA、ar-AE、bn、zh、fr、de、hi、id、it、ja、ko、pt-BR、pt-PT、ru、es-MX、es-ES、tr、vi。

speednumber

発話速度を制御します。0.7 以上 1.5 以下の数値。デフォルトは 1.0 です。


optimize_streaming_latencynumber

レイテンシ最適化のレベル。0 (デフォルト、最適化なし)、1、または 2 (最大限のレイテンシ削減)。


text_normalizationboolean

テキスト正規化を有効にします(より自然な発話のために数字、日付、略語を展開します)。デフォルトは false です。


with_timestampsboolean

音声と共に単語レベルのタイムスタンプを返します。ストリーミング TTS のパスでのみサポートされます(ワンショットの say 合成では無視されます)。デフォルトは false です。


注意: xAI TTS は、ワンショット合成(say Function 経由)と低レイテンシのストリーミング TTS の両方をサポートしています。xAI STT に使用するものと同じ xAI API キーの認証情報を使用します。

verbio

engine_versionstring

使用するエンジンのバージョン。(Verbio ドキュメントを参照)


whisper

model_idstring

使用する TTS モデル。(Whisper ドキュメントを参照)