Wipple CPaaS
メニュー
Function リファレンス / Recognizer

Recognizer

パラメータ

vendorstring必須

使用する音声認識ベンダー(下記の一覧を参照)。 注意: このフィールドは大文字・小文字を区別します。組み込みベンダーはすべて小文字です(例: AWS ではなく aws)。


altLanguagesarray

(Google、Microsoft) 話者が使用している可能性のある代替言語の配列。


asrDtmfTerminationDigitstring

連続 ASR を終了させる DTMF キー。


asrTimeoutnumber

連続 ASR のタイムアウト値。


autogeneratePromptboolean

(AssemblyAI) true の場合、親の gather Function にネストされた say Function のテキストを assemblyAiOptions.prompt に自動的に設定します。ネストされた say があり、かつ明示的な assemblyAiOptions.prompt が指定されていない場合にのみ適用されます。SSML タグは使用前に除去されます。


azureServiceEndpointstring

Microsoft がホストするリージョン別エンドポイントの代わりに接続するカスタムサービスエンドポイント。


diarizationboolean

(Google) 話者ダイアライゼーション(話者分離)を有効にします。


diarizationMaxSpeakersnumber

(Google) 話者数の最大値を設定します。


diarizationMinSpeakersnumber

(Google) 話者数の最小値を設定します。


enhancedModelboolean

(Google) 拡張モデルを使用します。


filterMethodstring

(AWS) 音声をフィルタリングする際の方法: remove、mask、または tag。


hintsarray

(Google、Microsoft、Deepgram、Nvidia、Soniox) 音声検出を補助する単語またはフレーズの配列。
下記の 音声ヒントの指定 を参照してください。


hintsBoostnumber

(Google、Nvidia) 設定したヒントに割り当てる強度を示す数値。
下記の例を参照してください。


identifyChannelsboolean

(AWS) チャネル識別を有効にします。


initialSpeechTimeoutMsnumber

(Microsoft) 初期発話タイムアウト(ミリ秒)。


interactionTypestring

(Google) インタラクションタイプを設定します: discussion、presentation、phone_call、voicemail、
professionally_produced、voice_search、voice_command、dictation。


interimboolean

true の場合、中間文字起こし結果が送信されます。
デフォルト: false。

注意: これは Transcribe Function で使用する場合にのみ影響します。Gather では、中間結果は partialResponseHook の有無に基づいて送信されます。


languagestring

音声検出に使用する言語コード。
デフォルトはアプリケーションレベルの設定です。


languageModelNamestring

(AWS) 音声処理時に使用するカスタム言語モデルの名前。


minConfidencenumber

指定した場合、信頼度がこの値より低い最終文字起こし結果は
Webhook で 'stt-low-confidence' という reason を返します。


modelstring

(Google) 使用する音声認識モデル。
デフォルト: phone_call。


naicsCodenumber

(Google) 音声に関連する業種の NAICS コードを設定します。


outputFormatstring

(Microsoft) simple または detailed。
デフォルト: simple。


profanityFilterboolean

(Google、Deepgram、Nuance、Nvidia) true の場合、音声の文字起こし結果から不適切な表現をフィルタリングします。
デフォルト: false。


profanityOptionstring

(Microsoft) masked、removed、または raw。
デフォルト: raw。


punctuationboolean

(Google) 自動句読点付与を有効にします。


requestSnrboolean

(Microsoft) 信号対雑音比(SNR)情報を要求します。


separateRecognitionPerChannelboolean

true の場合、発信者と着信側の音声を別々の認識セッションで認識します。


singleUtteranceboolean

(Google) true の場合、単一の発話/文字起こし結果のみを返します。
デフォルト: gather では true。


transcriptionHookstring必須

中間または最終の文字起こし結果を受信したときに HTTP POST を受け取る Webhook。


vad.enableboolean

true の場合、音声が検出されるまでクラウド認識エンジンへの接続を遅延させます。


vad.modenumber

vad が有効な場合、この設定は音声区間検出器(VAD)の感度を制御します。
値は 0 から 3 までの範囲でなければなりません。
数値が小さいほど感度が高くなります。


vad.voiceMsnumber

vad が有効な場合、クラウド認識エンジンに接続する前に必要な音声のミリ秒数。


vocabularyFilterNamestring

(AWS) 音声処理時に使用するボキャブラリーフィルターの名前。


vocabularyNamestring

(AWS) 音声処理時に使用するボキャブラリーの名前。


ベンダー固有オプション

assemblyAiOptions

apiKeystring

認証に使用する AssemblyAI API キー(アカウントに設定された認証情報を上書きします)。


serviceVersionstring

使用するストリーミング API のバージョン。v2 または v3。


speechModelstring

認識に使用する AssemblyAI 音声モデル(例: u3-rt-pro)。


formatTurnsboolean

各話者ターンをフォーマットします。デフォルト: true。


endOfTurnConfidenceThresholdnumber

ターン終了(end-of-turn)をトリガーする前にモデルが満たすべき信頼度のしきい値(0.0~1.0)。例: 0.5。


minEndOfTurnSilenceWhenConfidentnumber

モデルがターン終了(EOT)が発生すべきと確信している場合に、最後に話された単語の後、システムがターン終了イベントをトリガーするまでに必要な最小の無音時間(ミリ秒)。デフォルト: 400。例: 500。


maxTurnSilencenumber

ターン終了が自動的にトリガーされるまでに、ターン内で許容される最大の無音時間(ミリ秒)。デフォルト: 1280。例: 2000。


minTurnSilencenumber

ターン終了を許可するまでの最小の無音時間(ミリ秒)。


keytermsarray

認識時にブーストするキーワードのリスト。例: ["Wipple", "Miraicom"]。


promptstring

認識モデルを誘導するプロンプトテキスト。通常は、想定されるユーザーの応答の説明です。応答が予測可能な場合(例: 直前に尋ねた質問のテキスト)に精度が向上します。認識エンジンの autogeneratePrompt も参照してください。これは gather Function にネストされた say からこの値を自動的に設定します。


languageDetectionboolean

自動言語検出を有効にします。


vadThresholdnumber

音声区間検出(VAD)のしきい値。


inactivityTimeoutnumber

ストリームを閉じるまでの非アクティブ状態のタイムアウト(秒)。


azureOptions

speechSegmentationSilenceTimeoutMsnumber

現在話されているフレーズ内で、そのフレーズが「完了」と見なされるまでの非音声オーディオの継続時間(ミリ秒)。
詳細は こちら を参照してください。


audioLoggingboolean

音声ログ記録を有効にします。 詳細は こちら を参照してください。


deepgramOptions

alternativesnumber

返却する代替文字起こし結果の数。


apiKeystring

認証に使用する Deepgram API キー(アカウントに設定された認証情報を上書きします)。


customModelstring

カスタムモデルの ID。


diarizeboolean

文字起こし結果の各単語に 話者を割り当てるかどうか。


diarizeVersionstring

'2021-07-14.0' に設定すると、従来のダイアライゼーション機能が使用されます。


endpointingnumber | string

話者が単語またはフレーズを言い終えたと Deepgram が判断するために使用する
無音のミリ秒数を示します。
値はミリ秒数、またはこの機能を完全に無効にする 'false' のいずれかでなければなりません。
デフォルト: 10ms。


eagerEotThresholdnumber

Deepgram Flux でのみ利用可能。 EagerEndOfTurn イベントをトリガーする信頼度のしきい値。早期の LLM 応答生成を可能にします。


eotThresholdnumber

Deepgram Flux でのみ利用可能。 ターン終了検出の信頼度のしきい値


eotTimeoutMsnumber

Deepgram Flux でのみ利用可能。 信頼度に関係なく EndOfTurn を強制するまでの最大無音時間。有効な値は 500 ~ 10000 ミリ秒です。


keytermsarray

キーワードプロンプトの配列


keywordsarray

コンテキストの理解を助けるために、モデルがブーストまたは抑制の面で特に注意を払うべき
キーワードの配列。


mipOptOutboolean

Deepgram のモデル改善プログラムをオプトアウトするかどうかを示します。


modelstring

送信された音声の処理に使用する Deepgram モデル。
モデルの例: 'nova-3'、'nova-2'、'nova-2-phonecall'。完全な一覧は Deepgram ドキュメント を参照してください。
デフォルト: 'general'。


multichannelboolean

各オーディオチャネルを独立して文字起こしするかどうかを示します。


noDelayboolean

Deepgram の no_delay 機能を有効にするかどうかを示します。


numeralsboolean

数字を文字表記(例: "one")から数値表記(例: "1")に
変換するかどうかを示します。


profanityFilterboolean

文字起こし結果から
不適切な表現を削除するかどうかを示します。


punctuateboolean

文字起こし結果に
句読点と大文字化を追加するかどうかを示します。


redactarray

文字起こし結果から
情報を秘匿するかどうか。
許可される値: 'pci'、'numbers'、'true'、'ssn'。


replacearray

送信された音声内で検索して置換する
用語またはフレーズの配列。


searcharray

送信された音声内で検索する用語またはフレーズの配列。


shortUtteranceboolean

Deepgram の is_final プロパティが設定され次第、文字起こし結果を返すようにします。
これは、非常に短い確認応答や直接的なコマンドが想定され、
レイテンシーを最小限にしたいシナリオでのみ使用してください。


smartFormattingboolean

Deepgram の Smart Formatting 機能を有効にするかどうかを示します。


tagstring

リクエストに関連付けるタグ。
タグは使用状況レポートに表示されます。


tierstring

使用する Deepgram ティア。
許可される値: 'enhanced'、'base'。
デフォルト: 'base'。


utteranceEndMsnumber

最後の単語が話された後、Deepgram が UtteranceEnd イベントを返すまでに待機する
無音のミリ秒数。このプロパティが指定された場合、Wipple CPaaS はこのイベントを使用して
文字起こし Webhook をトリガーします。
これは実質的に Deepgram 版の連続 ASR です。


versionstring

使用するモデルの Deepgram バージョン。
デフォルト: 'latest'。


googleOptions

Google は 1 組の認証情報で 3 つの音声 API を提供しています: Cloud Speech-to-Text v1、Cloud Speech-to-Text v2、および Gemini Live 文字起こしモデルです。どれが実行されるかは認識エンジンの model によって決まります。gemini- で始まる名前は Gemini Live API を選択し、それ以外は Cloud Speech 認識エンジンを選択します。model を未設定のままにすると、Wipple CPaaS は従来どおり言語に適した Cloud Speech モデルを選択します。デフォルトモデルは、アカウントに設定された Google 音声認証情報に保存することもできます。この場合、リクエストで上書きされない限り、そのアカウントのすべての通話に適用されます。

Gemini Live 文字起こしは話者ダイアライゼーションや単語タイムスタンプをサポートしておらず、Google はライブセッションを 10 分に制限しています。このパスでは認識エンジンの diarization および words プロパティは無視されます。

認識は GA 版の Vertex AI インターフェース上で実行され、音声認証情報自身のサービスアカウントとして認証します。追加のシークレットは不要ですが、プロジェクトで課金が有効になっており、サービスアカウントに roles/aiplatform.user が付与されている必要があります。プロジェクトはサービスアカウントから、リージョンは parentPath から決定されます。リージョンのデフォルトは、これらのモデルが提供されている global です。モデル名は Vertex AI が公開している表記で指定してください。プレビュー版の Gemini Developer API(「AI Studio」)は同じモデルを異なる表記で扱いますが、サービスアカウントを拒否するためサポートされていません。

modestring

Gemini の文字起こしスタイル(gemini モデルのみ): VERBATIM(デフォルト)は話されたとおりに文字起こしし、SMART は言いよどみを除去してフォーマットを適用します。


customVocabularyarray

認識を偏らせるための用語、略語、ブランド名、固有名詞を最大 1000 件まで指定します(gemini モデルのみ)。例: ["Wipple", "Miraicom"]。省略した場合、代わりに認識エンジンの hints が使用されます。


serviceVersionstring

Cloud Speech-to-Text API のバージョン。v1(デフォルト)または v2。gemini モデルは別の API であるため、無視されます。


recognizerIdstring

Google Speech 認識エンジンリソースの ID(v2 のみ)。


parentPathstring

Google Speech 認識エンジンの親リソースパス(v2 のみ)。例: projects/my-project/locations/us-central1。global 以外のロケーションを指定すると、リクエストはそのリージョンのエンドポイントにもルーティングされます。


speechStartTimeoutMsnumber

発話開始を待機するミリ秒数(v2 のみ)。


speechEndTimeoutMsnumber

発話終了の検出に使用する無音のミリ秒数(v2 のみ)。


enableVoiceActivityEventsboolean

Google の音声区間検出イベントを有効にします(v2 のみ)。


transcriptNormalizationarray

文字起こし結果の正規化ルール(v2 のみ)。各要素は {search, replace, caseSensitive} です。


xaiOptions

xAI(xai)はライブストリーミング認識エンジンです。中間および最終の両方の文字起こし結果がサポートされています。

apiKeystring

認証に使用する xAI API キー(Wipple CPaaS に設定された認証情報を上書きします)。


modelstring

使用する文字起こしモデル。例: grok-voice-transcribe-2.0 または grok-voice-transcribe-1.0。
指定しない場合、xAI が現在のデフォルトモデルを自動的に選択します。


endpointinginteger

発話が最終と見なされるまでの無音のミリ秒数。
有効な値は 0 ~ 5000 です。


diarizeboolean

話者ダイアライゼーションを有効にします。


fillerWordsboolean

文字起こし結果にフィラー(例: 「um」「uh」)を含めます。


keytermsarray

認識をブーストするキーワードの配列。


smartTurnnumber

ターン終了の信頼度のしきい値。0.0 から 1.0 の範囲。


smartTurnTimeoutinteger

ターン終了の最終結果を強制するまでの最大無音ミリ秒数。
有効な値は 1 ~ 5000 です。


houndifyOptions

houndifyOptionsnumber

発信者の緯度。


longitudenumber

発信者の経度。


citystring

発信者の都市。


statestring

発信者の州。


countrystring

発信者の国。


timezonestring

発信者のタイムゾーン。


domainstring

audioEndpointstring

maxSilenceSecondsnumber

maxSilenceAfterFullQuerySecondsnumber

maxSilenceAfterPartialQuerySecondsnumber

vadSensitivitynumber

vadTimeoutnumber

vadModestring

vadVoiceMsnumber

vadSilenceMsnumber

vadDebugdebug

audioFormatstring

enableNoiseReductionboolean

enableProfanityFilterboolean

enablePunctuationboolean

enableCapitalizationboolean

confidenceThresholdnumber

enableDisfluencyFilterboolean

maxResultsnumber

enableWordTimestampsboolean

maxAlternativesnumber

partialTranscriptIntervalnumber

sessionTimeoutnumber

connectionTimeoutnumber

customVocabularystring

languageModelstring

ibmOptions

acousticCustomizationIdstring

カスタム音響モデルの ID。


baseModelVersionstring

使用するベースモデル。


instanceIdstring

IBM 音声インスタンス ID(アカウントに設定された認証情報を上書きします)。


languageCustomizationIdstring

カスタム言語モデルの ID。


modelstring

音声認識に使用するモデル。


sttApiKeystring

認証に使用する IBM API キー(アカウントに設定された認証情報を上書きします)。


sttRegionstring

IBM リージョン(アカウントに設定された認証情報を上書きします)。


watsonLearningOptOutboolean

IBM が API リクエストデータをサービス改善に使用しないようにするには true に設定します。


watsonMetadatastring

提供するリクエストデータに適用する
タグ値。


nuanceOptions

allowZeroBaseLmWeightboolean

true の場合、カスタムリソース(DLM、ワードセットなど)が重みの全範囲を使用できます。


clientDataobject

通話ログに挿入する任意のキーと値のペアを含むオブジェクト。


clientIdstring

認証に使用する Nuance クライアント ID(アカウントに設定された認証情報を上書きします)。


discardSpeakerAdaptationboolean

話者プロファイルを使用する場合、更新された話者データを破棄するかどうか。
デフォルトではデータは保存されます。


filterWakeupWordboolean

最終結果からウェイクアップワードを削除するかどうか。


formatting.optionsobject

データパックで定義されたフォーマットオプションと値のキーと値のペアを含むオブジェクト。


formatting.schemestring

データパックで定義されたフォーマットタイプのキーワード。


includeTokenizationboolean

トークン化された認識結果を含めるかどうか。


kryptonEndpointstring

接続先のオンプレミス Krypton エンドポイント。
デフォルト: ホステッドサービス。


maskLoadFailuresboolean

外部リソースの読み込みに失敗したときに認識を終了するかどうか。


maxHypothesesnumber

返却する n-best 仮説の最大数。


noInputTimeoutMsnumber

認識タイマーの開始後、ユーザー入力を待機する間に許容される最大の無音時間(ミリ秒)。


punctuationboolean

自動句読点付与を有効にするかどうか。


recognitionTimeoutMsnumber

認識ターンの最大継続時間(ミリ秒)。


resourcearray

認識を改善するための 0 個以上の 認識リソース
(ドメイン LM、ワードセットなど)の配列。


resource[].builtinstring

データパック内の組み込みリソースの名前。


resource[].externalReferenceobject

話者プロファイルを作成または更新するための
外部 DLM または設定ファイル。


resource[].externalReference.headersobject

HTTP キャッシュ制御ディレクティブ(例: max-age など)を含むオブジェクト。


resource[].externalReference.maxLoadFailuresboolean

true の場合、リソースの読み込みに失敗しても文字起こしの続行を許可します。


resource[].externalReference.requestTimeoutMsnumber

リソースをダウンロードする際の待機時間。


resource[].externalReference.typestring

リソースタイプ: 'undefined_resource_type'、'wordset'、'compiled_wordset'、'domain_lm'、
'speaker_profile'、'grammar'、'settings'。


resource[].externalReference.uristring

URN 参照としてのリソースの場所。


resource[].inlineGrammarstring

SRGS XML 形式のインライン文法。


resource[].inlineWordsetobject

インラインワードセット JSON リソース。
詳細は Wordsets を参照してください。


resource[].reusestring

リソースが 複数回使用されるかどうか。
許可される値: 'undefined_reuse'、'low_reuse'、'high_reuse'。
デフォルト: low_reuse。


resource[].weightNamestring

データパックに対するドメイン LM または組み込みリソースの
重み を設定する入力フィールド。
許可される値: 'defaultWeight'、'lowest'、'low'、'medium'、'high'、'highest'。
デフォルト: MEDIUM。


resource[].weightValuenumber

DLM または組み込みリソースの重み。0 から 1 の数値。
デフォルト: 0.25。


resource[].wakeupWordarray

ウェイクアップワード の配列。


resultTypestring

認識結果のレベル: 'final'、'partial'、'immutable_partial'。
デフォルト: final。


secretstring

認証に使用する Nuance シークレット(アカウントに設定された認証情報を上書きします)。


speechDetectionSensitivitynumber

音声とノイズ(呼吸音など)の検出のバランス。0 から 1 の範囲。
0 はすべてのノイズを無視し、1 はすべてのノイズを音声として解釈します。
デフォルト: 0.5。


speechDomainstring

データパック内の言語モデル用の内部重みセットへのマッピング。


suppressCallRecordingboolean

通話ログの記録と音声キャプチャを無効にするかどうか。
デフォルトでは、通話ログ、音声、およびメタデータが収集されます。


suppressInitialCapitalizationboolean

true の場合、文の最初の単語は自動的に大文字化されません。


topicstring

特化型言語モデル。


utteranceDetectionModestring

オーディオストリーム内で処理する文(発話)の数。
許可される値: 'single'、'multiple'、'disabled'。
デフォルト: single。


utteranceEndSilenceMsnumber

文の終わりを判定する最小の無音時間(ミリ秒)。


userIdstring

アプリケーション内の特定のユーザーを識別します。


nvidiaOptions

customConfigurationobject

カスタム設定のために Nvidia に送信できるキーと値のペアのオブジェクト。


maxAlternativesnumber

返却する代替文字起こし結果の数。


profanityFilterboolean

文字起こし結果から不適切な表現を削除するかどうかを示します。


punctuationboolean

文字起こし結果に句読点を付与するかどうかを示します。


rivaUristring

Nvidia Riva が待ち受けている GRPC エンドポイント(ip:port)。


verbatimTranscriptsboolean

逐語的な文字起こし結果を提供するかどうかを示します。


wordTimeOffsetsboolean

単語レベルの詳細を提供するかどうかを示します。


openaiOptions

apiKeystring

認証に使用する OpenAI API キー(指定した場合、アカウントに設定された認証情報を上書きします)。


languagestring

OpenAI の言語コード。言語は認識エンジンレベルでも設定できますが、 ここで設定した場合はこの値が優先されます。言語コードは ISO-639-1 形式(例: en)で指定することに注意してください。


modelstring

OpenAI モデル。現在、'whisper-1'、'gpt-4o-mini-transcribe'、'gpt-4o-transcribe'、'gpt-realtime-whisper'、および 'gpt-live-transcribe' がサポートされています。 注意: 'gpt-live-transcribe' および 'gpt-realtime-whisper' は OpenAI のサーバー側ターン検出をサポートしていません。これらのモデルでは turn_detection の設定は 無視され、代わりに Wipple CPaaS がローカルで発話終了を検出します(vadMode、vadSilenceMs、vadVoiceMs を参照)。


languagesstring[]

'gpt-live-transcribe' でのみ使用されます。このモデルは単一のコードではなく言語ヒントのリストを受け付けます。例: ["en", "fr"]。 language および認識エンジンレベルの言語より優先されます。


keywordsstring[]

'gpt-live-transcribe' でのみ使用されます。音声に含まれる可能性のある文字どおりの用語(製品名、略語、薬品名など)。 これらはヒントであり、必須の出力ではありません。ここで値を設定せず、ヒントを指定した場合は、ヒントがキーワードとして送信されます。


delaystring

'gpt-live-transcribe' でのみ使用されます。'minimal'、'low'、'medium'、'high'、または 'xhigh' のいずれかで、レイテンシーと精度のトレードオフを指定します。 低い値ほど部分テキストが早く出力され、高い値ほどモデルにより多くの音声コンテキストが与えられ、精度が向上する可能性があります。


promptstring

モデルのスタイルを誘導したり、前の音声セグメントを継続したりするための任意のテキスト。 ここで値を設定せず、ヒントを指定した場合は、ヒントを OpenAI モデルに伝えるためのプロンプトが自動的に生成されることに注意してください。


input_audio_noise_reductionobject

入力音声にノイズ除去を適用するかどうかを制御します。


input_audio_noise_reduction.typestring必須

'near_field' または 'far_field'。


promptTemplatesobject

OpenAI に送信するプロンプトを動的に構築するために使用できるテンプレート。


promptTemplates.hintsTemplatestring

ヒントを伝えるプロンプトを構築するために使用できるテンプレート。プレースホルダー "{{hints}}" を使用します。例: "Please transcribe the following audio, making sure to spell the following words correctly: {{hints}}"


promptTemplates.conversationHistoryTemplatestring

直近の会話に基づいてプロンプトを構築するために使用できるテンプレート。プレースホルダー "{{turns}}" を使用します。例: "Here is the recent conversation history: {{turns}}"。
デフォルトでは会話の直近 4 ターンが使用されますが、次のように変更できます: "Here is the recent conversation history: {{turns:3}}"。


turn_detectionobject

話者が話し終えたことを検出する方法を指定します。


turn_detection.typestring必須

'none'、'server_vad'、または 'semantic_vad'。


turn_detection.eagernessstring

'low'、'medium'、'high、または 'auto'。semantic_vad モードでのみ使用されます。 モデルが応答する積極性です。low はユーザーが話を続けるのをより長く待ち、 high はより速く応答します。auto がデフォルトで、medium と同等です。


turn_detection.thresholdnumber

server_vad モードでのみ使用されます。VAD の活性化しきい値(0.0 ~ 1.0)。デフォルトは 0.5 です。 しきい値を高くするとモデルを活性化するためにより大きな音量が必要になるため、 騒がしい環境ではより良く動作する可能性があります。


turn_detection.prefix_padding_msnumber

server_vad モードでのみ使用されます。VAD が検出した音声の前に含める音声の量(ミリ秒)。 デフォルトは 300ms です。


turn_detection.silence_duration_msnumber

server_vad モードでのみ使用されます。発話の停止を検出するための無音の継続時間(ミリ秒)。 デフォルトは 500ms です。値を短くするとモデルはより速く応答しますが、ユーザーの短い間で割り込んでしまう可能性があります。


vadModenumber

'gpt-live-transcribe' または 'gpt-realtime-whisper' でのみ使用されます。ローカルの音声区間検出器の感度。0 ~ 3 の整数。高いほど積極的です。デフォルトは 2 です。


vadSilenceMsnumber

'gpt-live-transcribe' または 'gpt-realtime-whisper' でのみ使用されます。発話終了を検出してバッファをコミットするために必要な無音のミリ秒数。デフォルトは 500ms です。


vadVoiceMsnumber

'gpt-live-transcribe' または 'gpt-realtime-whisper' でのみ使用されます。発話開始を検出するために必要な音声のミリ秒数。デフォルトは 250ms です。


houndifyOptions

latitudenumber

位置情報に基づくクエリ用の緯度座標。


longitudenumber

位置情報に基づくクエリ用の経度座標。


citystring

位置情報コンテキスト用の都市名。


statestring

位置情報コンテキスト用の州または県。


countrystring

位置情報コンテキスト用の国。


timeZonestring

タイムゾーン識別子(例: 'America/New_York')。


domainstring

特定の機能を有効にする Houndify ドメイン。


audioEndpointstring

カスタム音声ストリーミングエンドポイント URL。


maxSilenceSecondsnumber

リクエストを終了するまでの最大無音時間(秒)。


maxSilenceAfterFullQuerySecondsnumber

完全なクエリを検出した後の最大無音時間(秒)。


maxSilenceAfterPartialQuerySecondsnumber

部分的なクエリを検出した後の最大無音時間(秒)。


vadSensitivitynumber

音声区間検出の感度レベル。


vadTimeoutnumber

音声区間検出のタイムアウト値。


vadModestring

音声区間検出モード。


vadVoiceMsnumber

VAD 検出のための最小音声時間(ミリ秒)。


vadSilenceMsnumber

VAD 検出のための最小無音時間(ミリ秒)。


vadDebugboolean

VAD デバッグ情報を有効にします。


audioFormatstring

オーディオストリームの音声フォーマット指定。


enableNoiseReductionboolean

音声ノイズ除去処理を有効にします。


enableProfanityFilterboolean

文字起こし結果から不適切な表現をフィルタリングします。


enablePunctuationboolean

文字起こし結果への自動句読点付与を有効にします。


enableCapitalizationboolean

文字起こし結果の自動大文字化を有効にします。


confidenceThresholdnumber

認識結果を受け入れるための最小信頼度のしきい値。


enableDisfluencyFilterboolean

文字起こし結果から言いよどみ(um、uh など)をフィルタリングします。


maxResultsnumber

返却する結果の最大数。


enableWordTimestampsboolean

文字起こし結果に単語レベルのタイムスタンプを含めます。


maxAlternativesnumber

返却する代替文字起こし結果の最大数。


partialTranscriptIntervalnumber

部分的な文字起こし結果の更新を送信する間隔(ミリ秒)。


sessionTimeoutnumber

セッションタイムアウト時間(秒)。


connectionTimeoutnumber

接続タイムアウト時間(秒)。


customVocabularyarray

認識精度を向上させるためのカスタム単語またはフレーズの配列。


languageModelstring

認識に使用するカスタム言語モデルの識別子。


sonioxOptions

api_keystring

Soniox API キー。


modelstring

使用する Soniox モデル。
デフォルト: 'precision_ivr'。


profanityFilterboolean

文字起こし結果から 不適切な表現を削除する かどうかを示します。


storageobject

音声や文字起こし結果を保存するかどうかを指定するプロパティ。
デバッグ目的で役立つ場合があります。


storage.disableSearchbooleanデフォルト: false

true の場合、検索を許可しません。


storage.disableStoreAudiobooleanデフォルト: false

true の場合、音声を保存しません。


storage.disableStoreTranscriptbooleanデフォルト: false

true の場合、文字起こし結果を保存しません。


storage.idstring

ストレージ識別子。


storage.titlestring

ストレージタイトル。


gladiaOptions

modelstring

使用する処理モデル。 デフォルト: 'solaria-1'。


endpointingnumber

発話完了をトリガーする無音の継続時間(秒)。 値は 0.01 から 10 の範囲でなければなりません。 デフォルト: 0.05。


maximum_duration_without_endpointingnumber

エンドポインティング検出なしの最大継続時間(秒)。 値は 5 から 60 の範囲でなければなりません。 デフォルト: 5。


custom_metadataobject

文字起こしセッションにカスタムメタデータを添付します。


language_configobject

文字起こしの言語設定。


language_config.languagesarray

文字起こしに使用する言語コードの配列。


language_config.code_switchingboolean

オーディオストリーム内での自動言語切り替えを有効にします。


pre_processingobject

音声前処理の設定。


pre_processing.audio_enhancerboolean

音声強調処理を有効にします。


pre_processing.speech_thresholdnumber

音声検出のしきい値。


realtime_processingobject

リアルタイム処理の設定。


realtime_processing.custom_vocabularyarray

認識精度を向上させるためのカスタム語彙の配列。


realtime_processing.custom_vocabulary_configobject

カスタム語彙の動作に関する設定。


realtime_processing.custom_spellingarray

カスタムスペルルールの配列。


realtime_processing.custom_spelling_configobject

カスタムスペルの動作に関する設定。


realtime_processing.translationboolean

リアルタイム翻訳を有効にします。


realtime_processing.translation_configobject

翻訳先言語を含む翻訳設定。


realtime_processing.named_entity_recognitionboolean

固有表現認識(NER)を有効にします。


realtime_processing.sentiment_analysisboolean

文字起こし結果に対する感情分析を有効にします。


post_processingobject

後処理の設定。


post_processing.summarizationboolean

自動要約を有効にします。


post_processing.summarization_configobject

要約の動作に関する設定。


post_processing.chapterizationboolean

自動チャプター検出を有効にします。


messages_configobject

セッション中に受信するイベントタイプを制御します。


messages_config.receive_pre_finalboolean

最終確定前の文字起こしイベントを受信します。


messages_config.receive_finalboolean

最終の文字起こしイベントを受信します。


messages_config.receive_speech_recognitionboolean

音声認識イベントを受信します。


callbackboolean

文字起こしイベントのコールバック配信を有効にします。 デフォルト: false。


callback_configobject

callback が有効な場合のコールバック設定。


callback_config.urlstring

コールバックイベントを受信する URL。


speechmaticsOptions

sm_audioEventsConfigobject

報告する音声イベント。


sm_audioEventsConfig.typesarray必須

"applause"、"laughter"、または "music"


transcription_configobject

音声文字起こしの設定。


transcription_config.additional_vocabarray

追加の語彙。


transcription_config.audio_filtering_configobject

音声フィルタリングの設定。


transcription_config.audio_filtering_config.volume_thresholdnumber

transcription_config.diarizationstring

transcription_config.domainarray

transcription_config.enable_entitiesboolean

transcription_config.enable_partialsboolean

部分的な文字起こし結果を有効にします。


transcription_config.languagestring

文字起こしする言語。


transcription_config.max_delaynumber

transcription_config.max_delay_modestring

"fixed" または "flexible"


transcription_config.output_localestring

transcription_config.operating_pointstring

Speechmatics により model を優先して非推奨とされています。"standard" または "enhanced"。


transcription_config.modelstring

モデルの選択(非推奨となった operating_point を置き換えます)。例: "standard"、"enhanced"、または "melia-1"。最新の一覧は Speechmatics モデルドキュメント を参照してください。


transcription_config.punctuation_overridesobject

句読点の設定


transcription_config.punctuation_overrides.permitted_marksarray

transcription_config.punctuation_overrides.sensitivitynumber

transcription_config.transcript_filtering_configobject

文字起こし結果のフィルタリング設定。詳細は Speechmatics フォーマットドキュメント を参照してください。


transcription_config.transcript_filtering_config.remove_disfluenciesboolean

文字起こし結果から言いよどみの音(「um」「uh」)を削除します。英語のみ。デフォルト: false。


transcription_config.transcript_filtering_config.replacementsarray

文字起こし結果に適用する単語置換ルール。各要素は from(通常の単語または /regex/)と to(置換テキスト)を持つオブジェクトです。例: [{"from": "foo", "to": "bar"}]。


transcription_config.conversation_configobject

会話ベースの文字起こし機能の設定。


transcription_config.conversation_config.end_of_utterance_silence_triggernumber

発話終了イベントをトリガーする無音の継続時間(秒)。話者が話すのをやめてから、発話が完了したと判定するまでにシステムが待機する時間を制御します。詳細は Speechmatics ターン検出ドキュメント を参照してください。


sm_audioFilteringConfigobject

音声フィルタリングの設定。


sm_audioFilteringConfig.volume_thresholdnumber必須

フィルタリングする音量のしきい値。


音声ヒントの指定

多くの認識エンジンは、認識エンジンが「ブースト」すべき単語やフレーズの動的なリストを指定する機能をサポートしています。つまり、認識エンジンがこれらの用語を検出して文字起こし結果に含める可能性が高くなります。 ブースト係数を適用することもできます。 最も基本的な実装は次のようになります:

"hints": ["benign", "malignant", "biopsy"],
"hintsBoost": 50

さらに、google と nvidia ではフレーズ単位でブースト係数を指定できます。例:

"hints": [
  {"phrase": "benign", "boost": 50},
  {"phrase": "malignant", "boost": 10},
  {"phrase": "biopsy", "boost": 20},
]