Recognizer
パラメータ
vendorstring使用する音声認識ベンダー(下記の一覧を参照)。
注意: このフィールドは大文字・小文字を区別します。組み込みベンダーはすべて小文字です(例: AWS ではなく aws)。
altLanguagesarray(Google、Microsoft) 話者が使用している可能性のある代替言語の配列。
asrDtmfTerminationDigitstring連続 ASR を終了させる DTMF キー。
asrTimeoutnumber連続 ASR のタイムアウト値。
autogeneratePromptboolean(AssemblyAI) true の場合、親の gather Function にネストされた say Function のテキストを assemblyAiOptions.prompt に自動的に設定します。ネストされた say があり、かつ明示的な assemblyAiOptions.prompt が指定されていない場合にのみ適用されます。SSML タグは使用前に除去されます。
azureServiceEndpointstringMicrosoft がホストするリージョン別エンドポイントの代わりに接続するカスタムサービスエンドポイント。
diarizationboolean(Google) 話者ダイアライゼーション(話者分離)を有効にします。
diarizationMaxSpeakersnumber(Google) 話者数の最大値を設定します。
diarizationMinSpeakersnumber(Google) 話者数の最小値を設定します。
enhancedModelboolean(Google) 拡張モデルを使用します。
filterMethodstring(AWS) 音声をフィルタリングする際の方法: remove、mask、または tag。
hintsarray(Google、Microsoft、Deepgram、Nvidia、Soniox) 音声検出を補助する単語またはフレーズの配列。
下記の 音声ヒントの指定 を参照してください。
hintsBoostnumber(Google、Nvidia) 設定したヒントに割り当てる強度を示す数値。
下記の例を参照してください。
identifyChannelsboolean(AWS) チャネル識別を有効にします。
initialSpeechTimeoutMsnumber(Microsoft) 初期発話タイムアウト(ミリ秒)。
interactionTypestring(Google) インタラクションタイプを設定します: discussion、presentation、phone_call、voicemail、
professionally_produced、voice_search、voice_command、dictation。
interimbooleantrue の場合、中間文字起こし結果が送信されます。
デフォルト: false。
注意: これは Transcribe Function で使用する場合にのみ影響します。Gather では、中間結果は partialResponseHook の有無に基づいて送信されます。
languagestring音声検出に使用する言語コード。
デフォルトはアプリケーションレベルの設定です。
languageModelNamestring(AWS) 音声処理時に使用するカスタム言語モデルの名前。
minConfidencenumber指定した場合、信頼度がこの値より低い最終文字起こし結果は
Webhook で 'stt-low-confidence' という reason を返します。
modelstring(Google) 使用する音声認識モデル。
デフォルト: phone_call。
naicsCodenumber(Google) 音声に関連する業種の NAICS コードを設定します。
outputFormatstring(Microsoft) simple または detailed。
デフォルト: simple。
profanityFilterboolean(Google、Deepgram、Nuance、Nvidia) true の場合、音声の文字起こし結果から不適切な表現をフィルタリングします。
デフォルト: false。
profanityOptionstring(Microsoft) masked、removed、または raw。
デフォルト: raw。
punctuationboolean(Google) 自動句読点付与を有効にします。
requestSnrboolean(Microsoft) 信号対雑音比(SNR)情報を要求します。
separateRecognitionPerChannelbooleantrue の場合、発信者と着信側の音声を別々の認識セッションで認識します。
singleUtteranceboolean(Google) true の場合、単一の発話/文字起こし結果のみを返します。
デフォルト: gather では true。
transcriptionHookstring中間または最終の文字起こし結果を受信したときに HTTP POST を受け取る Webhook。
vad.enablebooleantrue の場合、音声が検出されるまでクラウド認識エンジンへの接続を遅延させます。
vad.modenumbervad が有効な場合、この設定は音声区間検出器(VAD)の感度を制御します。
値は 0 から 3 までの範囲でなければなりません。
数値が小さいほど感度が高くなります。
vad.voiceMsnumbervad が有効な場合、クラウド認識エンジンに接続する前に必要な音声のミリ秒数。
vocabularyFilterNamestring(AWS) 音声処理時に使用するボキャブラリーフィルターの名前。
vocabularyNamestring(AWS) 音声処理時に使用するボキャブラリーの名前。
ベンダー固有オプション
assemblyAiOptions
apiKeystring認証に使用する AssemblyAI API キー(アカウントに設定された認証情報を上書きします)。
serviceVersionstring使用するストリーミング API のバージョン。v2 または v3。
speechModelstring認識に使用する AssemblyAI 音声モデル(例: u3-rt-pro)。
formatTurnsboolean各話者ターンをフォーマットします。デフォルト: true。
endOfTurnConfidenceThresholdnumberターン終了(end-of-turn)をトリガーする前にモデルが満たすべき信頼度のしきい値(0.0~1.0)。例: 0.5。
minEndOfTurnSilenceWhenConfidentnumberモデルがターン終了(EOT)が発生すべきと確信している場合に、最後に話された単語の後、システムがターン終了イベントをトリガーするまでに必要な最小の無音時間(ミリ秒)。デフォルト: 400。例: 500。
maxTurnSilencenumberターン終了が自動的にトリガーされるまでに、ターン内で許容される最大の無音時間(ミリ秒)。デフォルト: 1280。例: 2000。
minTurnSilencenumberターン終了を許可するまでの最小の無音時間(ミリ秒)。
keytermsarray認識時にブーストするキーワードのリスト。例: ["Wipple", "Miraicom"]。
promptstring認識モデルを誘導するプロンプトテキスト。通常は、想定されるユーザーの応答の説明です。応答が予測可能な場合(例: 直前に尋ねた質問のテキスト)に精度が向上します。認識エンジンの autogeneratePrompt も参照してください。これは gather Function にネストされた say からこの値を自動的に設定します。
languageDetectionboolean自動言語検出を有効にします。
vadThresholdnumber音声区間検出(VAD)のしきい値。
inactivityTimeoutnumberストリームを閉じるまでの非アクティブ状態のタイムアウト(秒)。
azureOptions
speechSegmentationSilenceTimeoutMsnumber現在話されているフレーズ内で、そのフレーズが「完了」と見なされるまでの非音声オーディオの継続時間(ミリ秒)。
詳細は こちら を参照してください。
audioLoggingboolean音声ログ記録を有効にします。 詳細は こちら を参照してください。
deepgramOptions
alternativesnumber返却する代替文字起こし結果の数。
apiKeystring認証に使用する Deepgram API キー(アカウントに設定された認証情報を上書きします)。
customModelstringカスタムモデルの ID。
diarizeboolean文字起こし結果の各単語に 話者を割り当てるかどうか。
diarizeVersionstring'2021-07-14.0' に設定すると、従来のダイアライゼーション機能が使用されます。
endpointingnumber | string話者が単語またはフレーズを言い終えたと Deepgram が判断するために使用する
無音のミリ秒数を示します。
値はミリ秒数、またはこの機能を完全に無効にする 'false' のいずれかでなければなりません。
デフォルト: 10ms。
eagerEotThresholdnumberDeepgram Flux でのみ利用可能。 EagerEndOfTurn イベントをトリガーする信頼度のしきい値。早期の LLM 応答生成を可能にします。
eotThresholdnumberDeepgram Flux でのみ利用可能。 ターン終了検出の信頼度のしきい値
eotTimeoutMsnumberDeepgram Flux でのみ利用可能。 信頼度に関係なく EndOfTurn を強制するまでの最大無音時間。有効な値は 500 ~ 10000 ミリ秒です。
keytermsarraykeywordsarrayコンテキストの理解を助けるために、モデルがブーストまたは抑制の面で特に注意を払うべき
キーワードの配列。
mipOptOutbooleanDeepgram のモデル改善プログラムをオプトアウトするかどうかを示します。
modelstring送信された音声の処理に使用する Deepgram モデル。
モデルの例: 'nova-3'、'nova-2'、'nova-2-phonecall'。完全な一覧は Deepgram ドキュメント を参照してください。
デフォルト: 'general'。
multichannelboolean各オーディオチャネルを独立して文字起こしするかどうかを示します。
noDelaybooleanDeepgram の no_delay 機能を有効にするかどうかを示します。
numeralsboolean数字を文字表記(例: "one")から数値表記(例: "1")に
変換するかどうかを示します。
profanityFilterboolean文字起こし結果から
不適切な表現を削除するかどうかを示します。
punctuateboolean文字起こし結果に
句読点と大文字化を追加するかどうかを示します。
redactarray文字起こし結果から
情報を秘匿するかどうか。
許可される値: 'pci'、'numbers'、'true'、'ssn'。
replacearray送信された音声内で検索して置換する
用語またはフレーズの配列。
searcharray送信された音声内で検索する用語またはフレーズの配列。
shortUtterancebooleanDeepgram の is_final プロパティが設定され次第、文字起こし結果を返すようにします。
これは、非常に短い確認応答や直接的なコマンドが想定され、
レイテンシーを最小限にしたいシナリオでのみ使用してください。
smartFormattingbooleanDeepgram の Smart Formatting 機能を有効にするかどうかを示します。
tagstringリクエストに関連付けるタグ。
タグは使用状況レポートに表示されます。
tierstring使用する Deepgram ティア。
許可される値: 'enhanced'、'base'。
デフォルト: 'base'。
utteranceEndMsnumber最後の単語が話された後、Deepgram が UtteranceEnd イベントを返すまでに待機する
無音のミリ秒数。このプロパティが指定された場合、Wipple CPaaS はこのイベントを使用して
文字起こし Webhook をトリガーします。
これは実質的に Deepgram 版の連続 ASR です。
versionstring使用するモデルの Deepgram バージョン。
デフォルト: 'latest'。
googleOptions
Google は 1 組の認証情報で 3 つの音声 API を提供しています: Cloud Speech-to-Text v1、Cloud Speech-to-Text v2、および Gemini Live 文字起こしモデルです。どれが実行されるかは認識エンジンの model によって決まります。gemini- で始まる名前は Gemini Live API を選択し、それ以外は Cloud Speech 認識エンジンを選択します。model を未設定のままにすると、Wipple CPaaS は従来どおり言語に適した Cloud Speech モデルを選択します。デフォルトモデルは、アカウントに設定された Google 音声認証情報に保存することもできます。この場合、リクエストで上書きされない限り、そのアカウントのすべての通話に適用されます。
Gemini Live 文字起こしは話者ダイアライゼーションや単語タイムスタンプをサポートしておらず、Google はライブセッションを 10 分に制限しています。このパスでは認識エンジンの diarization および words プロパティは無視されます。
認識は GA 版の Vertex AI インターフェース上で実行され、音声認証情報自身のサービスアカウントとして認証します。追加のシークレットは不要ですが、プロジェクトで課金が有効になっており、サービスアカウントに roles/aiplatform.user が付与されている必要があります。プロジェクトはサービスアカウントから、リージョンは parentPath から決定されます。リージョンのデフォルトは、これらのモデルが提供されている global です。モデル名は Vertex AI が公開している表記で指定してください。プレビュー版の Gemini Developer API(「AI Studio」)は同じモデルを異なる表記で扱いますが、サービスアカウントを拒否するためサポートされていません。
modestringGemini の文字起こしスタイル(gemini モデルのみ): VERBATIM(デフォルト)は話されたとおりに文字起こしし、SMART は言いよどみを除去してフォーマットを適用します。
customVocabularyarray認識を偏らせるための用語、略語、ブランド名、固有名詞を最大 1000 件まで指定します(gemini モデルのみ)。例: ["Wipple", "Miraicom"]。省略した場合、代わりに認識エンジンの hints が使用されます。
serviceVersionstringCloud Speech-to-Text API のバージョン。v1(デフォルト)または v2。gemini モデルは別の API であるため、無視されます。
recognizerIdstringGoogle Speech 認識エンジンリソースの ID(v2 のみ)。
parentPathstringGoogle Speech 認識エンジンの親リソースパス(v2 のみ)。例: projects/my-project/locations/us-central1。global 以外のロケーションを指定すると、リクエストはそのリージョンのエンドポイントにもルーティングされます。
speechStartTimeoutMsnumber発話開始を待機するミリ秒数(v2 のみ)。
speechEndTimeoutMsnumber発話終了の検出に使用する無音のミリ秒数(v2 のみ)。
enableVoiceActivityEventsbooleanGoogle の音声区間検出イベントを有効にします(v2 のみ)。
transcriptNormalizationarray文字起こし結果の正規化ルール(v2 のみ)。各要素は {search, replace, caseSensitive} です。
xaiOptions
xAI(xai)はライブストリーミング認識エンジンです。中間および最終の両方の文字起こし結果がサポートされています。
apiKeystring認証に使用する xAI API キー(Wipple CPaaS に設定された認証情報を上書きします)。
modelstring使用する文字起こしモデル。例: grok-voice-transcribe-2.0 または grok-voice-transcribe-1.0。
指定しない場合、xAI が現在のデフォルトモデルを自動的に選択します。
endpointinginteger発話が最終と見なされるまでの無音のミリ秒数。
有効な値は 0 ~ 5000 です。
diarizeboolean話者ダイアライゼーションを有効にします。
fillerWordsboolean文字起こし結果にフィラー(例: 「um」「uh」)を含めます。
keytermsarray認識をブーストするキーワードの配列。
smartTurnnumberターン終了の信頼度のしきい値。0.0 から 1.0 の範囲。
smartTurnTimeoutintegerターン終了の最終結果を強制するまでの最大無音ミリ秒数。
有効な値は 1 ~ 5000 です。
houndifyOptions
houndifyOptionsnumber発信者の緯度。
longitudenumber発信者の経度。
citystring発信者の都市。
statestring発信者の州。
countrystring発信者の国。
timezonestring発信者のタイムゾーン。
domainstringaudioEndpointstringmaxSilenceSecondsnumbermaxSilenceAfterFullQuerySecondsnumbermaxSilenceAfterPartialQuerySecondsnumbervadSensitivitynumbervadTimeoutnumbervadModestringvadVoiceMsnumbervadSilenceMsnumbervadDebugdebugaudioFormatstringenableNoiseReductionbooleanenableProfanityFilterbooleanenablePunctuationbooleanenableCapitalizationbooleanconfidenceThresholdnumberenableDisfluencyFilterbooleanmaxResultsnumberenableWordTimestampsbooleanmaxAlternativesnumberpartialTranscriptIntervalnumbersessionTimeoutnumberconnectionTimeoutnumbercustomVocabularystringlanguageModelstringibmOptions
acousticCustomizationIdstringカスタム音響モデルの ID。
baseModelVersionstring使用するベースモデル。
instanceIdstringIBM 音声インスタンス ID(アカウントに設定された認証情報を上書きします)。
languageCustomizationIdstringカスタム言語モデルの ID。
modelstring音声認識に使用するモデル。
sttApiKeystring認証に使用する IBM API キー(アカウントに設定された認証情報を上書きします)。
sttRegionstringIBM リージョン(アカウントに設定された認証情報を上書きします)。
watsonLearningOptOutbooleanIBM が API リクエストデータをサービス改善に使用しないようにするには true に設定します。
watsonMetadatastring提供するリクエストデータに適用する
タグ値。
nuanceOptions
allowZeroBaseLmWeightbooleantrue の場合、カスタムリソース(DLM、ワードセットなど)が重みの全範囲を使用できます。
clientDataobject通話ログに挿入する任意のキーと値のペアを含むオブジェクト。
clientIdstring認証に使用する Nuance クライアント ID(アカウントに設定された認証情報を上書きします)。
discardSpeakerAdaptationboolean話者プロファイルを使用する場合、更新された話者データを破棄するかどうか。
デフォルトではデータは保存されます。
filterWakeupWordboolean最終結果からウェイクアップワードを削除するかどうか。
formatting.optionsobjectデータパックで定義されたフォーマットオプションと値のキーと値のペアを含むオブジェクト。
formatting.schemestringデータパックで定義されたフォーマットタイプのキーワード。
includeTokenizationbooleanトークン化された認識結果を含めるかどうか。
kryptonEndpointstring接続先のオンプレミス Krypton エンドポイント。
デフォルト: ホステッドサービス。
maskLoadFailuresboolean外部リソースの読み込みに失敗したときに認識を終了するかどうか。
maxHypothesesnumber返却する n-best 仮説の最大数。
noInputTimeoutMsnumber認識タイマーの開始後、ユーザー入力を待機する間に許容される最大の無音時間(ミリ秒)。
punctuationboolean自動句読点付与を有効にするかどうか。
recognitionTimeoutMsnumber認識ターンの最大継続時間(ミリ秒)。
resourcearray認識を改善するための 0 個以上の 認識リソース
(ドメイン LM、ワードセットなど)の配列。
resource[].builtinstringデータパック内の組み込みリソースの名前。
resource[].externalReferenceobject話者プロファイルを作成または更新するための
外部 DLM または設定ファイル。
resource[].externalReference.headersobjectHTTP キャッシュ制御ディレクティブ(例: max-age など)を含むオブジェクト。
resource[].externalReference.maxLoadFailuresbooleantrue の場合、リソースの読み込みに失敗しても文字起こしの続行を許可します。
resource[].externalReference.requestTimeoutMsnumberリソースをダウンロードする際の待機時間。
resource[].externalReference.typestringリソースタイプ: 'undefined_resource_type'、'wordset'、'compiled_wordset'、'domain_lm'、
'speaker_profile'、'grammar'、'settings'。
resource[].externalReference.uristringURN 参照としてのリソースの場所。
resource[].inlineGrammarstringSRGS XML 形式のインライン文法。
resource[].inlineWordsetobjectインラインワードセット JSON リソース。
詳細は Wordsets を参照してください。
resource[].reusestringリソースが 複数回使用されるかどうか。
許可される値: 'undefined_reuse'、'low_reuse'、'high_reuse'。
デフォルト: low_reuse。
resource[].weightNamestringデータパックに対するドメイン LM または組み込みリソースの
重み を設定する入力フィールド。
許可される値: 'defaultWeight'、'lowest'、'low'、'medium'、'high'、'highest'。
デフォルト: MEDIUM。
resource[].weightValuenumberDLM または組み込みリソースの重み。0 から 1 の数値。
デフォルト: 0.25。
resource[].wakeupWordarrayウェイクアップワード の配列。
resultTypestring認識結果のレベル: 'final'、'partial'、'immutable_partial'。
デフォルト: final。
secretstring認証に使用する Nuance シークレット(アカウントに設定された認証情報を上書きします)。
speechDetectionSensitivitynumber音声とノイズ(呼吸音など)の検出のバランス。0 から 1 の範囲。
0 はすべてのノイズを無視し、1 はすべてのノイズを音声として解釈します。
デフォルト: 0.5。
speechDomainstringデータパック内の言語モデル用の内部重みセットへのマッピング。
suppressCallRecordingboolean通話ログの記録と音声キャプチャを無効にするかどうか。
デフォルトでは、通話ログ、音声、およびメタデータが収集されます。
suppressInitialCapitalizationbooleantrue の場合、文の最初の単語は自動的に大文字化されません。
topicstring特化型言語モデル。
utteranceDetectionModestringオーディオストリーム内で処理する文(発話)の数。
許可される値: 'single'、'multiple'、'disabled'。
デフォルト: single。
utteranceEndSilenceMsnumber文の終わりを判定する最小の無音時間(ミリ秒)。
userIdstringアプリケーション内の特定のユーザーを識別します。
nvidiaOptions
customConfigurationobjectカスタム設定のために Nvidia に送信できるキーと値のペアのオブジェクト。
maxAlternativesnumber返却する代替文字起こし結果の数。
profanityFilterboolean文字起こし結果から不適切な表現を削除するかどうかを示します。
punctuationboolean文字起こし結果に句読点を付与するかどうかを示します。
rivaUristringNvidia Riva が待ち受けている GRPC エンドポイント(ip:port)。
verbatimTranscriptsboolean逐語的な文字起こし結果を提供するかどうかを示します。
wordTimeOffsetsboolean単語レベルの詳細を提供するかどうかを示します。
openaiOptions
apiKeystring認証に使用する OpenAI API キー(指定した場合、アカウントに設定された認証情報を上書きします)。
languagestringOpenAI の言語コード。言語は認識エンジンレベルでも設定できますが、 ここで設定した場合はこの値が優先されます。言語コードは ISO-639-1 形式(例: en)で指定することに注意してください。
modelstringOpenAI モデル。現在、'whisper-1'、'gpt-4o-mini-transcribe'、'gpt-4o-transcribe'、'gpt-realtime-whisper'、および 'gpt-live-transcribe' がサポートされています。
注意: 'gpt-live-transcribe' および 'gpt-realtime-whisper' は OpenAI のサーバー側ターン検出をサポートしていません。これらのモデルでは turn_detection の設定は
無視され、代わりに Wipple CPaaS がローカルで発話終了を検出します(vadMode、vadSilenceMs、vadVoiceMs を参照)。
languagesstring[]'gpt-live-transcribe' でのみ使用されます。このモデルは単一のコードではなく言語ヒントのリストを受け付けます。例: ["en", "fr"]。
language および認識エンジンレベルの言語より優先されます。
keywordsstring[]'gpt-live-transcribe' でのみ使用されます。音声に含まれる可能性のある文字どおりの用語(製品名、略語、薬品名など)。 これらはヒントであり、必須の出力ではありません。ここで値を設定せず、ヒントを指定した場合は、ヒントがキーワードとして送信されます。
delaystring'gpt-live-transcribe' でのみ使用されます。'minimal'、'low'、'medium'、'high'、または 'xhigh' のいずれかで、レイテンシーと精度のトレードオフを指定します。 低い値ほど部分テキストが早く出力され、高い値ほどモデルにより多くの音声コンテキストが与えられ、精度が向上する可能性があります。
promptstringモデルのスタイルを誘導したり、前の音声セグメントを継続したりするための任意のテキスト。 ここで値を設定せず、ヒントを指定した場合は、ヒントを OpenAI モデルに伝えるためのプロンプトが自動的に生成されることに注意してください。
input_audio_noise_reductionobject入力音声にノイズ除去を適用するかどうかを制御します。
input_audio_noise_reduction.typestring'near_field' または 'far_field'。
promptTemplatesobjectOpenAI に送信するプロンプトを動的に構築するために使用できるテンプレート。
promptTemplates.hintsTemplatestringヒントを伝えるプロンプトを構築するために使用できるテンプレート。プレースホルダー "{{hints}}" を使用します。例: "Please transcribe the following audio, making sure to spell the following words correctly: {{hints}}"
promptTemplates.conversationHistoryTemplatestring直近の会話に基づいてプロンプトを構築するために使用できるテンプレート。プレースホルダー "{{turns}}" を使用します。例:
"Here is the recent conversation history: {{turns}}"。
デフォルトでは会話の直近 4 ターンが使用されますが、次のように変更できます:
"Here is the recent conversation history: {{turns:3}}"。
turn_detectionobject話者が話し終えたことを検出する方法を指定します。
turn_detection.typestring'none'、'server_vad'、または 'semantic_vad'。
turn_detection.eagernessstring'low'、'medium'、'high、または 'auto'。semantic_vad モードでのみ使用されます。 モデルが応答する積極性です。low はユーザーが話を続けるのをより長く待ち、 high はより速く応答します。auto がデフォルトで、medium と同等です。
turn_detection.thresholdnumberserver_vad モードでのみ使用されます。VAD の活性化しきい値(0.0 ~ 1.0)。デフォルトは 0.5 です。 しきい値を高くするとモデルを活性化するためにより大きな音量が必要になるため、 騒がしい環境ではより良く動作する可能性があります。
turn_detection.prefix_padding_msnumberserver_vad モードでのみ使用されます。VAD が検出した音声の前に含める音声の量(ミリ秒)。 デフォルトは 300ms です。
turn_detection.silence_duration_msnumberserver_vad モードでのみ使用されます。発話の停止を検出するための無音の継続時間(ミリ秒)。 デフォルトは 500ms です。値を短くするとモデルはより速く応答しますが、ユーザーの短い間で割り込んでしまう可能性があります。
vadModenumber'gpt-live-transcribe' または 'gpt-realtime-whisper' でのみ使用されます。ローカルの音声区間検出器の感度。0 ~ 3 の整数。高いほど積極的です。デフォルトは 2 です。
vadSilenceMsnumber'gpt-live-transcribe' または 'gpt-realtime-whisper' でのみ使用されます。発話終了を検出してバッファをコミットするために必要な無音のミリ秒数。デフォルトは 500ms です。
vadVoiceMsnumber'gpt-live-transcribe' または 'gpt-realtime-whisper' でのみ使用されます。発話開始を検出するために必要な音声のミリ秒数。デフォルトは 250ms です。
houndifyOptions
latitudenumber位置情報に基づくクエリ用の緯度座標。
longitudenumber位置情報に基づくクエリ用の経度座標。
citystring位置情報コンテキスト用の都市名。
statestring位置情報コンテキスト用の州または県。
countrystring位置情報コンテキスト用の国。
timeZonestringタイムゾーン識別子(例: 'America/New_York')。
domainstring特定の機能を有効にする Houndify ドメイン。
audioEndpointstringカスタム音声ストリーミングエンドポイント URL。
maxSilenceSecondsnumberリクエストを終了するまでの最大無音時間(秒)。
maxSilenceAfterFullQuerySecondsnumber完全なクエリを検出した後の最大無音時間(秒)。
maxSilenceAfterPartialQuerySecondsnumber部分的なクエリを検出した後の最大無音時間(秒)。
vadSensitivitynumber音声区間検出の感度レベル。
vadTimeoutnumber音声区間検出のタイムアウト値。
vadModestring音声区間検出モード。
vadVoiceMsnumberVAD 検出のための最小音声時間(ミリ秒)。
vadSilenceMsnumberVAD 検出のための最小無音時間(ミリ秒)。
vadDebugbooleanVAD デバッグ情報を有効にします。
audioFormatstringオーディオストリームの音声フォーマット指定。
enableNoiseReductionboolean音声ノイズ除去処理を有効にします。
enableProfanityFilterboolean文字起こし結果から不適切な表現をフィルタリングします。
enablePunctuationboolean文字起こし結果への自動句読点付与を有効にします。
enableCapitalizationboolean文字起こし結果の自動大文字化を有効にします。
confidenceThresholdnumber認識結果を受け入れるための最小信頼度のしきい値。
enableDisfluencyFilterboolean文字起こし結果から言いよどみ(um、uh など)をフィルタリングします。
maxResultsnumber返却する結果の最大数。
enableWordTimestampsboolean文字起こし結果に単語レベルのタイムスタンプを含めます。
maxAlternativesnumber返却する代替文字起こし結果の最大数。
partialTranscriptIntervalnumber部分的な文字起こし結果の更新を送信する間隔(ミリ秒)。
sessionTimeoutnumberセッションタイムアウト時間(秒)。
connectionTimeoutnumber接続タイムアウト時間(秒)。
customVocabularyarray認識精度を向上させるためのカスタム単語またはフレーズの配列。
languageModelstring認識に使用するカスタム言語モデルの識別子。
sonioxOptions
api_keystringSoniox API キー。
modelstring使用する Soniox モデル。
デフォルト: 'precision_ivr'。
profanityFilterboolean文字起こし結果から 不適切な表現を削除する かどうかを示します。
storageobject音声や文字起こし結果を保存するかどうかを指定するプロパティ。
デバッグ目的で役立つ場合があります。
storage.disableSearchbooleantrue の場合、検索を許可しません。
storage.disableStoreAudiobooleantrue の場合、音声を保存しません。
storage.disableStoreTranscriptbooleantrue の場合、文字起こし結果を保存しません。
storage.idstringストレージ識別子。
storage.titlestringストレージタイトル。
gladiaOptions
modelstring使用する処理モデル。
デフォルト: 'solaria-1'。
endpointingnumber発話完了をトリガーする無音の継続時間(秒)。
値は 0.01 から 10 の範囲でなければなりません。
デフォルト: 0.05。
maximum_duration_without_endpointingnumberエンドポインティング検出なしの最大継続時間(秒)。
値は 5 から 60 の範囲でなければなりません。
デフォルト: 5。
custom_metadataobject文字起こしセッションにカスタムメタデータを添付します。
language_configobject文字起こしの言語設定。
language_config.languagesarray文字起こしに使用する言語コードの配列。
language_config.code_switchingbooleanオーディオストリーム内での自動言語切り替えを有効にします。
pre_processingobject音声前処理の設定。
pre_processing.audio_enhancerboolean音声強調処理を有効にします。
pre_processing.speech_thresholdnumber音声検出のしきい値。
realtime_processingobjectリアルタイム処理の設定。
realtime_processing.custom_vocabularyarray認識精度を向上させるためのカスタム語彙の配列。
realtime_processing.custom_vocabulary_configobjectカスタム語彙の動作に関する設定。
realtime_processing.custom_spellingarrayカスタムスペルルールの配列。
realtime_processing.custom_spelling_configobjectカスタムスペルの動作に関する設定。
realtime_processing.translationbooleanリアルタイム翻訳を有効にします。
realtime_processing.translation_configobject翻訳先言語を含む翻訳設定。
realtime_processing.named_entity_recognitionboolean固有表現認識(NER)を有効にします。
realtime_processing.sentiment_analysisboolean文字起こし結果に対する感情分析を有効にします。
post_processingobject後処理の設定。
post_processing.summarizationboolean自動要約を有効にします。
post_processing.summarization_configobject要約の動作に関する設定。
post_processing.chapterizationboolean自動チャプター検出を有効にします。
messages_configobjectセッション中に受信するイベントタイプを制御します。
messages_config.receive_pre_finalboolean最終確定前の文字起こしイベントを受信します。
messages_config.receive_finalboolean最終の文字起こしイベントを受信します。
messages_config.receive_speech_recognitionboolean音声認識イベントを受信します。
callbackboolean文字起こしイベントのコールバック配信を有効にします。
デフォルト: false。
callback_configobjectcallback が有効な場合のコールバック設定。
callback_config.urlstringコールバックイベントを受信する URL。
speechmaticsOptions
sm_audioEventsConfigobject報告する音声イベント。
sm_audioEventsConfig.typesarray"applause"、"laughter"、または "music"
transcription_configobject音声文字起こしの設定。
transcription_config.additional_vocabarray追加の語彙。
transcription_config.audio_filtering_configobject音声フィルタリングの設定。
transcription_config.audio_filtering_config.volume_thresholdnumbertranscription_config.diarizationstringtranscription_config.domainarraytranscription_config.enable_entitiesbooleantranscription_config.enable_partialsboolean部分的な文字起こし結果を有効にします。
transcription_config.languagestring文字起こしする言語。
transcription_config.max_delaynumbertranscription_config.max_delay_modestring"fixed" または "flexible"
transcription_config.output_localestringtranscription_config.operating_pointstringSpeechmatics により model を優先して非推奨とされています。"standard" または "enhanced"。
transcription_config.modelstringモデルの選択(非推奨となった operating_point を置き換えます)。例: "standard"、"enhanced"、または "melia-1"。最新の一覧は Speechmatics モデルドキュメント を参照してください。
transcription_config.punctuation_overridesobject句読点の設定
transcription_config.punctuation_overrides.permitted_marksarraytranscription_config.punctuation_overrides.sensitivitynumbertranscription_config.transcript_filtering_configobject文字起こし結果のフィルタリング設定。詳細は Speechmatics フォーマットドキュメント を参照してください。
transcription_config.transcript_filtering_config.remove_disfluenciesboolean文字起こし結果から言いよどみの音(「um」「uh」)を削除します。英語のみ。デフォルト: false。
transcription_config.transcript_filtering_config.replacementsarray文字起こし結果に適用する単語置換ルール。各要素は from(通常の単語または /regex/)と to(置換テキスト)を持つオブジェクトです。例: [{"from": "foo", "to": "bar"}]。
transcription_config.conversation_configobject会話ベースの文字起こし機能の設定。
transcription_config.conversation_config.end_of_utterance_silence_triggernumber発話終了イベントをトリガーする無音の継続時間(秒)。話者が話すのをやめてから、発話が完了したと判定するまでにシステムが待機する時間を制御します。詳細は Speechmatics ターン検出ドキュメント を参照してください。
sm_audioFilteringConfigobject音声フィルタリングの設定。
sm_audioFilteringConfig.volume_thresholdnumberフィルタリングする音量のしきい値。
音声ヒントの指定
多くの認識エンジンは、認識エンジンが「ブースト」すべき単語やフレーズの動的なリストを指定する機能をサポートしています。つまり、認識エンジンがこれらの用語を検出して文字起こし結果に含める可能性が高くなります。 ブースト係数を適用することもできます。 最も基本的な実装は次のようになります:
"hints": ["benign", "malignant", "biopsy"],
"hintsBoost": 50
さらに、google と nvidia ではフレーズ単位でブースト係数を指定できます。例:
"hints": [
{"phrase": "benign", "boost": 50},
{"phrase": "malignant", "boost": 10},
{"phrase": "biopsy", "boost": 20},
]