OpenAIRealtimeServerVad
Server VAD turn-detection configuration for OpenAI Realtime transcription sessions.
Defined in: src/providers/stt/openai/OpenAIRealtimeSTT.ts:24
Server VAD turn-detection configuration for OpenAI Realtime transcription sessions.
Remarks
Server VAD detects the start and end of speech based on audio volume and commits the input buffer automatically at each turn boundary.
See
OpenAIRealtimeSTTConfig.turnDetection
Properties
| Property | Type | Description | Defined in |
|---|---|---|---|
prefixPaddingMs? | number | Amount of audio (in milliseconds) to include before detected speech. Default 300 (OpenAI server default) | src/providers/stt/openai/OpenAIRealtimeSTT.ts:37 |
silenceDurationMs? | number | Duration of silence (in milliseconds) that ends a turn. Shorter values finalize utterances faster but may cut off slow speakers. Default 500 (OpenAI server default) | src/providers/stt/openai/OpenAIRealtimeSTT.ts:43 |
threshold? | number | Activation threshold for VAD (0.0 to 1.0). Higher values require louder audio and can perform better in noisy environments. Default 0.5 (OpenAI server default) | src/providers/stt/openai/OpenAIRealtimeSTT.ts:32 |
type | "server_vad" | Simple volume-based voice activity detection. | src/providers/stt/openai/OpenAIRealtimeSTT.ts:26 |