Skip to content

OpenAIRealtimeServerVad

Server VAD turn-detection configuration for OpenAI Realtime transcription sessions.

Defined in: src/providers/stt/openai/OpenAIRealtimeSTT.ts:24

Server VAD turn-detection configuration for OpenAI Realtime transcription sessions.

Remarks

Server VAD detects the start and end of speech based on audio volume and commits the input buffer automatically at each turn boundary.

See

OpenAIRealtimeSTTConfig.turnDetection

Properties

PropertyTypeDescriptionDefined in
prefixPaddingMs?numberAmount of audio (in milliseconds) to include before detected speech. Default 300 (OpenAI server default)src/providers/stt/openai/OpenAIRealtimeSTT.ts:37
silenceDurationMs?numberDuration of silence (in milliseconds) that ends a turn. Shorter values finalize utterances faster but may cut off slow speakers. Default 500 (OpenAI server default)src/providers/stt/openai/OpenAIRealtimeSTT.ts:43
threshold?numberActivation threshold for VAD (0.0 to 1.0). Higher values require louder audio and can perform better in noisy environments. Default 0.5 (OpenAI server default)src/providers/stt/openai/OpenAIRealtimeSTT.ts:32
type"server_vad"Simple volume-based voice activity detection.src/providers/stt/openai/OpenAIRealtimeSTT.ts:26

© 2026 CompositeVoice. All rights reserved.

Font size
Contrast
Motion
Transparency