Experience · Software component

Automatic Speech Recognizer

Software componentExperienceExperience & Human OversightVariation point (abstract)arc:AutomaticSpeechRecognizer

An abstract speech-to-text service that converts spoken audio into text transcripts for consumption by an agent or downstream processing.

Responsibility. Transcribes user or recorded speech into text.

Also known as: ASR service, Speech-to-text service, Voice input modality handler, Voice input

sends data todeployed onis invoked bysends data tois routed to byis specialized byis scaled byis scaled byis invoked byis specialized bydeployed onhostshostsis configured byAgent Controller: sends data toAgent ControllerInference Server: deployed onInference ServerConversational (Chat) Interface: is invoked byConversational (Chat) In…Dialogue Flow Manager: sends data toDialogue Flow ManagerMultimodal Content Router: is routed to byMultimodal Content RouterSpeech Transcriber: is specialized bySpeech TranscriberQueue-Depth Autoscaler: is scaled byQueue-Depth AutoscalerScheduled Scaler: is scaled byScheduled ScalerVoice Turn Coordinator: is invoked byVoice Turn CoordinatorStreaming Speech Recognizer: is specialized byStreaming Speech Recogni…Cloud Region: deployed onCloud RegionDomain ASR Language Model: hostsDomain ASR Language ModelSpeech Recognition Model: hostsSpeech Recognition ModelASR Word Boost List: is configured byASR Word Boost List
Direct neighbourhood (hover for relationship types)

Variants

VariantWhen to choose
Speech TranscriberChoose for post-hoc analysis (call-center QA, meeting summaries, voicemail), maximum accuracy (legal, medical), speaker diarization or overlapping multi-speaker audio, where higher latency is acceptable.
Streaming Speech RecognizerChoose when real-time interaction is required (live customer-service calls, voice assistants, live accessibility captioning) and latency matters more than perfect accuracy.

Relationships

deployed on structural

hosts structural

is configured by structural

is invoked by dependency

is routed to by dynamic

sends data to dynamic

is scaled by control

Design guidance

Quantitative guidance

As stated by the sources; verify before use.

Classification

Patterns
Voice pipeline: ASR -> LLM agent -> TTS
Technologies
NVIDIA Riva ASR
Quality attributes
Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)Performance efficiency (ISO/IEC 25010)Interaction capability (ISO/IEC 25010)
Risks mitigated
Excluding voice, the primary channel for many users

Sources

  1. Ch7.5: T. Nguyen, "NeMo Curator, Riva Speech AI & Multimodal Integration," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 7.5. ISBN: 9798244538229.
  2. Ch10.1: T. Nguyen, "Conversational UI," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 10.1. ISBN: 9798244538229.