alicloud-ai-audio-asr-realtime
Original:🇺🇸 English
Translated
1 scriptsChecked / no sensitive code detected
Use when low-latency realtime speech recognition is needed with Alibaba Cloud Model Studio Qwen ASR Realtime models, including streaming microphone input, live captions, or duplex voice agents.
8installs
Sourcecinience/alicloud-skills
Added on
NPX Install
npx skill4agent add cinience/alicloud-skills alicloud-ai-audio-asr-realtimeTags
Translated version includes tags in frontmatterSKILL.md Content
View Translation Comparison →Category: provider
Model Studio Qwen ASR Realtime
Validation
bash
mkdir -p output/alicloud-ai-audio-asr-realtime
python -m py_compile skills/ai/audio/alicloud-ai-audio-asr-realtime/scripts/prepare_realtime_asr_request.py && echo "py_compile_ok" > output/alicloud-ai-audio-asr-realtime/validate.txtPass criteria: command exits 0 and is generated.
output/alicloud-ai-audio-asr-realtime/validate.txtOutput And Evidence
- Save session payloads and response samples under .
output/alicloud-ai-audio-asr-realtime/
Critical model names
Use one of these exact model strings:
qwen3-asr-flash-realtimeqwen3-asr-flash-realtime-2026-02-10
Use cases
- Realtime subtitles and captions
- Voice-agent duplex input
- Streaming speech-to-text in browser or terminal clients
Prerequisites
- Set in your environment, or add
DASHSCOPE_API_KEYtodashscope_api_key.~/.alibabacloud/credentials - Realtime sessions generally require WebSocket or streaming session handling in the client.
Normalized interface (asr.realtime)
Request
- (string, optional): default
modelqwen3-asr-flash-realtime - (array<string>, optional)
language_hints - (string, optional): e.g.
format,pcmwav - (int, optional): e.g.
sample_rate16000 - (int, optional): frame size in milliseconds
chunk_ms
Response
- (string): recognized transcript fragment
text - (bool): finalization marker
is_final - (object, optional)
usage
Quick start
Generate a request template:
bash
python skills/ai/audio/alicloud-ai-audio-asr-realtime/scripts/prepare_realtime_asr_request.py \
--output output/alicloud-ai-audio-asr-realtime/request.jsonOperational guidance
- Prefer 16kHz mono PCM unless your client stack requires another format.
- Keep chunks small enough for responsive partial results.
- If you only have recorded files, use instead.
skills/ai/audio/alicloud-ai-audio-asr/
References
references/sources.md