Qwen-Audio 3.0 Realtime Flash

Alibaba / Qwen
Model overview

qwen-audio-3.0-realtime-flash

Qwen-Audio 3.0 Realtime Flash is a real-time speech model for real-time speech handling and duplex conversation, with parallel inference and omnidirectional streaming used to control end-to-end response latency.

multimodalaudiospeechrealtimevoice assistantrealtime voiceenterprise access
Representative version

qwen-audio-3.0-realtime-flash

CompanyAlibaba / Qwen
Release2026-07-14
Release typeModel release
ParametersNot disclosed
ArchitectureNot disclosed
ContextNot disclosed
Input modalitiestext / audio
Output modalitiestext / audio
Tool use / function callingConfirmed: Tool use, Function calling
Structured output / reasoningNot shown: Reasoning
Vision / audio / videoConfirmed: Audio
Open weights / LicenseWeight status not disclosed / license not disclosed
alibaba-qwen-qwen-audio-3-0-realtime-flash-current · License source pending verification
Vendor APIAvailable
Qwen-Audio Realtime API guide - Alibaba Cloud Model Studioalibaba-qwen-qwen-audio-3-0-realtime-flash-current · 2026-07-14
OpenRouterNot separately listed on OpenRouter
PricingOfficial · checked 2026-07-20 · China mainland (Beijing): text input $0.413 · audio input $4.126 · text output $4.126 · audio output $13.752 · per 1M tokens
BenchmarkNo reliable public source
Public signalsNo reliable public source
Use casesLow-latency voice assistants / Duplex customer service / Tool-using voice agents / voice assistant
Claim evidenceRelease eventAlibaba Cloud Model Studio model lifecycle and updatesqwen-audio-3.0-realtime-flash · 2026-07-14
Model specificationsQwen-Audio real-time voice model - Alibaba Cloud Model StudioQwen-Audio 3.0 Realtime Flash · qwen-audio-3.0-realtime-flash
OpenRouter

Pricing / context / availability

OpenRouterNot separately listed on OpenRouter
OpenRouter listingNot separately listed in the current OpenRouter public list
Mapped versionqwen-audio-3.0-realtime-flash
alibaba-qwen-qwen-audio-3-0-realtime-flash-current
PricingOfficial · checked 2026-07-20 · China mainland (Beijing): text input $0.413 · audio input $4.126 · text output $4.126 · audio output $13.752 · per 1M tokens
ContextNot disclosed
Speed/LatencyNo reliable public source
Snapshot time2026-08-11T06:28:09.895Z
SourceView source
Verified limitations

Usage boundaries

  • Beijing region only; 50 turns or 300 seconds is the audio-history window, not a token context limit.
  • Function calling is supported; reasoning mode is not.
Missing public information

Public information not yet available

Parameter scale not disclosedNot listed on OpenRouterNo reliable benchmark sourceNo public model-card activity countersNo linkable model-specific reviewSpeed/latency not disclosed