阿里云百炼平台近期上线了一款性能出色的多语言实时音视频同传大模型——千问Qwen3.5-LiveTranslate-Flash。该模型基于Qwen3.5-Omi基座打造,融合海量多模态训练数据、跨语言与跨模态对齐能力,以及视觉增强技术,具备高精度、低延迟、高鲁棒性三大优势。它不仅支持离线翻译与实时音视频翻译两种模式,还可识别60种语言,并输出29种语言,适用于多语种实时沟通与跨语言交流场景。
开通百炼:https://www.aliyun.com/product/bailian 免费领取Token,Qwen3.5-LiveTranslate-Flash目前可免费体验100万Tokens。
Qwen3.5-LiveTranslate-Flash模型适用于国际会议、跨境直播、多语种客服等对翻译实时性和准确率要求较高的应用场景,并可通过函数计算FC进行一键式快速部署,方便企业和开发者快速接入。

Qwen3.5-LiveTranslate-Flash模型能力
多语言覆盖:支持60种语言互译,其中29种语言支持音频与文本输出,其余31种语言仅支持文本输出。视觉增强翻译:可同时处理音频和图像输入,通过分析画面中的口型、动作、文字等视觉上下文信息,在嘈杂环境或一词多义场景下显著提升翻译准确率。低延迟高质量:端到端同传延迟最低可达2.8秒,结合语义单元预测技术,有效解决跨语言语序差异问题,翻译效果接近离线高质量水平。自然拟人语音:可生成语气与情感自适应的高质量合成语音,并支持声音复刻(可实时生成或使用预存音色),让翻译播报更接近本人真实发声。热词配置:支持注入行业领域热词,进一步提升专业术语和专有名词的翻译准确性。技术规格
输入模态:Audio、Image。输出模态:Text、Audio。上下文长度:53,248 tokens(最大输入49,152,最大输出4,096)。暂不支持功能:Function Calling、结构化输出、联网搜索、前缀续写、批量推理、模型调优。费用价格与限流(华北2/北京)
价格:音频输入40元/百万 tokens,图片输入3.3元/百万 tokens,文本输出100元/百万 tokens,音频输出160元/百万 tokens。限流:RPM=10,TPM=100,000。更多关于Qwen3.5-LiveTranslate-Flash模型的详细介绍,请前往阿里云百炼AI大模型官方平台查看:https://www.aliyun.com/product/bailian
