8月7日,阿里巴巴正式推出国内首个一站式AI语音生产力平台CosyVoice Studio。该平台基于阿里自研语音模型Qwen-Audio打造,在全球权威AI评测平台Artificial Analysis上,该模型斩获语音识别(ASR)、实时交互(RealTime)和语音合成(TTS)三个赛道的全球第一。
这是阿里首次将语音模型能力以聚合产品形态对外开放,标志着国内AI语音行业从“单点工具”向“一站式生产力平台”的演进。
三大功能模块
CosyVoice Studio包含三个核心功能,分别覆盖语音记录、智能交互和内容创作场景。
语音记录CosyFlow:转写叠加语义理解,输出结构化文本
CosyFlow在传统语音转文字基础上叠加了语义理解和文本生成能力。日常场景中,平台可自动过滤“那个”“嗯”等口语填充词,将零散想法整理为清晰表达;工作场景中,口述即可生成邮件、工作汇报、会议纪要等规范文本。
面向会议、访谈、课堂等场景,CosyFlow内置“随记”功能,支持实时录制和离线上传,可根据声纹智能区分不同发言人,录音结束后自动生成结构化章节和智能摘要。单次最长支持6小时的连续录音。
平台还支持数字、公式等特殊文本的智能转写,“三点五八亿”“百分之十二点六”可直接输出为3.58亿、12.6%,覆盖金融、科研、媒体等专业场景。
语音智能体CosyAgent:自然语言创建实时对话Agent
CosyAgent支持通过自然语言快速创建具备企业知识、工具调用和实时语音交互能力的智能体,兼容prompt与workflow深度配置,面向智能客服、电话营销等场景。
音频创作CosyCreative:上传文档即可生成播客或有声书
CosyCreative内置上千种音色,支持声音复刻,生成的音色十分接近真人。用户上传文档、网页链接或输入文字,即可生成对话播客或多角色有声书,覆盖音频内容创作的全链路。
技术与体验
CosyVoice Studio的底层支撑是Qwen-Audio-3.0-TTS语音合成大模型,于今年7月发布。该模型支持细粒度情感标签控制(如[gasp][angry])、freestyle自由风格模式、16种语言及20种方言覆盖。
音频输出从24kHz提升至48kHz,单次语音合成可长达3分钟。其中,面向实时交互的Flash版本首包延时仅300ms级别。
即日起,用户可在iOS、Android、Mac和Windows应用商店搜索“CosyVoice”下载体验,限时免费使用。CosyAgent和CosyCreative目前以白名单邀请制面向企业用户测试,近期将全面开放。企业用户可在平台上直接体验效果,再按需调用API。
行业影响
语音正在成为AI时代人机交互的核心界面。随着大模型能力成熟,用户在使用AI产品时越来越自然地选择语音对话而非文字输入。行业的技术架构也在随之演变,早期散点化的语音转写和合成工具,正在向端到端的语音Agent靠拢。
CosyVoice Studio的发布将阿里的语音模型能力第一次以聚合产品的形态对外开放,可全面满足企业、开发者和个人的AI语音需求。从语音识别全球第一的技术底座,到“记录-创作-交互”的全链路覆盖,CosyVoice Studio标志着国内AI语音行业正式进入一站式生产力平台时代。