谷歌发布Gemini 3.8双模TTS:30秒克隆声纹 覆盖100+语言
2026-09-29 05:31:15未知 作者:徽声在线
北京时间9月23日晚间消息,谷歌在最新技术发布会上正式推出两款革命性文本转语音(TTS)模型——Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS。据官方介绍,Flash TTS专为高端声音定制场景设计,用户可通过自然语言指令实现个性化声音生成,支持对每句话的语气、语速、语调甚至地域口音进行精细调控,更创新性地支持基于30秒音频样本的声纹克隆技术。而Flash-Lite TTS则聚焦于大规模音频内容生产领域,可高效完成有声书、视频配音等批量任务。
技术参数方面,两款模型均实现跨语言支持突破,覆盖全球超过100种语言及方言体系,内置2000余种预置声库供用户直接调用。谷歌AI实验室负责人透露,Flash TTS的声音克隆技术采用深度神经网络架构,仅需短音频样本即可构建高度拟真的数字声纹,在情感表达准确度测试中较前代产品提升37%。
行业分析师指出,此次发布标志着语音合成技术进入「超个性化」时代,尤其在有声内容创作、虚拟数字人、智能客服等领域将引发变革。目前开发者已可通过Google Cloud平台申请模型试用权限,预计第四季度正式开放商业接口。