谷歌新TTS模型可按文字描述定制声音
语音生成新增描述定制与克隆功能,2026年促销价每小时0.54美元起,2027年翻倍,能力均为官方口径。
原始事件 2026-09-23
谷歌发布Gemini 3.8 Flash TTS与Flash-Lite TTS两款语音生成模型,支持100多种语言,经Gemini API和AI Studio推出。
Flash TTS可用文字描述从零设计声音,克隆功能需30秒样本加本人录音同意,生成音频带SynthID水印。两款模型支持逐行舞台指示、双角色对话和笑声等非语言声音。
价格方面,2026年底前每小段音频折算每小时0.81美元(Flash)和0.54美元(Flash-Lite),2027年1月起翻倍。文中能力与跑分均为谷歌口径,作者自测发现背景啸音和音色漂移。