谷歌新语音合成模型可按文字描述定制声音
谷歌发布Gemini 3.8 Flash TTS与Flash-Lite TTS两款语音生成模型(TTS),支持100多种语言,经Gemini API和AI Studio推出。
Flash TTS可用文字描述从零设计声音,克隆功能需30秒样本加本人录音同意,生成音频带SynthID水印。两款模型支持逐行舞台指示、双角色对话和笑声等非语言声音。
价格方面,2026年底前每小段音频折算每小时0.81美元(Flash)和0.54美元(Flash-Lite),2027年1月起翻倍。文中能力与跑分均为谷歌口径,作者自测发现背景啸音和音色漂移。
信息源:the-decoder.com