谷歌近日推出了两款新的文本转语音模型,分别是Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。这些模型通过谷歌的云平台提供,具有相似的应用程序接口,便于开发者并行使用。Flash-Lite TTS优化了成本效益和推理速度,而Flash TTS则提供更高的音频质量。Flash TTS支持130种语言,而Flash-Lite TTS支持101种语言,且两者都提供超过2000种预打包的声音库。开发者可以使用自然语言提示创建自定义声音,并通过30秒的音频样本生成合成声音。谷歌还使用SynthID技术在AI生成的语音中嵌入音频水印,以便于AI检测工具识别。 另一方面,高通在其年度Snapdragon峰会上发布了两款旗舰智能手机处理器,分别是Snapdragon 8 Elite Gen 6和Snapdragon 8 Elite Extreme Gen 6。这些芯片专注于提升AI功能,能够在本地运行多达200百万参数的小型模型,支持更好的个性化AI代理。新芯片的感应中心可以运行完整的语音输入和输出代理,并通过新的加速器元素以更高效的方式运行模型。高通的Extreme版本能够在本地运行一个30亿参数的混合专家模型,支持8K 60fps的视频录制。这些新技术的推出,标志着AI在语音生成和智能手机领域的进一步发展,值得关注的是,越来越多的用户将通过手机来使用AI功能。
行业观察 · 2026年9月24日
AI语音生成与智能手机芯片的最新进展
谷歌和高通分别推出了新的AI语音生成模型和智能手机芯片,推动了行业的发展。

