智识花园
模型AI 评分 73/100

Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

Google DeepMind:Blog(RSS)查看原始信源 ↗

AI guide

AI 导读

Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。

Story tracking

事件追踪

进行中 · 12 个信源 · 13 篇报道

最新进展:Google推出Gemini 3.8 Flash-Lite TTS语音生成模型,今日起在Gemini API和Google AI Studio开放

事件时间线

  1. X:洪明 (@hongming731)

    Google DeepMind 发布 Gemini 3.8 Flash 与 Flash-Lite 文本转语音模型

    Google DeepMind 新发布 Gemini 3.8 Flash 与 Flash-Lite TTS:前者支持自然语言设计声音、逐行指导表演,后者面向大批量生成。原文还说明声音复刻需授权验证,并为生成音频加入水印。

    阅读原始报道 ↗
  2. X:洪明 (@hongming731)

    Google DeepMind 推出 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 文本转语音模型,支持自然语言创建声音、逐行表演控制、双说话者场景与约30秒样本声音复刻

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS:前者侧重声音创作与角色设计,后者面向大规模、注重成本的语音生成,与面向实时语音对话的 Gemini Live 系列不同。Flash TTS 可用自然语言指定角色、口音和声音特征从头创建声音,Google 还提供2,000多个预备声音;两个模型都支持在脚本中逐行指定语速、语气、口音变化与短促回应。Google 展示了单份脚本中的双说话者场景控制并描述长篇生成能力,也说明可从约30秒样本重建有权使用的声音,但创建前需提供与参考说话者匹配的口头授权录音,生成音频带 SynthID 水印和内容凭证。Google 在公告中引用声音设计与质量评测的领先成绩及跨语言盲测表现,这些排名由 Google 转述评测。开发者目前可在 Gemini API 与 Google AI Studio 中接触这两款模型,Google 对企业平台的接入说明了不同推出节奏。

    阅读原始报道 ↗
  3. Hacker News 热门(buzzing.cc 中文翻译)

    Google发布Gemini 3.8 Flash TTS文本转语音模型,今日起在Gemini API和Google AI Studio推出

    Google推出Gemini 3.8 Flash TTS,面向深度创意指导和角色设计,可用自然语言提示从头创建全新声音,并对表演线索、节奏、方言转换和反馈语进行逐行控制。该模型支持超过100种语言和方言,提供2000+现成声音,并可从30秒音频样本复刻声音(需同意验证、SynthID水印和C2PA凭证)。它在Hume AI语音设计基准上以71.4分排名第一,口音建模得分60.8,并在Voice Arena盲测中于日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等语言中位居前列。开发者今日可在Gemini API和Google AI Studio使用,企业版API即将在Gemini Enterprise推出,普通用户可在Gemini Notebook使用。

    阅读原始报道 ↗
  4. The Decoder:AI News(RSS)

    Google发布Gemini 3.8 Flash TTS语音合成模型

    Google发布了Gemini 3.8 Flash TTS,支持通过文本描述从头设计声音,提供超过2000种预设声音库及区域变体,支持100多种语言、逐行舞台指示、双角色对话和非语言声音;声音克隆需30秒样本并录制同意声明,生成音频带SynthID水印。定位用于播客、有声书、游戏角色等创意场景,通过Gemini API和Google AI Studio推出,另在Gemini Notebook可用,企业API访问即将跟进。

    阅读原始报道 ↗
  5. Simon Willison 博客

    Google发布gemini-3.8-flash-tts和gemini-3.8-flash-lite-tts两款新文本转语音模型

    Google发布两款新的Gemini文本转语音模型:gemini-3.8-flash-tts和gemini-3.8-flash-lite-tts,附带超过2000种声音的语音库,并支持用一段30秒的本人声音或有权使用的声音样本创建自定义声音。

    阅读原始报道 ↗
  6. X:Logan Kilpatrick (@OfficialLoganK)

    发布 Gemini 3.8 Flash TTS:自称新的 SOTA 文本转语音模型

    发布公告宣布推出 Gemini 3.8 Flash TTS,定位为新的 SOTA 文本转语音模型:提供全新声音设计体验、2000+ 生产就绪声音、声音复制功能,支持 100 种语言;voice remixing 功能即将推出(soon)。据公告,该模型在 Hume AI 的声音基准测试中排名第一。

    阅读原始报道 ↗
  7. X:Artificial Analysis (@ArtificialAnlys) 一手信源

    Google发布Gemini 3.8 Flash TTS语音合成模型,发音鲁棒性基准登顶第一

    Google发布Gemini 3.8 Flash TTS文本转语音模型,支持预设声音和声音复制。该模型在发布方评测的发音鲁棒性基准以89.5%排名第一,Provider Voice Arena以1,263 Elo排第二,处理速度为每秒44.1个字符(约2.7倍实时),定价每百万字符32.98美元,高于上一代Gemini 3.1 Flash TTS但远低于Eleven v3。

    阅读原始报道 ↗
  8. IT之家(RSS)

    谷歌发布 Gemini 3.8 Flash TTS 文本转语音模型,面向深度创意方向,即日起可在 Google AI Studio 体验

    谷歌宣布推出 Gemini 3.8 Flash TTS 文本转语音模型,面向深度创意方向和角色设计,可通过自然语言提示从头创建全新语音,支持逐行指导表演、长篇生成、原生双声音场景编排等功能,并提供语音复制(含同意验证与 SynthID 水印)。该模型在 Hume AI 语音设计基准(71.4 分)位居总体第一,并已向开发者推送,可在 Gemini API 和 Google AI Studio 使用,Gemini Notebook 也可使用;通过 AI Studio 进行的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度不可用。

    阅读原始报道 ↗
  9. X:Testing Catalog (@testingcatalog)

    Google Gemini 3.8 Flash TTS在Google AI Studio和API上线

    原文报道Gemini 3.8 Flash TTS已在Google AI Studio和API上线,被称为支持语音设计(Voice Design)和双说话人剧本控制的旗舰TTS模型,可提示自定义声音人格、逐行指导台词演绎并添加语音爆发效果。

    阅读原始报道 ↗
  10. Hacker News:AI 热帖

    Google推出Gemini 3.8 Flash TTS语音生成模型,今日起在Gemini API和Google AI Studio开放

    Google宣布推出Gemini 3.8 Flash TTS,定位为面向深度创意指导与角色设计的语音生成模型,可通过自然语言提示从零创建全新声音,并对表演、节奏、方言转换等逐行控制。该模型支持长音频生成、双说话人场景编排及脚本化非语言提示,在Hume AI语音设计基准中以71.4分排名第一、口音建模60.8分领先,并在Voice Arena盲测中于日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等语言中位居前列。开发者今日起可通过Gemini API和Google AI Studio使用,企业版API即将在Gemini Enterprise开放,普通用户可在Gemini Notebook使用。

    阅读原始报道 ↗
  11. X:Google AI (@GoogleAI) 一手信源

    推出 Gemini 3.8 Flash TTS 语音合成模型,定位高保真创意生产,支持从零设计定制语音角色并提供逐行级控制

    原文宣布推出 Gemini 3.8 Flash TTS,定位用于游戏、沉浸式有声书和播客等高保真创意生产,支持从零设计定制语音角色并提供逐行级控制。该发布整体称模型可在100多种语言创建自定义声音、选用2000多种现成声音,并支持 <laughs>、|mhm| 等自然提示。发布主体在原文中未具名。

    阅读原始报道 ↗
  12. X:Google DeepMind (@GoogleDeepMind) 一手信源

    发布 Gemini 3.8 Flash TTS 文本转语音模型,支持设计具有独特口音和特征的自定义声音

    原文宣布发布新的 Gemini 3.8 Flash TTS 文本转语音模型,可用于创建和部署自定义音频,支持设计具有独特口音和特征的自定义声音。

    阅读原始报道 ↗
  13. Google DeepMind:Blog(RSS) 一手信源

    Google推出Gemini 3.8 Flash TTS,面向开发者开放Gemini API和AI Studio,企业版与Gemini Notebook渠道另有安排

    Google宣布推出Gemini 3.8 Flash TTS,面向深度创意指导与角色设计,支持用自然语言提示从头创建定制声音、逐行指导表演,覆盖100多种语言,并提供带同意验证、SynthID水印和C2PA凭证的声音复刻。该模型在Hume AI Voice Design Benchmark获总榜第一(71.4),在Voice Arena盲测多语种中居前列。发布即面向开发者开放Gemini API和Google AI Studio;通过API进入Gemini Enterprise的企业渠道为即将推出,同时面向所有用户登陆Gemini Notebook;声音重混音功能亦为即将推出。

    阅读原始报道 ↗
数据来源:AIHOT aihot.news ↗ · 内容版权归原作者所有