Gemini 3.8 語音模型登場:一句提示建聲線
2026-09-28 技術
Google 於 2026 年 9 月 23 日推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 兩款文字轉語音模型,開發者可用自然語言提示從零建立角色聲線,並在劇本編輯器內逐句指導演出。模型支援超過 100 種語言,內建 SynthID 水印與語音同意驗證機制。
閱讀更多以下是帶有「TTS」標籤的全部文章,共 7 篇。
2026-09-28 技術
Google 於 2026 年 9 月 23 日推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 兩款文字轉語音模型,開發者可用自然語言提示從零建立角色聲線,並在劇本編輯器內逐句指導演出。模型支援超過 100 種語言,內建 SynthID 水印與語音同意驗證機制。
閱讀更多
2026-09-22 技術
Voicebox 是開源的本地 AI 語音工作室,在 GitHub 累積 5.5 萬顆星標與 269 萬次下載。本文整理其 7 套 TTS 引擎、23 種語言、MCP 語音輸出與跨平台 GPU 支援,並分析它如何在單一應用內同時涵蓋語音合成與聽寫輸入。
閱讀更多
2026-09-09 技術
Real-Time-Voice-Cloning 是擁有 60,126 星標的經典開源語音克隆項目,基於 SV2TTS 架構,只需 5 秒音檔即可複製人聲並即時合成語音。本文解析其 GE2E、Tacotron、WaveRNN 三階段架構、核心技術亮點、安裝方式與生態定位,並比較其與 2026 年新方案的差異。
閱讀更多
2026-08-18 技術
Coqui TTS 是 GitHub 星標逾 4.5 萬的開源深度學習文字轉語音(TTS)項目,支援逾 1,100 種語言的預訓練模型,提供語音克隆、多語種模型與低延遲串流能力,MPL-2.0 授權,專為研究與生產環境打造的先進語音合成引擎。
閱讀更多
2026-08-16 技術
GPT-SoVITS 是 GitHub 星標逾 6 萬的開源語音克隆與文字轉語音項目,僅需 5 秒參考音訊即可零樣本合成語音,1 分鐘訓練資料即可微調出高相似度聲線,支援中英日韓粵五種語言跨語合成,MIT 授權,提供 WebUI 一站式工具鏈,2024 年 1 月發布至今持續更新。
閱讀更多
2026-08-16 技術
微軟開源語音 AI 家族 VibeVoice 在 GitHub 累積 52,713 顆星標,涵蓋 60 分鐘長語音辨識、90 分鐘多說話人語音合成與即時串流語音模型,採 MIT 授權,並整合 Azure AI Foundry 與 Hugging Face Transformers 生態。
閱讀更多
2026-08-08 技術
MoneyPrinterTurbo 是開源一站式 AI 短片生成工具,GitHub 星標超過 102,000 顆,輸入主題即可自動生成腳本、匹配素材、合成字幕與背景音樂並輸出高清影片,支援 WebUI、API、CLI 與 AI Agent 四種方式,採用 MIT 許可證。
閱讀更多