Meta 推 Muse Voice Transcribe:即時語音轉錄模型
2026-09-02 技術
Meta 推出首個即時音訊感知模型 Muse Voice Transcribe,提供多語言串流語音轉錄、20 位以上說話者辨識與自動斷句,以每千分鐘 3 美元開放予開發者使用。模型以超過 70 種語言訓練,已內建於 Meta AI for Mac 與 Muse Code,Mac 用戶按住 Fn 鍵即可在任意應用程式聽寫。
閱讀更多以下是帶有「語音辨識」標籤的全部文章,共 4 篇。
2026-09-02 技術
Meta 推出首個即時音訊感知模型 Muse Voice Transcribe,提供多語言串流語音轉錄、20 位以上說話者辨識與自動斷句,以每千分鐘 3 美元開放予開發者使用。模型以超過 70 種語言訓練,已內建於 Meta AI for Mac 與 Muse Code,Mac 用戶按住 Fn 鍵即可在任意應用程式聽寫。
閱讀更多
2026-08-18 技術
whisper.cpp 是 GitHub 星標逾 5 萬的開源項目,將 OpenAI Whisper 語音辨識模型以純 C/C++ 無依賴方式重新實作,支援 CPU 與 Apple Silicon 原生推理,可離線運行,MIT 授權,2022 年發布至今持續更新。
閱讀更多
2026-08-16 技術
微軟開源語音 AI 家族 VibeVoice 在 GitHub 累積 52,713 顆星標,涵蓋 60 分鐘長語音辨識、90 分鐘多說話人語音合成與即時串流語音模型,採 MIT 授權,並整合 Azure AI Foundry 與 Hugging Face Transformers 生態。
閱讀更多
2026-08-13 技術
Google DeepMind 於 2026 年 8 月 12 日推出多語手語轉文字模型 SL2T,品質為迄今最高,並首次將手語 AI 帶入消費產品:Pixel 11 率先支援美國手語轉英文。模型以逾 10 萬小時、50 多種手語資料訓練,零樣本得分 70 BLEURT。
閱讀更多