​Google Gemini 3.5 Transcribe登場 語音辨識錯誤率創新低 

圖/示意圖

商傳媒|林昭衡/綜合外電報導Google 今日發表全新人工智慧模型 Gemini 3.5 Transcribe,這項語音轉文字技術旨在大幅提升語音輸入的效率,不僅能自動過濾使用者口語中的贅詞(如「嗯」、「啊」),還能即時校正語音內容,產出精煉的 AI 文字。這款新模型在 AI 語音辨識技術上取得顯著突破,與前一代語音引擎 Chirp 3 相比,語音轉文字的速度預計可提升約七成,即時語音辨識的錯誤率更從 Chirp 3 的 7.32% 降低至 5.5%。

Gemini 3.5 Transcribe 的關鍵功能包含在辨識過程中,即時移除常見的口頭禪與修正語句,同時也能參考使用者提供的專屬詞彙表,精準處理特定領域的「專業術語」。這項技術支援 85 種語言,並能處理最多三位發言者的預錄音檔。

目前,Gemini 3.5 Transcribe 已整合至多項 Google 產品中。例如,Pixel 11 手機上的 Gboard 輸入法已內建「Rambler」功能,利用此模型提供更流暢的語音輸入體驗。Google 表示,今年稍晚會將 Rambler 擴展至更多 Gemini Intelligence 裝置。此外,Gemini app 的 macOS 版本、Antigravity 平台以及 AI Studio 的模型建構工具,也於昨日起開始支援 Gemini 3.5 Transcribe,讓開發人員能運用此語音辨識技術進行「vibe code」應用程式開發。開發者也能透過 Gemini API 存取這項新模型。Google 也規劃將此 AI 轉錄功能導入 Chrome 瀏覽器,預計將很快提供,屆時使用者可透過語音在任何網頁欄位輸入文字,例如撰寫電子郵件、發表評論,甚至以語音與 AI 聊天機器人互動。

     

相關新聞

您可能有興趣

即時新聞

熱門新聞