Google 稍早正式揭曉全新AI語音 模型Gemini 3.5 Transcribe,主打能將使用者隨口說出的發散思緒與「碎碎念」,精準轉化為結構化、格式整齊的文本。這項技術不僅將驅動最新的Pixel 11系列手機,未來更將整合至Chrome 瀏覽器,讓使用者能在任何網頁輸入欄位中直接進行語音聽寫。
從「逐字紀錄」到「結構化重塑」
相較於過往的語音辨識模型,Gemini 3.5 Transcribe 在精準度與語言適應性上均有顯著提升。其核心亮點包括:
• 強大的語言與除錯能力:模型具備自動偵測超過85種語言的能力。在轉錄過程中,系統會自動過濾掉口語表達中常見的贅詞 (Filler words),並且將非結構化的口語內容重新編排為容易判讀的文本。
• 高度客製化與字串捕捉:支援透過語音指令進行文字編輯。此外,模型能夠學習使用者的專屬詞彙與特殊拼寫方式,對於訂單編號、郵遞區號等由英數字元混合組成的字串,也擁有極高的捕捉準確度。
• 支援三人語音分離:針對預錄的音檔,Gemini 3.5 Transcribe能夠辨識、分離最多3位發言者,並且提供精確到「單字級別」 (Word-level)的時間軸標記。這項功能對於需要頻繁處理會議紀錄、訪談或Podcast節目聽打的工作者而言,將是一大福音。
深度整合Pixel 11生態與Chrome瀏覽器
Google正在積極將這項強大的語音模型推向旗下各項軟硬體服務:
• 驅動硬體與代理任務:Gemini 3.5 Transcribe目前已經成為Android裝置 (如全新Pixel 11系列)上全新AI語音輸入與文字潤飾功能「Rambler」的核心驅動力。在macOS版本的Gemini App中,則能與其他Gemini模型協同運作,執行複雜的代理式AI (Agentic AI)任務。
• Chrome網頁全欄位支援:這是本次發布中最具突破性的應用之一。Google預告,未來使用者將能在Chrome瀏覽器的「任何網頁欄位」中使用語音轉文字功能,無論是回覆社群貼文、撰寫郵件,或是用語音向AI下達提示詞,都能直接無縫完成。
除了上述端點應用,Gemini 3.5 Transcribe也將登上Google的代理式開發平台「Google Antigravity」,並且陸續整合至Search Live、Gemini Live、Docs、Keep與Gmail等Google原生服務中,同時也會開放API供外部開發者串接使用。
當大型語言模型接管語音輸入,鍵盤的必要性將進一步降低
過去的語音辨識技術多半停留在「你說什麼,我打什麼」的死板階段,這往往導致產出的文字充滿口語化贅字,難以直接用於正式文件。Gemini 3.5 Transcribe的出現,顯示Google正試圖將大型語言模型的邏輯重構能力與語音辨識深度融合。
而將語音輸入功能全面「無縫植入」Chrome的所有網頁欄位,更是直接挑戰傳統鍵盤輸入的地位。對於早已習慣用語音進行搜尋與指令下達的現代使用者而言,這項更新無疑是邁向「全語音互動」運算時代的重要基石。
《原文刊登於合作媒體mashdigi,聯合新聞網獲授權轉載。》
精華 FAQ
-
它不只做逐字轉寫,還能把使用者的零散口語、贅詞與跳躍思緒整理成更結構化、易閱讀的文本,讓內容更接近可直接使用的正式文字。
-
Gemini 3.5 Transcribe可自動偵測超過85種語言,並能在預錄音檔中辨識、分離最多3位發言者,還提供單字級時間軸標記,方便會議與訪談聽打。
-
Google將把它用於Pixel 11的AI語音輸入、Chrome任何網頁欄位的語音輸入,並逐步整合到Search Live、Gemini Live、Docs、Keep、Gmail與開放API。
訂閱《科技玩家》YouTube頻道!
💡 追新聞》》在Google News按下追蹤,科技玩家好文不漏接!
📢 Google Pixel 11 Pro XL開箱!實測7功能變追星機 一鍵抓拍、120倍變焦還能建名片檔
📢買iPhone Ultra有代價!蘋果首款摺疊機少5大功能 定價破6萬
📢北捷「白色機器」藏回饋金!TPASS 2.0、北捷常客優惠不一樣 教你兩邊一次拿
📢 iPhone別急著年年換!通訊行揭最佳時機:殘值高、機況好
📢2號碼開頭電話快掛掉!Whoscall揭詐團新招:接聽秒被當肥羊
📢 LINE推「編輯訊息」新功能!發錯訊息15分鐘內都有救 免費開啟方式看這

討論區