18+

告別語無倫次!Google打造Gemini 3.5 Transcribe語音辨識模型 Chrome網頁全欄位將支援語音輸入

Google 稍早正式揭曉全新AI語音 模型Gemini 3.5 Transcribe,主打能將使用者隨口說出的發散思緒與「碎碎念」,精準轉化為結構化、格式整齊的文本。這項技術不僅將驅動最新的Pixel 11系列手機,未來更將整合至Chrome 瀏覽器,讓使用者能在任何網頁輸入欄位中直接進行語音聽寫。

從「逐字紀錄」到「結構化重塑」

相較於過往的語音辨識模型,Gemini 3.5 Transcribe 在精準度與語言適應性上均有顯著提升。其核心亮點包括:

• 強大的語言與除錯能力:模型具備自動偵測超過85種語言的能力。在轉錄過程中,系統會自動過濾掉口語表達中常見的贅詞 (Filler words),並且將非結構化的口語內容重新編排為容易判讀的文本。

• 高度客製化與字串捕捉:支援透過語音指令進行文字編輯。此外,模型能夠學習使用者的專屬詞彙與特殊拼寫方式,對於訂單編號、郵遞區號等由英數字元混合組成的字串,也擁有極高的捕捉準確度。

• 支援三人語音分離:針對預錄的音檔,Gemini 3.5 Transcribe能夠辨識、分離最多3位發言者,並且提供精確到「單字級別」 (Word-level)的時間軸標記。這項功能對於需要頻繁處理會議紀錄、訪談或Podcast節目聽打的工作者而言,將是一大福音。

深度整合Pixel 11生態與Chrome瀏覽器

Google正在積極將這項強大的語音模型推向旗下各項軟硬體服務:

 驅動硬體與代理任務:Gemini 3.5 Transcribe目前已經成為Android裝置 (如全新Pixel 11系列)上全新AI語音輸入與文字潤飾功能「Rambler」的核心驅動力。在macOS版本的Gemini App中,則能與其他Gemini模型協同運作,執行複雜的代理式AI (Agentic AI)任務。

• Chrome網頁全欄位支援:這是本次發布中最具突破性的應用之一。Google預告,未來使用者將能在Chrome瀏覽器的「任何網頁欄位」中使用語音轉文字功能,無論是回覆社群貼文、撰寫郵件,或是用語音向AI下達提示詞,都能直接無縫完成。

除了上述端點應用,Gemini 3.5 Transcribe也將登上Google的代理式開發平台「Google Antigravity」,並且陸續整合至Search Live、Gemini Live、Docs、Keep與Gmail等Google原生服務中,同時也會開放API供外部開發者串接使用。

當大型語言模型接管語音輸入,鍵盤的必要性將進一步降低

過去的語音辨識技術多半停留在「你說什麼,我打什麼」的死板階段,這往往導致產出的文字充滿口語化贅字,難以直接用於正式文件。Gemini 3.5 Transcribe的出現,顯示Google正試圖將大型語言模型的邏輯重構能力與語音辨識深度融合。

而將語音輸入功能全面「無縫植入」Chrome的所有網頁欄位,更是直接挑戰傳統鍵盤輸入的地位。對於早已習慣用語音進行搜尋與指令下達的現代使用者而言,這項更新無疑是邁向「全語音互動」運算時代的重要基石。

《原文刊登於合作媒體mashdigi,聯合新聞網獲授權轉載。》

精華 FAQ

  • 它不只做逐字轉寫,還能把使用者的零散口語、贅詞與跳躍思緒整理成更結構化、易閱讀的文本,讓內容更接近可直接使用的正式文字。

  • Gemini 3.5 Transcribe可自動偵測超過85種語言,並能在預錄音檔中辨識、分離最多3位發言者,還提供單字級時間軸標記,方便會議與訪談聽打。

  • Google將把它用於Pixel 11的AI語音輸入、Chrome任何網頁欄位的語音輸入,並逐步整合到Search Live、Gemini Live、Docs、Keep、Gmail與開放API。

延伸閱讀

蘋果贏了!市占躍升追平三星 安卓陣營面臨「雙重打擊」歐洲陷苦戰

蘋果贏了!市占躍升追平三星 安卓陣營面臨「雙重打擊」歐洲陷苦戰

LINE免費貼圖4款!它放送滿滿節日祝賀 「ㄍㄟ婚」、升官、週年快樂都能用

LINE免費貼圖4款!它放送滿滿節日祝賀 「ㄍㄟ婚」、升官、週年快樂都能用

本日熱門 本周最熱 本月最熱