Google 為 Pixel 11 引入的 Gboard 語音轉文字功能 Rambler,憑藉 Gemini 大型語言模型的運算能力,可將口語中的停頓與贅詞整理成條理清晰的文字,並自動加入項目符號、分段等格式。使用體驗方面,Rambler 對語意判斷的準確度極高,即使發言者中途修正或重複語句,最終輸出仍能保留原意。對於駕車期間需要回覆訊息的使用情境而言,這項功能省卻了等待紅燈時逐字核對錄音結果的麻煩。
整體而言,Rambler 採用「整段輸入、整段輸出」的模式,系統必須取得完整上下文後,方能刪除口頭禪並產出最終文本。
缺乏即時預覽成為 Rambler 主要缺陷
Rambler 目前最明顯的不足,在於錄音期間完全沒有視覺反饋。使用者按下角落的麥克風按鍵開始說話,說畢須自行按下剔號確認,系統方會在短暫處理後顯示完整文本。由於過程中無法即時監察語音辨識的進度,不少使用者曾忘記按下確認鍵,最終只見空白畫面而無任何輸出。更棘手的是,語音轉文字的工作模式傾向「輸入指令」,即使用者必須在錄音結束後才能編輯或轉換結果,過程中難以中途修改或補充內容。
另一層限制在於技術架構本身。Rambler 必須取得使用者全部話語後,方能判斷語意並過濾冗詞,故此無法像傳統語音輸入般逐字即時顯示。這種「延遲輸出」的特性,雖然有助於提升最終文本的流暢度,卻令使用者失去中途修正的機會,亦令整體錄音時間無可避免地延長。
Nothing OS 5.0 展示可行解決方案
針對上述痛點,Nothing 在即將推出的 Nothing OS 5.0 Essential Voice 更新中展示了截然不同的做法。該系統會在使用者說話期間,於畫面上即時顯示語音轉文字的「預覽版本」,待處理完成後,預覽內容會自動刪除,並由經過 Gemini 處理、刪去贅詞的「最終版本」取代。這種「先預覽、後取代」的模式,既保留了逐字即時反饋的視覺線索,又兼顧了 Rambler 原有以大型語言模型整理文本的優勢。
對 Google 而言,只要將類似機制移植至 Gboard,即使預覽內容並非最終結果,亦足以讓使用者確認系統是否聽對內容。
若 Google 進一步在錄音期間於 Gboard 頂部的發光橫條顯示文字預覽,便可大幅改善 Rambler 的日常使用體驗。即時視覺反饋能讓使用者即時察覺語音辨識的準確度,減少因忘記按確認鍵而衍生的操作失誤。這項改動技術難度不高,亦無須改動 Rambler 倚重的後端處理流程,理論上可透過軟件更新方式推送至 Pixel 11 系列裝置。
項目 規格 功能名稱 Rambler (Gboard 語音轉文字) 底層模型 Gemini Intelligence 套件 / Gemini 大型語言模型 支援裝置 Pixel 11 系列 輸入方式 按下麥克風鍵 → 說話 → 按下剔號確認 即時預覽 不支援(錄音期間無文字反饋) 輸出格式 自動加入項目符號、分段等格式 編輯模式 錄音結束後方可編輯或轉換 參考解決方案 Nothing OS 5.0 Essential Voice(支援即時預覽)
利益聲明:本文包含合作商戶產品連結,如你透過連結購買,TechRitual 可能獲得佣金收入,但不影響產品評價及推薦。詳情請參閱私隱政策。
身為 Amazon Associate,本站會從合資格購買中賺取佣金。

