Pixel 11 Rambler 語音轉文字功能表現出色 惟缺少即時預覽成美中不足

GooglePixel 11 引入的 Gboard 語音轉文字功能 Rambler,憑藉 Gemini 大型語言模型的運算能力,可將口語中的停頓與贅詞整理成條理清晰的文字,並自動加入項目符號、分段等格式。使用體驗方面,Rambler 對語意判斷的準確度極高,即使發言者中途修正或重複語句,最終輸出仍能保留原意。對於駕車期間需要回覆訊息的使用情境而言,這項功能省卻了等待紅燈時逐字核對錄音結果的麻煩。

整體而言,Rambler 採用「整段輸入、整段輸出」的模式,系統必須取得完整上下文後,方能刪除口頭禪並產出最終文本。

缺乏即時預覽成為 Rambler 主要缺陷

Rambler 目前最明顯的不足,在於錄音期間完全沒有視覺反饋。使用者按下角落的麥克風按鍵開始說話,說畢須自行按下剔號確認,系統方會在短暫處理後顯示完整文本。由於過程中無法即時監察語音辨識的進度,不少使用者曾忘記按下確認鍵,最終只見空白畫面而無任何輸出。更棘手的是,語音轉文字的工作模式傾向「輸入指令」,即使用者必須在錄音結束後才能編輯或轉換結果,過程中難以中途修改或補充內容。

另一層限制在於技術架構本身。Rambler 必須取得使用者全部話語後,方能判斷語意並過濾冗詞,故此無法像傳統語音輸入般逐字即時顯示。這種「延遲輸出」的特性,雖然有助於提升最終文本的流暢度,卻令使用者失去中途修正的機會,亦令整體錄音時間無可避免地延長。

Nothing OS 5.0 展示可行解決方案

針對上述痛點,Nothing 在即將推出的 Nothing OS 5.0 Essential Voice 更新中展示了截然不同的做法。該系統會在使用者說話期間,於畫面上即時顯示語音轉文字的「預覽版本」,待處理完成後,預覽內容會自動刪除,並由經過 Gemini 處理、刪去贅詞的「最終版本」取代。這種「先預覽、後取代」的模式,既保留了逐字即時反饋的視覺線索,又兼顧了 Rambler 原有以大型語言模型整理文本的優勢。

對 Google 而言,只要將類似機制移植至 Gboard,即使預覽內容並非最終結果,亦足以讓使用者確認系統是否聽對內容。

若 Google 進一步在錄音期間於 Gboard 頂部的發光橫條顯示文字預覽,便可大幅改善 Rambler 的日常使用體驗。即時視覺反饋能讓使用者即時察覺語音辨識的準確度,減少因忘記按確認鍵而衍生的操作失誤。這項改動技術難度不高,亦無須改動 Rambler 倚重的後端處理流程,理論上可透過軟件更新方式推送至 Pixel 11 系列裝置。

項目規格
功能名稱Rambler (Gboard 語音轉文字)
底層模型Gemini Intelligence 套件 / Gemini 大型語言模型
支援裝置Pixel 11 系列
輸入方式按下麥克風鍵 → 說話 → 按下剔號確認
即時預覽不支援(錄音期間無文字反饋)
輸出格式自動加入項目符號、分段等格式
編輯模式錄音結束後方可編輯或轉換
參考解決方案Nothing OS 5.0 Essential Voice(支援即時預覽)

利益聲明:本文包含合作商戶產品連結,如你透過連結購買,TechRitual 可能獲得佣金收入,但不影響產品評價及推薦。詳情請參閱私隱政策

身為 Amazon Associate,本站會從合資格購買中賺取佣金。

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)