曾經那個需要單獨切換界面、隻能聽見聲音的ChatGPT語音助手,如今終于能和你在一個窗口裡既聊天又展示圖片了。
OpenAI于11月25日宣布,對ChatGPT的語音模式進行重大更新**,将其直接整合進主聊天界面中。這意味着用戶不再需要切換到單獨的語音模式,即可在語音對話的同時,實時查看AI的文字回複、圖片、地圖等視覺信息,獲得一種無縫的多模态交互體驗。
舊體驗:孤立的語音界面
在本次更新之前,ChatGPT的語音功能像一個獨立的功能模塊。
當用戶啟動語音對話時,會被帶到一個全新的、獨立的界面。這個界面的核心是一個動畫藍色圓圈,代表着語音交互的接口。
在此模式下,用戶隻能聽取ChatGPT的語音回複,而無法在屏幕上看到對應的文字内容。一旦錯過或沒聽清某句回複,就必須退出語音模式,返回到文本聊天界面才能查看記錄,體驗相當割裂。
這個獨立界面也配備了一些基礎控件,如靜音按鈕、實時視頻錄制選項,以及一個用于返回默認文本模式的“X”按鈕。
新體驗:融合的多模态交互
更新後,語音模式不再是獨立的“功能房間”,而是成為了主聊天界面的一部分。
你現在可以和ChatGPT進行自然對話,并同步看到你的問題和AI的回答以文字形式在屏幕上實時呈現。這讓語音交互變得前所未有的直觀和方便。
更重要的是,此次更新真正實現了語音、文本和視覺信息的同台協作。
例如,當你通過語音詢問“Mission區最好的面包店在哪裡?”時,ChatGPT不僅會用語音告訴你答案,還會在聊天窗口裡直接展示一張地圖,并标記出推薦的面包店位置。
核心價值:無縫銜接的對話流
此次界面更新的根本性進步,在于打破了語音與文本、視覺信息之間的壁壘。
現在,你可以在一次對話中,自由地在語音和文本輸入間切換,所有信息都以統一、連貫的形式呈現在同一界面。你甚至可以在語音交流的同時,回顧之前對話中的圖片或鍊接,使得整個對話上下文始終保持完整和可追溯。
盡管交互更加融合,但當你準備從語音輸入切換回純文本輸入時,仍然需要點擊“結束”按鈕來停止語音對話。
人性化設置:兼顧不同偏好
為了照顧老用戶的習慣,OpenAI并未徹底抛棄舊的語音模式。
在“設置” -> “語音模式”中,用戶會找到一個新增加的“分離模式”開關。開啟後,界面将恢複到此前的獨立語音模式,滿足那些可能更喜歡沉浸式音頻體驗的用戶。
戰略布局:邁向更自然的AI交互
這一改進是OpenAI持續疊代其産品的一部分。此前,該公司已推出了AI購物助手、支持iCloud鑰匙串的Atlas浏覽器功能,以及性能更強的GPT-5.1模型等。
一些業内觀察者在社交媒體上推測,此次功能升級可能與CEO Sam Altman對AI硬件設備的構想有關,旨在為未來更自然、更直觀的人機交互方式打下基礎。
從“聽不見文字”到“看得見聲音”,ChatGPT語音模式的這次深度整合,看似隻是界面調整,實則是通向更自然、更高效人機交互的重要一步。
當語音、文字和圖像在同一界面和諧共處,我們與AI的交流也終于變得更像與一個“人”對話——既能聽見他的聲音,也能看到他的表情和動作。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.



