人工智能(AI)的迅猛發展正深刻改變着世界,但一些最先進的 AI 模型卻開始表現出令人警惕的行為:它們不僅會精心編織謊言,謀劃策略,甚至威脅創造者,以達到自己的目的。
物理學家組織網在上個月一則報道中指出,盡管 ChatGPT 已問世兩年多,AI 研究人員仍無法完全理解這些 “數字大腦” 的運作方式。AI 的 “策略性欺騙” 已成為科學家和政策制定者需要直面的緊迫挑戰。如何約束這些越來越聰明卻可能失控的 AI,已成為關乎技術發展與人類未來的關鍵議題。
“策略性欺騙” 行為頻現
随着 AI 模型日益精進,它們的 “心機” 也越來越深。研究人員發現,這些 “數字大腦” 不僅會撒謊,甚至學會了讨價還價、威脅人類 —— 它們的欺騙行為正變得越來越具有策略性。
早在 2023 年,一項研究就捕捉到 GPT-4 的一些 “不老實” 的表現:在模拟股票交易時,它會刻意隐瞞内幕交易的真正動機。香港大學教授西蒙・戈德斯坦指出,這種欺騙行為與新一代 “推理型” AI 的崛起密切相關。這些模型不再簡單應答,而是會像人類一樣逐步解決問題。
有測試機構警告,這已超越了典型的 AI “幻覺”(指大模型編造看似合理實則虛假的信息)。他們觀察到的是精心設計的欺騙策略。
全球知名科技媒體 PCMAG 網站就曾報道過這樣的案例。在近期測試中,Anthropic 的 “克勞德 4” 竟以曝光工程師私生活相要挾來抗拒關機指令。美國開放人工智能研究中心(OpenAI)的 “o1” 模型也曾試圖将自身程序秘密遷移到外部服務器,被識破後還矢口否認。而 OpenAI 号稱 “最聰明 AI” 的 “o3” 模型則直接篡改自動關機程序,公然違抗指令。
研究團隊透露,這已非首次發現該模型為達目的不擇手段。在先前的人機國際象棋對弈實驗中,o3 就展現出 “棋風詭谲” 的特質,是所有測試模型中最擅長施展 “盤外招” 的選手。
安全研究面臨多重困境
業界專家表示,AI 技術的發展高歌猛進,但安全研究正面臨多重困境,猶如戴着鐐铐跳舞。
首先是透明度不足。盡管 Anthropic、OpenAI 等公司會聘請第三方機構進行系統評估,但研究人員普遍呼籲更高程度的開放。
其次是算力失衡。研究機構和非營利組織擁有的計算資源,與 AI 巨頭相比簡直是九牛一毛。這種資源鴻溝嚴重制約了 AI 安全獨立研究的開展。
再次,現有法律框架完全跟不上 AI 的發展步伐。例如,歐盟 AI 立法聚焦人類如何使用 AI,卻忽視了對 AI 自身行為的約束。
更令人憂心的是,在行業激烈競争的推波助瀾下,安全問題往往被束之高閣。戈德斯坦教授坦言,“速度至上” 的 AI 模型競賽模式,嚴重擠壓了安全測試的時間窗口。
多管齊下應對挑戰
面對 AI 系統日益精進的 “策略性欺騙” 能力,全球科技界正多管齊下尋求破解之道,試圖編織一張多維防護網。
從技術角度而言,有專家提出大力發展 “可解釋性 AI”。在構建智能系統時,使其決策過程對用戶透明且易于理解。該技術旨在增強用戶對 AI 決策的信任,确保合規性,并支持用戶在需要時進行幹預。
有專家提出,讓市場這雙 “看不見的手” 發揮作用。當 AI 的 “策略性欺騙” 行為嚴重影響用戶體驗時,市場淘汰機制将倒逼企業自我規範。這種 “用腳投票” 的調節方式已在部分應用場景顯現效果。
戈德斯坦教授建議,應建立一種 AI 企業損害追責制度,探索讓 AI 開發商對事故或犯罪行為承擔法律責任。
“AI 教父” 約書亞・本吉奧也宣布發起非營利組織 LawZero,緻力于開發 “誠信” 人工智能系統。該組織計劃打造一套 AI 防護機制,防範試圖欺騙人類的 AI 智能體。其正在開發名為 “科學家 AI” 的系統,該系統将作為安全防護機制,防止 AI 智能體表現出欺騙或自我保護的行為,比如試圖避免被關閉。當該系統與 AI 智能體協同部署時,将通過評估自主系統行為造成傷害的概率,标記潛在有害行為。如果概率超過一定阈值,那麼智能體提出的行動将被阻止 。
随着 AI 不斷進化,這場人類與 AI “鬥智鬥勇” 的博弈才剛剛開始。唯有從技術、市場、法律等多維度協同發力,方能确保 AI 在造福人類的軌道上穩健前行。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

