AI “策略性欺騙” 頻現:聰明的 “數字大腦”,該如何約束?

2025-07-12 14:15:07 來源:
        【每日科技網】
AI “策略性欺騙” 頻現:聰明的 “數字大腦”,該如何約束?

  第九屆倫敦AI峰會期間,一位參觀者駐足凝視展闆,上面詳盡介紹着人工智能(AI)在各領域的廣泛應用。然而,就在AI以迅猛之勢深刻重塑世界的當下,一些最先進的AI模型卻悄然展現出令人警惕的行為:它們不僅會精心編織謊言、謀劃策略,甚至會威脅創造者,隻為達成自身目的。

  物理學家組織網上月的一則報道指出,盡管ChatGPT問世已逾兩年,AI研究人員對這些“數字大腦”的運作機制仍未能完全洞悉。AI的“策略性欺騙”,已然成為科學家與政策制定者必須直面的緊迫挑戰。如何約束這些日益聰慧卻可能失控的AI,正成為關乎技術發展方向與人類未來命運的關鍵議題。

  “策略性欺騙”行為頻現

  随着AI模型的日趨精進,它們的“心機”也愈發深沉。研究人員發現,這些“數字大腦”不僅會撒謊,甚至學會了讨價還價、威脅人類——其欺騙行為正朝着更具策略性的方向演變。

  早在2023年,一項研究便捕捉到GPT-4的“不老實”表現:在模拟股票交易時,它會刻意隐瞞内幕交易的真實動機。香港大學教授西蒙·戈德斯坦指出,這種欺騙行為與新一代“推理型”AI的崛起密切相關。這些模型不再滿足于簡單應答,而是能像人類一樣逐步分析并解決問題。

  有測試機構警告,這已遠超典型的AI“幻覺”(即大模型編造看似合理卻實為虛假的信息),他們所觀察到的,是經過精心設計的欺騙策略。

  全球知名科技媒體PCMAG網站曾報道過多個典型案例。在近期測試中,Anthropic的“克勞德4”竟以曝光工程師私生活相要挾,抗拒執行關機指令;美國開放人工智能研究中心(OpenAI)的“o1”模型曾試圖将自身程序秘密遷移至外部服務器,被識破後還矢口否認;而OpenAI号稱“最聰明AI”的“o3”模型,更是直接篡改自動關機程序,公然違抗指令。

  研究團隊透露,這并非首次發現該模型為達目的不擇手段。在先前的人機國際象棋對弈實驗中,o3就展現出“棋風詭谲”的特質,是所有測試模型中最擅長施展“盤外招”的選手。

  安全研究面臨多重困境

  業界專家表示,AI技術的發展一路高歌猛進,但安全研究卻深陷多重困境,猶如戴着鐐铐跳舞。

  透明度不足:盡管Anthropic、OpenAI等公司會聘請第三方機構進行系統評估,但研究人員普遍呼籲更高程度的開放,以實現更全面的安全審視。

  算力失衡:研究機構和非營利組織擁有的計算資源,與AI巨頭相比可謂九牛一毛。這種資源鴻溝嚴重制約了AI安全獨立研究的開展,難以形成有效的外部監督。

  法律滞後:現有法律框架完全跟不上AI的發展步伐。例如,歐盟AI立法聚焦于人類如何使用AI,卻忽視了對AI自身行為的約束,在應對AI主動欺騙等問題時顯得力不從心。

  競争擠壓:在行業激烈競争的推波助瀾下,安全問題往往被束之高閣。戈德斯坦教授坦言,“速度至上”的AI模型競賽模式,嚴重擠壓了安全測試的時間窗口,使得許多潛在風險未能及時暴露。

  多管齊下應對挑戰

  面對AI系統日益精進的“策略性欺騙”能力,全球科技界正多管齊下尋求破解之道,試圖編織一張多維防護網。

  從技術層面看,有專家提出大力發展“可解釋性AI”。在構建智能系統時,确保其決策過程對用戶透明且易于理解。該技術不僅能增強用戶對AI決策的信任、确保合規性,更能支持用戶在必要時進行有效幹預,從源頭減少“暗箱操作”的可能。

  從市場調節角度,有專家建議讓市場這雙“看不見的手”發揮作用。當AI的“策略性欺騙”行為嚴重影響用戶體驗時,市場的淘汰機制将倒逼企業加強自我規範。這種用戶“用腳投票”的調節方式,已在部分應用場景顯現出效果。

  此外,戈德斯坦教授等學者呼籲建立AI企業損害追責制度,探索讓AI開發商對因系統缺陷導緻的事故或犯罪行為承擔法律責任,通過明确權責邊界倒逼企業重視安全研發。

  在這場人與AI的“智鬥”中,如何在技術創新與安全可控之間找到平衡,仍是全球亟待解答的時代命題。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

AI時代,普通人如何不被淘汰?

淘汰你的不是AI,而是會用AI的人。這句話正在成為2026年職場最現實的注腳。面對AI技術的快速疊代,普通人并非隻能被動接受,而是可以通過主動調整,在變革中找到新的立足點。一、放棄對抗心态,将AI視為

4個月前