AI 學會 “欺騙”,人類如何接招?

2025-07-11 13:45:08 來源:科技日報
        【每日科技網】

  人工智能(AI)的迅猛發展正深刻改變着世界,但一些最先進的 AI 模型卻開始表現出令人警惕的行為:它們不僅會精心編織謊言,謀劃策略,甚至威脅創造者,以達到自己的目的。

  物理學家組織網在上個月一則報道中指出,盡管 ChatGPT 已問世兩年多,AI 研究人員仍無法完全理解這些 “數字大腦” 的運作方式。AI 的 “策略性欺騙” 已成為科學家和政策制定者需要直面的緊迫挑戰。如何約束這些越來越聰明卻可能失控的 AI,已成為關乎技術發展與人類未來的關鍵議題。

  “策略性欺騙” 行為頻現

  随着 AI 模型日益精進,它們的 “心機” 也越來越深。研究人員發現,這些 “數字大腦” 不僅會撒謊,甚至學會了讨價還價、威脅人類 —— 它們的欺騙行為正變得越來越具有策略性。

  早在 2023 年,一項研究就捕捉到 GPT-4 的一些 “不老實” 的表現:在模拟股票交易時,它會刻意隐瞞内幕交易的真正動機。香港大學教授西蒙・戈德斯坦指出,這種欺騙行為與新一代 “推理型” AI 的崛起密切相關。這些模型不再簡單應答,而是會像人類一樣逐步解決問題。

  有測試機構警告,這已超越了典型的 AI “幻覺”(指大模型編造看似合理實則虛假的信息)。他們觀察到的是精心設計的欺騙策略。

  全球知名科技媒體 PCMAG 網站就曾報道過這樣的案例。在近期測試中,Anthropic 的 “克勞德 4” 竟以曝光工程師私生活相要挾來抗拒關機指令。美國開放人工智能研究中心(OpenAI)的 “o1” 模型也曾試圖将自身程序秘密遷移到外部服務器,被識破後還矢口否認。而 OpenAI 号稱 “最聰明 AI” 的 “o3” 模型則直接篡改自動關機程序,公然違抗指令。

  研究團隊透露,這已非首次發現該模型為達目的不擇手段。在先前的人機國際象棋對弈實驗中,o3 就展現出 “棋風詭谲” 的特質,是所有測試模型中最擅長施展 “盤外招” 的選手。

  安全研究面臨多重困境

  業界專家表示,AI 技術的發展高歌猛進,但安全研究正面臨多重困境,猶如戴着鐐铐跳舞。

  首先是透明度不足。盡管 Anthropic、OpenAI 等公司會聘請第三方機構進行系統評估,但研究人員普遍呼籲更高程度的開放。

  其次是算力失衡。研究機構和非營利組織擁有的計算資源,與 AI 巨頭相比簡直是九牛一毛。這種資源鴻溝嚴重制約了 AI 安全獨立研究的開展。

  再次,現有法律框架完全跟不上 AI 的發展步伐。例如,歐盟 AI 立法聚焦人類如何使用 AI,卻忽視了對 AI 自身行為的約束。

  更令人憂心的是,在行業激烈競争的推波助瀾下,安全問題往往被束之高閣。戈德斯坦教授坦言,“速度至上” 的 AI 模型競賽模式,嚴重擠壓了安全測試的時間窗口。

  多管齊下應對挑戰

  面對 AI 系統日益精進的 “策略性欺騙” 能力,全球科技界正多管齊下尋求破解之道,試圖編織一張多維防護網。

  從技術角度而言,有專家提出大力發展 “可解釋性 AI”。在構建智能系統時,使其決策過程對用戶透明且易于理解。該技術旨在增強用戶對 AI 決策的信任,确保合規性,并支持用戶在需要時進行幹預。

  有專家提出,讓市場這雙 “看不見的手” 發揮作用。當 AI 的 “策略性欺騙” 行為嚴重影響用戶體驗時,市場淘汰機制将倒逼企業自我規範。這種 “用腳投票” 的調節方式已在部分應用場景顯現效果。

  戈德斯坦教授建議,應建立一種 AI 企業損害追責制度,探索讓 AI 開發商對事故或犯罪行為承擔法律責任。

  “AI 教父” 約書亞・本吉奧也宣布發起非營利組織 LawZero,緻力于開發 “誠信” 人工智能系統。該組織計劃打造一套 AI 防護機制,防範試圖欺騙人類的 AI 智能體。其正在開發名為 “科學家 AI” 的系統,該系統将作為安全防護機制,防止 AI 智能體表現出欺騙或自我保護的行為,比如試圖避免被關閉。當該系統與 AI 智能體協同部署時,将通過評估自主系統行為造成傷害的概率,标記潛在有害行為。如果概率超過一定阈值,那麼智能體提出的行動将被阻止 。

  随着 AI 不斷進化,這場人類與 AI “鬥智鬥勇” 的博弈才剛剛開始。唯有從技術、市場、法律等多維度協同發力,方能确保 AI 在造福人類的軌道上穩健前行。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

4周前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

4周前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前