
埃森哲在《技術展望 2024》報告中指出,96% 的企業高管認為 AI Agent 生态系統應用将在未來 3 年内為他們的組織帶來重大機遇。
報告認為,随着人工智能向智能體演進,自動化系統将能夠自主決策和行動。智能體不僅會為人類提供建議,還将代表人類采取行動。人工智能将繼續生成文本、圖像和洞察,而 AI Agent 将自行決定如何處理這些信息。
當智能體升級成人類的同事後,就需要人類與智能體一起重新構建技術和人才的未來。
IDC《AIGC 應用層十大趨勢》報告中調研表明,所有企業都認為 AI Agent 是 AIGC 發展的确定性方向,50% 的企業已經在某項工作中進行了 AI Agent 的試點,另有 34% 的企業正在制定 AI Agent 的應用計劃。
這個報告,也對 AI Agent 發展趨勢做了兩點預測:AI Agent 讓 “人機協同” 成為新常态,個人與企業步入 AI 助理時代。AI Agent 能夠幫助未來企業構建以 “人機協同” 為核心的智能化運營新常态;AI Agent 變革未來生産力的組織形式,對抗組織熵增。未來企業工作任務将在 AIGC 的助推作用下變得日益原子化和碎片化,複雜的流程将被無限拆解,再進行靈活的編排和組合,每個環節的效能和潛力都将被 AI 持續挖掘。從供給端看,“人 + AI 數字員工” 的高效協同模式将為大型企業對抗組織熵增提供理想的解法。
而在騰訊發布的《2024 數字科技前沿應用趨勢》中,“多模态智能體加速 AGI 進程” 被列為第二大趨勢。
該報告認為,通用人工智能漸行漸近,大模型走向多模态,AI 智能體(Agent)有望成為下一代平台;端側大模型加速部署,或将成為未來交互新入口。AI 在數學推理、新藥研發、材料發現、蛋白質合成等領域大顯身手,“AI 科學家” 有望加速問世。
這三個報告,一方面預測了 AI Agent 的未來發展趨勢,另一方面也同時提及了多模态大模型、數字員工、具身智能等一系列概念。
其中 IDC 給出的新型數字員工概念,與 AI Agent 有了非常強的關聯。此外該報告中所提到的 “一個人加上足夠的 AI 工具,就可以成為一家專業化公司” 的 Agent 應用,也指向了當前正在熱議的超級個體。
事實上,AI Agent 不隻關聯了兩個概念,還催生了更多的研究方向。那麼,數字員工和超級個體與 AI Agent 有什麼關聯?具身智能與 AI Agent 有什麼關系?AI Agent 都有哪些研究方向?
本文,王吉偉頻道就與大家聊聊這些。
研究方向一:基于大型語言模型的 AI Agent
大語言模型(Large Language Models,LLM)是一種使用人工神經網絡構建的基于海量文本數據訓練的深度學習模型。它不僅能夠生成自然語言文本,還能夠深入理解文本含義,處理各種自然語言任務,如文本摘要、問答、翻譯等。
2023 年,大語言模型及其在人工智能領域的應用已成為全球科技研究的熱點,其在規模上的增長尤為引人注目,參數量已從最初的十幾億躍升到如今的一萬億。參數量的提升使得模型能夠更加精細地捕捉人類語言微妙之處,更加深入地理解人類語言的複雜性。
在過去的一年裡,大語言模型在吸納新知識、分解複雜任務以及圖文對齊等多方面都有顯著提升。随着技術的不斷成熟,它将不斷拓展其應用範圍,為人類提供更加智能化和個性化的服務,進一步改善人們的生活和生産方式。
大語言模型的浪潮推動了 AI Agent 相關研究快速發展,AI Agent 是當前通往 AGI 的主要探索路線。大模型龐大的訓練數據集中包含了大量人類行為數據,為模拟類人的交互打下了堅實基礎;另一方面,随着模型規模不斷增大,大模型湧現出了上下文學習能力、推理能力、思維鍊等類似人類思考方式的多種能力。
LLM 提供了 AI Agent 的新基座,自動化和拟人化是兩大方向。大語言模型龐大的訓練數據集中包含了大量人類行為數據,為模拟類人的交互打下了堅實基礎;另一方面,随着模型規模不斷增大,大模型湧現出了上下文學習能力、推理能力、思維鍊等類似人類思考方式的多種能力。
将大模型作為 AI Agent 的核心大腦,就可以實現以往難以實現的将複雜問題拆解成可實現的子任務、類人的自然語言交互等能力。由于大模型仍存在大量的問題如幻覺、上下文容量限制等,通過讓大模型借助一個或多個 Agent 的能力,構建成為具備自主思考決策和執行能力的智能體,成為了當前通往 AGI 的主要研究方向。
在 AGI 時代到來之前,AI Agent 的能力的極限将主要受其大腦也就是 LLM 的影響,可以說 LLM 決定了 Agent 在未來的普及與應用。
因此,基于 LLM 的 AI Agent,将是人們長期研究的方向。
研究方向二:AI Agent 構建、應用與評估
這是 AI Agent 研究的主要方向。
構建 AI Agent 需要深入理解其核心技術,包括 LLM、記憶、規劃技能和工具使用能力。AI Agent 的應用領域非常廣泛,包括遊戲、個人助理、情感陪伴等。評估 AI Agent 的性能是研究的重要部分,需要考慮如何在零樣本條件下評估其通用語言理解和推理能力。
AI Agent 的構建、應用和評估,都是人工智能研究的重要部分。
AI Agent 構建
AI Agent 的構建主要包括四個部分:大模型、規劃、記憶和工具使用。
大模型:大模型(如 GPT-4 及文心一言、通義千問等)作為 AI Agent 的 “大腦”,提供推理、規劃等能力。
規劃:代理能夠将大型任務分解為更小的、可管理的子目标,從而更好地處理複雜任務。
記憶:AI 代理具備長時間保留和回憶信息的能力,通常通過利用外部向量存儲和快速檢索實現。
工具使用:代理學習調用外部 API 以獲取模型權重中缺失的額外信息,包括當前信息、代碼執行能力、對專有信息源的訪問等。
這四個模塊與 AI Agent 能力的提升息息相關,接下來會有很多組織投入大量且持續的研究工作,以提升 AI Agent 能力的應用與普及速率。
AI Agent 應用
AI Agent 在多個領域都有應用,包括但不限于教育、遊戲、網絡購物和網頁浏覽等。比如在教育領域,AI 代理提供個性化、智能化和高效化的服務,優化學習體驗。
AI Agent 評估
評估 AI Agent 是一項很大的挑戰,需要量化和客觀地衡量其智能水平。圖靈測試是一種常見的評估方法,用于評估人工智能系統是否表現出類似人類的智能。
此外,還有專門的基準測試,如 AgentBench,用于評估 LLMs 作為智能體在各種真實世界挑戰和不同環境中的表現。接下來将會有更多的基準測試面向 Agent 的各個環節,以促進 Agent 生态的良性發展與生态完善。
研究方向三:多智能體系統
多智能體系統(Multi-Agent Systems, MAS)是由多個互相協作或競争的自治智能體組成的系統,旨在通過集體行為解決複雜問題。在 MAS 中,每個智能體都具有一定程度的自主性,并能夠感知環境、作出決策,并與其他智能體交互。
智能體可以執行多種任務,其具體性質取決于系統的目标和應用領域。智能體的主要任務通常包括感知環境、處理信息、作出決策,并與其他智能體交互以實現共同的目标。
多智能體系統是人工智能的一個重要分支,它研究如何設計和實現多個智能體之間的協作和競争的機制和方法。它具有以下特點:
由多個自治的、互動的、異構的智能體組成,每個智能體都有自己的目标、行為、信念和偏好,同時也受到環境的影響和約束。
目标是實現智能體之間的協作和競争的平衡,使得每個智能體都能達到自己的目标,同時也能促進整個系統的性能和效益。
難點是如何處理智能體之間的複雜的交互和協調,如何解決智能體之間的沖突和矛盾,如何評估智能體的表現和進步,如何接受人類的反饋和指導,如何遵守人類的倫理和法律等。
多智能體協作系統(Multi-Agent Collaboration Systems,MACS)是一種特殊的多智能體系統,其目标是使多個智能體能夠有效地協作,以實現一些超出單個智能體能力範圍的任務。
Agent 可以以協作或競争的方式相互交互。這使他們能夠通過團隊合作或對抗性互動來實現進步。在這些系統中,Agent 可以共同完成複雜的任務或相互競争以提高其性能。
比如用于模拟和優化交通、能源、物流等領域的複雜系統,也可以用于設計和實現智能家居、智能城市、智能工廠等應用場景。
多智能體協作系統的核心挑戰是如何實現智能體之間的協作和競争的平衡,以及如何使智能體能夠根據不同的任務和角色進行自适應和學習。
近年來,随着深度學習、強化學習、自然語言處理等技術的發展,多智能體協作系統的研究也取得了一些重要的進展和突破。
例如,CAMEL 是一個首個大模型多智能體框架,它可以讓多個智能體在一個共享的環境中進行協作和競争的學習,同時也可以讓智能體之間進行自然語言的交流和協商。CAMEL 已經在 NeurIPS 2023 上斬獲了 3.6k 星,展示了多智能體協作系統的巨大潛力和前景。
另外,還有一些具有代表性的多智能體協作系統,如 OpenAI Five、AlphaStar、DeepMind Quake III Arena Capture the Flag 等,它們分别在 DOTA 2、星際争霸 II、雷神之錘 III 等遊戲中,展示了超越人類水平的協作和競争的能力。
多智能體系統是人工智能的一個前沿和熱點的研究領域,涉及到多個學科和領域,如計算機科學、數學、經濟學、心理學、社會學、生物學等。
其研究和應用對于理解人類智能的本質和機制,提高人工智能的水平和能力,解決人類社會的各種問題,都具有重要的意義和價值。
研究方向四:自主智能體
在人工智能領域,自主智能體(Autonomous Agent)是指能夠在環境中感知、學習和執行動作的智能實體。這種實體具有自主性,即它能夠獨立地做出決策和行動,而無需人為幹預。
自主智能體具備自主決策和行動能力,能夠在給定的環境中自主地感知、學習和做出決策,以實現特定的目标。自主智能體能夠根據環境的變化和反饋信息,不斷地适應和改進自己的行為,從而實現更好的性能和效果。
它通常被設計成具備對環境的感知能力,能夠根據感知到的信息做出理性的決策,并執行相應的動作以達到特定的目标。在實現自主性的過程中,機器學習和深度學習等技術發揮了關鍵作用。
自主智能體的設計和實現涉及多個方面,包括但不限于機器學習、自然語言處理、計算機視覺等 AI 技術的綜合運用。
它們被設計用于執行各種不同的任務,如管理社交媒體賬戶、投資市場、制作兒童讀物等,甚至在一些情況下,它們可以幫助人們釋放時間去做更有創造性的事情。
其研究價值主要體現在強化學習和機器人學中,例如 deepmind 的 Alphago 和 Openai 的 OpenaiFive(一個會打團戰的 Dota2 遊戲 AI)都是比較典型的基于強化學習智能體運用。
LLM 爆發以後,近一年來關于 Agent 的研究和話題開始呈現井噴之勢,例如 AutoGPT、BabyAGI、Generative Agents、MetaGPT 等項目在 Github 上已狂攬上萬 star,成為炙手可熱的明星項目。
使用自主智能體,一般涉及以下步驟:确定問題和目标:首先,需要明确問題和目标,即定義智能體需要解決的任務和期望的結果;構建環境模型:了解和建模智能體與環境之間的交互方式,包括狀态空間、行動空間、獎勵函數等;選擇合适的算法:根據問題的性質和特點,選擇适合的強化學習算法或其他相關算法來訓練自治代理;訓練和優化:使用選擇的算法和環境模型,通過與環境的交互和反饋,訓練自治代理以學習适當的決策策略,以最大化累積獎勵或實現特定目标;調優和評估:根據訓練過程中的表現和性能,對自治代理進行調優和評估,以提高其決策能力和效果。
相比于之前的基于強化學習的 Agent 研究,現在的 Agent 主要是指以大模型技術 (LLM) 作為主體或者大腦,能進行自動規劃,擁有自主決策能力,以解決複雜問題的智能體。
近年來,有關自主智能體的研究有了許多突破性進展,以往困擾 AI Agent 研究者的社會交互性和智能性問題都随着大語言模型(LLM)的發展有了新的解決方向。
例如,已經有一些研究工作在探索如何通過引導大模型進行任務分解的大模型提示方法,如 Chain-of-Thought,以及如何使用工具學習(Tool Learning)的概念,強調了運用大模型來進行工具的創造和使用,并提供了 BMTools 工具包。
此外,還有一些研究工作在探索如何通過記憶模塊提升精準記憶和複雜推理能力。總的來說,自主智能體的研究進展迅速,展現出巨大的潛力和前景。
研究方向五:生成式智能體
生成式智能體(Generative Agents)可以定義為一種計算軟件智能體,能夠模拟可信的人類行為。它們能夠存儲智能體的完整經驗記錄,将這些記憶随時間整合為更高級别的反思,并動态地檢索這些記憶以規劃行為。
生成式智能體能夠對自己、其他智能體和環境進行廣泛的推理。面對新任務時,它們可以利用已獲得的一般知識和策略迅速調整學習方法,減少對大量樣本的依賴。這種技術可廣泛應用于交互式應用,如沉浸式環境、人際溝通的排練空間和原型設計工具等。
生成式智能體的概念,最早由斯坦福大學和谷歌的研究人員于 2023 年在論文《Generative Agents: Interactive Simulacra of Human Behavior》中提出。
為了創建生成式智能體,研究者構建了一個系統架構,此架構擴展了大型語言模型的功能,使其能夠存儲智能體使用自然語言的經驗記錄。随着時間的推移,這些記憶會被整合為更高級别的思考,并被動态檢索以規劃智能體的行為。
研究者将生成式智能體實際應用到一個互動沙盒環境中,這個環境受到了《模拟人生》的啟發。在這個環境中,終端用戶可以使用自然語言與一個由 25 個智能體組成的小鎮進行互動。
這些智能體的行為表現得就像人類一樣:他們早晨醒來,為自己做早餐,然後去工作;藝術家智能體會創作畫作,而作家智能體會撰寫文章;他們可以形成自己的觀點,關注其他智能體,并展開對話;在規劃第二天的工作時,他們會回憶并思考過去的日子。
此外,這些智能體還能使用自然語言來存儲與智能體相關的完整記錄,随着時間的推移将這些記憶整合為更高級别的思考,并動态地檢索這些記憶以指導其行為。
評估結果顯示,這些生成式智能體展現了可信的個體和社會行為。例如,從一個用戶指定的概念開始,即一個智能體想舉辦一個情人節派對,這些智能體在接下來的兩天裡自主地傳播派對的邀請,結識新朋友,互相約定參加派對,并協調在正确的時間一起出現在派對上。
研究結果表明,智能體架構的組成部分即觀察、計劃和反思等能力,都對智能體行為的可信度起到了關鍵性作用。
這項研究将大型語言模型與計算、交互式智能體相結合,為實現對人類行為的可信模拟奠定了基礎。
此外,這項研究還證明了可信的人類行為智能體能夠增強交互式應用程序的功能,從沉浸式環境到人際交流的排練空間,再到原型設計工具等。
研究方向六:人機協同
未來生成式 AI 帶來的人機協同,将會呈現三種模式:嵌入(embedding)模式、副駕駛(Copilot)模式及智能體(Agent)模式。
Embedding 模式:用戶通過與 AI 進行語言交流,使用提示詞來設定目标,AI 協助用戶完成這些目标。
Copilot 模式:在這種模式下,人類和 AI 各自發揮作用。AI 介入到工作流程中,從提供建議到協助完成流程的各個階段。
Agent 模式:由人類設定目标并提供資源,這些資源通常是計算能力,然後監督結果。在這種情況下,Agent 承擔了大部分工作。
Agent 模式,會成為未來人機交互的主要模式。
Agent 時代的人機協作(Human-Agent Collaboration,簡稱 HAC)是指人類與智能體(如機器人、虛拟助手等)之間的合作與協同,共同完成特定任務或解決問題。
Agent 可以與人互動,為人提供幫助并更高效、安全地執行任務。他們可以理解人類的意圖并調整他們的行為以提供更好的服務。人類反饋還可以幫助 Agent 提高性能。
在 Agent 模式下,人類設定目标和提供必要的資源(例如計算能力),AI 獨立地承擔大部分工作,最後人類監督進程以及評估最終結果。這種合作模式結合了人類的創造力和判斷力與智能代理的數據處理和實時響應能力,旨在實現更高效、更智能的工作方式。
這種模式下,AI 充分體現了智能體的互動性、自主性和适應性特征,接近于獨立的行動者,而人類則更多地扮演監督者和評估者的角色。智能體模式相較于嵌入模式、副駕駛模式無疑更為高效,或将成為未來人機協同的主要模式。
AI Agent 的出現,使得大模型從 “超級大腦” 進化為人類的 “全能助手”。AI Agent 不僅需要具備處理任務和問題的智能能力,還需要擁有與人類進行自然交互的社交智能。
這種社交智能包括理解和生成自然語言、識别情感和情緒等能力。社交智能的發展将使得 AI Agent 能夠更好地與人類進行合作和交流,拓展其應用場景。
基于大模型的 Agent 不僅可以讓每個人都有增強能力的專屬智能助理,還将改變人機協同的模式,必會帶來更為廣泛的人機融合。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

