阿丘科技李嘉悅:大模型驅動的AI檢測範式變革——大模型、小模型、智能體的協同進化

2025-06-19 14:21:58 來源:中華網
        【每日科技網】

  3月28日,由機器視覺産業聯盟(CMVU)主辦、慕尼黑展覽(上海)有限公司承辦的VisionChina2025(上海)機器視覺展在上海新國際博覽中心圓滿落幕。阿丘科技産品總監李嘉悅在機器視覺及工業應用研讨會現場,圍繞“大模型驅動的AI檢測範式變革:大模型、小模型與智能體的協同進化”的主題,發表了精彩演講。

阿丘科技李嘉悅:大模型驅動的AI檢測範式變革——大模型、小模型、智能體的協同進化

  尊敬的各位來賓,我是嘉悅,來自北京阿丘科技。今天,我将與大家分享《大模型驅動的AI檢測範式變革:大模型、小模型與智能體的協同進化》。

  在探讨大模型之前,讓我們簡單回顧一下工業AI視覺的發展曆程。2019年被視為工業AI視覺的元年,當時以CNN為主流的小模型路線開始在早期客戶中落地。後續一直到2024年,工業AI視覺處于一個跨越鴻溝的階段,AI開始逐漸在各個細分領域和市場中普及,從頭部客戶到腰部客戶,甚至在某些細分行業已經成為标配。到了2025年可以說,我們已經基本跨越了這個鴻溝,表現為大部分客戶已經認可AI在工業領域的實用性,認可AI在工業檢測中的落地能力。

  然而這幾年雖然認知是變化了,但AI檢測應用的增長速度并不算快,呈現出較為線性的增長趨勢,遠未達到爆發狀态,沒有形成質變。原因在于小模型技術路線存在一些長期困擾行業的問題:樣本收集周期長、模型疊代周期長以及模型泛化能力差。

  樣本收集方面,工業缺陷樣本稀缺,收集周期漫長。模型疊代過程中,非專業工程師在調優模型時常常面臨不收斂的問題,導緻AI落地周期延長。此外,小模型的泛化能力不足,對于未見過的樣本,模型往往無法準确識别,這又回到了樣本收集的難題上。這些問題成為了制約AI檢測落地和增長的關鍵因素。

  為了解決這些問題,阿丘科技這幾年一直在探索和嘗試。令人興奮的是,在去年AI領域出現了一個非常大的技術變量,通用大模型爆發式湧現了。從大家熟悉的OpenAI的ChatGPT,到後來的豆包、Kimi,再到春節期間爆火的DeepSeek,3月出現的Manus智能體,這些大模型引發了廣泛讨論。我們可以看到,通用AI智能的能力水平正在以驚人的速度提升,可能已經超越了許多普通人的智力和知識水平。雖然通用大模型不直接影響AI檢測,但它标志着AI技術已經來到了一個突破點,預示着即将迎來突破性的影響。

阿丘科技李嘉悅:大模型驅動的AI檢測範式變革——大模型、小模型、智能體的協同進化

  回歸到工業檢測本身,大模型技術的變遷會産生哪些影響呢?對于大模型在工業檢測中的應用,存在兩種不同的聲音。一種較為保守的觀點認為,大模型與工業檢測無關,它更像一個聊天機器人,可以輔助一些文書類工作,無法适應工業場景的嚴格的準确性要求。在工業檢測中無法發揮作用。另一種較為激進的觀點則認為,大模型的能力極其強大,很快就可以直接接入工廠,一步到位實現自動化質檢。

  而阿丘科技,一直對大模型技術發展進行了長期關注,我們的觀點是,大模型确實會加速AI檢測範式的轉變,但它并不是一個非此即彼的替代關系,我們認為,大模型将進入工業檢測領域,并與小模型形成協同關系。

  一、什麼是大模型、小模型、智能體

  接下來,我想簡單科普一下什麼是大模型、小模型、智能體。

  小模型通常指的是傳統的深度學習網絡,如CNN等,其參數規模較小,通常在百萬級。小模型在數據處理能力上存在一定限制,對數據量和數據多樣性要求較高,對數據質量和一緻性的要求也較為嚴格。這也就是為什麼在工業檢測中,我們要求标注必須準确無誤,否則模型會産生混淆。小模型的知識模态通常是單模态,要麼是文本,要麼是圖像、視頻等。其泛化性能相對較差,因為它們隻學習了特定的、局部的知識。例如,一個用于車牌識别的小模型,隻能進行車牌識别,無法識别其他物體。

  相比之下,大模型采用了Transformer等架構,解決了小模型在長時間和遠距離依賴問題上的不足。這種架構允許我們通過堆疊海量數據和參數來提升模型能力,參數規模通常達到數十億甚至上百億。大模型能夠接收批量規模的文本、圖像、音頻等多模态數據,并對其進行處理。它對數據中的噪聲和不一緻性具有較強的魯棒性,即使數據中存在一些錯誤,也不會對模型産生太大影響。大模型通常是多模态的,如視覺語言模型、聽覺語言模型等,具有出色的泛化性能,能夠在未見過的數據和新任務上表現出較好的适應性和舉一反三的能力。

  智能體可以簡單理解為大模型應用的一種包裝形式,它可以自主完成一系列動作以達成目标,類似于一個輔助人類的小助理。智能體并不是一個單獨的模型分類,而是大模型在特定應用方式下的體現。

  接下來,我們簡單了解一下這些模型是如何訓練出來的,這有助于我們理解模型為何具有這樣的能力。

  首先,無論是小模型還是大模型,都需要經過預處理階段。在這個階段,所有的非數字類信息都會被轉化為數字信息,以便計算機進行處理。

  其次是訓練過程。對于小模型來說,訓練過程主要是對專業知識的學習,可以采用監督學習或非監督學習的方式,在工業檢測領域,監督學習的應用較為廣泛。

  而對于大模型,其訓練過程則有所不同,通常分為兩個階段。首先是預訓練階段。在這個階段,模型通過大量的互聯網信息,以自監督的方式學習通用知識。這個過程通常需要消耗大量資金、算力和時間,因此,當人們提到做大模型燒錢時,通常指的是這個預訓練階段。預訓練之後,還有一個關鍵步驟叫做微調。由于互聯網數據可能存在信息不全或不準确,需要通過微調來提升模型的專業度。微調的其中一種方式是人工标注,類似于我們在工業檢測中對缺陷進行标注一樣,人工标注會告訴模型正确答案,然後模型會根據這些标注數據進行學習。此外,還有一種新興的方式是強化學習,即通過給模型的答案打分,讓模型不斷嘗試,直到達到較高的分數,從而确定最終答案。這兩種方法在實際應用中都有所采用。

阿丘科技李嘉悅:大模型驅動的AI檢測範式變革——大模型、小模型、智能體的協同進化

  前面我們所讨論的大模型概念,通常指的是我們日常接觸的一些應用場景,然而,當大模型真正應用于企業時,它可以細分為多個層次。

  除了通用大模型,适用于多種任務和生活場景的模型之外,還有行業大模型,這類模型是為特定行業量身定制的,具備該行業的專業性。例如,在煤礦領域的大模型需要了解煤礦行業的各種專業知識;在醫療領域,大模型可以作為醫生的助理,具備一定的專業輔助能力。

  再往下細分,還有場景大模型,這類模型針對特定的應用場景進行設計,具有更強的專業性。例如,用于磁材檢測的大模型、煙草檢測的大模型,或者針對某種工藝缺陷檢測的大模型等。

  最後是場景小模型,這是我們目前應用的主流。它專注于特定場景中的特定任務,在該任務上具有很強的專業性。例如,專門用于檢測某一産品某一缺陷項的模型,它可能無法檢測其他産品或其他缺陷項,這種場景小模型在日常應用中非常普遍。另外,按技術類型劃分,還可以分為單模态和多模态模型。多模态模型結合了多種不同類型的數據,如文本、圖像、視頻等,具有更強大的理解和生成能力。

  在企業應用大模型時,一個關鍵點是要準确匹配企業自己的實際問題和需求,然後選擇合适的模型。我們不能僅僅憑借感覺或偏好來選擇模型,不同模型的效果和訓練開銷存在很大差異,我們要避免“殺雞用牛刀”或“殺牛用雞刀”的情況。

  二、工業視覺如何運用大小模型?

  回到工業視覺領域,要探讨如何合理運用大小模型,我們可以來列舉和分析一下它們與工業檢測的匹配度。

  首先,通用AI大模型是通過大量互聯網數據訓練出來的,然而,工業數據在互聯網上相對較少,尤其是工業質量數據。因此,這類通用大模型在工業檢測中的準确度通常較差,直接應用于工業檢測的效果并不理想。

  相比之下,我們有機會構建專門的工業檢測大模型,這類模型類似于行業大模型的層次。通過大量工業數據、文本和圖像進行訓練,能夠學習到各行各業、各種制造領域中不同産品的各種缺陷知識,因此在工業檢測領域具有很強的泛化能力。然而,它的準确度和精确度存在一定的上限,推理速度也相對較慢。工業檢測大模型類似于企業中的綜合性人才,對于常見的任務和稍微專業一些的工作,它可以勝任。例如,今天檢測一種産品,明天換到另一個車間檢測另一種産品,它都能很快适應。這種模型适合于工業場景中典型的工藝,以及對檢測指标和速度要求不是特别嚴格的場景,能夠實現即插即用的效果。

阿丘科技李嘉悅:大模型驅動的AI檢測範式變革——大模型、小模型、智能體的協同進化

  接下來是場景大模型,這類模型學習了一定規模的特定範圍内的知識,因此在準确度、處理速度和泛化能力方面表現出色。在特定場景内,它可以實現即插即用,應用性非常好。就像直接聘請一位本領域的資深專家,他來了就能直接上手工作。這種模型适用于工藝具有一定代表性、積累了大量同場景不同産品數據的情況,同時待檢産品型号較多,需要一定的泛化能力。

  然後是小模型,它專注于學習特定的知識,優勢在于準确度高和推理速度快。由于它隻專注于一個任務,延展能力有限,類似于聘請了一位小學生,專門訓練他完成一項任務,他可以将這項任務完成得非常好,而且成本較低。小模型适用于工藝獨特、數據較少的場景,或者對檢測指标要求較高的情況,以及産品品類有限、不追求泛化能力的場景。

  最後是智能體,智能體在工業檢測領域可以作為一個自主模型訓練的小助手。目前,許多員工在重複性的工作中投入了大量時間,而引入智能體可以大幅降低模型疊代的難度和時間成本。

  綜合來看,工業市場是一個高度碎片化的市場,各種場景、缺陷類型和指标要求都存在。這意味着在工業檢測中,大小模型的協同是一個必然趨勢,沒有哪一種模型能夠完全取代其他模型覆蓋所有場景。

  同時,協同并不意味着是一種固定的模式,相反,随着技術的快速進步,這一過程一定是動态的。例如,在2024年,可能95%以上的應用都是小模型,隻有少數企業開始落地場景大模型,并取得了不錯的效果。到了今年,大模型的應用正在快速增長,工業檢測大模型可能迎來其首個落地場景。預計在未來的2026、2027、2028年,大模型系統将處于快速增加的狀态,但五年後可能會趨于平穩,三種模型的應用場景分工将逐漸明确和固定下來。此外,模型訓練智能體有望在未來一年左右時間内出現在市場上。

  三、阿丘科技AI模型産品布局

  沿着這些思路,阿丘科技正在布局自己的AI産品序列。首先,我們仍然保留小模型方向的産品,因為在未來幾年内,小模型仍将在應用中占據較大比重。我們為這一領域的場景提供開發工具套件,如大家熟悉的AIDI等軟件工具型産品,它們追求高精度、高準确度和高速性能。

阿丘科技李嘉悅:大模型驅動的AI檢測範式變革——大模型、小模型、智能體的協同進化

  對于場景大模型類産品,我們直接提供面向特定場景的端到端即插即用模型。除了去年分享過的PCB領域的大模型應用,今年我們還嘗試了在磁材、煙草、金屬和塑料表面等場景的模型落地,并取得了良好的效果,将落地周期從幾個月縮短到了一周左右。

  工業檢測大模型産品也是我們今年研發的重點。我們稱之為AQ-VLM,即阿丘的視覺語言模型,它是基于我們之前積累的所有工業圖像數據資産構建的一個智能的基座模型。這個大模型分為兩個部分,一個是用于缺陷檢測的工業視覺大模型,這個大模型能夠在一些常見的通用工業檢測場景中實現即插即用。同時,我們還開放了模型微調窗口,隻需原來小模型所需數據量的1%左右,就可以快速微調模型,以适應新的領域。

阿丘科技李嘉悅:大模型驅動的AI檢測範式變革——大模型、小模型、智能體的協同進化

  另一個分支是通用缺陷生成模型,同樣基于我們積累的高質量工業數據進行訓練,并支持提示和參考圖結合的方式進行生成。由于工業圖像數據對質量要求較高,我們通過文本編碼器和圖像編碼器相結合的方式進行生成,以确保生成的數據能夠滿足模型訓練的要求。

  這是一個正在研發中的産品,我們制作了一個小型demo在展台供大家分享。例如您可以導入任意一張圖片,然後給它一個指令,比如“請幫我檢測這張圖像中的髒污”,它能夠理解您的意思并框出缺陷的位置。同樣,對于缺陷生成模型,您可以輸入産品圖樣,并要求生成某種特定的缺陷,如“請幫我這張圖像的右下角生成一個凹陷”。

  接下來是智能體的部分。智能體不會作為我們的一個單獨的産品品類存在,而是更多地集成到我們的模型訓練開發平台中。它的使用模式是将原本許多人工重複性的工作,包括一些需要專業知識的重複性工作,轉變為由智能體完成。我們的目标是讓人工隻需負責保障标準的正确性,其餘工作都交由智能體處理。所以智能體可能嵌入在AIDI或阿丘的其他訓練平台中。我們相信,未來智能體将成為小模型和大模型訓練過程中的核心“人員”。

  四、實踐案例

  最後,我想分享一個實踐案例,以幫助大家更好地理解大小模型協同的概念。

  我們最近在幾個不同的客戶中在嘗試金屬結構件檢測的場景。這些客戶都已經非常認可AI技術,但仍被一些問題所困擾,如周期過長、模型不收斂等。于是,我們嘗試通過VLM和小模型協同的方案,看看是否能夠實現模型的複用,從而解決這些問題。

阿丘科技李嘉悅:大模型驅動的AI檢測範式變革——大模型、小模型、智能體的協同進化

  具體來說,我們針對不同的缺陷類型采取了不同的策略。對于明顯的缺陷,我們可以直接使用大模型進行檢測。例如,金屬表面上的壓傷是一種非常典型的缺陷類型,大模型此前已經經過充分學習,我們可以直接輸入指令,如“幫我檢測一下壓傷”,模型就能直接識别出壓傷,無需額外訓練。

  對于不那麼明顯但相對常見的缺陷,如果我有一些樣本數據,我們可以采用VLM加上微調的方法來實現檢測。例如,劃傷也是一種常見缺陷,但在某些場景中,劃傷可能很輕,看起來對比度很低,模型之前沒有學習過如此輕微的劃傷。我們可以通過微調,将這些對比度很低的劃傷樣本數據額外輸入模型,使其能夠順利識别出這種劃傷。

  第三種情況是缺陷既不明顯又較為罕見,幾乎沒有通用性。針對這種情況,我們采用生成式AI結合小模型和智能體的方法來解決。我們可以給生成模型輸入一張良品圖,再結合真實的缺陷參考圖,然後輸入一個指令,如“幫我生成一個類似的缺陷”,模型會理解您的意思,并生成一個形态不同但看起來較為真實的缺陷圖像。然後,我們将這些真實圖和生成圖作為訓練數據集輸入到AIDI中進行訓練,這個過程可以利用智能體來輔助。最終,我們可以在場景中實現實現對缺陷的良好識别。

  總結來說,對于明顯的缺陷,我們全部使用大模型VLM解決;對于不明顯但常見的缺陷,我們使用VLM加微調的方法;對于不明顯且罕見的缺陷,我們采用生成大模型+小模型+智能體的方式。當然,這些模型的能力邊界是動态變化的,因此,我們的方案也保持一定的開放性,例如也許對明顯且長尾的缺陷可以采用非監督小模型,這些都有很多可能性,這些也是我們會持續關注的方向。

  最後總結一下,去年展會演講時,我們老闆說過一句話:“不會用AI的将會被用AI的淘汰。”今年,在這個快速變化的時代,我要補充一句:“AI工業視覺的格局正在加速變革,不會用大模型的将會被善用大模型的人淘汰。”

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

1個月前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

1個月前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前