從買算力到賣能力:嬴徹科技七億商用裡程背後的雲上飛輪

2026-07-16 15:33:49 來源:極客網
        【每日科技網】

  大模型爆發後,所有 AI 公司都陷入了同一種競争模式:争搶數據、比拼算力、内卷模型。但真正能拉開差距的,往往不是這些資源本身,而是誰能把這三者整合起來,形成一條持續運轉的完整生産線。

  這種“資源整合”的挑戰,很多大模型公司如今才深有體會,但自動駕駛行業早已被它反複考驗。對自動駕駛而言,運營裡程本身并不能直接轉化為智能,它所帶回的,大多是零散、雜亂且海量的原始數據;隻有将這些數據持續轉化為模型能力,裡程才能真正成為企業的核心競争力。

  這也讓雲底座的角色發生了根本性變化:它不再隻是後台的資源儲備池,而是貫穿數據處理、模型訓練、仿真驗證和業務交付全流程的生産系統。短期來看,它影響的是研發效率;長期來看,它決定了業務能走多遠、能做到多大。

  基于這樣的洞察,嬴徹科技在 2018 年成立之初,就做出了極具前瞻性的選擇——全面上雲。不僅研發系統上雲,數據工程、在線業務、生産交付等所有環節,都全部運行在雲端,不保留本地機房,徹底擺脫了技術包袱。

  這家公司專注于卡車自動駕駛技術的研發和商業運營,為物流客戶提供從自動駕駛技術到新一代 TaaS 貨運網絡服務的一站式系統解決方案。八年時間裡,其雲原生底座支撐起了令人驚歎的業務規模:嬴徹智能輔助駕駛系統的商用運營裡程已超過 7 億公裡,處于全球領先水平;覆蓋了中國 97% 的高速網絡;數千台搭載嬴徹智駕系統的智能重卡,平均智駕裡程占比超過 90%。

  近日,作者與嬴徹科技雲與數據基礎設施負責人曹學成及其團隊深入交流,試圖還原這套雲原生體系的發展過程。拆解嬴徹八年的雲上實踐,本質上是在回答一個更具普遍性的問題:一家 AI 公司,如何借助雲原生架構,将解決算力極限的工程能力,轉化為可對外交付的商業優勢。

  重卡智駕的護城河究竟是什麼?

  自動駕駛行業常被認為是“算法驅動”的領域,但進入規模化發展階段,單一的算法已不再決定産品能力上限,真正決定企業勝負的,是“數據飛輪”(也就是數據閉環)。

  它不是靜止的數據池,而是一個能自我強化的循環體系:無論是車隊在真實場景中産生的運營數據,還是虛拟場景下生成的合成數據,都必須經過标注、訓練、驗證等環節,才能轉化為模型的核心能力;而模型上線後的實際表現,又會實時反哺數據采集,推動模型不斷疊代優化。

  在這條完整鍊路中,隻有讓數據順暢循環,才能将其沉澱為企業的核心資産。任何一個環節出現卡頓,整個生産線的效率都會被拖累。

  圖注:嬴徹科技自動駕駛研發鍊路基于阿裡雲雲原生底座,涵蓋車端數據采集、清洗、訓練、仿真評測與部署等環節,可支撐大規模任務編排、異構算力調度(AMD)和模型的持續疊代(其中模型訓練環節目前采用多雲架構)。

  這也是理解嬴徹科技的關鍵切入點。它聚焦的并非普通乘用車場景,而是幹線物流領域——這裡的核心載體,是長期在高速網絡上運行的重卡。重卡絕不是放大版的乘用車,其車體尺寸、載重結構、控制響應速度和運營場景,都讓數據閉環的實現難度大幅提升。

  具體來說,這種挑戰主要體現在三個方面:

  物理約束極嚴:重卡車體寬度可達 3.2 米,與 3.75 米的車道線之間僅剩下 25 厘米的餘量;車貨總重接近 50 噸,燃油底盤的響應延遲達 0.7 秒。這就要求智駕系統必須具備 400 米以上的遠距離感知能力和 7 厘米級的橫向控制精度。

  挂車變量極大:占整車大部分重量的挂車,是缺乏傳感器的柔性結構,會随着載重變化不斷擺動,算法隻能依靠車頭的傳感器,來推斷整車的重心和姿态。

  運營環境極嚴苛:在真實的物流網絡中,重卡會遇到大霧、車輛加塞等複雜場景,任何一次判斷失誤,都會因重卡巨大的慣性和較長的制動距離被放大,對行駛安全提出了極高要求。

  這三大約束決定了:重卡智駕不能靠“堆砌數據量”盲目發力。如果海量的零散數據無法被高效處理,反而會成為系統的負擔。數據閉環的關鍵,在于能否在這些極限約束下,快速将零散的長尾場景,轉化為可驗證、可落地的模型能力。

  嬴徹科技超 7 億公裡的智駕商用運營裡程,正體現了這種高效處理數據的能力:從 0 到 5 億公裡,用了數年時間;從 5 億到 6 億公裡,不到四個月;從 6 億到 7 億公裡,僅用了一個月。按照預期,到 2028 年中期,這一裡程數字将達到 50 億公裡。

  圖注:嬴徹智能輔助駕駛系統商用運營裡程持續加速增長

  從 7 億公裡向 50 億公裡邁進,意味着嬴徹科技面臨的不再是線性的規模增長,而是一條加速運轉的數據飛輪。更多真實場景的數據進入系統,更多零散的長尾問題被識别、挖掘和驗證,模型的訓練、仿真與疊代速度也必須同步提升。此時,核心矛盾已不再是“算法能否更優”,而是“這條智能生産線能否持續穩定運轉”。

  這也揭示了重卡智駕護城河的真正形态:表面上看是智駕算法和裡程數據,深層次來看,是一套能在極限高壓下,持續将數據轉化為模型能力的工程系統。

  飛輪的共性難題:異構算力與潮汐式負載

  當理論上的數據閉環落地為真實的工程系統,AI 公司的焦慮就從“如何用數據”,轉變為“如何更好地用資源支撐數據閉環運轉”。

  數據閉環的鍊路本身具有極強的關聯性:從數據采集、清洗、挖掘、标注,到模型訓練、評估、仿真回歸,任何一個環節出現阻塞,都會導緻整體疊代周期變長、反饋速度變慢。

  更棘手的是,這條鍊路上的每個環節,對算力的需求截然不同。

  數據處理和場景挖掘屬于 CPU 與 I/O 混合型負載,大規模的數據清洗、解析和特征提取,瓶頸往往不在于純算力,而在于存儲帶寬、小文件處理和元數據服務的效率。

  模型訓練屬于 GPU 密集型負載,分布式訓練和超參搜索,需要高吞吐的存儲和網絡支持,同時還需要對 GPU 進行精細化的配額、優先級和搶占管理。

  仿真驗證屬于高并發彈性計算負載,場景級的并行回歸會在版本發布前集中觸發,對任務啟動速度、調度效率和資源回收能力提出了極高要求。

  這三類負載必須運行在同一條生産線上,共享同一套基礎設施,但它們對資源的需求差異極大,幾乎沒有“共同語言”。這就是“異構資源調度”的核心難題:不是某一類算力不足,而是三種形态的算力需求同時存在、相互競争,調度系統必須持續進行動态平衡。

  對業務而言,這不是底層資源的簡單問題,而是直接影響研發節奏的關鍵:資源調度慢一步,模型疊代就慢一步;仿真回歸排隊一天,算法落地裝車就晚一天。

  讓問題更複雜的,是這些算力需求的時間分布特征——潮汐式負載。

  日常狀态下,模型訓練與數據處理任務持續運行,資源需求相對穩定,系統處于低負載狀态;但每到版本發布或回歸驗證前,仿真任務會集中爆發,并發需求瞬間達到日常的十倍甚至更高。

  這種極端的峰谷落差,讓任何基于固定資源池的方案都陷入兩難:按照峰值需求配置資源,平時會出現大量閑置;按照日常負載配置資源,峰值時生産線會出現排隊,疊代周期被拉長,反饋速度帶來的優勢也會徹底消失。

  異構算力與潮汐負載,共同構成了數據飛輪難以跨越的結構性困境。

  飛輪加速逼出雲上進化:從“可用”到“極限可用”

  随着量産車規模擴大、數據回傳量激增,行業的結構性困境很快在嬴徹的生産線上顯現出來,最終聚焦為兩個必須解決的核心問題:高并發的任務編排,以及潮汐負載下的彈性算力。

  突破并發瓶頸:從“兼容開源”到“企業級增強”

  在發展早期,嬴徹科技采用開源版本的 Argo Workflows,來串聯數據清洗、仿真、訓練等不同類型的任務。在中小規模的業務場景下,這套方案運轉良好。但随着數據飛輪轉速加快,當并發任務量攀升至萬級甚至十萬級時,開源組件在控制面穩定性和資源争搶隔離方面的固有瓶頸,開始逐漸顯現。

  面對這一挑戰,嬴徹科技沒有選擇投入大量人力進行運維修補,而是與阿裡雲團隊達成深度合作,将任務編排系統全面遷移至阿裡雲容器 Argo 工作流集群(托管版)。

  這次遷移并非簡單的“系統搬家”,而是一次架構層面的全面增強。阿裡雲團隊在保持社區協議兼容的前提下,針對高并發場景進行了系統性的内核優化:

  控制面加固:解決了海量任務調度下的狀态同步延遲問題,确保工作流引擎在極端壓力下,依然能保持穩定、可預期的表現。

  可觀測性升級:針對百萬級任務規模,重構了監控數據采集鍊路,消除了大規模集群下的監控盲區和性能損耗。

  精細化治理:引入基于 OIDC Token 的 SSO 登錄和細粒度的資源 Quota 分配機制,滿足了企業級多團隊協作的安全與隔離需求。

  這種深度合作帶來了顯著的“反哺效應”:嬴徹科技在生産環境中遇到的極端場景(如 Sidecar 事件的高頻回寫、複雜工作流的參數透傳),成為檢驗雲産品穩定性的最佳測試場景。這些問題被逐一攻克後,沉澱進阿裡雲的産品代碼庫,不僅支撐了嬴徹科技的業務發展,也提升了阿裡雲面向所有大規模 AI 客戶的交付能力。

  破解彈性難題:定義“瞬時爆發力”

  如果說調度系統是數據飛輪的神經中樞,那麼算力就是它的肌肉。自動駕駛的仿真驗證具有典型的“潮汐效應”:日常運行平穩,但在版本發布前的回歸驗證階段,并發需求會瞬間爆發至日常的十倍甚至百倍。

  傳統的雲計算彈性伸縮,往往存在分鐘級的滞後,且單集群的并發實例數有上限。對嬴徹科技而言,這意味着每次版本發布都是一場與時間的賽跑——如果容器啟動速度慢,算法上車的節奏就會推遲一天。

  為了打破這一技術瓶頸,阿裡雲以 ACS 作為雲基座核心,對底層調度邏輯進行了專項定制化優化:

  極速啟動優化:協同優化了實例創建流程和鏡像分發鍊路,大幅縮短了冷啟動時間,讓算力能夠“召之即來”。

  并發上限突破:通過重構資源分配算法,顯著提升了單賬号及單集群的并發實例上限,讓“萬級容器同時啟動”從理論變為實際可實現的工程常态。

  确定性服務保障:引入分層隊列與優先級調度機制,确保在資源極度緊張時,“回歸門禁”等關鍵路徑任務依然能獲得穩定的算力支持,不受其他低優先級任務的幹擾。

  優化完成後,曾經制約數據飛輪轉速的“彈性牆”徹底消失。萬級并發不再是系統的負擔,反而成為一種可被精準調度和治理的工程能力。

  從降本到治理:重塑算力成本

  當高并發和大數據處理吞吐率成為常态後,成本就成為了影響業務發展的另一關鍵因素。

  雲原生的成本優化,核心不是“把資源用滿”,而是通過合理的調度與治理,将業務負載匹配到“更合适的資源組合”,在不修改或盡量少修改應用的前提下,持續降低單位算力的成本。

  具體來說,以計算資源為例,嬴徹科技圍繞三個維度,開展了系統性的成本優化工作:

  4.1 通用計算資源:異構混部與負載畫像匹配

  自動駕駛涉及海量的離線批處理和數據清洗任務,傳統的“單一機型、按量采購”模式,不僅導緻算力成本居高不下,還難以應對負載波峰波谷帶來的資源浪費。

  在這類 CPU 與 I/O 混合型負載中,真正實現“省錢”的關鍵,是找到性能、吞吐與成本之間的最佳平衡點。以 AMD 通用計算為代表的高性價比算力,配合雲上調度的無感遷移和彈性伸縮能力,讓嬴徹科技在不改變既有數據鍊路代碼的前提下,将大規模離線批處理、清洗解析等作業,穩定運行在更合适的資源組合上,為後續的模型訓練與仿真環節,“騰出”更稀缺的高端算力。

  多架構 CPU 混部:引入 AMD 算力的同時,通過阿裡雲調度機制,在不改動代碼的前提下,将任務優先調度至高性價比機型,實現 10%-20% 的成本優化。

  Spot 與按量混合調度:将大規模回放等容錯性高的作業,部署在 Spot 實例上;而“門禁回歸”等關鍵路徑任務,則用預留資源兜底,實現穩定性與成本的最佳平衡。

  精準負載畫像:根據任務的 CPU、内存、I/O 密集度,動态匹配合适的實例規格,避免“大規格機型通吃”帶來的算力浪費。

  計算引擎性能調優:針對 Spark、Flink 等分布式引擎,通過優化執行計劃、内存分配和數據傾斜處理,同時利用 Ray 等框架,在數據加載和預處理環節實現 I/O 與計算的并行,大幅提升單位 CPU 資源的吞吐效率。

  4.2 GPU 資源:精細化治理與彈性填充

  GPU 是自動駕駛研發中最昂貴的核心資産。傳統的“獨占式、人工占卡”模式,導緻顯存利用率低下,且實驗任務之間的資源争搶,嚴重影響研發疊代效率。

  優先級與搶占機制:依托雲上資源調度能力,實現訓練、評估與生産任務的分層管理,對空閑的 GPU 資源自動回收或降配,提升整體資源填充率。

  細粒度共享:在短任務場景中引入時間片分配策略,支持小模型共享 GPU 資源,大幅提高昂貴算力的有效利用率。

  國産 AI 芯片遷移:将部分訓練、推理與評估場景,遷移至國産芯片,通過異構算力分流,進一步降低算力開支。

  4.3 應用與資源解耦:構建工程化閉環

  如果頻繁因為底層資源變動而修改業務邏輯,會導緻系統維護成本激增,且難以将“成本控制”沉澱為可量化、可優化的工程指标。嬴徹科技的解決方案,是将彈性、容錯與調度邏輯,固化在底座層:

  抽象編排層:将彈性、容錯與調度邏輯固化在底座層,确保業務邏輯與物理資源完全分離,互不影響。

  全鍊路可觀測性:通過統一的任務定義與指标回寫機制,實現對算力消耗的分鐘級審計與追溯,讓每一分算力支出,都能對應明确的業務産出。

  從内部成本,到外部壁壘

  解決了萬級并發的難題,克服了調度雪崩的風險後,嬴徹科技在阿裡雲上,沉澱出了一套完整的自動駕駛研發工具鍊。

  這套工具鍊最初隻是公司内部的成本中心,但随着技術成熟度和成本控制能力實現雙重突破,它完成了一次關鍵的角色躍遷:從内部工具,轉型為具備對外交付能力的商業化産品。

  這次躍遷的關鍵,在于嬴徹科技早期就遵循“标準接口優先”的選型原則,優先采用 Argo、Ray、Flink、Spark、Kubeflow 等開源生态工具,與社區技術路線保持一緻。

  這種架構選擇,讓平台天然具備多租戶隔離、彈性擴縮和跨雲可移植的能力,為商業化落地奠定了堅實基礎。

  而真正能夠對外出售的,并非某個單一模塊,而是一套經過真實業務極限測試的“确定性能力”——包括任務如何編排、資源如何分配、異常如何恢複、成本如何控制等全套解決方案。

  但同一套工具鍊,對内和對外的雲平台需求截然不同:對内,為了完成任務可以接受資源的“大起大落”;對外,必須保障多個客戶之間的安全隔離和穩定交付。

  為此,阿裡雲通過 ACK 的命名空間隔離與 ACS 的彈性配額管理,讓嬴徹科技在同一套物理架構上,實現了内部業務與外部業務的邏輯隔離,以及資源的按需彈性伸縮。

  行業内,很多傳統主機廠都有自動駕駛研發需求,但從零搭建這樣一套完整的生産線,不僅需要大量的時間和資金,更缺乏在極端并發、調度瓶頸中積累的工程判斷力。

  如今,嬴徹科技将整套工具鍊平台基于阿裡雲,交付給 OEM 廠商,并結合包括 AMD 在内的異構算力資源,為其提供大規模數據處理、仿真驗證和成本優化的支撐。外部車廠的工程師,無需從零搭建系統,就可以直接在雲端完成算法開發、規控調試、仿真驗證和數據分析,同時受益于 AMD 等高性價比計算資源及科學的資源調度策略。

  可以說,嬴徹科技交付的不僅僅是一套軟件授權,更是一條經過八年幹線物流場景極限驗證的研發流水線,以及讓這條流水線穩定運轉的全套工程能力。

  更重要的是,這種“按負載選擇資源”的能力,可以被規模化複制到不同客戶的場景中:AMD 通用算力作為更易獲取、成本更友好的選擇,讓 OEM 廠商在快速搭建研發産線時,可以優先用高性價比的 CPU 資源,承載數據工程與仿真前後處理任務,将預算集中在關鍵的模型訓練與驗證環節,從而讓“同樣的流程、不同的資源組合”,成為可交付的核心價值之一。

  通過接入更多 OEM 主機廠的研發場景,嬴徹科技本身也能持續獲得新的反饋,進一步驅動核心能力的疊代優化。

  從雲算力的消費者,轉變為智駕雲平台能力的構建者,嬴徹科技的這次角色轉變,并非簡單“上雲”就能實現,而是八年雲原生實踐沉澱出的能力外溢。技術選型中堅持的标準化原則,最終成為了對外賦能的開放性基礎。

  結 語

  雲原生在最初階段,往往隻是優化系統架構的工程工具。但當業務被推向極限,它的真正價值才會顯現:它不僅能重塑系統,更能決定企業能否将“應對極限的工程能力”,轉化為“對外輸出的商業壁壘”。

  嬴徹科技用八年時間,走出了這樣一條道路:搭建起讓數據自我強化的智能生産線,将生産線推向極限,再突破極限,最終讓生産線本身成為可交付的産品。

  如今,幾乎所有 AI 公司都在面對同樣的考驗:數據飛輪如何持續運轉、算力如何合理控制、并發壓力如何支撐。或許隻需兩三年,它們也會面臨嬴徹科技曾經遇到的高強度并發挑戰。

  那些關于架構、合規與成本的前置選擇,平時看似隻是技術上的取舍,但到了業務規模化的關鍵節點,終将轉化為一家公司的核心能力底座。

  雲原生的最終目标,不是把系統搬到雲上,而是在雲上拓展業務的新邊界;當這個邊界可以被複制和交付,基礎設施就不再隻是成本中心,更會成為平台能力對外輸出的起點。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

4周前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

4周前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前