
近日,神策數據已經推出全新的神策分析 2.5 版本,該版本支持分析模型與外部數據的融合性接入,構建全域數據融合模型,實現從用戶到經營的全鍊路、全場景分析。新版本的神策分析能夠為企業提供更全面、更有效的市場信息和經營策略,幫助企業深入了解用戶需求、把握市場動态,從而提高競争力。這一重要升級為企業提供了更強大的數據分析工具,為其業務發展和決策提供有力支持。
神策客戶旅程分析引擎(簡稱“神策分析引擎”)作為新版本的技術内核,也進行了一次重要的架構演進,接下來,本文将詳細講述神策分析 2.5 版本中分析引擎的架構演進方向和重要能力優化。
搜索神策數據進入官網,即可免費體驗神策分析。
一、全面的彈性架構能力支持
神策分析引擎支持全面的彈性架構,實現了存儲、查詢、導入三部分的架構分離,且各自都支持多種能力等級配置和彈性擴縮容。企業可以結合自己的業務需要,靈活組合方案,優化硬件成本。

圖 神策分析引擎整體架構
1、彈性存儲,雙向打通主流數據湖生态
神策分析引擎是原生的存算分離架構,無論是不可變數據存儲(HDFS、對象存儲),還是可變數據存儲(Kudu),都可以靈活的進行擴展。
根據數據的冷熱程度和可更新性,神策分析引擎采用不同的存儲系統。這樣做的目标是程度減少對高性能 SSD 磁盤的使用需求,盡量采用低成本的 HDD 磁盤存儲大容量數據。通過 Alluxio 的方案,引擎可以直接無縫連接各大公有雲的對象存儲,實現低成本的彈性擴容。當然,考慮到本地存儲具有更好的性能優勢,以及在一次性預付費折扣下成本也相對可控,因此彈性也并不總是選擇。企業可以根據業務類型和需求,靈活調整存儲類型的比例,以在性能和成本之間找到平衡點。
存算分離架構也會帶來一些性能方面的副作用,因此在小規模集群中,神策數據默認依然采用計算和存儲同機部署模式,以減少網絡開銷并提高掃描性能。而在大規模集群和彈性模式下,引擎則會智能利用 Local Cache 技術,減少因存算分離帶來的額外網絡開銷。
此外,神策分析引擎完全兼容 Iceberg 标準,使得與客戶現有的數據倉庫和數據湖體系進行雙向打通變得輕松,無需冗餘存儲數據,且保證了不同應用之間數據的一緻性。Iceberg 數據湖标準目前受到了主流數據倉庫和數據湖解決方案的廣泛支持,擁有完善的開源生态工具鍊。
2、彈性查詢,靈活應對企業經營需求
查詢資源通常是分析引擎的整體資源使用中波動的部分,因為它不僅和企業的業務高峰有關系(例如促銷活動帶來的流量高峰),也受到企業的自己的經營活動(例如周報月報、版本發布)的直接影響。為此,神策分析引擎提供了非常靈活的查詢資源配置方案。
首先,對于較穩定的業務固定查詢需求,需要配備一定比例的本地查詢資源,由于這部分資源是存儲計算一體化,通常查詢性能更好、延遲更低。後期也可以根據業務的增長需要,再進行擴容操作。
其次,對于夜間的離線計算或者臨時性大規模查詢,例如大型促銷活動或者新遊戲上線等場景,可以使用基于 Kubernetes 集群的彈性的查詢資源。這裡的實踐方案是使用各大公有雲廠商的按需計價節點,或者競價實例(如 AWS Spot 實例)來進行部署。按照神策數據過往服務客戶的實踐經驗,該方案相比完全使用本地查詢資源大約可以節省 20%~30% 的成本。
最後,分析引擎不僅支持物理隔離的查詢資源組,還支持在資源組中劃分優先級隊列,例如可以按照産品線、查詢大小來進行資源分配,從而更好的保障高優先級的業務需求。
3、彈性導入,化硬件資源利用率
在導入能力上,神策分析引擎提供了秒級實時、分鐘級微批和小時級離線導入等多種方式,以在時效性和吞吐量之間取得平衡,限度地提高資源利用率。并且允許在不同模式之間進行動态切換,如在導入高峰期間切換到微批模式,過後再切回實時模式。
相比查詢來說,導入的資源消耗通常是比較穩定的,一般默認情況下使用固定的本地資源運行即可。但是,對于大批量、一次性曆史數據導入需求,更好的選擇是在彈性 Kubernetes 集群上運行,以避免短時間内頻繁擴容和縮容帶來的操作和硬件成本。
搜索神策數據進入官網,即可免費體驗神策分析。
二、六大核心能力優化
1、全面強化的用戶旅程分析
神策分析引擎專注于用戶旅程分析這一專屬場景,與通用的 OLAP 分析引擎相比,我們構建了高效的用戶序列分析框架,所有的漏鬥、路徑、歸因、LTV 等分析模型均基于此框架開發。這不僅保證了執行效率的卓越,同時也能快速根據業務需求進行功能擴展。
在應對大數據量場景時,我們提供了基于完整用戶數據的快速抽樣能力,确保用戶行為在抽樣過程中不會被割裂,從而在低成本的基礎上實現快速計算,并保持指标的準确性。另外,我們還實現了高效的點查能力,支持單用戶行為序列場景,有效避免了數據的冗餘存儲和不一緻問題。此外,為應對 ID-Mapping 和數據合規場景,我們專門支持了單用戶數據删除和修複功能。
2、精準的查詢資源預估
對每個查詢的資源進行準确預估是神策分析引擎穩定運行的重要前提。神策分析引擎除了傳統的基于統計信息的預估方式之外,還引入了基于查詢曆史的預估,在真實業務場景中,由于企業的産品使用通常存在較強的規律性,因此往往系統運行一段時間之後,基于曆史的查詢預估會起到關鍵作用,大大提升整體的準确性。
基于精準的查詢資源預估結果,一方面可以獲取更佳的執行計劃,另外也可以更準确地進行查詢資源的調度——例如讓小查詢進入高優先級隊列快速執行。除此之外,還可以給用戶更加準确的交互反饋。
3、批流一體的實時數據聚合
神策分析引擎在支持離線分析和 Ad-Hoc 查詢的同時,還能從任意曆史數據時間點開始進行流式聚合查詢。這意味着我們可以使用同一套查詢引擎和 UDF/UDAF 實現三種不同的應用場景,實現語法的一緻性、性能的高效和可複用性。通過這部分能力,我們能夠實現秒級時效性的高頻查詢,更好地滿足實時監控類需求。

圖 實時聚合的應用示例
4、一緻性物化視圖
物化視圖是常見的 OLAP 查詢引擎優化能力,通常有兩種實現方式:和基表數據一緻,或者需要定期更新。神策分析引擎采用一緻性物化視圖,這意味着我們可以在保持數據一緻性的基礎上,實現常用查詢性能的 10 倍提升。
5、完備的數據安全體系
為确保企業數據的安全性,神策分析引擎采取了多重安全措施。首先,引擎提供完整的表級别和行列級别的訪問控制,以确保隻有授權用戶能夠獲取相應的數據,從而保護數據的隐私和機密性。其次,在更高安全要求的場景下,引擎還支持對所有底層存儲服務啟用基于 KMS(Key Management Service)的加密機制,以增強數據的加密保護,确保數據在存儲過程中也始終處于加密狀态,防範潛在的安全威脅。
6、通用性能優化
作為一個全流程支持 CodeGen 的 C++ 查詢引擎,神策分析引擎在處理複雜查詢時有着顯著優勢。此外,通過服務 2000+ 客戶的實踐,我們積累了大量優化經驗,引入了諸如表達式預計算、無效 JOIN 裁剪、正則緩存、Bucket Join 等細節優化,進一步提升了在複雜業務場景下的性能表現。
特别值得一提的是,在完成了諸多指令集級别的适配工作之後,神策分析引擎能夠完美支持在國産 x86 和 ARM 芯片上運行,并有良好的性能表現。
三、神策分析引擎高效賦能企業經營
基于神策分析引擎,企業得以更高效地實現看數查數、分析洞察等關鍵業務場景。包含舊版本在内,神策分析引擎已成功為包括泛金融、泛品牌零售、泛互聯網以及泛企業各細分領域在内的 2000+ 客戶的數字化經營提供了穩健的能力支撐。
以某互聯網工具類客戶為例,其每日新增數據量高達百億條,日均查詢數千次。在此背景下,神策分析引擎展現出了優異的性能表現:看數型查詢的 P95 指标在 3 秒左右,分析型查詢則在 30 秒,而原始的 SQL 查詢也能達到 36 秒。類似地,某電商類客戶每日新增數據百億條,日均查詢次數近萬次,也在不同使用場景下達到了數秒至數十秒不等的 P95 指标。
衆多諸如此的成功案例充分表現出了神策分析引擎在大規模數據處理與高頻查詢場景下的傑出能力,為數字化時代企業的快速發展提供了強有力的數據支持,助力企業實時了解業務情況、準确做出決策,實現高效企業經營。
搜索神策數據進入官網,即可免費體驗神策分析。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

