7月6日,由世界人工智能大會組委會主辦的“2024世界人工智能大會語料主題論壇”在上海成功舉辦。上海市政府副秘書長莊木弟出席論壇并緻辭,中國科學院院士鄂維南作主旨演講。上海市各相關部門代表、上海人工智能實驗室、人民網、上海算法創新研究院、中國信通院、複旦大學等1000餘家大模型語料生态企業共同參會。标貝科技聯合創始人&CTO李秀林受邀出席論壇,參與“共話未來-我們需要怎樣的語料供給”圓桌對話。

本次論壇以“語料築基,智生時代”為主題,圍繞高質量語料數據如何高效供給賦能大模型産業發展,向市場傳遞專業化、鍊接型、前瞻性的語料生态設計理念。會上,大模型語料生态企業通過主題演講、案例分享、圓桌共話的形式暢談了各自對大模型産業發展的創新想法和實踐。
在圓桌環節,标貝科技聯合創始人&CTO李秀林博士與其他企業代表圍繞“大模型語料供給帶來的機會和挑戰,數據的自動化标注與人工标注現況趨勢以及合成數據的未來”3個問題進行了深入探讨。

李秀林博士表示,大模型背後是人工智能算法、算力和數據的融合升級。要讓大模型更為聰明,就離不開高質量數據資源。預訓練語料的選擇對于模型的最終質量有着重要的影響。
一方面,随着大模型的廣泛應用,高質量、多樣化數據需求也将不斷增長,這為AI數據服務企業提供了廣闊的市場空間。另一方面,從技術角度來看,大模型技術的快速發展也推動了AI數據服務的升級。企業利用大模型技術開發出更加智能數據處理工具,來提升數據生産的質量和效率。
标貝科技深耕AI數據領域多年,結合過去豐富的實戰經驗,打磨了大批量多模态數據集,可以滿足當前市場上大模型訓練或調優需求。另外,标貝科技還用大模型技術支撐數據的生産,構建大模型數據處理技術解決方案能力,可以支持數據采标、管理、模型訓練與優化、部署與應用,以及定制化方案,為企業提供更加高效卓越的數據處理服務。
對于數據自動化标注和人工标注的占比問題。李秀林博士認為,數據标注行業不是簡單的勞動密集型産業,自動化标注和人工标注也不是對立關系,而是技術和人力協同。随着技術的發展,市場需求越來越複雜,需要大量專業知識的積累,兩者将長期共存。
目前,标貝科技已經有了很成熟的人機協同标注工具平台。通過系統集成将大模型預标注能力與人工标注完美結合,集标注工具、預标注模型、項目管理為一體,智能化提升數據标注效率70%以上。
例如,在語義标注上的應用場景下,标貝科技2D圖像标注平台可以支持對百兆級别的超大像素圖片進行高精度标注,自動識别、标定和描述超大像素圖像中的所有細節,并在幾秒鐘内生成完整的圖像标注結果。

高質量、大規模、安全可信的語料資源是邁向AI時代的重要基石,這已成為行業的共識。為了推動大模型産業健康可持續發展,會上标貝科技攜手50餘家單位共同發起“語料生态服務大模型可持續發展倡議”。 旨在建立模型訓練、語料供給、學術研究、第三方服務等多方機構合作機制,打造一個資源共享、互利共赢、國際融通的“語料生态圈”,進一步強化語料生态全産業鍊的交流合作,有力支撐大模型科研攻關。

論壇期間,标貝科技還與庫帕思公司簽署《共建語料生态産業鍊合作協議》,雙方将依托各自在語料資源、技術研發、市場推廣等方面的優勢,在語料生态産業鍊的各個環節上開展務實合作,實現資源共享、規則共建,推動全行業語料提質、增效、降本。
随着AI技術的不斷進步和生态合作的深化,未來數據庫将更加智能、靈活和強大,為人工賦能千行百業的實體經濟發展提供堅實的基礎。标貝科技将将依托豐富的數據資源和技術積累,持續布局前沿數據語料,緻力于推進大模型語料數據的高質量供給,為AI大模型産業發展提供安全、可靠的數據支持。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

