商湯日日新SenseNova U1信息圖增強版上線後,得到很多創作者和開發者的積極反饋。而随着 GPT-Image-2 等新一代商業圖像生成模型的出現,行業期待也在快速提高:模型不隻要“畫得像”,還要能處理更長文本、更複雜的版式結構,以及更穩定的圖文對應關系。
基于這一技術趨勢,我們對SenseNova U1信息圖增強版進行了專項疊代,推出SenseNova U1信息圖增強版V2(SenseNova-U1-8B-MoT-Infographic-V2),希望把這類高信息密度圖像生成能力,以更開放、更輕量的 8B-MoT 模型形式持續推進,讓開源模型在小字清晰度、複雜排版和視覺質感上不斷向行業前沿靠近。
該模型權重已在 Hugging Face 和魔搭社區開放,相關代碼、文檔與示例已同步至 GitHub。
小字清晰度和複雜版式升級,回應真實創作場景
如果說前一個版本——SenseNova U1信息圖增強版(SenseNova U1-8B-MoT-Infographic)能做到的是:文字準确、圖表可靠、背景穩定;信息圖增強版V2的跨越式突破,就是讓AI真正懂得如何把信息圖“做得更美”——小字更清晰,排版疏密有緻,整體質感向專業設計師看齊。
以下是V2版本生成的部分信息圖:
|
|
|
|
V2模型進行的關鍵升級包括:
1、小文本更清晰,信息細節更好讀
信息圖中的腳注、數據來源、表格注釋、坐标軸标簽及免責聲明等小字,往往承載着關鍵的輔助信息。過去模型生成的圖片邊緣極易模糊、筆畫粘連,導緻用戶需要放大數倍去“猜字”,作品也顯得專業度欠缺。
V2版本顯著提升了小字文本的邊緣銳利度和清晰度。以下報紙版面設計的渲染圖,無需反複放大,在正常閱讀距離下即可對各類小字信息、數據“一目了然”。
|
|
2、駕馭複雜密集排版,自帶“設計師”視覺
當信息密度極高時,信息圖的模塊之間容易相互擠壓,導緻視覺路徑混亂、閱讀體驗差。
V2版本将複雜密集排版與整體美觀度作為核心升級方向。通過培養模型對網絡結構、視覺層級和語義對應關系的深層理解,讓畫面排版疏密有緻、條理清晰。在以下生成商業海報、遊戲指南、知識圖譜等場景中,圖像的專業度、美觀精緻度和整圖可用性均大幅提升。
|
|
面向更多真實場景:持續突破,專項與通用能力并重
優質的生圖效果,源于信息圖增強版V2在底層訓練機制上的創新與重構:
• 專項強化方面:在 MT( 中期訓練)/ SFT(監督微調)階段,我們引入更多更好的高質量合成/真實數據,并重新平衡信息圖相關樣本内分布以及和其他數據分布,進一步優化訓練數據組成,針對小字渲染、複雜密集排版和高美觀度生成能力進行了專項強訓。 • 視覺質感方面:在 RL(強化學習)階段,引入了 DPO(直接偏好優化)訓練,從人類視覺審美出發,整體拉高視覺質感。 • 穩定性提升方面:在 GRPO(組相對策略優化)階段,進一步優化了獎勵配方(reward recipe),從機制上讓模型能夠更穩定地避免非預期暗色背景的出現。
得益于這一套組合拳,信息圖增強版V2交出亮眼答卷:
• 在開源模型中保持領先,并較前代顯著提升:相比舊版本,V2版本在 BizGenEval(hard/easy)困難與簡單測試集上,得分從 46.6 / 65.4 躍升至 50.3 / 67.9(分别提升 +3.7 / +2.5);在 IGenBench(Q-ACC/I-ACC)指标上,也由 69.5 / 17.0 提高到 71.4 / 18.3(分别提升 +1.9 / +1.3)
舊版本生成 |
V2版本生成 |
• 通用生成能力保持穩定:綜合測評指标 OneIG(EN/ZH)得分為 55.4 / 53.5.與上一版基本持平,這表明V2在信息圖專項能力顯著提升的同時,并未明顯犧牲通用生成能力。

V2在OneIG (EN, ZH), LongText (EN, ZH), BizGenEval (Easy, Hard), CVTG and IGenBench 的綜合能力表現

信息圖基準表現
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.











