周躍峰在論壇上強調(diào):“AI時代,模型訓練、推理效率與體驗的量綱都以Token數(shù)為表征,Token經(jīng)濟已經(jīng)到來”。為保障流暢的推理體驗,企業(yè)需持續(xù)加大算力投入,但如何在推理效率與成本之間找到最佳平衡點,成為了全行業(yè)亟待解決的重要課題。
為此,華為推出UCM推理記憶數(shù)據(jù)管理器,包括對接不同引擎與算力的推理引擎插件(Connector)、支持多級KV Cache管理及加速算法的功能庫(Accelerator)、高性能KV Cache存取適配器(Adapter)三大組件,通過推理框架、算力、存儲三層協(xié)同,實現(xiàn)AI推理“更優(yōu)體驗、更低成本”。
在與中國銀聯(lián)的聯(lián)合創(chuàng)新技術試點中,UCM的技術價值得到驗證。在中國銀聯(lián)“客戶之聲”業(yè)務場景下,借助UCM技術及工程化手段,大模型推理速度提升125倍,僅需10秒即可精準識別客戶高頻問題,促進服務質(zhì)量提升。未來,中國銀聯(lián)將依托國家人工智能應用中試基地,聯(lián)合華為等生態(tài)伙伴共建“AI+金融”示范應用,推動技術成果從“實驗室驗證”走向“規(guī)?;瘧?rdquo;。
論壇現(xiàn)場,華為正式公布了UCM開源計劃。UCM通過開放統(tǒng)一的南北向接口,可適配多類型推理引擎框架、算力及存儲系統(tǒng)。今年9月,UCM將正式開源,后續(xù)逐步貢獻給業(yè)界主流推理引擎社區(qū),攜手全產(chǎn)業(yè)共同推動AI推理生態(tài)的繁榮發(fā)展。