近期,極佳視界聯(lián)合創(chuàng)始人、首席科學(xué)家朱政接受中國(guó)證券報(bào)記者采訪,談及公司團(tuán)隊(duì)從自動(dòng)駕駛切入具身智能、以通用世界模型賦能三大場(chǎng)景的成長(zhǎng)路徑。朱政認(rèn)為,具身智能面對(duì)更頻繁的物理世界交互,需要視覺(jué)、觸覺(jué)、力控等多模態(tài)信號(hào),模型訓(xùn)練極具挑戰(zhàn),同時(shí)也對(duì)應(yīng)著廣闊的市場(chǎng)空間。
目前,極佳視界推動(dòng)具身機(jī)器人落地家庭服務(wù)與工業(yè)制造場(chǎng)景,并開啟“機(jī)器人造機(jī)器人”產(chǎn)線建設(shè)。同時(shí),公司以通用世界模型為底座,將模型能力賦能具身智能、自動(dòng)駕駛、內(nèi)容創(chuàng)作三大場(chǎng)景,加速世界模型商業(yè)化應(yīng)用。
極佳視界人形機(jī)器人在模擬工業(yè)產(chǎn)線作業(yè) 公司供圖
進(jìn)入具身智能賽道
“2023年前,團(tuán)隊(duì)一直從事自動(dòng)駕駛的研發(fā),感受到市場(chǎng)的天花板,而具身智能可能是更大的市場(chǎng)。”朱政回憶公司發(fā)展歷程時(shí)說(shuō)。2023年6月,極佳視界正式成立,多位核心成員來(lái)自自動(dòng)駕駛領(lǐng)域,公司成立后便聚焦世界模型,并面向具身智能、自動(dòng)駕駛、內(nèi)容創(chuàng)作三個(gè)方向同步布局。
朱政表示,自動(dòng)駕駛為具身智能提供技術(shù)和人才的儲(chǔ)備,但同時(shí),具身智能的模型相較于自動(dòng)駕駛更為復(fù)雜。
在自動(dòng)駕駛領(lǐng)域,車輛在道路上行駛,拐彎、加速、停下,車體與外界并沒(méi)有復(fù)雜的交互,主要需要避免碰撞,算法只需考量車輛與車輛、車輛與行人之間的博弈,模型訓(xùn)練的數(shù)據(jù)也非常充足。“過(guò)去10年,新能源車企已經(jīng)積累了上億公里的路測(cè)數(shù)據(jù)。”朱政說(shuō)。在此基礎(chǔ)上,自動(dòng)駕駛的應(yīng)用落地加速,商業(yè)化路徑也更為清晰。而在具身智能領(lǐng)域,模型訓(xùn)練的難度更高、數(shù)據(jù)需求更為多樣。
“具身機(jī)器人的雙臂和靈巧手,加起來(lái)就有幾十個(gè)自由度,需要與物體頻繁接觸,接觸過(guò)程中會(huì)用到視覺(jué)信號(hào)、電子皮膚收集的觸覺(jué)信號(hào),還有關(guān)節(jié)傳感器的力控信號(hào)等,都要統(tǒng)一到同一個(gè)模型中。”朱政介紹,因此機(jī)器人面臨更復(fù)雜的數(shù)據(jù)需求、應(yīng)用場(chǎng)景和模型算法挑戰(zhàn)。
面對(duì)這一挑戰(zhàn),極佳視界選擇了以世界模型為中心的技術(shù)路線。朱政介紹,從去年底開始,具身大腦的技術(shù)路線逐漸收斂至以世界模型為中心的具身基礎(chǔ)模型,“世界模型像人的右腦一樣,是適配空間、理解與行動(dòng)最合適的架構(gòu)。從數(shù)據(jù)規(guī)模、模型參數(shù)與訓(xùn)練方法來(lái)看,這一路線有望更快兌現(xiàn)具身智能領(lǐng)域的縮放定律(Scaling Law)。”
基于這一路線,極佳視界最新發(fā)布并全面開源具身基礎(chǔ)模型GigaBrain-0.7,可實(shí)現(xiàn)超20分鐘、超過(guò)20個(gè)子任務(wù)的一鏡到底自主操作。
通用世界模型賦能三大業(yè)務(wù)
朱政介紹了極佳視界在全球首次提出的通用世界模型L1到L5分級(jí)體系:L1階段,模型可生成視覺(jué)真實(shí)的通用視頻世界,支撐AI短劇、游戲內(nèi)容生產(chǎn);L2階段,模型可生成高效、合理的通用執(zhí)行動(dòng)作,用于自動(dòng)駕駛車輛、具身機(jī)器人;L3階段,模型生成幾何準(zhǔn)確的通用空間世界,讓世界成為可被定位、測(cè)量和導(dǎo)航的空間;L4階段,模型能夠生成物理精確的通用物理世界,可預(yù)測(cè)物體下一步行為和影響;L5階段,模型將生成可長(zhǎng)程運(yùn)行的世界,在長(zhǎng)時(shí)間尺度維持狀態(tài)、規(guī)則、記憶和交互。
“更高層級(jí)不是替代更低層級(jí),而是在其上疊加更強(qiáng)的約束。世界模型在技術(shù)上已經(jīng)沒(méi)有大的理論瓶頸,只要沿著L1到L5不斷往前推進(jìn),就能迎來(lái)各個(gè)產(chǎn)業(yè)爆發(fā)的時(shí)刻。”朱政說(shuō)。
在商業(yè)策略上,朱政介紹,極佳視界以通用世界模型為底座,從數(shù)據(jù)、建模、訓(xùn)練方法上,打通具身智能、自動(dòng)駕駛和內(nèi)容創(chuàng)作三大場(chǎng)景。
自動(dòng)駕駛領(lǐng)域,公司商業(yè)化已較為成熟。極佳視界推出自動(dòng)駕駛世界模型模擬器Drive Dreamer Engine,可生成多視角一致的視頻與激光雷達(dá)點(diǎn)云數(shù)據(jù),完成大區(qū)域場(chǎng)景重建,覆蓋真實(shí)路測(cè)難以采集的長(zhǎng)尾場(chǎng)景;同時(shí)提供閉環(huán)仿真環(huán)境用于端側(cè)模型的強(qiáng)化學(xué)習(xí),可代替部分實(shí)車測(cè)試,降低測(cè)試成本。目前已與多家頭部主機(jī)廠達(dá)成定點(diǎn)與量產(chǎn)合作。
具身智能領(lǐng)域,極佳視界同步推進(jìn)通用具身大腦GigaBrain與原生本體Maker系列的研發(fā),大腦與本體協(xié)同設(shè)計(jì)、深度適配。在此過(guò)程中,世界模型可為機(jī)器人提供訓(xùn)練數(shù)據(jù)、強(qiáng)化學(xué)習(xí)環(huán)境以及仿真評(píng)測(cè)環(huán)境,并直接輸出機(jī)器人動(dòng)作策略。
內(nèi)容創(chuàng)作領(lǐng)域,商業(yè)化路徑明確。世界模型能力可用于影視行業(yè)后期制作、短劇制作、游戲生成,公司向工作室、個(gè)人創(chuàng)作者開放API接口,提供模型能力。
技術(shù)落地層面,極佳視界搭建算法、數(shù)據(jù)“雙金字塔”體系:數(shù)據(jù)金字塔整合互聯(lián)網(wǎng)視頻數(shù)據(jù)、真人示教數(shù)據(jù)、世界模型生成與仿真合成數(shù)據(jù)、真機(jī)實(shí)測(cè)數(shù)據(jù);算法金字塔分為世界模擬、動(dòng)作對(duì)齊、經(jīng)驗(yàn)強(qiáng)化三層,先由世界模型學(xué)習(xí)世界規(guī)律,再完成動(dòng)作對(duì)齊。
多場(chǎng)景落地攻堅(jiān)產(chǎn)線自動(dòng)化
極佳視界正在探索具身機(jī)器人在真實(shí)場(chǎng)景落地。在家庭場(chǎng)景,極佳視界百臺(tái)拾光S1家庭機(jī)器人訂單已落地武漢光谷“之寓”人才公寓,設(shè)備正分批部署,可獨(dú)立完成取餐備餐、餐桌整理、衣物收納等居家服務(wù)工作。工業(yè)領(lǐng)域,公司啟動(dòng)“機(jī)器人造機(jī)器人”項(xiàng)目,首批百臺(tái)Maker H01人形機(jī)器人已完成交付,兩條示范產(chǎn)線建設(shè)完成。
朱政介紹,極佳視界的示范產(chǎn)線分階段推進(jìn)自動(dòng)化:第一階段目標(biāo)是由機(jī)器人接管物料搬運(yùn)、設(shè)備上下料等約20%的工序,第二階段提升至60%,遠(yuǎn)期目標(biāo)是打造90%工序無(wú)需人工干預(yù)的全自動(dòng)化智能產(chǎn)線。“機(jī)器人可自主學(xué)習(xí)生產(chǎn)規(guī)范、組裝零部件、完成機(jī)器人產(chǎn)品的打包與發(fā)貨,未來(lái)這套自動(dòng)化生產(chǎn)能力還將延伸至倉(cāng)儲(chǔ)物流、3C、汽車制造等主流工業(yè)產(chǎn)線。”朱政表示。
整體而言,朱政認(rèn)為,具身智能產(chǎn)業(yè)化仍處于發(fā)展早期。現(xiàn)階段,模型能力仍然有限,機(jī)器人難以處理極端工況、意外情形,或?qū)崿F(xiàn)跨場(chǎng)景的泛化;同時(shí),考慮到實(shí)際應(yīng)用需求,機(jī)器人本體成本偏高,電池續(xù)航、安全性能仍有待提升,行業(yè)發(fā)展有賴于固態(tài)電池等前沿技術(shù)持續(xù)突破。
從落地場(chǎng)景成熟度來(lái)看,朱政認(rèn)為,當(dāng)前物流分揀已是具身機(jī)器人落地應(yīng)用的核心賽道。機(jī)器人可實(shí)現(xiàn)全天候不間斷作業(yè),有效提升物流分揀整體效率。除此之外,無(wú)人咖啡店、無(wú)人藥房、無(wú)人零售店等泛服務(wù)場(chǎng)景落地提速,機(jī)器人可完成夜間值守、商品服務(wù)等工作,助力實(shí)體業(yè)態(tài)實(shí)現(xiàn)24小時(shí)不間斷運(yùn)營(yíng)。
談及行業(yè)發(fā)展趨勢(shì),朱政認(rèn)為,具身智能大約落后語(yǔ)言模型5年,未來(lái)2到3年內(nèi)有望迎來(lái)自身的“GPT-3時(shí)刻”。每一代新模型的突破,都將打開全新的商業(yè)化應(yīng)用空間。隨著行業(yè)資本持續(xù)涌入、專業(yè)人才不斷集聚,國(guó)內(nèi)世界模型產(chǎn)業(yè)有望迎來(lái)跨越式發(fā)展。
中證網(wǎng)聲明:凡本網(wǎng)注明“來(lái)源:中國(guó)證券報(bào)·中證網(wǎng)”的所有作品,版權(quán)均屬于中國(guó)證券報(bào)、中證網(wǎng)。中國(guó)證券報(bào)·中證網(wǎng)與作品作者聯(lián)合聲明,任何組織未經(jīng)中國(guó)證券報(bào)、中證網(wǎng)以及作者書面授權(quán)不得轉(zhuǎn)載、摘編或利用其它方式使用上述作品。