智元大模型登上DailyOmni全模態(tài)理解榜單首位 每日關(guān)注
【資料圖】
7月28日,記者獲悉,近日,具身全模態(tài)理解權(quán)威榜單DailyOmni最新評測結(jié)果揭曉,智元自研的具身原生全模態(tài)大模型WITA-Omni Preview,憑借音視頻聯(lián)合理解與時(shí)序推理能力,以85.21分綜合成績登陸榜單首位,在八項(xiàng)細(xì)分指標(biāo)中的六項(xiàng)取得第一。
對于人形機(jī)器人交互能力來說,以往的全模態(tài)模型大多優(yōu)先適配線上數(shù)字內(nèi)容交互,而機(jī)器人身處持續(xù)變化的物理空間,不僅需要同步“看見畫面、聽見聲音”,更要實(shí)時(shí)判斷聲音歸屬主體、事件發(fā)生順序,識別交互對象、找準(zhǔn)響應(yīng)時(shí)機(jī),傳統(tǒng)模塊化機(jī)器人方案很難完成這類時(shí)序耦合的復(fù)雜推理任務(wù),也是長久以來人機(jī)交互生硬割裂的關(guān)鍵瓶頸。
對具身智能機(jī)器人而言,“理解”和“回應(yīng)”并不是兩個(gè)割裂的步驟,而是一個(gè)持續(xù)發(fā)生的物理過程。機(jī)器人需要一邊觀察環(huán)境、一邊接收聲音;一邊組織語言、一邊配合動作和表情。在多人、開放且持續(xù)變化的真實(shí)環(huán)境中,它還必須進(jìn)一步判斷:是否應(yīng)該回應(yīng)、什么時(shí)候回應(yīng),以及正在與誰交互。
據(jù)智元方面介紹,WITA-Omni并不是簡單地把聊天模型“裝進(jìn)”機(jī)器人,而是將物理動作和表情提升為與語音并列的一級輸出,用一個(gè)原生端到端模型統(tǒng)一驅(qū)動感知、決策與表達(dá)。
同時(shí),WITA-Omni一套圍繞具身全模態(tài)交互構(gòu)建的分層數(shù)據(jù)體系與針對性訓(xùn)練方法。在中訓(xùn)練階段,WITA-Omni 使用千萬小時(shí)級多模態(tài)數(shù)據(jù),將強(qiáng)文本、視覺底座進(jìn)一步升級為能夠“聽得見、看得懂,并進(jìn)行音畫聯(lián)合推理”的全模態(tài)模型。模型不僅學(xué)會“回答正確”,還進(jìn)一步學(xué)會在真實(shí)場景中判斷:該不該回應(yīng)、何時(shí)回應(yīng),以及回應(yīng)誰。
標(biāo)簽: 財(cái)經(jīng)頻道 財(cái)經(jīng)資訊

南向資金今日凈賣出美團(tuán)9.24億港元