智東西(公眾號(hào):zhidxcom)
作者 |? 許麗思
編輯 |? 漠影

智東西1月8日?qǐng)?bào)道,今天,在阿里云通義智能硬件展上,阿里云發(fā)布多模態(tài)交互開發(fā)套件,該套件集成了千問、萬相、百聆三款通義基礎(chǔ)大模型,并預(yù)置十多款生活休閑、工作效率等領(lǐng)域的Agent和MCP工具。

這款多模態(tài)交互開發(fā)套件不僅能聽、會(huì)看,還能思考并且與物理世界交互,可應(yīng)用于AI眼鏡、學(xué)習(xí)機(jī)、陪伴玩具、智能機(jī)器人等硬件設(shè)備。

一、適配超30款主流架構(gòu)終端芯片平臺(tái),預(yù)置十MCP工具和Agent

在芯片層面,阿里云多模態(tài)交互開發(fā)套件適配了30多款主流ARM、RISC-V和MIPS架構(gòu)終端芯片平臺(tái),滿足市面上絕大多數(shù)硬件設(shè)備的快速接入需求。未來,通義大模型還將與玄鐵RISC-V實(shí)現(xiàn)軟硬全鏈路的協(xié)同優(yōu)化,實(shí)現(xiàn)通義大模型家族在RISC-V架構(gòu)上的高效部署和推理性能。

在模型優(yōu)化層面,除通義模型家族外,阿里云還針對(duì)大量多模態(tài)交互場景進(jìn)行分析,推出適合AI硬件交互的專有模型,全面支持全雙工語音、視頻、圖文等交互方式,端到端語音交互時(shí)延低至1秒,視頻交互時(shí)延低至1.5秒。

此外,該套件預(yù)置十多款MCP工具和Agent,覆蓋生活、工作、娛樂、教育等多個(gè)場景,例如,基于預(yù)置的出行規(guī)劃Agent,用戶可直接調(diào)用路線規(guī)劃、旅行攻略、吃喝玩樂探索等能力。

該套件還接入了阿里云百煉平臺(tái)生態(tài),用戶不僅可以添加其他開發(fā)者提供的MCP和Agent模板,還能通過 A2A協(xié)議兼容三方Agent,極大程度地?cái)U(kuò)展了應(yīng)用的能力邊界,幫助企業(yè)靈活搭建業(yè)務(wù)場景。

阿里云發(fā)布多模態(tài)交互開發(fā)套件!讓AI眼鏡、人形機(jī)器人、陪伴玩具能聽會(huì)看會(huì)交互

二、多家具身智能企業(yè)亮相,阿里云與樂聚機(jī)器人企業(yè)達(dá)成全棧AI合作

同時(shí),阿里云還展示了面向智能穿戴設(shè)備、陪伴機(jī)器人、具身智能等領(lǐng)域的解決方案。

例如,在AI眼鏡領(lǐng)域,基于千問VL、百聆CosyVoice等模型,阿里云打造了感知層、規(guī)劃層、執(zhí)行層以及長期記憶的完整交互鏈路,可一站式實(shí)現(xiàn)同聲傳譯、拍照翻譯、多模態(tài)備忘錄、錄音轉(zhuǎn)寫功能,有效解決交互不自然、回答準(zhǔn)確率低的難題。

面向家庭陪伴機(jī)器人場景,基于千問模型和多模態(tài)交互套件,阿里云推出的解決方案不僅可實(shí)時(shí)監(jiān)測異常狀況,并及時(shí)告警信息推送,用戶還能基于關(guān)鍵詞查找、定位視頻,與機(jī)器人進(jìn)行對(duì)話交互和控制設(shè)備等。

展會(huì)現(xiàn)場,出現(xiàn)了多家具身智能廠商包括魔法原子、靈心巧手、跨維智能、原力無限等的身影,展出了多款人形機(jī)器人、四足機(jī)器人、靈巧手產(chǎn)品。人形機(jī)器人現(xiàn)場彈鋼琴、做咖啡,人氣爆棚。

阿里云發(fā)布多模態(tài)交互開發(fā)套件!讓AI眼鏡、人形機(jī)器人、陪伴玩具能聽會(huì)看會(huì)交互 阿里云發(fā)布多模態(tài)交互開發(fā)套件!讓AI眼鏡、人形機(jī)器人、陪伴玩具能聽會(huì)看會(huì)交互

另外,阿里云還宣布與樂聚機(jī)器人達(dá)成全棧AI合作,雙方將基于阿里云算力、AI平臺(tái)、千問模型,共同開展人形機(jī)器人訓(xùn)練場合作,以及探索基于千問模型的具身智能聯(lián)合解決方案和人形機(jī)器人產(chǎn)品的開發(fā)。

目前,樂聚新版展廳機(jī)器人已接入千問模型。接入千問后,機(jī)器人在語音交互、知識(shí)庫問答、實(shí)時(shí)對(duì)話等場景下,響應(yīng)更快、答案更準(zhǔn)、互動(dòng)更自然。

結(jié)語:推動(dòng)AI硬件告別“單感官”時(shí)代

大模型已開始具備理解、感知以及和物理世界交互的能力,越來越多的硬件和終端設(shè)備廠商開始通過接入大模型來提升交互體驗(yàn)。然而,僅靠基礎(chǔ)大模型仍無法同時(shí)滿足硬件設(shè)備對(duì)低成本、低時(shí)延、功能豐富和高質(zhì)量效果的需求。

而阿里云多模態(tài)交互開發(fā)套件的出現(xiàn),集成了千問、萬相、百聆三款通義基礎(chǔ)大模型,使硬件廠商和開發(fā)者能夠通過套件快速為產(chǎn)品賦予高階智能,告別了“單感官”時(shí)代,極大地縮短了開發(fā)周期,降低了開發(fā)成本?;诎⒗镌频倪@款開發(fā)套件,未來AI硬件有望出現(xiàn)更多的創(chuàng)新型解決方案。