【信報財經新聞】字節跳動(ByteDance)宣布,正式推出原生音視頻全雙工大模型SeedRealtime,將為走向全模態交互關鍵一步。
據該公司介紹,SeedRealtime用統一架構原生融合音訊、視頻與文本,能在連續多模態訊息流上即時交互,帶來「邊看、邊聽、邊說」的體驗。目前,SeedRealtime已在豆包手機應用程式(App)全量上線。
從端到端人工評測結果顯示,相比級聯模型,SeedRealtime音視頻對話節奏問題減少了一半,模型對說話時機把握更自然,話未說完被搶斷、話音已落卻回應遲緩、或是被背景雜音與閒聊誤觸發等現象顯著減少;單次對話能夠順暢、完整交流概率明顯提升。