內容忠實度:verified-transcript(根據 Bilibili 影片音訊的本機暫存轉錄整理;影片沒有官方字幕,模型名稱及部分數字可能有聽寫誤差,請以京東官方 Repository、模型卡及論文為準。)
影片介紹
影片介紹京東剛開源的即時視像語言互動模型 JoyAI-VL-Interaction(轉錄中曾聽成相近讀音,本文以頁面標題的 JoyAI-VL-Interaction 為準)。它的重點不是收到一張圖片後才回答,而是持續接收直播畫面或攝影機輸入,主動理解畫面變化並作出語言回應。
影片提出的核心能力
- 連續視像輸入:持續觀看直播或攝影機畫面,不需要使用者每次重新發問。
- 即時理解與回饋:影片聲稱可在接近秒級的延遲內理解並回應;這是影片說法,實際延遲會受硬件、串流方式及部署設定影響。
- 事件觸發預警:在照護場景中,正常活動時保持安靜,察覺異常時才發出預警。
- 主動逐句翻譯:使用者可以要求逐句翻譯字幕,模型會持續追蹤畫面,在出現新字幕時主動翻譯,而不是每翻一句便停下等下一個指令。
- 直播事件播報:可以等待指定事件,例如球賽中裁判出示紅牌,事件出現時同步播報。
影片時間軸
- 00:00–00:11:介紹京東開源的即時影片語言互動模型,主張可持續接收直播或攝影機畫面並快速回應。
- 00:12–00:16:以照護場景舉例:老人正常活動時不打擾,發現異常時才預警。
- 00:17–00:27:展示逐句字幕翻譯概念;模型持續看字幕並主動翻譯。
- 00:26–00:40:以 2026 世界盃墨西哥對南非的直播作例子;使用者要求出現紅牌時提醒,影片聲稱模型在紅牌出現時同步播報,平均延遲約 94 毫秒。
- 00:40–00:51:影片聲稱模型約 8B 參數,並在監控預警、即時翻譯、直播解說、長期記憶等 58 項場景測試中,整體表現超過 Gemini 視頻助手及豆包視頻助手。
- 00:52–01:03:影片再次強調世界杯例子、訓練資料規模及模型權重/訓練方案開源,邀請有相關需求的開發者試用。
可能的應用
- 長者照護:持續監察活動,對跌倒、長時間不動或其他預先定義的異常發出提醒。
- 直播及體育:偵測紅牌、進球、犯規或其他指定事件並即時播報。
- 即時翻譯:追蹤影片字幕、會議投影或現場演講,逐句翻譯。
- 家庭及工作監察:理解攝影機畫面中的流程或狀態,但必須先處理私隱、同意及保存政策。
- 機械人及視像 Agent:將持續視覺理解接到語音、告警或自動控制系統。
與一般圖片問答的差別
一般視覺模型多數是「收到一張圖片/一段影片,再回答一次」。JoyAI-VL-Interaction 的宣傳重點則是「保持觀看狀態、追蹤時間變化、在事件發生時主動回應」。因此它更接近持續視像 Agent,而不是單次圖片 OCR 工具。
影片聲稱與需要核實的地方
- 影片聲稱平均延遲約 94 毫秒;這需要查閱測試條件、硬件、串流解析度及計算方式。
- 影片聲稱在 58 項場景測試中整體表現超過 Gemini 及豆包;這是影片中的比較結論,不代表獨立第三方基準。
- 影片提到約 8B 參數及「數百萬條」級別資料;實際模型大小、訓練資料、授權和權重下載方式應以官方模型卡為準。
- 長期記憶、照護預警及紅牌偵測屬示範/宣傳場景,不能直接當作醫療、保安或裁判級可靠性保證。
部署前注意
- 先測試攝影機輸入、串流延遲、GPU 記憶體及模型推理速度。
- 照護場景要有人工覆核及緊急備援,不能只依靠模型通知。
- 攝影機涉及人臉、居家活動及健康相關資訊,應取得同意並限制保存。
- 開源不等於安全;部署前應檢查模型權重來源、依賴套件、服務端口、日誌及 API 權限。
來源
Bilibili 原始影片|影片標題:京東開源 JoyAI-VL-Interaction:讓大模型從「一問一答」邁入「邊看邊說」的實時交互時代|片長:約 64 秒
留言
暫時未有公開留言。
登入後可以留言。