京东开源视觉语言实时交互模型JoyAI-VL:8B参数实现「边看边说」,打破多模态一问一答范式
来源:互联网多模态大模型的交互方式正在经历一次范式级变革。京东团队即将开源的视觉语言实时交互模型JoyAI-VL-Interaction,用一个仅8B参数的轻量模型,挑战了自ChatGPT以来「一问一答」的轮次制交互传统——它能够通过摄像头实时持续观察周围环境,自主判断何时开口、何时沉默、何时将任务委派给后台更强大的模型。
从「被问才答」到「主动感知」
传统多模态大模型遵循严格的轮次制逻辑:用户提问、模型回答、等待下一次提问。JoyAI-VL-Interaction打破了这个范式。它通过摄像头实时视频流持续观测现实世界,在无人提问的状态下也能主动发现问题并作出响应。核心突破在于,「何时开口」这一决策被直接训练进了模型内部,而不是依赖外部轮询系统来判断——这从根本上消除了传统轮询方案固有的延迟枷锁。
前后台分层架构:轻量感知+深度推理
JoyAI-VL-Interaction采用了一套精巧的分层设计。前台由轻量小模型(8B参数)持续盯着视频流,负责高频、低复杂度的实时感知判断;当遇到复杂问题时,自动将任务委派给后台大模型或Agent进行深度推理。这种「轻量感知+深度推理」的架构,有效解决了实时交互对算力与延迟的双重约束,也大幅降低了端侧和边缘侧的部署门槛。
评测数据亮眼:特定场景对Gemini全胜
在58个评测案例中,JoyAI-VL-Interaction对豆包的总体胜率达77.6%,对Gemini的总体胜率达87.9%。在监控预警等特定场景下,对两个对手均取得了100%的胜率。值得注意的是,这些优势主要来自于时机判断的精准度,而非通用知识储备的碾压——这也恰恰说明该模型在交互逻辑层面实现了差异化突破。
开源生态布局:完整技术栈开放
京东此次开源的力度相当罕见:模型权重、交互数据、训练方法、完整系统代码以及后台接口桥接方案将一并开放。这种「全栈开源」策略,意在吸引开发者在安防监控、直播运营、无障碍辅助等实时视频流感知场景中构建应用生态,抢占多模态实时交互赛道的产业先机。