上下半场的分界线
数字人产业的技术竞赛正在换挡。上半场比的是拟真度——像不像真人、皮肤材质、口型同步;下半场考验的是交互能力与落地价值。中国数字人产业正经历从“展示型”向“实用型”的转向。
增长很猛,痛点也很真
据沙利文报告,中国数字人赛道年复合增长率达 52%,约为全球增速的 1.5–2 倍,亚太已是全球最大增量市场。
但高速增长背后,“落地难”是共性痛点:多数数字人仍停留在照本宣科的展示阶段——能输出不能互动,能录制短视频却撑不住长时直播。实时交互能力成为制约产业规模化落地的核心瓶颈。这也是为什么很多企业买了数字人,用了两个月就闲置:内容发完了,互动接不住,价值就停在“新鲜感”。
实时交互成了分水岭
2026 世界人工智能大会上,虎牙发布自研实时多模态数字人基础模型 VAM 1.0。它的关键点是:
- 基于 DiT 架构,全链路实时生成;
- 仅需输入一张静态照片,即可生成能实时说话、聆听、反应的数字人形象;
- 无需预渲染和录播素材,每一帧均为在线实时生成;
- 原生覆盖静默、聆听、说话三种对话状态——用户发言时同步做出注视、点头等反馈,用户停顿可自然接话,被打断能即时响应;
- 支持弹幕、语音双通道驱动交互。
成本结构正在改变
随着数字人技术融入直播、内容全链路,内容供给模式从真人主导的线性供给,转向“真人+AI数字人”的多元供给,边际成本随规模扩大持续下降。行业普遍的体感是:AI 让数字人制作成本大幅下降、创作效率成倍提升,过去只有大预算才能做的虚拟形象,现在中小企业也用得起。
企业怎么选:两条路线不冲突
现在市面上的数字人应用基本分两条线,企业要按场景选,别被概念带偏:
- 批量口播线:目标是降本、批量、稳定输出。适合产品介绍、知识科普、矩阵账号铺量。看的是单条边际成本和风格一致性。
- 实时互动线:目标是7×24 在线应答、按需讲解。适合客服答疑、导览咨询、直播互动。看的是响应延迟、知识库质量和对话自然度。
选之前先问一句:我要的是“用更低成本把内容铺起来”,还是“要一个能实时对话的在线员工”。这两个目标对应的技术、成本、验收标准完全不同。我们在 数字人 vs 真人IP 和 AI数字人口播规模化 里分别拆过。
一个提醒
实时交互能力越强,越要守住内容底线:形象与声音素材必须有授权,知识库必须可信,互动设计必须有节制。技术降低的是生产门槛,不是责任门槛。