WAIC 2026 释放的信号
2026 世界人工智能大会于 7 月 20 日在上海落幕,主题“智能伙伴 共创未来”,展览规模再创新高:1100 余家企业参展、3000 余项展品集中亮相、超过 300 款产品全球首发,覆盖大模型、人工智能体、智能计算、具身智能等方向。与往年“百模大战”的喧嚣不同,今年会场传递出的信号很一致:AI 的竞争重心正从云端参数比拼,转向实打实的落地体验。
从“一键成片”到“一人剧组”
央视在 WAIC 2026 观察中把短视频行业的变化归纳为六个维度:生产流程、叙事能力、创作者生态、跨境传播、交互形态、可信治理。其中最值得企业关注的是“交互形态”:AI 视频正在由固定成片走向可交互的“动态活内容”。
区别在于:过去是预先生成一段数字人视频,现在是每一帧都在线生成,并对用户行为即时反馈——一条弹幕可以触发角色反应,一次提问可以改变讲解路径,一个选择可以推动互动短剧走向不同情节。内容从创作者单向交付的“作品”,变成创作者、智能体和用户共同参与的“过程”。
实时交互模型密集落地
- 阿里 Wan-Streamer v0.1(6月26日):原生流式、端到端的全双工音视频实时交互多模态基础大模型,在单个 Transformer 架构内把文本、音频、视频的输入输出 Token 交织建模,模型端响应延迟低至 200ms。
- 生数科技 Vidu S1(7月3日):语音控制数字角色的实时交互式视频生成模型,支持语音实时控制、无限时长生成,消费级显卡即可实现 42FPS 实时交互。
- Xmax X2.0(7月15日):通用实时交互视频模型,支持实时重渲——CharX 实时换人(人变背景不变)、ClothX 实时换装、VibeX 实时换风格。
对企业意味着什么
最直接的:数字人从“能录播”走向“能直播互动”。过去数字人只能照本宣科,撑不住长时直播;实时交互能力成熟后,7×24 在线应答、按用户提问调整讲解,开始具备可行性。这对知识讲解、产品答疑、导览咨询类场景是实打实的增量。
但有个前提必须说清:实时在线不等于持续有价值。数字人越逼真,越需要清晰的人设、可信的知识库、经过授权的形象与声音素材,以及有节制的互动设计。没有内容积累与价值筛选,24 小时运转也只是重复输出无效内容。
冷思考:技术降低门槛,不降低标准
生成、复刻、批量投放门槛不断降低,风险也从版权争议扩展到虚假影像、声音仿冒、身份冒用、商业误导和低质内容泛滥。未来评价 AI 视频工具,不能只看生成速度、画面质量和成本,还要看内容能否清晰标识、过程是否留痕、侵权与虚假信息能否被及时识别。
我们现在能落地到哪一步
实时交互还在快速迭代,但批量口播内容生产已经完全可以商用:脚本、数字人出镜、字幕、多平台导出全流程跑通,把单条内容的边际成本压到很低。这是我们目前在跑的产线,见 AI内容与视频 和 宁波金融助贷AI口播样片。