先说结论
Wan Streamer 是阿里达摩院 7 月 16 号刚发的实时全双工多模态基础模型。打开摄像头跟 AI 视频聊天——AI 边听边回你自然的声音、口型跟说的话完全同步、还能边聊边做动作。端到端延迟 0.5 秒,几乎感觉不到卡顿。目前只发了论文和演示,1.0 版本后会公测开放。如果上线,会把现在的数字人赛道掀翻。
为什么跟别的数字人不一样
市面上 AI 数字人分两类:一类是提前录好的真人视频片段,根据问题匹配播放。不是 AI,是视频检索。另一类是模块拼接式——ASR转文字→LLM理解→生成回复→TTS转语音→口型同步→面部动画。每一环都有延迟和误差,最后看着就很不自然。Streamer 走的是完全不同的路线——一个 Transformer 同时处理文字+声音+画面。不经过语音转文字中间步骤,直接从音频和画面信号里理解你,同时直接输出声音+表情+动作。端到端 200 毫秒。面部表情和语音完全同步——同一个模型在同一个推理步骤里生成,不存在口型滞后。
v0.3:世界设定+事件流
把视频拆成两件事——世界设定(场景、AI长相、光线)不变,事件流(说话、动作、表情)随时间变化。世界设定只加载一次就持续推进。长对话场景下数字人的外貌和背景不会聊着聊着就变形。
自由行为——AI能做动作
别的数字人只能说话对口型。Streamer 的数字人能执行自然语言描述的动作——括号指令嵌在对话里,比如「(打开冰箱拿出鸡蛋) 好,我帮你把食材准备好。(打鸡蛋) 你看这个手法」。嘴巴说话、手操作物体、表情语气同步——三件事在一个模型里同时跑,不是预先录的动画。
基本信息
| 工具名称 | Wan Streamer |
| 项目官网 | wan-streamer.com |
| 开发商 | 阿里达摩院/万象团队 |
| 版本 | v0.3(2026年7月16日) |
| 延迟 | 550ms(模型200ms+网络350ms) |
| 状态 | 论文+演示已发,代码/API待1.0公测 |
相关导航
暂无评论...
