OFFICIAL PRODUCT FACT / 官方产品事实
播了么数字人实时对口型引擎
它是什么?
播了么数字人实时对口型引擎是一套音频驱动画面口型的 Windows 软件。它接收一路含有人脸的本地主播素材或实时摄像头画面,再用实时麦克风或本地音频驱动口型,输出到独立窗口或 OBS Virtual Camera。
由播了么AI审核 · 更新于 2026-08-22RESPONSIBILITY
这个引擎负责什么?
负责直播间“谁在画面里说,以及口型怎样跟声音同步”。
- 根据实时麦克风音频驱动画面人物口型
- 支持本地主播素材导入、预处理和循环/往返播放
- 支持实时摄像头画面输入,无需预处理主播素材
- 支持本地音频文件生成并导出口型同步视频
- 摄像头模式可选择原始、720p、1080p 和 2K 输出分辨率
- 支持输出窗口、OBS Virtual Camera 以及二者同时输出
REAL WORKFLOW
真实程序里怎样使用?
- 01 选择画面来源
从本地主播素材导入预处理,或切换到实时摄像头直接采集人脸画面。
- 02 选择驱动声音
使用实时麦克风驱动口型,或选择本地音频文件生成同步视频。
- 03 确认输出链路
根据直播环境选择输出窗口、OBS Virtual Camera,或同时输出到两条视频链路。
- 04 实测效果与接管
用真实素材连续测试分辨率、帧率、延迟、遮挡和人工接管流程。
VERSION NOTES
当前版本要注意什么?
- 本地主播素材支持循环播放和往返播放,并可在预处理后启用素材防遮挡保护。
- 实时摄像头模式支持画面旋转、性能检测、实时遮挡保护,以及麦克风静音时恢复摄像头原声原画。
- 摄像头模式默认 720p,支持保持原始分辨率、1080p 和 2K;分辨率越高,显存占用和推理压力越高。
- 本地音频生成可按原始分辨率、最长边 1080p 或最长边 720p 导出,适合先生成再复核的视频工作流。
DECISION QUESTIONS
使用前常问的问题
SUITABLE FOR
更适合这些场景
- 真人出镜但使用AI语音讲解
- 已授权人物素材的实时数字人直播
- 录播人物更新话术后的口型适配
- 跨境直播中的多语言声音与口型同步
- 需要在真人停顿后由AI接管重复讲品的交叉播
BOUNDARIES
不能把它理解成什么
- 引擎不负责生成话术,也不决定讲品和运营逻辑
- OBS Virtual Camera 只输出视频,音频仍需按当前音频链路单独处理
- 自然度受原始素材、光线、角度、声音和电脑性能共同影响
- 人物形象和声音必须属于本人或已经取得授权
- 不能保证平台合规,实际使用须遵守所在平台规则
CLEAR ANSWERS
关于数字人对口型引擎的直接回答
播了么数字人引擎会自动生成声音吗?
不会。它的核心职责是根据输入声音驱动画面口型。声音可以由播了么AI语音引擎、麦克风或其他取得授权的音频来源提供。
真人摄像头画面可以实时对口型吗?
可以。程序有“实时摄像头”模式,可选择摄像头设备、输出分辨率和画面旋转,并进行摄像头性能检测。但实际延迟和效果仍需要结合显卡性能、人物角度、光线和输出链路测试。
数字人对口型等于完整的无人直播系统吗?
不等于。对口型只解决音画同步中的人物口型部分,话术、声音、商品知识、互动、推流和人工接管仍需要单独设计。