OFFICIAL PRODUCT FACT / 官方产品事实

播了么数字人实时对口型引擎

它是什么?

播了么数字人实时对口型引擎是一套音频驱动画面口型的 Windows 软件。它接收一路含有人脸的本地主播素材或实时摄像头画面,再用实时麦克风或本地音频驱动口型,输出到独立窗口或 OBS Virtual Camera。

由播了么AI审核 · 更新于 2026-08-22

RESPONSIBILITY

这个引擎负责什么?

负责直播间“谁在画面里说,以及口型怎样跟声音同步”。

  • 根据实时麦克风音频驱动画面人物口型
  • 支持本地主播素材导入、预处理和循环/往返播放
  • 支持实时摄像头画面输入,无需预处理主播素材
  • 支持本地音频文件生成并导出口型同步视频
  • 摄像头模式可选择原始、720p、1080p 和 2K 输出分辨率
  • 支持输出窗口、OBS Virtual Camera 以及二者同时输出
播了么数字人直播引擎本地主播、实时麦克风驱动和直播输出真实界面
真实界面:本地主播素材、实时摄像头、麦克风驱动、本地音频生成和 OBS Virtual Camera 输出入口

REAL WORKFLOW

真实程序里怎样使用?

  1. 01
    选择画面来源

    从本地主播素材导入预处理,或切换到实时摄像头直接采集人脸画面。

  2. 02
    选择驱动声音

    使用实时麦克风驱动口型,或选择本地音频文件生成同步视频。

  3. 03
    确认输出链路

    根据直播环境选择输出窗口、OBS Virtual Camera,或同时输出到两条视频链路。

  4. 04
    实测效果与接管

    用真实素材连续测试分辨率、帧率、延迟、遮挡和人工接管流程。

VERSION NOTES

当前版本要注意什么?

  • 本地主播素材支持循环播放和往返播放,并可在预处理后启用素材防遮挡保护。
  • 实时摄像头模式支持画面旋转、性能检测、实时遮挡保护,以及麦克风静音时恢复摄像头原声原画。
  • 摄像头模式默认 720p,支持保持原始分辨率、1080p 和 2K;分辨率越高,显存占用和推理压力越高。
  • 本地音频生成可按原始分辨率、最长边 1080p 或最长边 720p 导出,适合先生成再复核的视频工作流。

SUITABLE FOR

更适合这些场景

  • 真人出镜但使用AI语音讲解
  • 已授权人物素材的实时数字人直播
  • 录播人物更新话术后的口型适配
  • 跨境直播中的多语言声音与口型同步
  • 需要在真人停顿后由AI接管重复讲品的交叉播

BOUNDARIES

不能把它理解成什么

  • 引擎不负责生成话术,也不决定讲品和运营逻辑
  • OBS Virtual Camera 只输出视频,音频仍需按当前音频链路单独处理
  • 自然度受原始素材、光线、角度、声音和电脑性能共同影响
  • 人物形象和声音必须属于本人或已经取得授权
  • 不能保证平台合规,实际使用须遵守所在平台规则

CLEAR ANSWERS

关于数字人对口型引擎的直接回答

播了么数字人引擎会自动生成声音吗?

不会。它的核心职责是根据输入声音驱动画面口型。声音可以由播了么AI语音引擎、麦克风或其他取得授权的音频来源提供。

真人摄像头画面可以实时对口型吗?

可以。程序有“实时摄像头”模式,可选择摄像头设备、输出分辨率和画面旋转,并进行摄像头性能检测。但实际延迟和效果仍需要结合显卡性能、人物角度、光线和输出链路测试。

数字人对口型等于完整的无人直播系统吗?

不等于。对口型只解决音画同步中的人物口型部分,话术、声音、商品知识、互动、推流和人工接管仍需要单独设计。

LET'S TALK

聊聊你的
直播场景。

你可以先发产品、直播平台和目前遇到的问题。不急着谈软件,先看看这套方案是否适合你的业务。

电话 / 手机 187 9800 0692
子龙 Zeelong 的微信二维码,扫码添加好友
WECHAT 微信扫码,备注你的直播场景