INPUTS / 对口型输入

数字人实时对口型需要哪些输入?

直接答案

数字人实时对口型需要四项基本输入:一路包含清晰可识别人脸的画面、一路本人或已授权的合法音频、满足目标分辨率和帧率的电脑性能,以及目标直播平台允许的采集或推流链路。最终效果还受人物角度、光线、声音和网络影响。

由播了么AI审核 · 更新于 2026-08-27

ONE-MINUTE DECISION

一分钟判断

  1. 01

    先用正脸、清晰、光线稳定的画面测试

  2. 02

    声音必须属于本人或取得明确授权

  3. 03

    按目标分辨率、帧率和推流链路测试延迟

01

画面输入

当前程序提供本地主播素材和实时摄像头两类入口。本地主播素材需要先导入并预处理;实时摄像头模式会直接采集摄像头人脸画面。人脸越清晰、角度越稳定、遮挡越少,越容易获得稳定口型。

02

音频输入

当前程序提供实时麦克风驱动和本地音频生成。声音可以来自播了么AI语音引擎、真人麦克风或其他合法音频来源,但对口型引擎只根据声音驱动画面,不负责判断话术内容是否准确。

03

性能与输出链路

实时生成会占用计算资源。当前程序可输出到独立窗口或 OBS Virtual Camera,其中 OBS Virtual Camera 仅输出视频,音频仍需按直播间实际声卡、软件或平台链路处理。应在实际电脑上测试分辨率、帧率、生成延迟和推流稳定性。

SOURCE & REVIEW

来源与审核

本页由播了么AI依据产品事实与公开用户手册整理,由子龙 Zeelong 审核产品定位和能力边界。 动态平台支持、版本功能和操作步骤以带更新时间的用户手册为准。

LET'S TALK

聊聊你的
直播场景。

你可以先发产品、直播平台和目前遇到的问题。不急着谈软件,先看看这套方案是否适合你的业务。

电话 / 手机 187 9800 0692
子龙 Zeelong 的微信二维码,扫码添加好友
WECHAT 微信扫码,备注你的直播场景