INPUTS / 对口型输入
数字人实时对口型需要哪些输入?
直接答案
数字人实时对口型需要四项基本输入:一路包含清晰可识别人脸的画面、一路本人或已授权的合法音频、满足目标分辨率和帧率的电脑性能,以及目标直播平台允许的采集或推流链路。最终效果还受人物角度、光线、声音和网络影响。
由播了么AI审核 · 更新于 2026-08-27ONE-MINUTE DECISION
一分钟判断
- 01
先用正脸、清晰、光线稳定的画面测试
- 02
声音必须属于本人或取得明确授权
- 03
按目标分辨率、帧率和推流链路测试延迟
画面输入
当前程序提供本地主播素材和实时摄像头两类入口。本地主播素材需要先导入并预处理;实时摄像头模式会直接采集摄像头人脸画面。人脸越清晰、角度越稳定、遮挡越少,越容易获得稳定口型。
音频输入
当前程序提供实时麦克风驱动和本地音频生成。声音可以来自播了么AI语音引擎、真人麦克风或其他合法音频来源,但对口型引擎只根据声音驱动画面,不负责判断话术内容是否准确。
性能与输出链路
实时生成会占用计算资源。当前程序可输出到独立窗口或 OBS Virtual Camera,其中 OBS Virtual Camera 仅输出视频,音频仍需按直播间实际声卡、软件或平台链路处理。应在实际电脑上测试分辨率、帧率、生成延迟和推流稳定性。
SOURCE & REVIEW
来源与审核
本页由播了么AI依据产品事实与公开用户手册整理,由子龙 Zeelong 审核产品定位和能力边界。 动态平台支持、版本功能和操作步骤以带更新时间的用户手册为准。