AI虚拟主播数字人技术实现Wav2Lip【附完整版教程】及【效果评测】

作者：寸_铁 | 2024-07-30 18:42:39

踩

wav2lip

前言
建议直接阅读飞书文档：Docshttps://yv2c3kamh3y.feishu.cn/docx/S5AldFeZUoMpU5x8JAuctgPsnfg

近期很多饱子私信，想知道关于AI数字人主播的技术实现。现本篇就AI数字人虚拟主播的Wav2Lip技术进行实现与评测，后续还会有其他的相关技术实现与评测。

本文主要实现图片说话（如下图的蒙娜丽莎）、视频融合语音（这里的核心都是人物口型与音频中的语音唇形同步）。主要通过将两个不相关的人的视频、音频，采用Wav2Lip技术，最终得到一个完整的视频文件，且视频的人物口型与音频内容一致。举例：小红的语音、加上小花的自拍视频，融合为一个最终的视频；那么小红在发出“啊”声音的时候，小花的嘴应该是张开的，以下是一张效果图），本文第四部分有完整的效果评测视频！

本文内容由网友自发贡献，转载请注明出处：https://www.wpsshop.cn/w/寸_铁/article/detail/904883