
作者|亚娜
2026年WAIC现场,百度展区循环播放的一段视频,引来不少参会者驻足。

画面中,甲子光年创始人张一甲与量化分析师林深对坐而谈,金句频出。比对话内容更抓人眼球的,是两位数字人毫秒级的微表情演绎,生动程度足以混淆虚实。画面流畅到让多数观众浑然不觉,屏幕背后的那张脸完全是由大模型生成的。
过去一年,数字人正在加速渗透到视频内容创作领域。去年618期间,罗永浩团队试水数字人直播;今年世界杯期间,百度一镜携手可口可乐推出了“AI范志毅”实时互动数字人;海外健身顶流帕梅拉借助AI生成的能量棒广告内容。

这些实践表明,数字人已经逐步从概念走向直播、品牌互动、广告营销等多元场景应用中,高质量内容的生产门槛被进一步拉低。
但有一个考题却从未解决,数字人能应对带货场景中的对话配合,放到深度访谈里就接不住了。直播带货尚且可以靠语调和动作支撑起来,深度访谈中一来一回的互动、下意识的微表情、眼神的落点、接话的节奏,这些真人之间习以为常的细节,恰恰是数字人最难跨越的门槛。
百度一镜在WAIC展示的视频播客方案,正是对这一命题的产业级回应。

百度一镜数字人有多“逼真”?
视频播客的热度在近两年持续攀升,但在实际落地中仍面临诸多痛点。
真人访谈类节目的制作成本居高不下,从布景陈设、嘉宾邀约到设备租赁、后期剪辑各个环节都需要大量投入,且制作周期长、产出效率不高。现有数字人视频方案虽然能在一定程度上增效降本,但技术尚未成熟,数字人表情生硬、对谈缺乏交互感,画面合成痕迹过重,观众几乎一眼便能识破,无法沉浸其中。
在2026年WAIC现场,百度一镜首发的数字人视频播客之所以能引发关注,源于其在观感上已经较为贴近真人访谈,部分片段甚至足以“以假乱真”,引发了不少参会者关注。

光是微表情这一项,就能看出差距。 传统数字人在情绪转换上往往缺乏过渡,例如数字人从“振奋”到“沉思”几乎不带情感过渡,违和感十足。而百度一镜的视频播客中,林深在发表观点时会下意识挑眉,甲小姐在倾听对方观点进入思考状态时嘴角也会轻微下压,这类近乎人类本能反应的细节,让数字人有了“活人感”。

再看对话互动配合。 视频播客中双人访谈的难点从来不只是考验台词的完成度,而是在于双方之间的实时反馈。这段长约3分钟的对谈中,两人的互动节奏较为流畅。在林深陈述观点时,甲小姐会适时点头回应表达认可,视线始终稳定落在对方面部;当话题推进到关键节点,甲小姐会迅速反应调整并顺势接过话头,整体衔接没有明显的停顿或错位感。

最后是画面质感。市面上多数AI数字人之所以“一眼AI”,核心原因在于数字人皮肤太过光滑,滤镜太偏重,再加上人物与背景之间缺乏统一的光影逻辑,很容易造成人画分离的悬浮感。在这个视频中,两位数字人都保留了相对自然的皮肤纹理,眼角纹路和颧骨斑点未被刻意磨除,近乎1:1真人可隆,且人物与背景的光照方向也基本一致,合成感有所减弱。
简而言之,传统数字人在访谈场景中更像一套预设动作的执行工具;而百度一镜的这版方案,则更像一个有反馈的谈话对象。

根据百度公布的数据,使用该方案后,视频播客制作成本降低74%,制作效率提升至原来的近8倍,同时内容平均播放时长增加了29%。不难看出,这轮技术升级后,百度一镜至少在成本控制和用户留存两个维度上,为行业提供了可量化的参考。
而此次升级后的百度一镜,已不限于双人深度访谈,还支持单人讲解、多人圆桌讨论等场景。公开信息显示,百度一镜在财经短视频赛道已涌现多个爆款,多个由百度一镜生成的数字人财经主播视频播放量高达200w+。

同样是数字人,百度一镜改了什么?
AI数字人要做到真正意义上的“逼真”,关键不在于渲染精度,而在于行为逻辑是否经得起推敲。
市面上大量数字人产品之所以“一眼AI”,根源在于其行为逻辑是编程式表演。通过对输入内容做情绪标签分类,调取对应表情模版,结果是数字人表情转换缺乏过渡,情绪反应孤立,缺少连贯的人设支撑。
百度一镜给出的技术解法是,把数字人从执行指令的木偶,变成理解内容的演员。
这套逻辑背后,有三个值得关注的技术要点。
其一,文心大模型充当导演。
传统技术路线是Low-level控制,识别一句话的情绪倾向,匹配一个对应的表情动画。百度一镜升级到了High-level控制,不只看情绪,而是从六个维度综合评估,给出细粒度的表演指令。这项能力的底层基础是AU级(Action Unit)控制,把面部微表情拆解为上百个可独立调度的基本单元。

以“挑眉”为例,传统方案只能做"挑眉/不挑眉"的二元开关;而百度一镜可以通过“标签+自然语言描述”相结合的方式,控制挑眉的角度、速度、持续时间以及它与嘴角、眼神的配合关系。
这种控制粒度,相当于将导演的意图拆解为可执行的表演指令。
其二,专精模型确保导演的指令被执行到位。
文心大模型完成规划后,需要执行层将指令转化为画面输出。这部分的技术难点在两个维度:空间上,多个部位需要同步运动且互不干扰;时间上,表情变化的响应速度要足够快,否则就会出现声画错位。
百度自研的数字人专精模型,在空间维度实现了对数百个微表情单元的协同调度;在时间维度上,将表情控制粒度压缩到1秒以内,以确保语音节奏与面部动作精准对齐。这两项能力叠加,解决了此前数字人产品普遍存在的模态拼接失真问题。
例如,在可口可乐的一条AI范志毅广告TVC中,数字人先是自然注视主持人,随后从容抬起搭在膝上的双手,从口袋掏出手机,同时回答从未间断。整个过程中,目光、手势、语音三者精准同步,几乎看不出AI的痕迹。
其三,海量影视级数据“喂”出来的真实感。
数字人演技打磨需要靠高质量素材的喂养。百度一镜通过将大量影视级素材输入文心大模型,让模型理解每一帧画面内容,再经过多轮清洗、筛选、提炼,最终保留高质量样本用于训练。而训练数据的质量,直接决定了数字人在面对不同场景时能否做出恰当的反应。
经过高质量喂养和训练后,百度一镜生成的数字人演技得到了直观的提升。
三层技术叠加下,百度一镜数字人的语音节奏、面部表情、肢体动作不再作为三个独立模块运行,而是形成了一套统一连贯的表达系统。
需要指出的是,尽管这套方案已在单人讲学、双人访谈、多人讨论等场景中有所展示,量产稳定性和泛化能力仍有待更长周期的验证。但至少从技术路径上看,它为行业提供了一个值得参照的方向。

从视频播客到AI短剧,内容创作正式迈入“超级个体”时代
过去一年,AI视频生成行业普遍卡在同一瓶颈上:文生图像、文生视频热度不减,但生成人物表情依然僵硬,口型对齐仍有偏差;数字人直播虽已不少见,但能承载深度访谈内容的几乎没有。
百度一镜这次切入的,正是“微表情”这块最难啃的骨头。
拉长时间线来看,百度一镜过去一年的产品演进路径颇为清晰,场景边界持续外扩。
AI罗永浩时期,重点在于验证电商直播场景中数字人的真实感能否被用户接受;AI范志毅阶段,数字人从带货主播延展为可交互的品牌资产;WAIC现场展示的视频播客方案,则把双人深度访谈做成了可落地的产品形态。

其底层产品架构也在同步升级。目前,百度一镜已将直播、视频、互动三大板块整合为统一平台,背后的编剧Agent、导演Agent、剪辑Agent配合80多个Skill模块,共同支撑起从内容策划到成片输出的完整制作流程。
百度创始人李彦宏曾在Create大会上提出一个判断:“数字人就是看得见的智能体。” 当数字人具备了微表情表达能力,它的角色定位就不再是直播间的出镜工具,而是可以深度参与内容创作的基础设施。
这种基础设施属性,在一个容易被忽视的细节上体现得尤为明显。市面上多数视频生成工具仅能生成数十秒的片段,而百度一镜可以输出几分钟甚至数小时的连贯内容,同时支持实时互动,不在同一量级。

更重要的是,这套方案的使用门槛并不高。用户只需上传3分钟素材,即可1:1复刻本人的形象与声音,拍摄时间和制作成本被大幅压缩。
量级差异带来的是创作方式的根本变化。一个人加上百度一镜,就能完成以任意人物形象为主体的视频制作。场地、设备、嘉宾、剪辑,这些过去绕不过去的门槛,正在被逐一拆除。
视频播客验证了数字人在深度内容场景的可行性,尤其是被突破的微表情能力,让角色在对话中的情绪流露有了“真人感”的底色——同样的能力,正在向AI短剧迁移。一部十分钟的AI短片,创作者只需提供故事和创意,编剧、导演、剪辑三个Agent各司其职,百度一镜数字人负责把想法演绎出来。一部短剧的制作成本从数万元降至几乎为零,制作周期更是从数周压缩至数小时。
市场对这套逻辑已有初步反馈。据沙利文报告,百度一镜以8.1%的市场份额位列行业第一,产品综合实力排名同样居首,当前已经累计服务客户超10万,覆盖30多个行业。
从视频播客到AI短剧,数字人的应用边界还在持续外扩。若将视线放得更远,数字人在内容创作领域的最终形态,或许是一个“7×24小时在线的创作协作体”。
当创作不再受制于资源,表达的门槛便只剩下想象力本身。而想象力,从来不是技术能决定的。百度一镜正在做的,是把内容生产的主动权,从机构交还给个体。