Skip to content
TopicTracker
来自 HackerNews查看原文
译文语言译文语言

交互式虚拟形象

交互式虚拟形象是Synthesia平台提供的一项功能,允许用户创建能够与观众进行实时互动的AI虚拟人物。这些虚拟形象可以回答问题、提供信息并参与对话,从而提升视频内容的参与度和个性化体验。该技术广泛应用于企业培训、客户支持和营销等领域。

背景速读

Synthesia 是一家总部位于伦敦的 AI 视频生成初创公司,估值超过 10 亿美元,主要面向企业客户(如亚马逊、沃尔玛、Accenture)制作虚拟主播视频。其核心产品是"AI 数字人"——由真实演员授权录制后,用生成式 AI 合成出的虚拟形象,用户只需输入文本即可生成一段该形象出镜的讲解视频。 - 传统上,Synthesia 的 AI 主播只能单向念稿(输入文字→输出视频),无法与观众互动或实时响应。 - 新推出的"交互式数字人"功能的最大突破是:AI 形象可以实时理解用户的口头或文字提问,并基于 Synthesia 背后的语言模型(推测基于 GPT 类大模型或自研方案)进行自然语言回复,同时保持唇形同步、面部表情和手势。 - 这意味着 AI 主播的角色从"录像"变成了"现场对话者"——可用于培训问答、销售接待、内部客服等场景,不再需要真人实时在场。 - 竞争背景:HeyGen、D-ID、Colossyan 等对手也在做类似 AI 数字人,但实时对话 + 高度合成的自然动作仍是差异化难点;OpenAI 的 GPT-4o 展示的实时语音对话能力进一步拉高了用户对该类产品的预期。

相关报道