是否曾觉得高质量的视频内容触不可及,除非您有摄制组、录音棚和丰厚的预算?想知道独立创作者和小团队如何突然之间在不雇用编辑、配音演员或动画师的情况下制作电影式内容吗?

在本文中,您将了解如何使用Google Veo 3,从设置账户和故事板到掌握提示结构、声音一致性和后期制作流程。您将了解像Google Whisk和ElevenLabs这样的工具如何提升质量、管理成本并开启新的创意可能性。

一. 为什么营销人员应该使用AI视频创作工具

直到最近,制作高质量视频内容意味着需要克服重大限制。独立营销人员和创作者面临着剧本能力、分镜技能、人才招聘、专业编辑要求和动画能力等方面的限制。这些障碍使得复杂的视频制作往往只能对那些拥有大量资源的人开放。

Leslie Samuel,人工智能爱好者和互动生物学创始人,利用 Google Veo 3 改变了他的视频创作方式,从传统的制作方法转向了 AI 驱动的创作。

现在,任何企业、营销团队或内容创作者都可以制作以前只属于大型制片公司和大型制作公司的内容。这一转变意味着你的想象力成为主要限制,而不是你的预算或技术技能。

二. 关于使用谷歌Veo 3 你需要知道的事项

什么使 Google Veo 3 与其前身区别开来的是视觉质量的显著提升以及先进的音频功能。该平台可以生成内容,其中角色会说话,动物会交流,背景音乐会播放,音效会增强观看体验。与早期显得明显人工的 AI 视频尝试相比,现实感有了显著演变。

Veo 3 创建的八秒视频剪辑可以组合成更长的作品,为内容创作者提供前所未有的灵活性。

每个八秒的短片可以包含您能想象的任何视觉风格,从照片真实的影片到皮克斯风格的动画,因此您可以创建动画、产品视频、故事内容、教育材料和视频广告。

通过将这八秒的片段串联在一起,您可以创建引人入胜的叙述、全面的产品演示、教育内容或任何您想象的视频格式。美妙之处在于8秒片段提供的细致控制——如果某个片段未能达到您的期望,您可以重新生成该特定部分,而不影响整个视频。

 Google Veo 3账户计划的费用

Google Veo 3并不是一项免费服务;信用系统作为视频生成的货币。不同类型和质量水平的视频需要不同数量的信用。

使用 Google Veo 3 时,您可以选择快速模式,每个八秒的片段约需二十个积分,或质量模式,每个片段收费一百个积分。

萨缪尔建议通过您的个人Gmail帐户使用Google Veo 3,并配合Google的人工智能计划。这些计划可让您访问他在视频制作过程中使用的其他人工智能工具,例如Google Flow和Google Whisk。

使用专业计划,您可以使用快速模型生成五十个视频片段。此分配允许进行大量实验和内容创建,同时保持成本效率。

超级计划提供显著更多的生成能力,非常适合需要制作大量视频内容的重度用户或专业内容创作者。

三. 如何使用谷歌Veo 3创建优质视频

塞缪尔将人工智能视频创作视为一项战略过程,而非自发的实验。视频的实际生成是他的最后一步。他从预制作和规划开始。

1. 使用Gemini进行视频分镜和剧本开发

首先定义你视频的目的。塞缪尔问自己一些基本问题:这个内容是为了推广一个活动吗?它展示了一项服务吗?它会娱乐或教育你的观众吗?这种清晰度驱动了创作过程中每一个后续决策。

一旦视频的目标确立,塞缪尔便开始全面的分镜头和剧本开发,首先创建完整的叙事结构。他发展情节,撰写完整的剧本,并在考虑单独场景之前建立内容流。

塞缪尔随后将完整的故事分解为单独的场景,每个场景代表一个八秒的片段。这种分段需要仔细规划,以确保叙事的连贯性和片段之间的逻辑推进。

在这个阶段,塞缪尔利用谷歌双子星来帮助生成创意、开发剧本和创建详细的场景描述。他与人工智能保持持续对话,迭代地完善概念,直到它们与他的创意愿景对齐。

例如,在为他的生物频道开发内容时,塞缪尔可能会告诉双子座:

I want to do an animated series for my biology YouTube channel. Can you help me come up with a few different ideas that can work?

从双子座的建议中,他选择了一个系列概念,然后请求更详细的发展创意。

This idea about an immune system squad scouring the body and trying to figure out what these foreign invaders are—can you give me some examples of topics that would work well there?

协作过程继续进行,塞缪尔请求具体的制作元素,如脚本、故事板创意、初始视频生成提示等。

到了前期制作结束,塞缪尔拥有完整的脚本、详细的故事板以及每个独立场景的初始提示。这种准备显著提高了他最终输出的质量,同时减少了实际视频生成过程中所需的迭代次数。

2. 使用双子座创建角色DNA档案,以保持角色一致性和声音发展在您的视频中

创建多场景AI视频时最具挑战性的方面之一是保持各个八秒片段中角色外观和声音的一致性。

塞缪尔的解决方案集中于他所称的角色DNA——每个角色的视觉和音频特征的极其详细描述。这些描述确保在AI生成每个新场景时,它有全面的参考信息以保持角色的一致性。

字符的 DNA 发展过程开始于要求双子座创建角色外观的详尽描述。塞缪尔要求涵盖身体特征、服装、表情和任何区别性特征的细节。这些描述越具体,角色在多个场景中出现一致的可能性就越大。

同样重要的是制定详细的声音描述。塞缪尔要求双子座不仅要描述角色应该听起来如何,还要具体的声音特征、说话模式和音频特性。

在从一个场景转到下一个场景时,塞缪尔在生成的每个场景的每个提示中都包含完整的角色DNA档案,以确保一致性。

3. 使用Google Whisk测试视频提示,然后在Veo 3中生成视频

在将积分投入Google Veo 3的视频生成之前,Samuel利用Google Whisk进行战略测试,该平台是一个图像生成平台,与Veo的图像生成系统共享基础技术。

Google Whisk作为一个预览平台,Samuel可以在他投入昂贵的视频生成之前测试他的场景提示。Whisk使用类似于Google Veo 3的图像生成特性,但成本要低得多,为这种实验和改进提供了理想的环境。

测试过程始于将剧本创作过程中开发的场景提示输入到 Google Whisk。如果生成的图像符合 Samuel 的构想,他知道该提示可能在 Google Veo 3 中效果很好。如果图像不符合预期,他可以迭代和优化,而不会消耗宝贵的视频生成积分。

当Whisk产生不理想的结果时,Samuel将生成的图像和具体反馈返回给Gemini。他可能会说:

This prompt gave me this image. I don’t like it because the blood cell that it created looks a little weird. Can you tweak the prompt so that it can look more like the way that I want it to look?

这种迭代的精 refinement 继续,直到Samuel为所有场景提示实现期望的视觉效果。只有在那时,他才有信心地继续使用Google Veo 3,确保他的提示将生成令人满意的结果。在完成这项前期工作后,他通常只需一到三次尝试就能成功生成视频,显著减少信用消耗和挫折感。

4. 使用Veo 3制作视频

当你准备生成你的第一个视频剪辑时,从Google Flow中访问Google Veo 3,并选择你的视频创建选项。

4-1. 文本到视频生成 

大多数创作者会发现文本到视频生成满足他们的需求,尤其是在使用谷歌Veo 3时。此方法提供卓越的结果,同时保持简单的工作流程,无需额外的图像创建或复杂的设置程序。

开始将您的前期制作元素汇总成一个全面的提示,其中包括场景描述、角色DNA(详细的视觉描述)、声音DNA(详细的音频特征)以及场景的具体对话或动作。

场景描述应包括环境细节、光照条件、摄影角度以及任何相关背景信息。

你还应该明确音频要求。虽然 Google Veo 3 可以生成背景音乐和音效,Samuel 通常指示系统只关注角色对话和基本场景音频,以防止不同背景音频元素之间发生突兀的切换。

这一指示的理由与后期制作控制有关。Samuel 更倾向于在后期制作中使用你喜欢的视频编辑工具添加音乐和音效,而不是接受AI生成的任何背景元素,从而确保最终视频中平滑的过渡和一致的音频。

Here is the scene: [detailed scene description]. Here is the character description: [comprehensive visual details]. Here is what I want the character to say: [specific dialogue]. Here is the voice description: [detailed audio characteristics]. Create this scene with character dialogue only, no background music, no sound effects, no ambient audio.

接下来,选择生成模式。您可以选择快速和高质量。

在 Google Veo 3 的快速和高质量模型之间的选择会影响成本和输出特性。塞缪尔一直使用快速模型,因为质量差异不足以证明高质量模型五倍的成本。

4-2. 帧到视频

对于希望最大限度控制视频输出的创作者,Google Veo 3 的帧到视频功能允许您使用照片、人工智能生成的图像或任何视觉内容作为视频创作的基础。人工智能分析提供的图像,并基于您的额外提示创建运动、动画和视觉叙事。

Samuel认为这种方法是“在角色一致性方面的终极选择”,因为它从你想要的视觉效果开始,而不是寄希望于文本描述能生成合适的图像。当你控制输入图像时,输出的一致性和质量会大幅提高。

前期制作工作始于使用Google Whisk创建精确的图像。Samuel在Whisk中设计单个角色、背景和完整场景,不断迭代,直到他实现自己所期望的视觉风格和角色外观。

然后他开发描述图像应如何动画、角色应说什么以及场景中应发生哪些动作的提示。

这种方法使复杂场景的创建成为可能,Samuel可以在动画开始之前设计特定角色的互动、环境细节和视觉构图。他可能创建一幅展示两个角色在特定环境中的图像,然后通过逐帧的视频过程对他们的对话和互动进行动画处理。

虽然与文本生成视频相比,帧转视频需要额外的准备时间,但结果证明了这一投资对优先考虑视觉质量和一致性的创作者是值得的。

一旦对静态图像满意,Samuel通过Google Flow将它们导入Veo 3,选择帧转视频选项,然后生成他的剪辑。

专业提示:使用ElevenLabs的帧到视频功能,从真实人物的图像和声音克隆创建视频

Samuel对使用个人照片作为帧到视频生成的输入进行了广泛实验,使Veo 3能够为对话创建合适的嘴唇同步和面部动画。初始音频听起来不像他,但视觉元素已正确同步。

他将最终视频上传到 ElevenLabs,并从生成的视频中提取原始音轨,通过 ElevenLabs 的语音克隆系统处理,将原始的 AI 生成声音替换为他声音的克隆版本,保持相同的时序、韵律和对话内容。

该工作流程要求事先对目标人物的声音特征进行训练。一旦训练完成,系统可以在保留原始时序和同步的情况下交换声音,从而生成同时展示该人物实际外貌和真实声音的视频。

对于希望创建包含实际团队成员或发言人的个性化内容的企业,这种方法提供了一条通往专业质量视频制作的途径,而无需传统的拍摄要求。

5. 使用 Google Flow 下载您的 Veo 3 视频

Google Veo 3 根据您访问平台的方式以不同分辨率生成视频内容。

使用Gemini直接使用该工具时,输出分辨率为720p。然而,通过Google Flow访问Veo 3提供了额外的选项,包括将内容升级到1080p的能力。

根据塞缪尔的说法,提升的内容“看起来与原始内容完全相同”,但分辨率更高,适合专业应用和现代观看标准。

对于计划在多个平台上使用其内容的创作者来说,1080p 与 YouTube、社交媒体平台和专业演示环境具有出色的兼容性。质量水平超越了许多智能手机拍摄的视频,同时保持了使 AI 视频创作具有吸引力的制作效率。

文末:Deal说海外促销团队提供各区域Deal站和群组推广业务,业务范畴覆盖亚马逊,速卖通,沃尔玛,eBay等主流跨境电商平台以及独立站,目前和国内多家头部出海品牌均有合作,各位读者有需求的,可以联系我们对应同事,微信号:tmishi123

此外Deal说Friends系列业务提供各类亚马逊和沃尔玛店铺申诉服务,不成功不收费,可加急当天处理。有需要请加微信:julie20178