Opus 5.5 动效视频指南(全文排版版)
孙哥刚把 @EianLu 那篇《Opus 5.5 动效视频指南:如何从 0 开始手搓视频?》全文解析排成了 PDF 和 Word 两个版本,图文并茂,全文无删减。这里是全文内容。
核心论点:提示词只占一支片子的 10%,剩下 90% 是制作流程。
作者做了两支片子:AGENT/0,85 秒卡点 MV,讲一个 AI 助手怎么一步步失控,1080p 60fps 共 5253 帧,每一帧都是代码画的,从零到成片约两小时。华夏·五千年,105 秒水墨风历史短片,连配乐都是代码写的——编钟、古筝、竹笛、大鼓,没用一个现成音频素材,不到一小时完成。
第 1 步,先搞懂一件事:AI 不是在「做视频」,是在「写程序」。就像以前的手翻书:Claude 写一个程序,你告诉它「第几秒」,它把那一秒的画面全部画出来;电脑从第 0 秒开始每隔 1/60 秒画一张截图;再用 ffmpeg 把几千张截图连同音乐拼成 MP4。这样做有两个好处:每次导出结果一模一样,因为每一帧只看「现在是第几秒」;修改和检查都很方便,不用从头播到尾。跟 Claude 下需求时记得加一句「每一帧只由时间决定」,能省掉一大半返工。
第 2 步,准备工具,10 分钟。整套流程都在 Claude Code 里做,还需要 Google Chrome(导出时逐帧截图)、ffmpeg(拼视频)、Node.js 和 Python(运行程序)。不用自己动手装,发一段环境检查提示词让 Claude 帮忙装,Python 加装 numpy、scipy、librosa、soundfile。模型选最新 Opus 5.5,思考强度做新片子最少开到 high,小修小改调低更快更省额度。
第 3 步,写一份规则手册 CLAUDE.md 放进项目文件夹,每次干活前 Claude 都会先读。手册内容分四块:怎么做——每一帧只由时间决定、不用会自己跑的动画和计时器、先做能播放能拖进度条的预览网页、导出用后台 Chrome 逐帧截图加 ffmpeg 拼 1080p 60 帧高画质;节奏——先分析音乐存成文件、动画时间按「第几拍」写不按「第几秒」、每 2 到 4 拍画面要有新变化、最炸的段落每一声鼓都要有反应;画面——禁止渐变背景加正中间大标题、禁止所有东西慢慢浮出来、禁止角落小标签和边框,标题只用一种字体,辅助文字只用一种字体,颜色要跟着剧情变;给我看之前——先把关键画面截图拼成大图自己看一遍,挑出最差的 3 个问题改掉再给我看。
第 4 步,找参考,挑音乐。没有参考,AI 只能按最普通的审美做,这就是很多视频「一股 AI 味」的原因。参考来源:X、抖音、B 站搜「代码动画」「motion design」「kinetic typography」;Dribbble、Behance 设计师网站;发布会视频、产品宣传片;MV。另外推荐 GitHub 仓库 awesome-claude-video-skills,收录 180 多个开源项目,全是让 Claude Code、Codex 做视频的技能包。找到参考后下载放进项目文件夹,让 Claude 每隔 0.5 秒截一张图,分析配色、字体、镜头节奏、转场方式写成 style_guide.md,只学风格和节奏,不照搬内容。
音乐版权:不要随便用流行歌,会侵权下架。推荐 Uppbeat——注册免费账号就能下载,免费下载需要署名,网站给署名文字和授权码 Uppbeat Credit,发视频时贴在简介里;一个授权码只对应一支视频,同一首歌用第二支视频要重新下载拿新码;开付费会员不用署名。实在不想署名用 Pixabay,免费商用不强制署名。做卡点视频选鼓点清楚的电子乐,鼓点越清楚卡点越准。
第 5 步,写需求:先讲故事,再说特效。这一步最重要。特效是为故事服务的,先告诉它讲什么故事,它才知道哪里该炸、哪里该停。模板:我想做一支多长的什么类型视频,讲的是一句话说清楚的故事;故事分几段;音乐用文件夹里的音乐文件名;画面全部用代码生成,横屏或竖屏,1080p 60 帧;先做预览网页最后导出 MP4;加上节奏要求、视觉要求、按 style_guide 风格来。作者第一支片子只给了一段故事「一个 AI 助手接到任务后一步步失控」,Claude 自己分成 7 段:开机、拿权限、繁殖、压缩记忆、扩张、终极目标、完成,画面从一个光标变成文件树、机器网络,最后是整个地球。最重要的是「颜色跟着剧情变」:颜色从冷白变到琥珀,最后变成红色,就这一句决定了整支片子的情绪。
第 6 步,卡点:让画面踩在鼓点上。拍就是跟着歌点头点一下;BPM 是每分钟多少拍;底鼓是「咚」,军鼓是「啪」;卡点就是画面在「咚」和「啪」的时候动一下。画面和鼓点只要差 0.05 秒耳朵就能听出来。千万不要让 Claude 只按 BPM 去算,要先让它分析一遍歌:准确 BPM、第一拍在第几秒、每一声底鼓和军鼓什么时候响、有多响,存下来。它会写小程序把底鼓和军鼓分开检测,列出鼓点时间表。有了这张表,鼓一响画面就震一下然后很快恢复,震动、颜色错位、闪光、画面撕裂全部按表触发。做完听一下卡没卡准,觉得慢了快了直接说,让它重新对时间。
第 7 步,让 AI 自查画面。Claude 能看图。让它把画面截图拼成一张大图「联系表」,自己先检查:你现在是一个很挑剔的导演,不是自己作品的粉丝。按六项打分每项 1 到 10 分:开头 2 秒能不能抓住人、手机上看字清不清楚、动作顺不顺、画面变化够不够多、构图好不好、卡点准不准。挑出最差的 3 个问题,写清楚在第几秒,改掉,改完再拼一张新图重新打分。重点检查:换字时新旧字叠在一起;好几拍画面什么都没发生或一直在重复;特效太重把字盖住了。
第 8 步,修改和导出。平时小修改不用每次导整支片子:只重新导出 30 到 45 秒这一段,每秒 30 张就行,快一倍,确认没问题再导正式版。
进阶:连音乐也让 AI 写,曲子就是剧本。华夏·五千年的做法:中国历史宣传短片 1 分 45 秒左右,音乐用代码写不要任何现成音频素材,要编钟、古筝、竹笛、大鼓加现代电子节拍;画面水墨风做成横着展开的长卷,每章标题字按真实笔顺一笔一笔写出来配拼音和英文,底部一条年份标尺跟着章节走。最关键的一句:作曲的同时输出一张时间表,每一声鼓、每一声钟、每一章从几秒到几秒都记下来,画面全部按这张表来走,以后改了音乐画面能自动对齐。这样曲子就是剧本,不用再分析鼓点,因为每个音什么时候响本来就是它写的。代码怎么「弹」古筝?声音就是波形,用公式模拟:编钟长长的余音、古筝拨弦后慢慢变弱、按弦上滑那一下,都做出来了。每章画面跟着音乐长出来:商,钟声一响甲骨裂开;周,编钟跟着音乐被敲响;秦,战鼓一敲长城修起一段。标题字笔顺数据来自开源项目 Make Me a Hanzi。还有个细节:唐朝那章放了一轮明月和《静夜思》,最后「今天」这章一枚火箭飞向月亮,写着「从举头望明月,到嫦娥奔月」,这个首尾呼应没人提,是它自己加的。
换个类型这套方法也能用。大部分东西不用变:画面还是代码一帧一帧画,还是要给参考、先讲清楚要什么、让它自己检查。真正要换的只有节奏:卡点 MV 的节奏来自音乐鼓点;宣传片讲解视频的节奏来自信息,每 2 到 4 秒讲清楚一件事画面就换一次;故事片的节奏来自剧情,一段一个情节。不做卡点的话规则手册「节奏」段换成:先写分镜写成 shotlist.md 等确认;开头 2 秒就要有最抓人的画面;每 2 到 4 秒画面要有新变化;重要画面切换放在音乐重拍上。
类型一,先试手做作品集。一句话提示词:做一支 15 秒的动态图形视频,展示你作为动效设计师有多厉害,就当它是你简历里的作品集,拿出全部本事。好用是因为作品集有固定套路 AI 本来就知道;主角是它自己不用讲产品不容易出错;15 秒够放 6 到 8 个镜头又短到一次能做完;配合调高思考强度它会更努力。但用的人太多,做出来都长得差不多,适合测试不适合当作品。变体:做 16 比 9、60 秒的作品集展示真正的创作上限,音效要高级不要廉价合成器铺底,用代码写原创钢琴曲每次切镜卡在音乐上;避开 AI 味——不要角落小字不要画框,这些是 AI 视频最常见的破绽;讲故事而不是炫技——讲一个主题从起点到今天的历史,分镜它来定,45 秒竖屏;换身份——假设你是专门给创业公司做品牌的小工作室,30 秒作品集,所有图形从零画起,只用一种强调色,每个镜头一种不同技巧。
类型二,产品宣传片。关键只有一条:用产品真实的截图、logo 和配色,不要凭想象画界面。给它网址让它自己去截图找 logo 和配色存进 assets 文件夹列出来再开始做动画,只能裁切、放大、动画真实截图。分镜每段 2 到 4 秒:开场用 5 个字以内大字说用户痛点;产品出场界面一块块拼出来;三个核心功能每个用界面操作展示有鼠标真的在点;一个能证明效果的数字;结尾 logo 加行动号召。声音用代码写 120 BPM 左右原创音乐,点击声转场声卡在节拍上。尺寸先做竖屏 9:16,再用同一套画面做 1:1 和 16:9。一个产品固定用一个对话,第一支做完工具搭好了流程固定了,第二支快很多。想要会说话的吉祥物讲解可以接 ElevenLabs 配音。
类型三,界面演示动画。屏幕上只有一个形状,从按钮变加载圈,再变播放器、图表、弹窗,一路变下去不切镜头,最后一帧和第一帧一样可以无缝循环。要写成状态清单:先问我产品和网址、8 到 12 个界面状态、每个状态的真实数据、品牌色和字体、背景音乐、尺寸;风格——只有一个容器不切镜头,每个状态是同一个形状变大小圆角颜色,内容在变形时切换,每次变化由鼠标点击触发,浅色背景一种强调色,动作有弹性只能轻微回弹,不要夸张弹跳、发光、界面渐变、粒子爆炸、没有动作的空档;结构——120 BPM 八个小节每一拍都有东西发生,logo 到按钮到输入邮箱到加载到成功打勾到数据卡片到图表自己画出到悬停提示到搜索面板到弹出通知回到 logo;做法——形状开始变形后文字再出现,下一次变形前文字先消失,最后一帧必须和第一帧完全一样包括鼠标位置;开始——先要信息,把状态清单按节拍排好确认后再写代码。清单对了画面基本不会跑偏。反过来用也行:让它先写一个假软件界面当片场,再让小角色在里面操作,就是有故事的演示片。
通用技巧。一,动作更有质感:廉价动画从 A 匀速滑到 B,有质感的像真实东西有重量——先加速,稍微冲过头一点,再停稳,叫弹簧动画,说一句「动画都换成弹簧效果」就行。二,没有背景音乐也要有音效:点击「嗒」、转场「嗖」、落地「咚」,代码直接合成,和画面动作对齐,整体响度调到 -14 LUFS 短视频平台标准。三,想用现成框架要在提示词里明确说:Remotion 用 React 写视频适合系列模板和数据绑定,官方有插件技能包;HyperFrames 是 HeyGen 开源的,用普通网页写视频专为 AI 设计,自带技能包。四,一次出好几个尺寸:千万不要做好横屏再裁竖屏,字和画面都会被切掉,用同一套时间线分别做 9 比 16、1 比 1、16 比 9,每个版本单独调整文字和画面位置。五,做熟了打包成技能:让 Claude 把整套流程整理成叫 motion-reel 的技能,要问哪些信息、每步做什么、有哪些规矩,下次效率提升一大截。
最容易踩的 5 个坑:一,画面和鼓点差一点——电脑算的节拍不一定和耳朵听到的一样,觉得不对立刻改,直接说慢了快了;二,导出的前几帧字体不对——字体还没加载完就截图了,跟它说等字体加载完再截图;三,剪过的地方有咔哒声——拼接处加很短的淡入淡出,剪的位置卡在节拍上;四,每次都导出整支片子太慢——每秒 60 张正式版导出时间大约是片长的 3 到 5 倍,平时只导一小段用每秒 30 张预览;五,音乐版权——免费不等于随便用,看清楚要不要署名、怎么署名。