AIGC落地大型演出视觉:百米12K巨幕制作全流程拆解
尤栗Yuri这场演唱会视觉上最让人印象深刻的不是舞美装置有多复杂也不是灯光编程有多炫而是舞台正后方那块宽近百米、分辨率做到12K的巨型屏幕。说实话我第一次接到这个需求的时候第一反应是“这玩意儿真的是给人做的吗”。单张画面要接近一亿两千万像素还要铺满整个舞台背景这在传统CG流程里意味着几十个渲染节点连轴转好几个星期。但这次我们走的是另一条路——AIGC。从概念设计到分镜草稿再到最终上屏的画面成品生成式AI贯穿了整条制作链路。这篇文章就把这套“AIGC落地大型演出视觉”的完整流程拆开讲清楚。这件事适合谁来参考如果你是做演唱会、音乐节、大型晚会视觉的或者你在商业项目里想用生成式AI替代部分传统CG工作流再或者你只是好奇“AI生成的东西到底能不能真正上到万人场馆的屏幕上”——这篇文章都值得看完。我会把需求拆解、技术选型、实操流程、踩坑记录全部摊开来讲包括那些在项目总结里不会写进去的细节。1. 项目需求拆解为什么偏偏是“百米12K”1.1 12K不是噱头是屏幕物理尺寸逼出来的很多不太接触大屏工程的朋友听到“12K”会觉得是在堆参数。但如果你真的站在场馆内距离屏幕二十米的位置肉眼能分辨的像素密度其实远超一般人想象。百米宽的屏幕如果只做到4K一颗像素点摊开来大概有一厘米见方凑近看全是马赛克远景镜头一推上去画面就崩了。这次项目的屏幕宽度实测接近一百米高度约五米为了兼顾近景观众和远景导播镜头水平分辨率必须拉到12000像素以上最终我们定在12288×1024这个规格单帧像素总量约1260万——比8K还要高出近一倍。这里有一个大屏工程里的通用公式屏幕宽度米× 像素密度像素/米 水平分辨率。户外LED屏的合理像素密度通常在60~120像素/米之间百米宽的屏幕取100像素/米就是10000像素起步再考虑到信号传输的编码损耗和现场拼接屏的物理缝隙12K是一个安全余量充足的方案。这个规格意味着我们每一帧画面都要比普通电影级项目多处理两倍以上的数据量生成时间、缓存占用、渲染压力全部翻倍往上涨。1.2 传统CG流程的痛点不是做不出来是等不起百分之百用传统三维流程做这种规格的内容技术上完全可行。但算一笔时间账就明白了一个15秒的CG镜头从建模、贴图、灯光、动画到最终输出熟练的CG师至少需要两到三天。而一场演唱会通常需要八到十二个这样的完整视觉段落总时长按六十分钟算纯CG制作周期至少要排到四个月以上。再加上演唱会视觉有一个极其残酷的特点——所有视觉内容必须等歌单确认之后才能开始创作而歌单确认通常只比演出早六到八周。也就是说传统流程在这个项目里会面临一个无解的难题时间窗口就两个月按常规做法只能完成一半内容。AIGC介入后情况完全不一样了。我们用一个三人小组在六周内完成了十二首歌曲的全部视觉内容其中七成画面由生成式AI产出最终达到导播台直接推流上屏的交付标准。这也是这次项目最有价值的一点不是“用AI试试看”而是“靠AI把项目救下来”。1.3 这只队伍到底靠什么协作我们这个视觉小组总共三个人分工非常明确。我负责整体视觉方案和AIGC工作流搭建一位资深合成师负责所有画面的后期修复和调色还有一位三维设计师只负责AI生成结果的“打底”处理——也就是把AI出图的三维感不足的部分补上包括场景深度、空间透视和镜头运动。三个人两周出完所有分镜草稿六周完成全部正片输出。这是纯粹的工业化协作模式每个人只做自己最擅长的事把AI的产能和人工的经验结合在一起。2. 技术选型解析这套流程里的“地基”是什么2.1 生成模型Stable Diffusion为何成为主力市面上能用于图像生成的大模型不少Midjourney、Stable Diffusion、DALL·E各有优势。这个项目最终选择了Stable Diffusion作为核心引擎原因有三个每一个都是实际项目里绕不开的考量。第一分辨率可控性。Midjourney在很长一段时间里只能输出固定比例和固定分辨率的图片想要精确控制到12288×1024这种非标准规格需要多次外部放大和裁切画质损耗很麻烦。而Stable Diffusion配合ComfyUI可以精确设定每一个生成步骤的输出尺寸配合各类放大模型直接以目标分辨率出图中间环节少画质可控性高。第二工作流复现能力。十二首歌的视觉内容每一首都可能需要五到十张主视觉图来支撑。这些图不能是完全独立的风格必须保持统一的视觉语言。Stable Diffusion生态里的LoRA微调模型和ControlNet结构控制可以做到“同一个风格框架下生成不同内容”而Midjourney的风格一致性相对更难精确控制。第三可控性工程化。这一点最关键。演出画面的构图必须预留屏幕拼接缝、必须保证关键视觉元素避开人物站位区、必须让画面风格跟现场灯光色系匹配。这些需求对应到Technical层面就是ControlNet的lineart、depth、canny等控制条件Stable Diffusion这套体系是现成可用的。Midjourney再怎么调Prompt也做不到像素级的结构约束。2.2 ComfyUI节点式工作流的优势在工具的最终选择上我们用的是ComfyUI而不是更常见的AUTOMATIC1111 Stable Diffusion WebUI。最大的原因是节点式工作流在“批量生产”这件事上的效率碾压。演唱会视觉有个特点不是做一张图而是以“组”为单位生产。比如一首歌五分钟每十秒到十五秒需要切换一次主视觉那就是二十到三十张图。这些图之间必须保证风格统一、元素连贯、色调协调。WebUI的操作逻辑是一张一张来手动调参手动切换模型ComfyUI则是把整个流程做成一个图所有参数在节点里预设好输入不同Prompt一键批量跑完整个流程。另外ComfyUI的显存管理机制比WebUI好很多。在12K这种量级的高分辨率生成场景下我们经常需要用Tiled VAE把图像分块解码这一块ComfyUI天然支持得更完善。如果你的项目也涉及高分辨率大批量出图建议直接上ComfyUI节省的时间不是一点点。2.3 ControlNet是不可缺失的控制层在这么大的画幅上做纯Prompt生成结果一定失控——画面结构自由发挥人物比例跑偏场景透视混乱这些都是常有的事。所以ControlNet是这套工作流里绝对不能缺的一环。我在实际项目里的用法是先用三维软件快速搭一个粗糙的“灰模”场景或者直接在PS里拼一个基础构图然后导入ComfyUI作为ControlNet的深度图或线稿图再让AI在这个结构约束下生成最终画面。灰模不用做得很精细一个大概的布局就行。关键信息就三条地平线在哪里、主体物在哪里、视觉重心在哪里。ControlNet会把这三个要素死死锁住AI能发挥的只剩材质、光线、色彩和细节这恰好是生成式AI最擅长的工作。结果是既保留了人的“导演思维”又放大了AI的“渲染能力”。3. 实战流程拆解从需求到百米巨幕的完整链路3.1 关键词策略从“一句话”到“结构化公式”第一个要解决的问题是Prompt怎么写。这个项目的Prompt不能是Midjourney那种“一句自然语言描述”而必须是一套结构化公式。我们最后稳定下来的模板是这样的subject主体描述 medium媒介质感 style风格参考 lighting光影描述 color palette色彩方案 composition构图说明 technical specs技术参数举一个实际例子。尤栗Yuri有一首歌是偏电子国风的我们在“水墨山川”这个概念基础上做的画面Prompt长这样a giant luminous dragon winding through ink wash mountains, digital art, ultra-detailed, cinematic lighting, volumetric fog, traditional chinese ink painting style mixed with neon glow accents, dominant colors deep blue and electric purple, composition centered on dragon head, wide-angle view, 8k resolution, sharp focus, high contrast分割线后面那一串是决定性因素。同一个subject如果把“cinematic lighting”改成“soft pastel lighting”整张图的氛围就完全不同。在批量生成的时候我们维护了一张Prompt参数表把风格、光线、色调、质感这些可变项分别列出来每一首歌对应一行这样整个项目的视觉语言就非常统一不会出现第一首歌是赛博朋克、第二首歌突然变成新海诚的尴尬情况。3.2 从单张图到“组图”批量生成工作流的搭建项目做到第三周的时候我们已经总结出了一套可复用的批量生产工作流。具体来说分四步第一步粗构图。在PS或者三维软件里按16:9做一张黑白灰的layout图锁定画面结构。 第二步ControlNet约束生成。把layout图导入ComfyUI接上depth或lineart模型生成一批初稿尺寸控制在1536×640这个分辨率足够看清布局和风格方向。 第三步风格筛选。初稿生成后人工筛选出构图和风格都过关的作为“种子图”。 第四步高分辨率放大与精修。把选中的种子图用多重分辨率放大流程推到最终交付尺寸。这四步顺畅跑起来之后我们一天的产能能达到三十到四十张精修级主视觉图。放到传统CG流程里这大概是一个五人小组一周的工作量。而且AIGC最爽的一点是改稿成本极低。导演说“这个感觉不对要更暗一点”我只需要把Prompt里的“bright lighting”改成“dim moody lighting”重新跑一遍十分钟后就能把新图递上去。这在传统流程里意味着让三维师重新调整灯光参数并重新渲染那就是以小时为单位起步了。3.3 分镜逻辑15秒一个视觉节奏演唱会视觉是严格跟着音乐走的。我们的做法是把每一首歌拆成15秒一个的视觉段落每个段落一个主视觉。这样既保证视觉上有变化又不至于切得太碎让观众消化不过来。每个段落的生成逻辑是先听歌抓到段落情绪关键词再去看歌词提炼出核心意象最后转化成Prompt。这个过程我把它叫“转译”。导演的需求从来不是“这里我需要一张AI生成的图”而是“这一段歌词是‘在废墟中重生’我想要一种从荒芜到有希望的感觉”。转译成Prompt就是“desolate wasteland, cracks of glowing light emerging, hopeful atmosphere”。AI最大的价值就是能把这种模糊的情绪概念快速转变成具体的视觉草图而且可以给出十几种不同的方向。分镜确认之后我们会做一张总表标明每一首歌每一段主视觉的文件名、风格、色调、生成参数。这张表是整个项目的中枢后期组和导播组都靠它来对接。3.4 百米巨幕的分块生成与拼接逼疯人的细节到了这个阶段最艰巨的技术挑战来了。最终交付的12288×1024原始分辨率的画面不能直接用一张生成图做放大来获得——那样细节会模糊且出现大量AI“幻觉”纹理。正确做法是中间层先生成一张1920×1080的精修图然后通过多次Low-level Enhancement和Tile Upscale把画面逐级放大到目标尺寸。分享几个实测有效的设置。Upscale模型我们优先用4x-UltraSharp它处理建筑、人物皮肤纹理和风景细节效果都很出色。如果显存有限可以用Tiled Upscale分块放大每次只放大画面的局部区域最后再拼接回来。这个过程中要留意的是必须打开Tiled VAE否则在12K大图上直接解码VAE极容易爆显存。实际操作中我一般先用4倍放大模型把1920×1080推成7680×4320再用一次2倍放大到15360×8640如果还要更高清再微调局部区域几乎不会失真。对“画面跨度达百米”的巨幕来说还有一个反直觉的技巧不要生成整张无缝的连续图。LED屏幕拼接的时候物理上一定会存在拼接缝隙所以视觉内容的手指位不能有贯穿全屏的完整竖线或横行线条——否则拼缝一挡画面就花了。我们反而会主动把画面拆成四到六块分别生成再拼起来保证每块内容相对完整拼缝处的过渡通过后期合成来柔和掉。这样做还有一个额外的好处可以把相同场景里不同区域的细节分别放大最终拼出来的12K画面比一次性整张生成的清晰度高不少。4. 核心环节实现AI生成后的“精加工”才是决胜点4.1 修复与增强Topaz Video AI与After Effects的组合拳AI生成的静态图再精细放到大屏幕上也只是“素材”不是“成品”。要让画面动起来、真正适合演出节奏还得走一套视频化处理流程。我的一套稳定处理组合拳是首先把生成好的静图导入Topaz Video AI让它的模型通过智能插值生成中间帧模拟出缓慢的镜头推拉效果。比如一张“山水蔓延”的主视觉加入0.2倍速的慢速推近效果大屏上的视觉张力立刻就不一样了——观众会觉得画面在呼吸。接下来再用After Effects加一层摄像机移动的位移效果、一层辉光和镜头的暗角让静图彻底“活”过来。这一步是很容易被忽略但价值极高的环节。AIGC的内容生成能力确实很强但生成出来的图像是静止的。而线下演出需要的是“沉浸感”视觉一定要和音乐的节奏、灯光的变化联动。经过Topaz和AE加工后的视觉素材才能符合导播的切换需求。不然观众看到的就是一块巨大的静态海报再精美也撑不起三五个小时的演出。4.2 补帧与帧率匹配肉眼可见的流畅度差异大屏播片的流畅度要求比普通视频要高得多。演唱会现场的导播系统通常以每秒30帧为基准进行切换慢了快了都会导致画面闪烁导播台的同步器也会报警。而AI生成视频的帧率通常只有24帧就需要补帧。补帧我用的是After Effects内置的Pixel Motion做基础插值。它的原理是计算两帧之间物体的运动轨迹然后自动生成中间帧。但AI生成的画面有大量云雾、粒子这类半透明元素Pixel Motion很容易算错运动方向导致画面出现果冻感。这种时候就得用更专业的补帧工具比如Flowframes配合RIFE模型。RIFE是目前在补帧领域效果最稳的AI模型之一对云雾、粒子这类不规整运动的处理远好于传统光流算法。4.3 暗部细节与色彩统一避免屏幕“死黑”户外演唱会最大的敌人其实是暗部细节的丢失。百米巨幕的LED灯珠在显示暗部画面时如果素材的暗部细节不够灰阶过渡会出现断层看起来就是一块块黑斑非常难看。传统CG渲染出来的画面很少出现这个问题但AI生成的素材尤其是加了暗色调滤镜的那些暗部经常是死黑的。解决方法是生成阶段就控制好色调范围。我在Prompt里明确要求了“low contrast in shadow areas, visible texture in dark regions”同时在后期的Lumetri调色环节里用曲线工具把暗部整体提亮10%~15%确保暗部有信息量。这么做还有一个好处灯光师在现场打光的时候暗部有细节的画面会自动和灯光融合得更自然如果素材就是死黑一片现场灯光再怎么补都救不回来。5. 常见问题速查一个月里踩过的坑全记录5.1 生成主体在最终放大后出现结构崩坏这个坑我踩得很深。一开始有张主视觉是巨型石像的1920分辨率看完全没问题推到7680后石像的五官开始出现奇怪的扭曲。原因后来排查清楚了放大模型的“脑补”能力不足以支撑大倍率细节重建原图本身的细节信息不够。解决方法是生成阶段就把分辨率拉高到2048×1152再做放大同时加了一步局部重绘Inpaint把石像面部单独框选出来用低Denoising强度重新生成细节。5.2 静图推镜头后画面边缘穿过屏幕有一首非常治愈系的慢歌视觉素材是一棵巨大的树我们给它加了一个向下摇镜头的动画。结果推上去之后画面下边缘直接露馅地面和背景的接缝触目惊心。解决办法其实不算复杂在AE里处理镜头运动时要先对原图做一次Extended Fill或者叫外扩。让AI生成一张比实际使用尺寸大20%的版本给镜头运动预留出裁切空间。这个技巧我们在后面所有涉及镜头运动的主视觉里都做了只要预留量足够边缘露馅的问题基本可以杜绝。5.3 多首歌的色调差异大到以为换了个项目做到第五首歌的时候导演组反馈说视觉风格有点“跳”——每首歌单看都很好看但放在同一个演出里就缺乏连贯性。这个问题在AI生成项目里特别容易发生因为每次生成的色彩方案都是独立的。解法是在生成时统一使用固定的色彩描述短语比如“deep teal and warm amber”作为整场演出的基调再在后期调色环节用同一个LUT统一全局色调。这样做完之后十二首歌的画面放在一起看才真正像一个完整的视觉故事。5.4 现场屏幕颜色和预览完全不一致第一次全屏测试的时候出了个大问题我们在制作电脑上看到的颜色是饱和浓郁的但到了现场LED屏幕上变得灰蒙蒙的。排查后确认是色彩空间不匹配。LED屏幕的显示色域是P3接近但不完全等于sRGB而我们的图片输出的是sRGB IEC61966-2.1色彩空间。解决方法是交付前用DaVinci Resolve做一遍色彩空间转换把sRGB的画面转换到Rec.2020或者P3-D65色域同时用测试图在现场做白平衡校准。这是一件看起来很小、但直接影响最终效果的事情。5.5 拼缝处的画面断裂感还有一个细节问题也值得提一下。因为我们最终是分块生成的所以拼缝处经常出现明显的“断层”——左右两块内容的色调或亮度不一致。这个问题的根源是生成时各块的随机种子不同。解决方法是在生成每一块之前先手动设定统一的风格参考图或者直接共用同一个降噪强度来生成相邻的块。如果还是明显最后在合成软件里对拼缝两侧各做5%~10%的透明度渐变让两边自然过渡。这个方法很笨但很管用。6. 实操的总结与个人体会这套AIGC演唱会视觉流程做完之后我最大的感触是AI生成的瓶颈根本不是“模型不够强”而是“使用者的工程化能力不够”。同样的Stable Diffusion放在不同的人手里产出的质量和稳定性天差地别。差在哪里差在有没有把无序的生成过程变成有序的工业化流程。具体来说就是要给自己的项目建立一套固定的“参数基线”。一条完整的Prompt怎么写、采样步数固定在多少、CFG调到什么值、用哪个Upscaler模型、放大倍率分几步这些都是可以模板化的。模板建立好之后每一次新项目的启动成本就会大幅降低而且产出质量的下限被死死兜住了。在演出行业干久了你会发现现场永远比办公室复杂十倍。一块LED屏灯珠老化可能导致局部偏色导播台的显卡不兼容某个视频编码会导致现场卡顿因为带宽限制导致4K素材无法实时播放……所有这些问题都不会在你自己的电脑上出现。所以AIGC制作在交付前的最后阶段一定要做“现场模拟测试”用实际的硬件播放环境、实际的信号链路、实际的屏幕色域去看一眼最终效果。这一眼能帮你避开80%的现场翻车事故。这次项目里我们把Luma AI的生成视频模型也用进了小部分氛围镜头的制作效果意外地好尤其是在云雾缭绕的氛围背景这类没有具体主体、不需要严格结构约束的画面上。未来AI视频生成再成熟一点应该能做到更大范围地替代传统动态视觉制作。但那一天的到来靠的不是模型自己变强而是我们这些做内容的人先把自己的流程跑通。最后分享一个小建议如果你也想在演出视觉里尝试AIGC不要一上来就挑战100米12K这种项目从一块普通比例的小屏幕开始跑通“生成—后期—上屏”的完整链路感受一下AI素材在现场的真实质感。等到你对画面质量心里有数了再慢慢往大的项目走。这条路的每一步我都是这么走过来的。