# PixVerse：从像素到叙事：多模态模型如何重构视频生成的能力边界

> **合规声明（生成式 AI 服务）**：前述特定亚马逊云科技生成式人工智能相关的服务目前在亚马逊云科技海外区域可用。亚马逊云科技中国区域相关云服务由西云数据和光环新网运营，具体信息以中国区域官网为准。
> 
> **完整资料：如果想了解更多内容可以访问:https://events.amazoncloud.cn/china-summit-on-demand/
> 
> **免责声明**：本摘要仅为便于您了解峰会内容而提供，我们不对其完整性及准确性作出任何保证，且不构成任何建议或结论。相关内容仅供参考，实际内容以峰会回放视频为准。

## 一、基础信息

- **会议类型**：专题演讲
- **Persona**：模型实践者
- **时间信息**：6月23日 | 15:00 - 15:30
- **标题**：PixVerse：从像素到叙事：多模态模型如何重构视频生成的能力边界
- **PDF 资料**：有
- **视频回放**：有

## 演讲人信息

### 会议信息
- **地点**：上海世博中心（2026 亚马逊云科技中国峰会）
- **日期**：2026年6月23日（Day 1）
- **时间**：15:00 - 15:30
- **会议类型**：专题演讲
- **面向 Persona**：模型实践者

### 亚马逊云科技演讲人
- **汪其香**：解决方案架构师

### 客户 / 合作伙伴演讲人
- **荣蓉**（北京爱诗科技有限公司）：企业服务产品负责人

## 二、会议资料 PDF 转录内容

--- Page 1 ---
S E S S I O N 262
PI X VE RSE × AMAZO N W E B SE RVICE S
从像素到叙事： 多模态模型重构视频生成的能力边界
荣蓉 汪其香
Rong Rong Wang Qixiang
企业服务产品负责人 解决方案架构师
爱诗科技 亚马逊云科技

--- Page 2 ---
01 / OPENING
视频生成，正进入
从"能生成"走向"可叙事"的爆发时刻
01 02 03
视频成为通用语言 范式从扩散走向统一 能力边界被系统重写
文本理解、图像感知、时序建模、物理规律—— 从一段几秒钟的片段，到一段可被导演、被剪辑、
从文字到图像，从图像到视频——人类表达的密度
多模态架构正在把它们融为一体。 被交付的"完整影像"。
正在被一帧一帧地拉高。

--- Page 3 ---
视频生成模型发展路线
从 2022 单帧扩散 → 2026 统一多模态与世界模型 · 能力边界沿曲线持续右移
PART A · ARCHITECTURE PARADIGM TIMELINE
六大技术范式· 沿时间与能力维度的演进曲线
2022 — 2023 2023 — 2024 2024 — 2025 2025 — 2026 2026 →
早期范式 扩散范式登场 DiT 主流时代 统一多模态崛起 世界模型前沿
能力
边界
时间
LEGACY LEGACY CURRENT CURRENT NEXT-GEN ★ FRONTIER ★★
U-Net Diffusion Autoregressive DiT Diffusion Latent Consistency Unified Multimodal World Model
基于 SD 视频化 逐帧自回归生成 Transformer 时空 Token 蒸馏+ 少步采样 文/ 图/ 视频共享语义 实时· 无限· 可交互 PixVerse R1
单 clip · 短时序（2-4s） VideoGPT · CogVideo 主流方案 实时推理可行
Text →Video Image →Video 商用主力 Multimodal Edit & Interactive 专业级
参考帧→动效· 角色/ 风格可控· 品牌一致性
Prompt →完整片段· 入门通用· 最广泛的入口 镜头/ 角色/ 风格· 多镜头叙事· 实时可交互
影视级镜头控制+ 一键商用输出

--- Page 4 ---
01 / OPENING
但要走到"商业落地"——
有三个变量必须同时成立
质量 × 可控性 × 规模化
= 视频 AI 真正进入商业市场的"乘法公式"
质量 · Quality 可控性 · Control 规模化 · Scale
画面级别从"可观看"升级到 镜头、角色、风格、连续性—— 推理算力、全球分发、合规交付——
"电影级、可商用"。 创作者要的不是惊喜，而是确定。 这是云厂商的主场。

--- Page 5 ---
视频生成流程环节
01 02 03 04 05 06
INPUT PROMPT EMBEDDING ★ GENERATION ★ MODERATION DELIVERY
输入理解 提示词重写 多模态检索 视频生成 内容审核 分发与后处理
Multimodal Input Parsing Prompt Optimization Multimodal Embedding & RAG Video Synthesis Core Safety & Compliance Post-process & CDN
理解用户上传的 用户口语→模型可读的 检索素材库/ IP 库/ 历史片段， 管线的核心模型层—— 文本提示+ 输出图像/视频 转码/ 加水印/ 拼接/
文本/ 图像/ 视频/ 音频 结构化分镜脚本 给生成模型注入 文生/ 图生/ 多镜头叙事/ 双向审核，过滤 多分辨率出片，
作为生成的语义起点 显著提升首次成片质量 "品牌一致性"与"角色一致性" 实时世界模型 暴力/ 不当内容/ 版权风险 就近全球分发
BEDROCK 模型 BEDROCK 服务 BEDROCK 模型 BEDROCK 模型矩阵 安全栈 媒体栈
Amazon Nova Prompt Optimization Nova Multimodal Luma Ray2 Bedrock Guardrails S3 · CloudFront
Embeddings
Claude Nova Prompt Optimizer Nova Reel 1.1 Image Content Filters Nova Sonic · 语音
同一接口，多模型可选
开源模型 Claude 重写 Rekognition · Video Mod
首个统一支持文/ 文档/
客户按场景/ 成本/ 风格
图/ 视频/ 音频的
自选 能力· 从生成到观众端
能力· 图像/视频内容描 能力· 启发式+ LLM 双 Embedding 模型 到端
Frontier Model 能力· 企业级安全护栏
述、参考帧提取、风格 路径，自动适配下游模
PixVerseV6 / R1 / C1
识别 型语法

--- Page 6 ---
02 / Amazon CAPABILITY
Amazon Bedrock：一个让模型厂商
"被使用"的开放生态
全球已有100,000+ 组织在 Bedrock 上构建生成式 AI 应用[Source] aws.amazon.com/bedrock
SCALE OF THE PLATFORM
①模型自由选择· Model Choice
数百款 FM 一键接入:Anthropic / Meta / Mistral / OpenAI / Amazon Nova / 合作伙伴模
100,000+
型。
②自有数据安全定制· Custom & Private
Knowledge Bases / Data Automation / 微调——你的数据永不用于训练他人模型。
全球客户构建生产级 AI 应用
③企业级安全合规· Guardrails
Hundreds Up to 75%
ISO / SOC / GDPR / FedRAMP / HIPAA 全覆盖;Guardrails 拦截高达88% 有害内容。
基础模型可选择 推理成本可优化空间
覆盖文本 / 图像 / 视频 （模型蒸馏 + 智能路由）
④Agent 化能力· Bedrock AgentCore
把视频生成模型嵌入 Agent 链路：跨工具、跨数据、跨工作流

--- Page 7 ---
×
亚马逊云科技 多模态生态 PixVerse 模型实践
= 全球创作者的视频 AI 基础设施
接下来，把舞台交给 PixVerse
从视频模型到视频 Agent - AI 如何接管内容生产

--- Page 8 ---
从视频模型到视频 Agent
从5～15秒分镜头生成，到自动完成1个完整视频生产任务
01 爱诗科技公司介绍
02 生成式视频模型发展
03 覆盖 UGC 和专家的视频 Agent 能力
04 我们相信 Agent 是下一代生产力

--- Page 9 ---
01 爱诗科技公司介绍

--- Page 10 ---
01 爱诗科技公司介绍
26.04 Artificial 榜单

--- Page 11 ---
01 爱诗科技公司介绍

--- Page 12 ---
02 生成式视频模型发展
2022年 2024年 2026年
AI 能生成视频吗？ AI 能生成更真实的视频吗？ AI 能生成更长更完整的视频吗？

--- Page 13 ---
03 覆盖 UGC 和专家的视频 Agent 能力
UGC 人人都能用 专业创作者
我有一个想法，AI 帮我自动完成 我有一个脚本，AI 辅助我完成

--- Page 14 ---
03 覆盖 UGC 和专家的视频 Agent 能力
爱诗科技视频 Agent 技术架构
AI Gateway Agent 状态 统一 ACP 协议
公开 Skill
Agent Runtime AgentCore
Tool Sandbox 运维、测试
SDK
CLI
大模型 API 服务 大语言模型 图片模型 视频模型 多模态模型

--- Page 15 ---
03 覆盖 UGC 和专家的视频 Agent 能力
爱诗科技公开 Skills

--- Page 16 ---
03 覆盖 UGC 和专家的视频 Agent 能力
UGC 人人都能用
对话式视频 Agent
输入想法 --
• LLM：需求澄清
• 多模态：素材分析
• LLM：设计脚本
• IT2V：生成分镜视频
• 工具：拼接剪辑

--- Page 17 ---
03 覆盖 UGC 和专家的视频 Agent 能力
UGC 人人都能用——对话式视频 Agent

--- Page 18 ---
03 覆盖 UGC 和专家的视频 Agent 能力
专业创作者
对话+无限画布
• 对话自动生成画布
• 脚本、图片、视频可在一个页面完成
• 可复刻创作者画布

--- Page 19 ---
03 覆盖 UGC 和专家的视频 Agent 能力
视频成片
专业创作者
对话+无限画布
• 对话自动生成画布
• 脚本、图片、视频可在一个
页面完成
• 可复刻其他创作者的画布

--- Page 20 ---
03 覆盖 UGC 和专家的视频 Agent 能力
垂直行业 Agent
输入音频 MP3 自动做音乐 MV 视频 --
• LLM：歌词分析
• LLM：分镜脚本
• IT2V：生成分镜视频

--- Page 21 ---
03 覆盖 UGC 和专家的视频 Agent 能力
行业 Agent--音乐 mv

--- Page 22 ---
03 Agent 时代已到来
操作页面
行业 Agent--
营销视频
• 输入：商品信息
• Agent 工作：
LLM：意图、商品信息理解
多模态：素材分析
LLM：设计脚本、写营销文案
IT2V：生成分镜视频
工具：拼接剪辑
• 输出：完整的营销视频

--- Page 23 ---
03 覆盖 UGC 和专家的视频 Agent 能力
行业 Agent --营销视频

--- Page 24 ---
04 我们相信 Agent 是下一代生产力
爱诗科技 Agent 实践
人工（天） 人工+AI（天）
30
7 7
2
0.5 0.5
交互设计 Agent 开发 做广告素材

--- Page 25 ---
04 我们相信 Agent 是下一代生产力
爱诗科技 Agent 实践
交互设计 Agent 开发 广告投放
过去：1-2周 过去：1-2个月 过去：广告费+代理服务费
MRD->PRD->UX->UI 算法->工程->前后端
现在：
现在：0.5天 现在：1-2周 OpenClaw 搭建 workflow->自
OpenAI Codex 做 UX/UI -内测：产品 AI coding 动做素材->接入广告账号自
-增长：研发介入保障稳定 动投放->回收数据->分析和
爆款的差距自动学习

--- Page 26 ---
04 我们相信 Agent 是下一代生产力
产品设计
• 输入：文字需求、参考交互图、
授权公司的 Figma 设计组件规范
读取权限
• 输出:OpenAI Codex 做 UX/UI

--- Page 27 ---
04 我们相信 Agent 是下一代生产力
U X 演示
产品设计
• 输入：文字需求、参考交互图、
授权公司的 Figma 设计组件规范
读取权限
• 输出:OpenAI Codex 做 UX/UI

--- Page 28 ---
04 我们相信 Agent 是下一代生产力
操作录屏
产品投放
自然语言搭建 OpenClaw
• 输入：需求 或 模板 id
• Agent 工作：需求分析和链路匹配
• 输出：广告投放视频

--- Page 29 ---
04 我们相信 Agent 是下一代生产力
视频成片
产品投放
基于 OpenClaw 搭建 workflow
• 输入：文字需求
• Agent 工作：需求分析和链路匹配
• 输出：广告投放视频

--- Page 30 ---
PART 0 3
与亚马逊云科技
共建全球创作基础设施
为 PixVerse 提供全球低延迟交付、企业级合规、海量推理算力。
让"灵感一键成片"成为基础设施能力。

--- Page 31 ---
03 / CO-BUILD
PixVerse 技术优势 × 亚马逊云科技全球基础设施
三层能力共建，支撑 1 亿 + 用户 · 175 国家 的高并发视频生成 [Source] PixVerse 官方 / GeekWire 2026.03
LAYER 01 LAYER 02 LAYER 03
全球低延迟交付 企业级安全合规 规模化推理算力
Global Low-Latency Delivery Enterprise Security & Compliance Massive GPU Inference
36+ 175+ 100M+
亚马逊云科技全球 Region 网络 国家/地区监管落地 PixVerse 全球用户基数
让创意从生成到分发以秒级触达全球。 本地数据合规、区域监管适配。 承接亿级日活的视频生成负载。
• 全球 PoP + CloudFront 加速 • ISO / SOC / GDPR / HIPAA • 丰富的 GPU 资源+ Trainium
• 就近推理/ 就近渲染 • 数据驻留+ 加密传输/存储 • 弹性容量池/ Spot 经济性
• 创作者→观众端到端延迟优化 • Bedrock Guardrails 内容护栏 • SageMaker/EKS 等资源管理平台

--- Page 32 ---
Thank you

--- Page 33 ---
Session 4:PixVerse：从像素到叙事：多模态模型如何重构视
频生成的能力边界
扫描上方二维码
填写调查问卷
## 三、会议回放视频转录内容

嗨，大家好
然后前面几个 Session 相对来说都比较硬核啊
主要讲的是那个关于很多 GPU 部署这块的一些事情
然后我们今天这个 Session 可能相对来说会轻松一些
然后我们更多的是看现在就是第一梯队的这种视频生成的模型
它的能力到了什么样的一个阶段
让大家可以更加直观的看到现在这种视频生成模型的一个状态吧
一会后面会有非常多的 demo
然后会由我们这个爱诗科技的产品负责人来给大家讲
然后第一个的话就是其实我们先是去聊一下说
其实视频生成的整个阶段的话
现阶段已经进入到了就部分可商用的
就可用的这么一个阶段吧
第一个是说我们从互联网时代就大家就经历到说
从文字到图片到视频这么几个模态的一个跃升
那同样的其实在 AI 时代我们也是一样的
从第一代我们这个 Chatbot 以文字的这种交流方式
到第二个阶段我们看到更多图片的一些理解
图片的一些生成进入稳定的一个状态
那现在到第三个阶段的话
其实我们也是会去看说整个多模态模型能力的一个
到了什么样的一个阶段
因为不管是视频还是音频
其实它是更多的跟我们生活或者我们直观能够接受到的
这个信息是更加直观的
然后大家使用起来日常跟它交互的时间也是最长的
然后第二个的话就是我们看到这种视频生成的模型
它的整个底层的架构现在也进入了更加统一的一个阶段
就比如说我们从这个 Diffusion Transformer 的架构
基本上说视频生成模型里面可能90% 多
现在用的都是这一套架构
那更多的话就是说大家的这种技术范式达到统一了之后
那接下来的话肯定更多的就是去进行它
在它的视频生成的一个能力和质量上面有更大的一个提升
然后第三个阶段的话这个就是大家非常直观的看到
我们最开始去讲 GenAI 的时候都会聊到说
视频生成可能更多的还是一个玩具
我们没有办法去落地生产
那到今年我们去看 GenAI 的在视频生成的这块能力上的话
几乎我们已经可以看到在某些场景下面
已经可以做到商用的一些级别
就它整个的 PMF 其实已经是跑通了的
然后整个的一个我们会看到过去这些年整个视频生成
发展的一个脉络的话
就是从最开始因为视频生成其实就是从
图像扩散模型那里借过来的这样的一个架构
更多的最开始我们去做这种逐帧的生成的时候
可能基本上就是用的 U-Net Diffusion 的这种架构
那那个时候的话基本上就只能去说
单帧地去做一些生成
然后时长相对来说也会比较短
然后中间就会有出现了一些自回归类型的
这样的一些模型
但是后期就是会验证说这个模型的
是有一些局限性的
但是在大家关注这块儿会看到
其实在去年自回归的这一条路线
其实会有一些新的工作出现
因为它还是会有一些流式的这种生成方式的优势在
大家关注的可以去看一下
然后到现在这个阶段
就我们前面提到的
大家视频生成的玩家基本上都统一到
就是变成了这种 Diffusion Transformer 的
这种架构里面去做
因为它可以把这种时间的维度的
token 放到里面来
那就让我们在做视频生成里面的连续性
让整个视频的质量会好很多
然后但是这个架构就是解决了
我们视频生成的清晰度或者质量的问题
但是会有新的问题出现
我们在生成整个视频模型的时候
会出现我们时长相对来说是比较大的
因为大家都知道生成视频对于底层的
算力要求肯定是很高的
我们生成一段更长的视频
或者质量更高的模型
时间也就会很久
大家可能都有一个提醒说
之前你要是去做上一个
类似于视频生成的这种网站
你要生成一段几秒的视频
你要等待的时间
或者看到预览图的时间是很长的
然后这个中间就出现了一些
就是我们用一些压缩的这样的
一些模型的手段
然后用一些蒸馏
包括中间少步采样的一种方式
让生成的时间提速了很多
然后再到第三个阶段的话
就是说我们除了希望这个模型
能够生成出视频以外
我们希望它也能够理解
更多的图像的内容
以及我们生成的
这个中间的有一些物理的一些规律
因为大家可能看到很多视频生成
手变多了
或者是一致性的这样的一些问题
大家去做的一些努力
就是在后面去做的一些探索
因为确实现在视频生成
在整个一致性或者连续性
以及可控性上面
还是会有一些缺陷
这个时候大家在更多的去探索的
就是这种统一空间的
多模态这种模型的方式
然后再到未来大家去考虑到的
就是很多比较少的玩家
在做这种视频模型的一个方向
这个一会儿
这个也是 PixVerse 也在做的
视频模型更多的话
就是世界模型更多的话
就是跟以前你可能只是
给它一个文字
给它一个图片
它给你一段视频
不一样的这种呈现方式就在于
它是一个实时的
就是你进入这个世界里面
然后你不断地跟它去做交互
比如说我现在是从长城面前走过
然后下一步你可以说
你接着飞到另外一个
埃菲尔铁塔这种地方
它是会基于你每次跟它实时交互
去生成下一帧的一个
就后面这些帧数的一个视频的
然后这个其实在内容圈
就是我们比如说做社交内容
或者电商内容这些里面没有那么多的用途
但是在自动驾驶的那个圈子里面
其实世界模型相对来说用处是更大的
然后这个是整个世界模型的
大概的一个概述
然后整个的场景我们会看到的
就是说要从文字到视频
然后刚刚讲的这个
现在商用相当于落地比较
比较多的场景就是图片到视频
然后包括还有到最后我们这种
如果在专业级别里面
我们要去做一段
比如说广告或者电影里面的一些片段的话
那更多的可能就是要去做
多镜头的一些叙事
或者更多一致性
连贯性的一些操作
然后这块会提到说
前面已经讲到了
就不同的这个模型发展到现在这个阶段
其实相对来说有比较多的几个要素
第一个就是整个视频的质量
第二个就是我们讲到
就是现在我们去看做视频生成
还很难做到说
你给它一个 Prompt
它就生成一个完全你想要的
一个长的视频
更多的其实还是会说
希望这个视频能够做到可控可编辑
那我们的专业的
比如说导演或者是你自己
能够在中间去编辑这段视频
做出来的效果
就你作为导演或者作为控制人
能够生成一段更符合你要求的一段视频
然后第三个阶段就是规模化
就是说我们要求底层的算力
能够支撑起来
以及它的整个模型的运算速度
是能够把它打下来的
不然的话你去做一段视频
要等很长的时间
这个价值就会降低非常多
所以整个就会对应到这有三个要素
那整个我们会看到
视频生成的这个环节里面
其实它是跟现在的 LLM 差别还是很大的
因为它不光是说
像 LLM 那样你给它一个 Prompt
然后生成下一个 token
因为这个中间还会涉及到很多
就是比如说
它需要能够理解到你的图片
然后理解你给它的视频
理解你让它做的一件事情
第二个是说
它帮你生成这样一段视频之后
可能还会涉及到我们要做很多的内容的审核
以及到后面的分发的一些处理
然后第一个的话就是我们会看到说
因为我们刚刚提到做视频生成
输入的这个模态有可能是文字
有可能是图片
有可能是视频
所以第一步的话
会需要去做到说
我们要把用户的这个 Prompt
去做一个理解它真实的一个意图
然后再去做一个 Prompt 的重写
因为很多的生成的模型里面
它中间要求到的一些精度或者一些细节
用户可能是没有办法考虑到的
然后所以在这个
其实重写这部分
其实可能很多厂商就需要去把这块做到更好
那这样的话
一部分是可以降低用户的使用门槛
就用户可能写很简单的一句话
最后得到的这个视频是非常高质量的一个视频
那是其实就相对来说是很重要
然后另外一个就是
比如说我们需要
其实前面有提到
我们会有不同模态的一个数据进来
然后我们把它做成这种多模态的
就把多个模态的数据对齐之后
放到一个语义空间里面
再去做后面的生成
那在这块的话
就是会有这种多模态搜索相关的一个模型
然后最核心的那这个视频生成的这个模型
一会儿 PixVerse 同学会去给大家看一下
中间的一个效果
然后后面两个部分就是传统的
我们会讲到说
需要去做内容审核以及分发给用户的时候
我可能要去
申请不同的码率或者不同的一些格式
然后这个里面
我们会看到不同的环节里面
其实会用到不同的一个模型
然后这块的话
就是说在 Bedrock 平台上面
刚刚前面提到的不同的环节
涉及到的不同的模型
在 Bedrock 上面其实也都会有
然后我们其实也是在努力当中
让 PixVerse 未来
大家也能够在 Bedrock 上面去用到
对
然后第二个部分的话
就交给我们的合作伙伴 PixVerse 的同学
然后他给大家去做一些 demo 的展示
好 谢谢汪其香的分享
谢谢大家
接下来由我跟大家聊一聊
视频模型和视频 Agent 的能力边界
大家可以放轻松
因为我这一趴没有什么太多的硬核技术
给大家看几个片子
我先给大家介绍一下我们的公司
其次带大家回顾一下视频大模型的发展
最后会重点讲一讲 Agent 的能力现状
给大家看一下 case
最后会分享一下 Agent 是如何帮我们公司
自己的产品研发提高效率的
先介绍一下公司
我们是2023年决定投入做视频大模型的
这个在当时是一个非共识的决策
那个时候如果大家有印象的话
最火的模型是大语言模型
最火的产品形态是 chatbot
但我们那个时候还是坚信说
AI 可以改变视频行业
到现在为止我们已经迭代了八代的模型
而且正如汪其香同学的介绍
我们也推出了 Real-time R 系列的实时世界模型
那现在我们覆盖了一亿多的用户
和100多个国家地区
那在今年4月份的全球榜单里面
PixVerse V6 这个最新版的模型
我们的排名是
仅次于字节的 Seedance 1.0
是在第二名
大幅领先可灵这些主流模型
接下来
带大家回顾一下视频模型这三年发生了什么
大家可以看个片子放松一下
好
2022年的时候
大家都在质疑说
AI 是不是真的能生成视频
那2023年的时候呢
我们和一些公司发布了初代大模型
但那个时候大家都当个笑话来看
因为漏洞百出
你那个面条都会吃到嘴巴外面
这个视频大家都看过很出圈的那年
那现在我们解决了真实性的堵点
物理规则这些堵点
AI 的效果变得越来越好了
但这个仍然不是终点
我们认为这仅仅是一个开始
因为用过大模型做过视频的同学
应该都会知道
它距离真正的规模化的
工业化的生产视频
还有很大的一个距离
那首先
你是要有脚本思维
你要把你的一句话的想法
变成一个结构化的脚本
那其次你要会抽卡
你要会写提示词
你要用更低的成本做出这些分镜头
那最后还有一个绕不过去的坎
你是得去学剪辑软件的
你要把这些碎片的视频
放到剪辑软件里面去做后期处理
把它拼成一个完整的视频
那现在
有了 Agent 之后
我们相信大模型结合 Agent 才是未来
才能帮我们实现创作平权
和人人都是导演这个梦想
那 Agent 能做什么呢
这个就是我今天演讲的重要的一个环节
我们先来看一下 Agent 能做些什么
如果我是一个普通的用户
我只有一个一句话的想法
那这个时候 Agent 可以帮我扩充认识的想法
把它变成一个专业的脚本
再把这个视频做出来
那如果你是一个专业的创作者
你有创意有脚本
那这个时候 Agent 其实是你的一个得力的助手
它可以帮你把脑中的创意
快速的完成初步的剪辑
那它为什么这么厉害
我们拆解一下 Agent 的架构
这个是我简化后的技术架构图
它依然有一些抽象
那我现场再继续简化一下
它其实有三个核心的环节
首先第一个环节是
我们可以理解用户的意图
今天我们已经用大语言模型还有多模态模型
自建了一套用户意图拆解的 Agent
就是不管我输入的是文字还是提示词
还是只是什么都不说
我就导入了一些图片的素材
那我都可以大概猜到用户想要什么
那第二个环节是
我们把行业里面的专家的知识
沉淀成了通用的 Skills
它可以互相协作
可以设计分镜图可以写脚本
那么它就可以把一个一句话的想法
变成一个专业的故事板
变成一个可被执行的视频生成指令
那到了最后一个环节
就是智能工具的调度
我们把一些常见的视频剪辑的过程
变成了通用的 Tools
就是工具库
那我根据上一个环节拿到的指令
我在这个环节就可以给这个视频
去找配对应的剪辑工具
那比如说现在我们可以根据视频画面里的情绪
口播文里面的故事
去找一个比较合适的 BGM
那这是它的架构
这个如果大家感兴趣的话
是可以在 GitHub 上去搜到的
今天我们把 PixVerse 的模型
以及全球主流的模型
包括我们刚刚说的这些 Skills 都做了开源
大家可以安装到自己的本地 code
然后自己去定义自己的 Agent
那接下来我会用四个案例
来讲解一下 Agent 的实战能力
这个环节都是看片子的
大家可以继续放松
首先这个是第一个
我们是为普通用户做的 Agent
那这个是我的操作录屏
我也是一个普通人
没有学过剪辑
一直都是干产品的
这个是我想要做一个广告片
我的输入就是 PixVerse 的
这个虚拟商品的咖啡杯
然后输入的这个脚本的想法
是想这个咖啡杯
逃离牛马的工作环境出去玩
然后 Agent 了解了我的想法之后
帮我做了需求的澄清
帮我扩充了一个完整的脚本
然后帮我固定下来了
咖啡杯的三视图
这个是三视图
为的是在后面所有的分镜图中
可以做到主体一致性
然后它会跟着我的脚本去生成分镜
图片
然后再用图片做视频
好了时间有限
我们就不全看完
直接可以看这个片子
左边的这个视频就是刚刚录屏操作的
结果是我做的
看完之后有没有觉得哪里不对劲
就我的广告部的同事跟我说
这个视频我自己玩玩就行了
是不要拿出去投放
因为故事线太慢
切镜不合理
然后音效也不统一
会有很多很多问题
那我就马上换了一个思路
我还是用刚刚那个 Agent
但这一次我选择相信 AI
我找了一个国际知名饼干广告的视频
我让 Agent 去学习里面的技巧
然后我的指令就很简单
学习这个视频里面的技巧帮我给素材
做一个新的广告片
我们可以看一下第二个视频的效果
也是我做的
这个视频已经被广告部拿去当素材投放了
看了第二个视频
大家应该更相信说
大模型和 Agent 的结合
真的可以让每个普通人
都能做出这样的片子成为导演
这个是给普通人做的 Agent 工具
那我们接下来看第二个 case 是专业创作者
对于专业创作者来说
它其实是看不上刚刚的片子的
它也看不上刚刚的一键成片的流程
因为它有自己的性格
有自己的风格想要呈现在作品里
那对于专业创作者来说
它最痛苦的事情其实是频繁切换工具
那么在这个画布里面
创作者可以用对话来生成一个画布的链路
也可以把脚本 图片 视频 编辑
都放在这个工作区里面
在这个节点上面去完成
我们可以看一下
这个是 AR 导演做的片子
这个就不是我做的了
会专业很多
据 AR 导演说有了画布之后
可以帮他提高一倍的生产效率
这个是给专业创作者的工具
除了刚刚两个通用的工具之外
我们还给一些行业客户定制了专属的 Agent
那这个是我们给一个 AI 音乐工具生态伙伴
做的 MV 视频一键成片工具
他们的用户是做完音乐之后还想做点视频
那这个操作也很简单
你今天不需要学写提示词
不需要去学剪辑
你只需要做两个操作
导入一个音频
然后选风格
你就可以拿到一个 MV 视频
我们可以看一下左边的这个视频是我老板做的
他跟我一样
是个技术宅
没啥审美
没学过剪辑
我们可以看一下他做的怎么样
左边这个
这个是我们给电商平台定制的一个一键成片视频的工具
那对于电商平台来说
最头疼的事情是如何调动起来
腰部、尾部商家的积极性和他们的销售额
因为这些商家大部分都是小团队个体户
他们一个是没有预算去请专业的广告公司
然后再来一个是另外一个是没有预算去请专业的广告公司
另外一个是他们自己没有那么多的时间和精力去学怎么做素材
那他们把经营店铺这件事学好
其实已经非常不容易了
那这个工具也很简单
他只需要把商品的图片导入进去
把商品的文字描述导入进去
都不需要商家自己去想商品卖点是啥
Agent 可以自动的总结卖点
做出来这个视频
写出来好的文案
我们可以看这个视频
知道吗
这条裙子有点不一样
复古立领设计简约不失精致
腰间抽绳可自由调节
各种身材都能穿得好看又显瘦
日系文艺配色
你整个温柔住了
上班能穿
约会能穿
随便带一双玛丽珍
轻松穿出杂志感
喜欢日系复古风的你
现在就能拥有它
心动就下单
别等了
好
我刚讲的这些都是
Agent 怎么帮我们这家公司赚钱的
那我现在想分享的是
Agent 是怎么帮我们来省钱的
是我们内部的一个实践
这一年里面
我们在 AI 的帮助下
其实在产品的交互设计
研发
投放三个环节
都大幅度节省了时间
这个是一张全员
和有 AI 参与之后的
工作时长对比图
我们在这三个环节
在 AI 的参与下
都改变了组织分工
协作的方式
也大幅提高了效率
那我们是怎么做到的呢
其实我们现在
今年开始对员工有了新的要求
我们第一点要求是对产品
经理还有研发工程师提出来的
我们希望每一个人成为 builder
builder 的意思就是
今天不再有严格的产品提需求
研发写写代码这个界限了
那每一个人都可以把 idea
变成一个落地的产品
每个人都是要具备 AI coding 的能力
第二个是我们对所有员工提出来的
就是今天我们希望每一个员工
都是一个视频的 creator
也就是创作者
那我们可以用大模型和 Agent
做出自己的视频的片子
去提高审美
我们可以用视频来和用户和客户来沟通
在我们全面拥抱 AI 的情况下
我们也逐步的在改进公司的组织结构
还有效率
那用 AI 做产品设计
用 AI 做产品研发
我相信大家听烂了
平台上面的内容博主
也宣传了很多了
我讲一下
不知道大家有没有听过的
或者是有没有看过的这个 case 是产品投放
其实在过去
爱诗科技也是一个要和广告代理商合作的公司
我们要花大量的时间去和对方沟通
我们对于广告内容质量是什么要求
我们还要为对方支付高额的内容制作费用
代理费用
甚至如果我要宣传模型
我让它用 AI
用我们自己的模型来做片子
算力还得我出
我要给它充积分
所以后来有了 OpenClaw 之后
我们很快基于 OpenClaw 搭建了一个自动投放广告的链路
经过两个月的打磨
这个已经逐步取代了我们内部人工投放的流程
就是现在它可以做到
我说一些需求
它自动帮我把广告素材做出来
然后自动帮我投放到广告平台上
可以多平台一键投放
也可以帮我回收和分析数据
还可以帮我分析我和爆款素材差在哪了
它学到了这个技巧可以继续沉淀下来
这个就是我们第一版产品的录屏操作
也是我在操作
我们可以看一下 OpenClaw
这个 workflow 自己做出来的视频是什么样子的
这个视频是 PixVerse 的一个特效模板的推广视频
这个模板是3D 手办
就是摆一张照片输入进去
可以变成一个3D 手办
这里的素材的选择
图片的生成
拼接音乐的选择
通通都是 AI 自己智能选择的
根据我们的预设好的指令
讲到这里我的分享差不多结束了
最后想给我们的合作伙伴打个广告
因为我们主要的客户在海外
我们在扩张的这一年的时间里面
也离不开亚马逊的支持
因为很多海外的客户对于低延时和对于安全合规
都有很严苛的需求
那么跟亚马逊合作会节省掉
我们自己去申请证书的很繁琐的流程
那最后我也希望和越来越多的优秀的伙伴一起合作
因为我们相信大模型加 Agent 确实是未来
它可以进一步的解放每一个普通人的创意
让我们一起把这个视频行业的蛋糕越做越大
谢谢大家
如果有问题的话可以通过二维码联系到我
还有五分钟的时间
大家有问题吗
我来做个返场
哪个
是哪个视频
FM
好的
FM
FM
FM
FM
FM
FM
好 我先结束了