AI工作站

AI视频创作 视频生成模型AI视频基础模型AI音频模型 TokenFlow项目提供论文、开源代码、Hugging Face在线演示Demo,开发者可本地部署,普通用户也可以在线体验视频编辑效果。
爱站权重:爱站爱站爱站爱站爱站
创建快捷到桌面设置为浏览器首页或按 Ctrl+D 收藏本页到浏览器收藏夹回家不迷路!

TokenFlow是由魏兹曼科学研究所团队提出、发表于ICLR 2024的开源AI文本驱动视频编辑框架。该框架依托预训练文生图扩散模型实现视频改写,输入原始视频与文本提示词,在修改画面内容、风格的同时,完整保留原视频物体空间布局、人物动作与运动轨迹,解决传统逐帧AI编辑视频容易出现画面闪烁、物体漂移、动作错乱的痛点。

TokenFlow官网插图

一、平台核心特点:

1、技术核心:扩散特征帧间传播:核心思路是在扩散特征空间保证时序一致性,提取视频帧Token特征,依靠帧间对应关系,把编辑后的特征在全部帧之间传递,而不是逐帧独立编辑画面,大幅降低闪烁失真问题,保障视频时序连贯性。

2、零训练、零微调:不需要额外数据集训练或者模型微调,直接复用现成预训练文生图扩散模型,部署门槛低,不用重新训练视频大模型即可完成高质量视频改写。

3、高兼容性,即插即用:可以和市面上主流图像扩散编辑方案兼容,包括Plug‑and‑Play、ControlNet、Prompt‑to‑Prompt等工具,能够拓展实现风格转换、物体替换、局部修改等多种效果。

4、主要编辑能力

     - 文本驱动视频改写:输入文字提示,对原有视频做风格化改造、物体替换;

     - 保留原始视频运动逻辑、镜头、物体位置,不会打乱原有动作与场景构图;

     - 丰富案例:可实现雕像化、油画梵高画风、冰雪材质改造、折纸效果、机器人形象替换等多种创意视频效果。

5、使用形式

     - 在线DemoHugging Face网页端可直接上传视频输入提示词快速体验;

     - 开源代码:基于PyTorch,适合开发者本地部署做二次开发;

     - 输出:生成经过改写、时序稳定的新视频文件。

6、局限性:更适合中短时长视频;长视频、超复杂高速运动场景下,时序一致性效果会有所下降,分辨率也受底层扩散模型限制。

二、典型使用场景:

1、短视频素材风格迁移:实拍视频一键转换成油画、雕塑、动漫等艺术画风;

2、视频物体替换:把视频中物体替换为冰雕、机器人、折纸等其他材质物体;

3、影视前期创意预览,广告素材快速迭代修改。

数据统计