人工智能行业深度报告:从Sora看多模态大模型发展
1、OpenAI发布视频生成模型Sora,视频生成能力实现大幅提升:•2024年2月16日,OpenAI发布视频生成模型Sora,能生成各种持续时间(甚至长达1分钟)、宽高比和分辨率的视频和图片。 2、国内外厂商相继发力布局多模态大模型领域,2024年文生视频有望进入商业化探索阶段:•目前除OpenAI之外,谷歌、字节跳动等厂商均已推出具备文生视频能力的多模态模型。 基于对StableVideoDiffusion、谷歌W.A.L.T以及其它文生视频模型的分析,我们认为高质量数据以及底层通用大模型是文生视频能力的重要决定因素,随着Transformer架构的引入,以及3D建模领域模型的迭代,20