
OpenAI 发布 Sora,AI 生成视频的里程碑
OpenAI 发布 Sora 文生视频模型,AI 行业持续高速发展 ——人工智能专题研究系列四 投资要点。
OpenAI发布Sora文生视频模型,视频生成性能强劲 。
2024年2月16日OpenAI发布视频生成模型Sora。该模型为文本生成视频模型,模型可根据文本信息生成时长一分钟的高保真视频。
Sora具有强劲的视频生成性能,可生成具有多角色、特定运动轨迹的复杂场景视频,并使视频中角色的物理交互符合现实世界物理规律。
Sora对AI行业的发展具有里程碑意义,OpenAI将Sora定位为一款世界模拟器的视频生成模型,为未来发展理解和模拟真实世界的模型奠定基础。
Sora在视频画面一致性、长视频生成等方面性能优于其他模型 通过新智元转引的Sora测评,Pika等其他主流视频生成模型大多只能维持5s左右的动作和画面一致性,而Sora可在长达17s的视频中保持动作和画面一致性。
在长场景视频生成中,Sora的细节丰富度和画面流畅度显著高于其他视频生成模型。
Sora对AIGC行业具有里程碑意义,有望推动AI应用行业发展 我们认为OpenAI推出Sora对AI行业的发展具有里程碑意义。
从中短期看Sora作为一款具有强劲性能的视频生成模型,将提升视频生成的质量和效率, 对影视和游戏等相关行业具有变革作用。
长期看Sora是一款对现实世界模拟的视频生成模型,有望成为理解和模拟真实世界的模型先驱。
OpenAI 发布文生视频模型 Sora,效果显著提升 近期,OpenAI发布新的文生视频模型Sora,其展示的效果相比其他的文生视频模型如Runway、Pika 有了显著的提升。
我们从几个维度来解读其创新之处: 从算法模型来看:OpenAI 使用了 Diffusion 模型+Transformer 的架构,通过构建含有时空信息的视觉 patch,统一了不用时间长度、分辨率、宽高比的视频和图片训练数据,从而使 得模型的训练数据得以大幅的丰富,同时输出结果可以实现不同分辨率和宽高比的视频。
从生成的视频来看:Sora生成的内容有几个方面实现了对现有其他算法的超越: 灵活的视频尺寸和更长的视频时长:Sora 能够制作各种尺寸的视频,从宽屏的 1920x1080 到竖屏的1080x1920,同时具有更好的构图效果。从生成视频的时长来看,也从其他模型的 4s 提升至最高 60s 的视频时长。
多模态的视频生成能力:除了文生图之外,Sora还可以实现图生视频、视频生成视频(即视频风格切换、环境变化和无缝衔接)等,具备丰富的多模态视频生成能力。
视频时间线的灵活扩展:Sora 还能将视频沿时间线向前或向后扩展。demo中的视频都是从同一个视频片段开始,向时间线的过去延伸。尽管开头各不相同,但它们最终都汇聚于同一个结尾 。
涌现的真实世界模拟能力:Sora 可以创造出带有动态视角变化的视频,让人物和场景元素在三维空间中的移动,看起来十分自然。
Sora可以保持视频的一致性和物体的持续存在,即便在物体被遮挡或离开画面时,也能保持其存在感。Sora 还可以模拟一些真实世界的物理规则,例如人吃汉堡时留下的咬痕清晰可见、画家画的樱花树水彩纸上留下了持久的笔触等。
Sora 有望引领 AI 新一轮景气度,产业链投资价值持续显现 我们认为,Sora 的横空出世,有望进一步激发市场对 AI 产业持续创新能力的期待。
从去年的 LLM,到文生图,再到文生视频,AI 大模型在对真实世界的理解和模拟方面能力持续且快速提升,向 AGI 迈进的速度也超出了大家的预料。此次 Sora 的推出,有望带动产业新一轮的景气度。
OpenAI 新模型可生成60秒视频,AI产业的“Iphone”时刻来临,目前OpenAI发布最新模型Sora可实现文本生成视频功能。 Sora具有长视频生成能力,可以生成长达一分钟的视频,大幅超出此前行业水平。
以奔跑的猛犸象视频为例,视频中几头巨大的猛犸象踏着雪地走近,周围扬起的雪尘运动轨迹十分流畅,远处的雪山和树木清晰生动。视频的整体播放效果连贯且不失真,色彩分辨率高,给人的视觉观感可比拟专业摄影师用高像素摄像机在现场录制的作品。
Sora的横空出世意味着AI大模型对包含文字、因果关系、图像在内的真实世界有更深入的理解。
文字理解:该模型可以在长视频的生成过程中,准确地根据描述生成能表达生动情感的引人注目的角色。通过对使用者复杂描述的文字进行准确刻画,生成视频标题,保证最终生成视频的准确性和一致性。
因果关系:Sora可以确保被摄体即使暂时离开视线也能保持不变。该模型还能提取现有视频,并对其进行扩展或填充缺失的帧。可以一次性生成整个视频,也可以扩展生成的视频以使其更长。
图像:较之于传统GPT 模型,Sora使用了来源更广泛的视觉训练扩散变换器,涵盖不同的时长、分辨率和宽高比。该模型还能根据现有的静态图像生成视频,并能准确、细致地对图像内容进行动画处理。
在下游AIGC核心生产力提升的驱动下,我们坚定看好上游AI算力硬件机会,持续推荐AI服务器龙头工业富联。我们坚定看好以大华股份和海康威视为代表的AI to B的公司,其具备较高壁垒,拥有足够的资金与研发能力,可以充分的吸收海外先进技术实现商业落地,下游应用场景清晰。
春节期间,我们看到了海外英伟达,超微电脑,ARM等AI龙头的一路暴涨,我们也惊叹于sora的文生视频让人眼前一亮,AI的科技发展非但没有变成主题慢慢散去,反而掀起的科技革命愈演愈烈。
我们近期也是重点研究了英伟达老总黄仁勋和OPENAI奥特曼的言论以及海外科技巨头微软,谷歌,META,亚马逊等巨头的电话会议纪要,有两点研究心得供大家分享:
不要抱着爆款的思维看AI发展,AI就是电的发明,每个国家每家公司每个人都需要AI,无论有没有爆款应用,算力芯片必须囤,然后对自己的各项业务进行AI再造。
过去的一年,虽然海外AI疯狂上涨,但国内AI经历了从狂热到冷却的过程,甚至很多人认为AI就是一个主题炒作,离我们还很遥远,这其中最关键的一个分歧就是国内过于追求AI的爆款和颠覆性,认为没有爆款AI应用,就意味着AI发展是不行的。
实际上,我们认为英伟达CEO黄仁勋所说的值得借鉴:“每个国家都需要拥有自己的人工智能基础设施,以便在保护自己文化的同时利用经济潜力。它记录了你的国家文化、社会智慧、常识、历史——你拥有你自己的数据。”
OPENAI的CEO奥特曼也希望筹集5万亿—7万亿美金,用于提高全球芯片制造能力。
结合海外科技巨头电话会议纪要所说,发展人工智能,不是要抱着出爆款的思维,而是思想上要极其重视AI,首先大量资本开支花费购买算力芯片(META预计 2024 年全年的资本支出将在 300 亿至 370 亿美元之间,比之前范围的上限增加 20 亿美元。预计24年底拥有H10035万张)。
其次用这些AI芯片算力对于自己的各项业务进行AI赋能,进一步抢占市占率和提高客户满意度,微软研究发现,使用生成式人工智能来执行特定的工作任务,生产力提高了70%,Microsoft 365用户的早期Copilot在搜索、写作和总结等一系列任务中总体速度提高了29%。
在AI的帮助下,微软云收入增速维持高增长的24%,微软现在有53,000 个Azure AI客户,其中超过三分之一是在过去的12个月里刚接触Azure的新用户。
谷歌和META也在电话会议里反复提到AI对于他们广告业务的帮助巨大,人工智能手机Pixel 8也已经使用谷歌的Gemini Nano等功能。
上述数据说明,AI的率先拥抱者并不是要抱着颠覆行业,而是通过AI赋能进一步提高市占率和用户满意度,就好比让房间有光,可以通过煤油灯,但如果有了电灯,将是对煤油灯的降维打击,所以,我们预计未来国内也会迎来大量购买AI芯片算力,同时对各项业务AI赋能的热潮。
拥有海量芯片算力,数据和IP的公司理论上AI应用突破会更快。我们研究亚马逊电话会议纪要过程中,看到亚马逊最近推出了AI电商助手Rufus,Rufus可让顾客提出购物旅程中的问题。
如使用什么高尔夫球才能更好地控制旋转?或者哪种防寒雨衣最好?您可以就其他相关或不相关的问题与Rufus进行对话,它能连贯地保留上下文。您也可以在我们丰富的产品页面中筛选,向Rufus提出有关任何产品功能的问题,它都会迅速给出答案。
我们认为亚马逊凭借强大的算力储备和海量的电商数据积累,推出这样的AI应用Rufus自然是水到渠成,而微软,谷歌,META也在凭借上述优势各自推出自己相关的AI产品,比如谷歌即将推出的“圈出搜索”功能,使用户可以通过简单的手势搜索在Android手机上看到相关内容,而无需切换应用程序。
所以我们可以预期的是,国内拥有大量算力芯片,拥有海量数据和IP的公司未来毫无疑问在AI应用层面上会率先突破,我们认为腾讯,字节,百度,阿里,京东,美团,拼多多等互联网巨头仍然会保持较强的AI竞争力
半导体。
Sora的改进点在于:1、统一处理图像和视频数据为patch,并将其进行训练;2、采用diffusion transformer这个新架构模型。3、借助OpenAI自己的文本和图像模型来帮助丰富提示词和图像训练。
Sora的意义在于视频模型的训练和推理需求预计比文本、图像又增加了一个维度,从而带来AI芯片持续增长的需求。视频内容的传输预计带来网络带宽的升级。
Google发布Gemini 1.5模型。最大支持百万级别上下文,可一次处理大量的信息。谷歌透露还成功测试了多达1000万个tokens。大模型处理信息的提升进一步拓展了其应用边界。
应用材料 Q1财报同环比基本持平,达到此前指引的上限。公司CEO表示,“云计算供应商的投资重新加速,晶圆厂的利用率正在提升,内存的库存水平也趋向正常。”
ADI此前提出从2月开始对老产品涨价10%~20%。整体板块预期同比在低基数下显著增长。 - 设备:三星、海力士23Q4存储业务均出现转好,预计反映存储行业持续修复。
Sora之后,AI将如何影响传媒行业 [礼物]预计AI视频对视频行业(场景包括泛娱乐、广告、新闻等等)将产生巨大影响。
对于短视频UGC平台,创作者经济的进一步发展,但也需关注是否会有竞争的变化。互联网时代已经降低了内容分发门槛和图文视频创作门槛,推动了图文、短视频 UGC 平台的建立。
过去UGC形式多为15s短平快的视频内容,借助于Sora等工具,普通用户也能实现一分钟精美内容的创作,人人都是微电影导演的时代将会到来。
随着AI多模态的进一步演进,更高维的长视频、游戏、 3D 创作门槛也是指日可待。对于短视频平台,如能及时升级视频剪辑工具的智能化水平,将有助于进一步提升内容生态丰富性,并拉长用户时长。
另一方面对于AI视频公司,通过积累海量创作者,也存在发展为新的调性不同于当前短视频的内容社区的可能性。近期抖音集团CEO辞任转而聚焦剪映,说明公司在新一轮战略调整中,对AI辅助创作领域进行深入探索。
对于内容创作(包括专业影视广告公司、社交媒体内容创作者)而言,一方面降低视频内容生产制作门槛,使得低水平内容竞争更加激烈;对于创意、逻辑、编剧、交互等要求较高的垂类或深度内容的创作,AI视频模型将成为重要的降本增效工具。
尤其是动画、科幻题材等超现实、但又需符合一定逻辑、解放想象力的内容以及视效领域。
从另一个角度看,IP的价值会更加凸显:一方面,模型训练有赖于高质量的数据(版权)另一方面,掌握优质IP的公司,有希望通过AI工具加快IP改编速度,突破过往IP改编中明显的产能瓶颈。
对于创意工具而言,低门槛的创作工具较易受到冲击,包括各类基于小模型的AI视频工具。
面向专业B端客户的创意软件,我们认为仍有一定竞争优势,一是订阅模式长期积累的客户粘性,二是版权库的积累,尤其是后者。
对于新闻等强调内容真实性的场景,AI视频将扰乱新闻创作、传播秩序,AI视频识别将成为内容审核的关键环节。
目前OpenAI发布最新模型Sora可实现文本生成视频功能。
Sora具有长视频生成能力,可以生成长达一分钟的视频,大幅超出此前行业水平。以奔跑的猛犸象视频为例,视频中几头巨大的猛犸象踏着雪地走近,周围扬起的雪尘运动轨迹十分流畅,远处的雪山和树木清晰生动。
视频的整体播放效果连贯且不失真,色彩分辨率高,给人的视觉观感可比拟专业摄影师用高像素摄像机在现场录制的作品。
Sora的横空出世意味着AI大模型对包含文字、因果关系、图像在内的真实世界有更深入的理解。
文字理解:该模型可以在长视频的生成过程中,准确地根据描述生成能表达生动情感的引人注目的角色。通过对使用者复杂描述的文字进行准确刻画,生成视频标题,保证最终生成视频的准确性和一致性。
因果关系:Sora可以确保被摄体即使暂时离开视线也能保持不变。该模型还能提取现有视频,并对其进行扩展或填充缺失的帧。可以一次性生成整个视频,也可以扩展生成的视频以使其更长。
图像:较之于传统GPT 模型,Sora使用了来源更广泛的视觉训练扩散变换器,涵盖不同的时长、分辨率和宽高比。该模型还能根据现有的静态图像生成视频,并能准确、细致地对图像内容进行动画处理。
春节期间,OpenAI 带头执行 AI 芯片投资计划并发布文生视频新品 Sora,英伟达正式发布此前已经有所展示的 AI 本地 部署 RAG 工具 Chat with RTX,谷歌更新 Gemini 至 1.5 版本。
OpenAI 宏伟投资计划,剑指改革全球半导体。据华尔街日报消息,OpenAI正在打造全球芯片供应链,来彻底重塑全球半导体行业,Altman 一直在关 注 AI 芯片的供需问题。
2018 年,Altman 个人投资了一家 AI 芯片初创公司Rain Neuromorphics,2019 年,OpenAI 花费 5100 万美元购买 Rain 的芯片; 去年 11 月,Altman 为一家代号为“Tigris”的芯片企业寻求数十亿美元的资金。
我们认为,从远期来看,算力需求或持续超出我们的想象,如果仅依 靠台积电的先进制程产能进行供应,或难以满足未来 AI 用户持续增长带来的供应缺口,而另起炉灶,构建一套由 OpenAI 自己领导的算力产业链,当 下来看是 OpenAI 切入基础设施领域的可行方案。
文生视频大模型 Sora 横空出世,其能够理解并呈现物理定律,影视动画行业的颠覆性时刻到来。
Sora 虽然仍旧使用 Transformer 架构和基于扩散模 型,但最大变化在于其能够在生成的视频中展现出火焰反光、物体运动惯性等自然界规律;
同时相较于其他扩散模型,视频可以保持相当高的稳定性和 一致性,因此,Sora 呈现的 AI 视频给用户一种连续性强、符合逻辑、具有一定观赏性的感觉。
最重要的是,Sora 依旧符合 AI 缩尺律(Scaling Law), OpenAI 在技术文档中说明,随着训练计算量的增加,样本质量明显提高,进一步佐证了多模态时代,算力需求将成为最核心的瓶颈之一。
Gemini 1.5 将实现大模型最大的上下文窗口。相较于 Gemini 1.0,1.5 最主要的改进是处理大文件的能力,Gemini 1.5 Pro 每次可以处理 100 万个 token,结合原生多模态能力,其可以一次性处理大量信息,例如 1 小时的视频、11 小时的音频、超过 3 万行(或 70 万个单词)的代码。
Gemini 基 于 MoE(Mixture-of-Experts)专家网络,根据给定的输入,MoE 模型将选择性地激活其神经网络中最相关的专家路径,从而极大提高模型效率。
Chat with RTX——AI 助理的一小步,边缘推理的一大步。该工具可以使用 Mistral、Llama 2 等开源模型,帮助用户阅读文档/视频并通过检索增强生成(RAG)总结文件内容,全程由本地 RTX 显卡进行推理。
我们认为,边缘推理是 AI 触及广大潜在用户的“毛细血管”,世界经济论坛在最近的一份报告中预测,能够离线运行生成式 AI模型的设备将“大幅增长”。
其中包括个人电脑、智能手机、物联网设备等,原因在于,本地模型不仅更加私密,而且与云托管模型相比,本地模型的延迟更低,成本效益更高。
在模型层面各家激战正酣,同时在 Scaling Law 不断应验的事实下,我们此前对算力需求充分乐观的观点将持续被验证,AI 算力有望继 2023 年后,继续成为新一年的热门投资方向。
据OpenAI官网,Sora的出发点是公司教育Al理解和模拟物理世界运动并解决现实世界交互问题。Sora 1分钟左右视频自动生成的长度天然契合短剧时长,结合AI换脸技术有望成为短剧出海必选项。
此前超讯通信投资七火山Seven Volcanoes,凭借海外上线发行及取得东南亚TOP3榜单的MiniTV平台开展视频内容新载体创造探索和短视频巨头内容AI化战略服务商等战略。
此次结合Sora发布以及AI换脸、Al图像增强等新型技术有望形成强共振,每成为海外快手AI视频内容战略合作伙伴,超讯通信已具备短剧出海的核心先决条件。
超讯通信官方微信公众号发布消息,公司投资的Seven Volcanoes(七火山)作为SnackVideo(海外快手)的AI视频内容战略合作伙伴,通过前沿Al技术,实现海量内容的本地化,将为印尼用户带来精彩的短剧内容,助力SnackVideo的平台内容生态建设。
OpenAI 发布首个文生视频模型 Sora,效果震撼。Sora 模型可以通过文本描述生成 60 秒长视频,还可以对视频色彩风格等要素精确理解,创造出人物表情丰富、情感生动的视频内容。
目前 Sora 尚未对公众全面开放,仅邀请部分测试者进行体验,但是 OpenAI CEO 在社交平台上展示了由网友提供文本描述生成的视频案例,展现了 Sora 在视频生成方面的强大能力。
Sora 三大亮点突出,实现 AIGC 领域的里程碑式进展。首先是 60 秒长视频,Sora 可以保持视频主体与背景的高度流畅性与稳定性。
其次是单视频多角度镜头,Sora 在一个视频内实现多角度镜头,分镜切换符合逻辑且十分流畅。再是理解真实世界的能力,Sora 对于光影反射、运动方式、镜头移动等细节处理得十分优秀,极大地提升了真实感。
Sora 的技术基础保障了强大功能的持续迭代。Sora 是一种 Diffusion模型,同时具备良好的扩展性。Sora 使用 DALL·E 3 的 Recaption 技术,使视频可以更符合文本指令,此外还具备静图生视频、原视频拓展补帧等能力。
OpenAI 表示 Sora 是构建世界模型的基础,未来将向实现 AGI 继续迈进,我们认为该模型的当前表现展现出这种潜力。
OpenAI的Sora文生视频模型效果:远超所有此前文生视频方案,几乎实现了两个代际的提升,接近消费者/工业生产需要。
60S的内容长度远超此前文生视频的10S长度,达到了短视频的爆款长度;极度稳定的长镜头乃至多镜头;丰富稳定的物理交互。
我们判断OpenAI的Sora效果远超此前的Diffusion模型的根本原因在于模拟世界物理的能力:OpenAli为Sora作为Diffusion模型能力提升的很大来自于更多的视频作为训练集以及准确深入的语言理解能力与世界构造能力。
OpenAI的白皮书尚未发布,从研究人员来看,真正研发Sora的人员仅有三人,其它均为支持性工作。
我们认为OpenAI Sora能力的大幅提升可能主要来自于三方面:1、Diffusion-Transformer架构,2、可能通过UE5、Unity、Nerf等大量生成合成数据作为训练集3、大语言模型的能力提升和对世界能力的提升。
目前商业化进度:OpenAI尚未公开开放Sora权限,表示Sora目前仅为研究项目的开始,CEO Altman在Twitter邀请留言生成视频展示能力,并表示OpenAI已经在和安全测试机构、电影和视频创作者合作,以改进产品。
未来市场展望:两千亿的短视频创作市场有望率先被颠覆。我们认为生成式AI在视频创作和世界模型的大踏步进步将实现对视频/3D/游戏等下游应用场景的渗透。
在短视频、创作工具、游戏等下游领域,Sora等AI原生产品有望融入工作流,增强用户体验、降低用户使用壁垒、进一步降低创作成本,并极大拓展创作者能力边界。
Sora已经踏过创造出爆款内容的时长和品质,意味着一到两年的整个行业的边界即将改变。我们认为在内容创作工具,OpenAI已经和其它产业出现代际差,并带动行业大幅进展,未来一年商业化预计大幅推进。
建议关注计算架构 (NVDA VRT)的需求在推理端的大幅需求提升,API/大模型推理侧的马太效应进一步增强(MSFT OpenAI)、IP类公司将小说转化为短视频能力的飞跃(阅文集团中文在线)电商等垂直行业用户的视频广告等商拍制作流程的大幅加速(ADBE 美图 虹软 焦点科技)、以及下一代互联网创作与分享的平台雏形出现!
OpenAl发布文生视频模型Sora,可以在用户的要求下,生成可最高长达一分钟的视频,例如摩登女子在东京街头行走、黑人男子读书等等(详细案例可参见官网视频),在长达一分钟的视频中可以同时存在远景与近景特写,且细节翔实逼真。
实今日起,Sora 会对部分视觉艺术家、设计师和电影制作人开放,以获得关于如何改进模型的反馈意见,使其对创意专业人士最有帮助。
OpenAI表示将尽早分享研究进展,以便开始与 OpenAI 以外的人员合作并获得他们的反馈,同时让公众了解人工智能的发展前景。
Sora能够生成包含多个角色、特定运动类型以及主体和背景准确细节的复杂场景。该模型不仅能理解用户在提示中提出的要求,还能理解这些事物在物理世界中是如何存在的。
该模型对语言有深刻理解,因此能准确解释提示,并生成能表达生动情感的引人注目的角色。Sora还能在单个生成的视频中创建多个镜头,准确地体现角色和视觉风格。
Sora 建立在过去对 DALL-E 和 GPT 模型的研究基础之上,因此,该模型能够在生成的视频中更忠实地遵循用户的文字说明。除了能够仅根据文字说明生成视频外。
该模型还能根据现有的静态图像生成视频,并准确、细致地对图像内容进行动画处理。该模型还能对现有视频进行扩展或填充缺失的帧。OpenAI今日会公布更详细的技术文档,从中我们有望获得更多技术细节。
OpenAI发布文生视频模型Sora,Sora可以直接输出长达60秒的视频,并且包含高度细致的背景、复杂的多角度镜头,以及富有情感的多个角色。
据OpenAI官网展示的Demo,Sora生成的视频一致性强于此前的Runway/Pika。但Sora目前的弱点是无法理解因果关系/难以模拟物理定律。
技术原理上,Sora基于Diffusion+Transformer模型,一次性生成整个视频的长度,并逐步消除噪声完成视频转换。
在一致性的保障机制上,通过一次性为模型提供多帧预测的方式,Sora确保一些物体即使镜头远离也能保持不变。Sora建立在OpenAl过去对DaLLE和GPT模型的研究基础上。
Google发布Gemini 1.5 Pro模型,使用MoE架构,性能与Gemini 1.0 Ultra类似。Gemini 1.5 Pro上下文窗口达到12.8万个token,部分开发者和企业用户可以通过Vertex AI和AI Studio的预览版尝试最多100万个token的上下文窗口。
在Gemini 1.5技术报告中,Gemini 1.5 Pro在较短的文本长度上的性能超过了GPT-4-Turbo,并且在100万token的范围内保持了相对稳定的表现。与之对比,GPT-4 Turbo的性能则明显下降,且无法处理超过128,000 token的文本。
Gemini 1.5继续强化Base Model向长上下文窗口发展的趋势,前OpenAl研究员Andrej Karpathy提到AI技术栈中,上下文窗口相当于缓存的作用。
据The Information,OpenAl正在研发一款搜索产品,并部分地由Bing支持,进一步强化与Google的竞争。此举反映Bing Chat并未影响Google在搜索市场的份额。
目前尚不清楚该搜索产品是否会独立上线,还是与ChatGPT结合。此前的ChatGPT也可以调用Bing搜索,但响应速度慢于Google的Gemini。
目前已有Perplexity深耕Al+搜索领域,截止24年1月,Perplexity ARR达800万美元,估值5.2亿美元,Perplexity主要基于GPT和其他开源模型。除Al+搜索外,OpenAI 24年预计会发布AI Agent产品
Sora性能:视频时长现象级扩展:可达到60秒,且并非多个3-4s视频的拼接,连贯性强;
更强的一致性:物体形状、场景风格保持出色,可实现多镜头切换,不再局限于单镜头视频生成;
逼真程度再上一台阶:相比PIKA、Runway,Sora生成视频在人物手部动作、面部表情、动物眨眼等高难度内容上表现大幅提升。采样灵活性:可根据设备的原生宽高比创建内容。
技术:将视频和图像编码成潜在代码,分解成包含时间和空间信息的Patches,利于模型训练,可类比LLM中的Token;
语言理解:使用了DALL-E 3中的重述技术,将视觉训练数据生成高精准描述性的字幕,提高语意理解能力。
OpenAI坦言Sora目前仍存在局限性,如难以准确地模拟复杂场景的物理属性,玻璃破碎;也可能无法理解因果关系的具体实例;混淆提示的空间细节,如左右等。OpenAI尚未公开开放Sora权限。
我们预计AI视频对视频行业(场景包括泛娱乐、广告、新闻等等)将产生巨大影响,一方面降低视频内容生产制作门槛,另一方面创意、IP的价值会更高;
算法、算力等技术公司也有往参与分享产业链价值。此外,UGC视频的质量将进一步提升,过去UGC视频多为15s短平快的视频,有了AI视频工具助力,一分钟以上的微电影社区指日可待
