OpenAI发布会解读及大模型前沿技术展望0516
相守湖畔
2024-05-17 08:24:32
来自江苏
  • 点赞
  • 评论
  •   ♥  收藏
  • A
    分享到:

OpenAI发布会解读及大模型前沿技术展望0516

摘要
本次讨论集中于一种新型的多模态交互模型,该模型通过结合多种交互形式(如语音与视觉),实现了高度个性化和流畅的用户体验。特别是其中的GIDPT模型,以其在端到端设计、多模态理解和生成能力等方面的突出表现,展现了在不同模态间无缝切换及实时响应用户输入的能力。此外,该模型在降低交互延迟、提升模态一致性的同时,还具备打断功能,增强了互动的自然性和实用性。通过对视频与语音模态特性的对比分析,指出了它们在信息量和处理速度上的差异,以及相应的技术挑战。讨论还涵盖了如何通过多模态训练、优化tokenization方法、使用高效连接方式等手段,提高模型性能和效率。其中,特别提到了注意力机制(如MLA)的应用,不仅减少了计算量和存储量,还提升了模型准确率。最后,探讨了未来在模型架构创新、优化及大型模型(如MOE架构)下的发展潜力,尤其是GPT-5预计将带来的多模态扩展能力,以及国内AI研究在追赶国际先进技术中的挑战。

 

问答

问:GPT-4在交互体验上有哪些显著提升?

答:GPT-4在产品体验上做了很多改进,特别是其多模态交互变得非常逼真且实时。在多模态交互过程中,包括语音、文本、视觉等多种模态能够无缝融合,实现流畅且低时延的交互,从而极大地提高了用户的满意度。

 

问:端到端多模态模型如何实现高效的交互和低时延?

答:端到端多模态模型(如GPT-4)通过直接接收和处理来自多个模态的输入,避免了传统级联式系统的两个主要问题。首先,级联系统由于处理环节较多,导致时延难以控制,尤其在语音回复中留给大模型的时间非常有限。其次,级联系统模态间的一致性较差,无法实现例如将说话人的语音实时部署给听众并用“悄悄话”方式播放的功能。相比之下,GPT-4能实时打断交互,并在保持内容不变的前提下对图片进行可控编辑,显示了其在模态一致性和实时性方面的优势。

 

问:视频理解与语音理解有何不同,以及视频模态在GPT-4中的具体表现如何?

答:在视频理解方面,GPT-4主要通过用户主动询问来获取视频内容,视频模态并非常驻,不像语音模态那样自然融入对话。此外,由于视频信息量远大于音频,每秒钟生成的token数量差距较大,对模型推理速度的要求也更高。因此,视频模态需要进行特定优化,如压缩、抽帧选取、关键词提取等,以确保模型能够快速处理大量视频信息,同时实现记忆功能,例如保留过去一段时间内的视频内容以供后续查询。虽然目前技术细节尚未公开,但GPT-4确实对视频模态做了有效的优化,使其能够更好地服务于用户需求。

 

问:在GPD3.5或GPD4的文本模型上,人格化拟人化是否可以扩展到语音模态?

答:是的,人格化拟人化在语音模态上也能实现,并且只要tokenizer支持普通说话的音节词和音调,以及语气(如感叹号)等信息,就具备这样的功能。语音模态和文本模态在数据上有天然的对齐性,因此少量语音和文本配对的数据就可以让预训练模型具备端到端语音功能。

 

问:端到端综合态大模型GPD4O在实现过程中面临的主要难点是什么?在训练统一端到端模型时,与单模态模型相比,数据上面临哪些特殊挑战?

答:主要难点有两个:一是多模态之间存在元素级的问题,单一模态模型训练相对容易,但在扩大规模并采用新架构后,稳定性挑战增加,包括模型变大导致集群故障、数值稳定性不稳定等。二是训练过程可能需要精细调整,特别是针对数据敏感词,如IP32精度的训练,以及可能需要分阶段进行训练,如固定第一阶段文本主干模型,第二阶段放开所有参数等。主要挑战在于多模态数据的质量和规模,尤其是数据的多样化和丰富度要求更高。此外,由于多模态模型可能泄露未来token信息,影响模型的学习过程。同时,对于合成数据的需求也很大,因为当前开源模型在文本数据上已接近最先进的闭源模型,而多模态数据仍有较大的提升空间。

 

问:在处理多模态数据时,如何混合不同模态的数据?

答:在多模态模型中,可以有四种主要的数据混合方式:单一模态输入输出、语音输出和文本输入、文本输出和语音输入、以及交互式的语音和文本输入输出等。此外,对于多模态模型,还可能涉及更多复杂交互任务,例如翻译、语音识别、文本语音生成等,这就要求将不同任务的数据混合并精细构建,以确保模型的稳定性和训练效果。

 

问:GPD4O模型在 tokenization 方面有何改进,这对推理速度有何影响?答:GPD4O模型针对英文为主的推理场景,对其 tokenization 的效率进行了提升。由于使用更少的 token 来代表词语,推理相同的实体时所需token量减少,从而使得推理速度更快。不过,这种改进不仅影响速度,还会对模型精度产生较大影响,具体效果需要通过实验验证。

 

问:OpenAI模型在处理不良词汇时为何表现随机?

答:OpenAI模型在处理不良词汇时反应随机是因为它在训练时,从预训练语料中选取高频词汇进行tokenize,并在训练过程中去除了一些低质量的数据。因此,对于那些低频且在预处理后可以屏蔽掉的不良词汇,模型缺乏针对性训练,将其视为噪声或无意义的词汇。

 

问:OpenAI模型提升推理速度和效率的可能性有多大?

答:提升OpenAI模型推理速度和效率的可能性相当高,可达30%到50%。

 

问:国内量化机构发布的开源模型“district version check”的创新点是什么?

答:该模型创新点在于attention层,尤其是MLA架构。它优化了KV cache处理方式,通过压缩和解压实现存储和计算的平衡,从而提升了模型的推理效率,同时比MOTA共享模型的效果更好。

 

问:MLA架构是如何实现KV cache压缩和解压的?

答:MLA架构首先对KV cache进行了压缩,使其变成一个固定长度的向量,与head数量无关。这使得在推理过程中,解压这一运算被省略,与其他运算融合在一起进行,从而实现了高效的推理实验。

 

问:业界对于去掉attention机制的模型架构如何看待?

答:业界对去掉attention机制的模型架构持谨慎态度,尽管存在一些理论上的探索,但目前并未见到头部模型厂商在这方面做出大的尝试和投入。同时,去掉attention机制的模型仍需解决计算效率和缓存瓶颈等挑战。

 

问:在大模型时代,模型架构创新是否更加苛刻?

答:是的,在大模型时代,对于模型架构的创新要求更高,因为大模型想要在大规模训练中被采用,需要比小模型更显著的优势。即使在实际落地方面,许多研究机构在探索新架构,但与作为预训练基座模型的要求相比,仍有一定距离。

 

问:针对线性模型如memba是否有十倍优化?

答:目前来看,memba等线性模型在transformer的细节上已经做了充足的工程优化,但在原始实现中很难做到极致优化,因此其效果可能没有论文中报告的显著,从而未能被大规模采用。

 

问:MOE在模型架构中的发展趋势是什么?

答:MOE作为一种模型稀疏化方法,其本质是在expert层面进行模型的参数化选择。目前出现了多种扩展MOE的新思路,如google的MOD,可以进行层级别的稀疏化,以及美国AI芯片独角兽提出的AI AOE,它能够集成多种异构模型进行协同计算。未来MOE的发展趋势包括在expert之外寻找其他维度进行稀疏化操作,以及对M1模型进行细粒度优化以提升性能。

 

问:在计算复杂度方面,MOE模型与传统transformer模型有何区别?

答:MOE模型的参数量和计算量相较于传统transformer均显著增大,尤其在FFN层上,存储消耗更大,显存压力增大。此外,MOE还涉及到OT通信,通信量相较于传统模型也有所增加,这对硬件设备提出了新的挑战。

 

问:在推理阶段,MOE模型是否会增加更多的通信需求?

答:是的,在推理阶段,MOE模型确实会增加不少通信需求,特别是在张量并行和专家并行这两个维度上,通信量较大。为了优化通信效率,需要将通信要求较高的节点或卡连接在高带宽节点之间进行通信,以减少跨节点通信的时间延迟。

 

问:目前针对长文本模型优化的程度如何?

答:针对长文本模型优化的程度较高,目前发布的长文本模型上下文长度已达数百万级别,满足了多模态应用特别是视频模态对长上下文的需求。随着文本长度的增加,模型优化的重点在于如何处理大量且快速增长的上下文信息,同时也可能面临新的挑战,例如如何在保持高质量输出的同时提高模型的训练和推理效率。

 

问:在长文本训练方面,业界有哪些关键的优化进展?

答:业界在长文本训练方面取得了显著进展,主要有三个方面。首先是black attention技术,通过显存优化可以大幅降低训练时所需的显存消耗;其次是序列并行技术,包括d discard的dispread方案、微软dispute方案以及国内coso牧城科技的方案,这些技术可以实现虚拟并行,提高训练效率;此外,英伟达在max to one call软件站中集成了序列定型工具包,进一步推动了长文本训练的发展。

 

问:预训练层面有哪些重要发展?

答:预训练层面的一个重要进展是,目前的模型能够训练到64K序列长度,同时具备一定的外推性能,能够在科学相对位置编码等方面再推4到8倍,但实现这一目标在工程层面仍面临挑战。

 

问:您认为今年可能会发布的GPT5会带来哪些新的能力?

答:GPT5作为GPT4的下一代模型,预计会是一个端到端的多模态生成模型,相比之前的文本中心模型如GPT4,其多模态特性具有极大的想象力。虽然GPT4O已经包含了联合视觉理解功能,但GPT5可能将这一特性发展到极致,并且在数据规模和模型规模上都会有更大幅度的提升。

 

问:国内模型追赶海外的节奏是加快还是放缓?目前面临哪些挑战?

答:虽然国际上最强大模型公司的研发进度可能不是线性的,但发布节奏是阶梯性的。总体来说,国内公司在追赶海外大模型方面呈现出一个缓慢但稳步的过程。特别是在从单模态到多模态架构转变方面,国内公司在数据和系统工程优化方面具有优势。然而,集群规模从几千卡到上万卡甚至10万卡的需求是一个关键挑战,国产芯片能否满足这一需求尚待观察。

 

问:国内在AI芯片、算法库和AI框架方面的情况如何?

答:国内有一些自己的大模型训练框架,如鹿城科技Closer和华为Mind Spore,但业界主流还是使用英伟达的patch加上训练框架。尽管开源社区也在积极发展,但由于大模型开发需要追求效率以与时间赛跑,所以大家倾向于使用英伟达这样的主流方案。

(来源:相守湖畔的财富号 2024-05-17 08:24) [点击查看原文]

郑重声明:用户在财富号/股吧/博客等社区发表的所有信息(包括但不限于文字、视频、音频、数据及图表)仅代表个人观点,与本网站立场无关,不对您构成任何投资建议,据此操作风险自担。请勿相信代客理财、免费荐股和炒股培训等宣传内容,远离非法证券活动。请勿添加发言用户的手机号码、公众号、微博、微信及QQ等信息,谨防上当受骗!
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500