用声音碰撞世界,
生动活泼,
Hello,
大家好,
我是丁,
欢迎收听全新一季,
哈喽,
大家好,
欢迎来到我们今天的科技,
早知道在这一季的第11期里面,
我们曾经邀请过几位研究人员和大家聊了聊投影人工智能离我们有多远这样的一个话题,
那当时听众尖头叉子在评论区里面聊到,
终于听到了一期讲AI研究的节目了,
那也有很多听众对上一次的嘉宾的问题表现出了很大的这个兴趣,
比如像是在大模型的记忆和泛化上面,
那研究人员是怎么样考虑的,
那也有一些说是那AI除了TOC端的应用之外,
还有一些其他什么样的这个tob端的应用,
那今天抱着这样一些问题,
我们邀请到了一位重磅的嘉宾田琪博士,
他是现任华为云人工智能领域的首席科学家,
国际欧亚科学院院士,
然后他也是爱的fellowo,
那今天我们就和田老师从他几十年的人工。
智能的从业经验,
来一起聊一聊大模型华为云盘古大模型的研究和开发,
以及在TOC以外的行业应用。
那今天欢迎田老师来做客我们的节目,
你好,
主持人,
我是平齐,
大家好,
嗯,
田老师,
您是其实一直是在人工智能,
算是在计算机视觉领域,
CV领域进行研究的,
整个您的职业生涯都是在这个领域的,
当时为什么是选择了这个领域,
能不能快速的帮我们介绍一下您的这个背景?
那我其实正式开始从事机视觉的研究呢,
是1997年,
我到UC,
就是利诺大学香槟分读博士开始的,
当时我导师呢是托马斯黄教授,
托马斯黄呢,
他是计算机领域的帕尼尔,
他培养了很多的师兄弟,
那么从那个时候还是从事正式的所位研究,
到现在的话已经26年了,
对那在计算机视觉的AI应用,
其实前几年应该是特别火的,
从停然后到这个自动驾驶,
我不知道您整个是行业的这样的一个发展,
您是怎么样的观察下来的?
KCT的游戏呢,
其实我自己也玩过,
大概109年10年出来以后呢,
我家的小孩子就很喜欢他对我也买过很很好玩打拳击的,
对对对,
他主要是K本身呢,
除了RGB以外呢,
再加了一个深度捕捉,
实际上回答这个问题来讲的话,
就是说学习和业界怎么相互促进和相互发展,
对吧?
那么我们在过去十几年在事业中看到的一个问题啊,
一般是产业界呢,
会在实际的应用中,
它会提炼出一些问题,
然后呢,
把这些问题呢给学术界,
比如知识学术界的一些研究,
希望学术界用了一些先进的理论来解决这些问题。
嗯,
您是什么时候从学界出来跳到产业界的?
如果正式说加入华为的话,
是2018年6月份,
那么如果说跟工业界的合作的话,
就开始很早了,
之前在美国大学做老师的时候,
那就跟企业界有很多的合作,
跟谷歌的合作,
跟微软的合作,
跟AC的合作,
就这两年工业界其实大家一开始在看到了像是BT这样子的一些在这个工业界的应用吧,
然后他在学界,
现在大家是怎么样看的,
我不知道这个你有没有一些观察。
是这样的,
因为这几年的话,
我主要聚焦在做大模型嘛啊,
大模型来讲的话,
其实是要求的条件是比较高的,
首先你得有比较大的算力,
这一点的话,
在学术界的话,
可能很难具被大量算力这样的一个一个条件,
同样的话,
你得有大量通用的数据,
那么一些海量的通用的数据呢,
是可以从学术界可以从网上去下载,
但是对于一些场景的行业的数据的话,
学术界呢也很难获得,
这是第二个啊,
因此呢,
就是说大家也可以看到在整个业界在大模型方面的研究呢,
像产业界呢,
它是领先力于学术界的,
那反过来呢,
产业界呢,
在大模型的研究中呢,
其实也发现了很多的问题,
也包括大模型的,
比如说推理训练的问题,
如何降低我的推理,
包括训练的成本,
去推理的成本,
那么这些问题的话,
都可以交给学术界来进行研究,
当然了就是学术界呢,
现在我听到的一些问题是相对有一些困惑,
因为在这个日活条件的大模型的研究中啊,
学术界觉得当很多老师啊。
啊,
作为独立的团队,
他们还是不太具备做大拇型的这个条件,
因此呢,
他们很渴望啊跟那个企业界的一种合作,
企业界来讲的话,
也有很多开放性的课题,
可以在大模型的基础上,
大模型的底座上呢,
开放给学习界一起来做研究,
共同学习的大模性的发展。
咱们这个盘古大模型,
我知道您是应该是在2021年的时候,
当时就是宣布了这个盘古的大模型,
当时是一个怎么样的契机,
是想要做盘古大模型的呢?
首先啊,
就是说因为到了2020年呢,
我们在自己的研究中啊,
也从几个方向提出的一些研究的此课题,
比如说我们在2020年4份的华为的HTC大会上呢,
我们在关于视觉的研究方向,
提出了关于数据、
模型和知识,
提出了六个此课题,
那么数据呢,
就包括数据模方计划,
数据冰山计划,
那模型呢,
包括那个模型摸高计划和模型瘦身计划,
模型的摸高呢,
就是指做大模型,
做到极致的性能,
在知识抽取方面来讲话,
我们提出了一个叫万无一失的计划,
另外一个是虚势合一,
因此在第6个子计划中呢,
跟我们大部型研究非常相关的就是一个模型摸高的计划,
一个是万物一失的计划,
所以从那个时之前呢,
就是在GPT3出来以前,
其实我们也在往这个方向是不断的推进。
G3在2020年5月份出来以后呢,
表现出了非常的压的一些表现,
这个表现呢,
在C的研究中,
当时还没有看到,
但是就直接感觉到呢,
这是一个非常好的一个发展方向,
因此呢,
从2020年的夏天开始就开始进行大模型的大模型NP大模型C方向,
包括后来扩展到多模态科学计算预测决策呢,
进行了这样的一项。
嗯,
那我再追问几个问题啊,
就刚刚您说的是,
咱们其实是在2020年的时候,
其实就已经在几个大的领域去进行研究了,
然后当时咱们可能最先开始研究的应该就是CV计算机视觉的这个大模型是吧,
然后NLP也是慢慢加入了这个我们的这个计划里面,
我不知道当时为什么是可能先选CV大模型开始在这个领域发力呢?
因为像团队的主要的成员,
包括我自己啊,
主要是视觉的背景,
所以呢,
我们当时一直是想做好视觉的这样的一个底层的骨干网络,
但是呢,
CV和AP呢,
它是有一定差别的,
CV的一些挑战,
比如说它的语信息的密度是非常稀疏的,
第二来讲的话,
它的预和预间的差异是比较大的,
因此呢,
这是它和NOPP的一些本质的区别,
导致了当时CV做大模型呢,
它会面临更多的一些挑战,
但是NP大模型出来以后呢,
那我们也看到了这样的大模型,
它带来的潜在的这样的一个一个能力,
所以的话,
在我们不仅在CV大模器上往前推进的话,
我们在NP大模型上的话,
也就开始发力了。
因为好像在业界,
其实现在在NLP现在好给大家发展到了一个新的高度,
其实在CV方面好像我们现在有点有点落后了,
我不知道能不能这么说哈,
就很多这个研究的团队,
其实把CVtoken化还是挺难的,
对于很多的研究人员来说,
他是一个前沿的一个研究的一个需要解决的难点,
我不知道您这块怎么看作一个CV的专家。
CV的发展呢,
在这些年呢,
确实遇到了一些瓶颈,
因为现在的话,
我们是把CV呢,
就像说的你把它to拉对吧,
然后呢,
把它当做一个序列的这样的一个问题来处理的,
但是呢,
我们认为呢,
就是说CV这里面呢存在的一些问题,
那主要是什么呢?
没有像比如说NP大模这么成功,
主要是CV呢,
还没有像AP那样的对话任务那样的一个东西,
构建出一个完善的一个交付的环境,
使得AI算法呢,
能够直接在目标任务上进行训练,
但是呢,
这两年呢,
大家看到CVRNP在,
其实我认为它在快速的融合,
因此呢,
我认为CV大一统的模型的话,
可能会在未来的1~3年之内会出现,
那么现在更多的研究呢,
是以多胞态的形式出现,
就是在比如说结合这个NP和CV这两个方向,
我不知道咱们现在的这个华为盘古大模型,
我们的研究方向是什么样子的。
那么我们主要研。
这个方向呢,
就是我们认为啊,
就是像大模型啊,
它本身就像网上所说的,
它是GPC和互联网以后它的一些新的这个一个科技革命,
所以很多行业的话就会给大们去重塑,
那么我们的研究方向来讲的话,
就是不仅要在算法开发上呢深入研究,
另外呢,
就是在工程化和商业化呢进行一个探索,
就是我们的一些算法研究人员,
那主要开发和训练这样的一个大模型啊,
我刚讲的大模型,
我指的是一系列的盘古系列大模型,
那么算法人员呢,
刚才说的主要是训练大模型,
以实现大模型的极致性能作为自己的目标。
另外一块人员呢,
是公众化人员,
主要负责探索如何让大众和企业更方便的去使用大模型,
为行业服务,
我们认为呢,
这是AFindustry人工智能下一个新的爆发点,
对吧,
最后的话就是除了研究和工程化以外呢,
我们探索一些新的商业模式,
保证大模型的这样的一个商业成功,
那么我们把大模型赋能启行百业呢,
我们把它分成呢,
成为A20。
到L1到L23层的模式,
到L0的基础模型类些model,
到L1的行业模型,
到L2的这种细分场景的模型,
那么针对不同客户的需求,
我们有不同的商业模式啊,
比如说我们可以提供算利,
我们可以帮他们去build的这样的一个foundationmodel,
对吧?
或者呢,
在foundationmodel110的基础上的话,
如何帮助客户去训练他们的行业模型,
甚至是帮他们如何去部署他们的细分场景的端测和边测的L2的这样一个模型。
嗯,
其实这块还有挺多问题,
我们可以延伸的哈,
就您刚刚讲的,
它是一个系统性的模型,
然后是可以分成L0L1和L2的,
然后其实根据客户的需求,
你可以不同的帮他们做一些部署,
然后不同的这样的一些调整和组合,
是吧,
其实我这样理解是没错的,
对吧?
是的,
因为客户呢,
他肯定有不同的需求,
那客户呢,
如果说他的AI的团队能力较弱的话,
我们需要帮助他从foundationmodel开始建起,
如果客户有一定的这样的AI团队,
但是可能相对能力不是特别够的时候呢,
那么我们可以帮助他们去建L的,
把防地报桶,
把它建好以后呢,
在L的基础上加入行业数据进行训练,
帮助他们,
然后呢,
就是把一些任务呢,
叫L2的开发任务呢,
可以交给他们团队自己完成,
因为他客户的需求有很多种,
如果说他的团队能力非常非常强,
那就是没有算力的话,
那么只是帮他提供算力,
帮他去做一些指导和咨询就够了。
理解就您刚刚我们其实最早开始聊的几块,
就是华为盘古底层的这个大模型,
CVNLP,
还有整个这个科学计算,
这个都是属于是L0的这个基础模型,
对吧?
对,
就是说我们是从基础大模型开始做起的,
但是呢,
就是像CVRAOPP啊,
比如说AOPP,
我们用海量的就互联网的数据来训练的基础模型,
在上面之上呢,
我们在用行业的数据,
或者说一些功能模块的数据来做各种各样的微调,
去实现对话,
实现翻译啊,
实现这样的文案摘要的不同的这样的一个应用。
那现在各个大厂其实都在积极的训练自己的大模型呢,
当然也包括一些这个创业公司了,
那华为云盘古大模型不太一样的地方,
它其实的切入点是在这个tob端是AIforindustry,
这个助力千行百业,
那我不知道这个田老师能不能给我们分享一些已经落地了的应用。
啊,
因为现在实际上我们的目前来讲的话,
像一些大模式的应用,
大部分是在N的方向,
那么在实际的商业落地的项目中呢,
大量的C位的项目,
还有一些预测决策的多摩肽呢,
从研究来讲的话,
它实际上是一个比较新的一个领域,
那么在学术界的话,
这方面研究主要是从去年开始的,
那么在多模态这方面来讲的话,
你要说现在有很多的行业用呢,
其实业绩也没有太多的,
所以就从我们在过去一年多的话呢,
更多的应用呢,
还是在视觉的项目中,
在NP的项目中呢,
实际上呢,
我们去年交付了一个千亿参数的阿拉伯语的大模型啊,
这可能是业界首个商业落地的,
而且千亿参数的NP大模型,
同样的话,
就是科学计算来讲的话,
我们在海洋气象上都做了自己的科学,
比如说盘古海洋大模型,
盘古气象的模型,
如果从商业变现的角度来讲的话,
这两个其实还在商业变现的推进的过程中。
但是从使用项目来看的话,
比如像我们的盘古气象等模型,
已经被欧洲气象局和中国气象局,
还包括谷歌、
英伟达,
法国气象局,
英国气象局做了多次的这样的一个对比的一个试验,
所以开他报告中的话,
像欧洲气象局也承认与盘古气统相比的话,
那盘古气统相对于欧洲气象中心的数据预报的话,
有个大幅的一个提升,
并且在今年的像2023年的世界气象大会上的话,
那么欧洲气象局的执行总裁他也说从今年六月份他们开始更新的系统中,
他们会和盘古的预测呢做对比,
对就现在就是AP和CV结合多模态的这样的一个应用呢,
实际上在业界还更多的才处于这种研究的一个状态,
这是我们今年谈到很多客户啊,
那么很多客户呢,
都提出了这样的需求,
只是具体的案例呢,
还没有完成啊,
啊当然里面呢,
还有什么研究呢,
还在继续中啊。
嗯嗯,
对,
因为现在大家好像在聊NLP,
然后一些落地的应用,
其实就是一些拆吧,
然后可能在TOC端的应用想象空间会更多一点,
当您提出来赋能工业的时候,
其实还是挺让大家觉得想要去多一些了解,
现在在工业场合当中是有哪些是我们能够很快能看到它的一个市场增长点和爆发点的,
我不知道这块您刚刚说已经聊了一些这种潜在的客户,
但是我们还是在可能早期的共同研发,
共同开发行业的这个解决solution当中,
我不知道能不能透露一些,
刚除了在气象上面有没有一些其他的可以给我们稍微稍微介绍一下的。
那么这样从几个方面来看吧,
就是一呢,
从需求的方面看,
工业领域呢,
有大量场景存在自动化的这样的一个需求,
比如说工业质检一个摄像头呢,
能够替代机械重复的这种人工的动作,
就非常适合AI模型在这些场景进行发力,
进行自动化的升级,
具有可观的这种潜在价值。
这从需求上看,
那么从数据上来看的话,
能得益于通讯或者数字化手段的普及,
那每个行业呢,
都积累了海量的高质量的电子化的数据,
能够满足数据驱动的AI模型进行大规模的训练,
从结构现状上看的话,
那许多工业场景已经完成了数字化的转型,
而智能化的转型还存在着巨大的空间,
我们这几年呢,
在tob的行业中呢,
也在AFindustry这个道路上的话,
也积累了很多经验,
嗯,
能不能咱们讲几个具体的例子呢?
其实非常多啊,
讲几个,
一个呢,
是铁路的这样的一个缺陷检测,
我们叫TFS,
一般来讲的话,
它是通过人工的巡检,
难度就比较大了,
那目前呢,
比如说全度大概有6000人左右的这样动态检测员,
他承担的对TFS检测设备所拍摄的车辆的图像,
他进行人工的分析,
工作量比较大,
那么我们团队呢,
大概从2020年开始探索铁路这个TFDS的智能的识别系统,
那么实现了超过300多个故障的自动化识别,
但这故障的总体识别率呢,
达到了99.15,
从结果上来看的话,
就是在2022年去年12月份进行评测的时候呢,
针对78个设计的这个故障,
那么算法呢,
实现了零漏减,
人工漏检呢,
其实还有16个,
因此呢,
在铁路上TFTT是在略应用呢,
获得了国铁集团正式发布的一个技术审查的一个证明,
啊,
这是盘古团队。
啊,
它发布的可商用这种大模型的一个落地的场景,
可以呢,
全面的提升检测员的工作效率,
确保车辆故障的精确分析。
另外的话就是说,
比如说在电力巡检上,
我们在国网电力巡检最早的方法,
但是工人比如说爬到高架上进行人工的这样一个检查,
当然是非常不安全的,
后面的话变成了无人机的巡检,
但是无人机每天会拍摄海量的照片,
那其实在里面有缺陷的样本呢,
还是非常少的,
因此如何从海量的这种收集的高这照片中快速的去筛选可能有缺陷的这样的照片,
如何从筛选出来图片中快速的去识别是哪种缺陷,
就是过去呢,
都是用小模型来做的,
在我们使用盘古大模型以前呢,
各个厂商基本呢采用多个小模型来适配不同的缺陷,
那模型大小的这样的数量级,
基本是像传统大家所用的RE50彩照网络5050车这样的一个。
大小参数呢,
在400万左右,
那么我们盘古大模型针对书店场景的,
它的几个大类的这样的一个缺陷的检测呢,
我仅使用一种模型就可以适配上百种小类别的缺陷,
这个模型的参数量呢,
大概在4亿左右,
那使用这个盘古大模型以后呢,
相对于之前的基准的方法,
它提升了20%以上的这个准确率,
并且呢,
大幅的减少了人工的标注量,
同时呢,
将它的筛选效率呢提升了30倍,
筛选质量呢提升了5倍以上,
嗯,
就您刚刚讲,
其实咱们之前很多行业的应用,
其实多个小模型它结合起来嘛,
然后现在变成了一个大模型,
其实是在这个效率上面和成本上面都是有极大的这个提升,
那我不知道中间过程中的算力消耗的这个情况是怎么样的。
所以你3号的话,
其实我先说气象吧,
好吧,
我先说问题啊,
它是在全球海洋的任何一个位置,
比如说告知它的精度和纬度以后呢,
我都可以定位,
第二来讲的话,
告知它的当地当时的风速,
这个是条件,
那么问题是什么?
告诉我现在这个地方,
在这个风速的情况下,
它的波浪的浪高是多少,
那么传统的科学计算,
那求解这个问题的话,
那么它可能要用比如说像太傅之光这样的一个超声中心,
几百个节点的一个算力,
它可能要运算两天才能做一次预测,
嗯,
那么在我们的盘古这个海洋模型中的话,
那么我做一次推理预测的话,
可能只需要一秒钟,
换句话说的话,
那么在做全球的这样的一个天气预报上,
那么对未来一小时到7天这样的一个全球的天气预报,
未来24小时一天气预报为例,
那么可能你在超限中心也需要3000个节点的超算算率。
也可能是需要运算几个小时才能得到一次预测,
嗯,
但是呢,
同样,
呃,
在盘古气象的模型来讲的话,
它做一次预报在24小时天气预报的话,
它只需要1.4秒,
嗯,
这个算力是极大的提升,
对,
就算你是极大提升,
甚至现在中国气象局下载了我们的,
就使用我们的盘古气象模型进行预测的时候,
它在CPU上就可以跑,
在CPU上跑的话,
它可能需要几个小时,
但对我来讲的话,
我觉得花几个小时,
比如说我不如去买块GPU板,
对吧,
但是呢,
就是即使几个小时这样的一个中国气象局他们也是可以接受的,
就刚才讲的是AI推理的过程会非常快的,
训练的话,
那么对盘古七象来讲的话,
我们用了全球,
比如说过去40年的数据总量呢,
它的数据呢,
可能超过1000TB,
那么实际上我们在训练我们第一个版本的时候呢,
我的数据呢,
可能用到它的一个子集可能在100TB。
到200TB之间,
那么我训练这样一个气象模型,
我是做了一个3D的,
叫做架构这样一个模型,
现在我们当一些新的工作,
其实我们已经完成,
只是还没有对外公开,
就是我们把过去需要三个月256卡的这样的一个训练的任务啊,
我已经把它降低到了用8卡只需要不到一周的时间,
那么甚至将来呢,
就是说从256卡三个月的训练量降低到现在8卡,
不到三天的训练量就可以完成,
嗯,
那么对于这样的一个带来的一个派的影响是什么呢?
就是过去西昌预报它需要巨大的超声算力,
甚至是很多小的国家它都没法去完成的一个任务,
现在的话,
我把它变成了8场,
这三天内可完成,
在普通的大学的一个实验室,
咱俩就可以完成这样的一个气象预报的一个训练的一个过程,
嗯嗯诶,
那我作为一个不是这个technical光的人,
我想要知道,
其实咱们这个参数已经足够然。
它是足够,
这个模型其实是比较泛化的,
在上面再加其他的一些训练是更加容易呢,
还是因为什么其他的原因,
那首先来讲呢,
就是说因为实际上呢,
对气象这一块来讲的话,
用3dtransformer架构,
我们是把这个气象预报的问题当成了一个视觉来处理的一个问题,
参数量是很大了,
对吧,
但是呢,
在视觉的很多问题中,
它不光光是说参数量大,
而且看我的计算的复杂度是很高的。
所以咱们其实解决了计算复杂度的问题,
通过算法,
然后计算量,
现在如果同样的计算量的话,
其实都可以更加快速高效的这个进行,
我可以这么理解吗?
是的是的,
就是我们在气象术语中,
因为我们把国内气象全球来讲的话,
它的精度和纬度对吧?
它精度呢,
是一个0~360°这样的一个范围吧,
它的纬度呢,
从北半球到南半球呢,
它是一个180°这样的一个范围,
然后我们获得的数据的它的经纬度的分辨率是多少呢?
是0.25×0.25,
那反过来讲的话,
从把它这样的一个分辨率进行网格化以后呢,
我们把全球呢,
就可以网格化成一个1440×720这样一个大小的像素点,
对气象来讲的话,
我们的这个通道呢,
可能它是有5个这样一个值啊,
当时选择了一些卫食啊,
高度啊,
风速啊等等,
还有一个来讲的话,
气象来讲的话,
它从海平面到高空,
它其实是有可以分成3。
三七个不同的这个等压层不同等压面呢,
就是不同代表气层的一个高度,
分成了37个等压面呢,
我们在第一版的训练中呢,
把它用到其中的13个等量面,
所以实际上它的气象的输入相当于图像的输入呢,
它的输入是1440×720×5再乘以13,
啊13就分三个等压面,
那么这个大小呢,
相对于图像大小呢,
在224×24×3的话,
基本上大了快500倍,
我想说的是什么呢?
就是说气象的输入和输出相对于常规说的CV的图像,
它是要大很多的,
我那我稍微来总结一下,
那原来需要24个小时,
现在只需要1.4秒,
这个数据还是蛮震惊到我的,
特别是刚刚田老师讲的这个精度啊,
纬度啊,
然后在等压层这些等等的这个数据叠加起来,
数据量是非常非常大的,
因为咱们现在只是一个开始嘛,
如果我们能持续的通过AI大模型,
然后让我们人类能够更好。
掌握气象,
那我们不管可能是在农业呀,
交通啊,
甚至是可能航天航海,
可能因为这样的一波技术的加持,
未来的想象空间就是人类不管是生活更好了,
还是我们效率更高了,
这个这个想象空间我觉得还是挺挺大的,
我不知道在就在其他的行业上面,
这样还有一些什么样的想象空间呢?
呃,
我们在大概2020年的时候呢,
当时判断人工智能有两个发展方向,
一个是趋势,
是小模型到大模型的一个趋势,
第二个来讲的话是说是人工智能和传统科学计算的一个结合,
就是ascience,
我们认为呢,
AI呢,
对传统科学计算有很极大的想象空间,
那刚刚在海洋和气象方面对吧,
那么在药物分子研发方面来讲的话,
也把它的过去的这个小分子的筛选的这样一个周期,
那么从过去的可能一个这个数年的时间能完成的工作呢,
把它降到数个月甚至一个月以内,
大模型这个方面来讲的话,
当时呢有几个观点啊,
那么想象空间呢就比较大啊,
第一来讲就是说我们认为大模。
经是AI的发展底座,
那么这个来讲的话,
就是目前已经是变成了现实,
对第二个来讲的话,
我们认为呢,
大模型会是人工智能的操作系统啊,
这个也是正在发生的事情上呢,
它支持更多的这种这个API,
支持更多的这样的一个插件,
往下的话,
它会软硬件更好的适配,
那么会针对我大模型的这样的一个训练,
降低,
比如降低我的训练的这样的一个成本,
提高我的训练效率啊,
提高我的这个推理的效率,
那么就会有很多专门的硬件来适配我的这样的一个大模型。
第三来讲的话,
呃,
大模型呢,
呃,
我认为呢,
下一个呢,
就是刚说的是会从千行百业的啊,
将来呢,
还会走走向千家万户啊,
那现在就刚才讲到我们AIforindustry对吧,
就是AI呢,
会赋能千行百业,
呃,
另外一方面来讲的话,
就像大型机一样,
曾经认为世界上可能全世界需要5台大型机就够了。
但实际上的话,
后来。
大型机像个人电脑,
像personalcomputer,
像PC的一个发展,
对吧,
让大让计算机呢,
真正的走入了千家万户,
那大模型也是这样,
就是大模型现在呢,
可能需要极大的算力来训练它,
而且呢,
需要较高的一个成本来进行推理,
所很难部署到比如说一些端测的设备上,
就手机上,
但是呢,
将来的话,
比如说大模型和这个底层的芯片更好的这样适配以后呢,
可能让我的这个推理成本可能成百倍,
成千倍,
甚至成万倍的这样的一个降低,
那么有可能就可以把我的这个大模型态,
将来就可以比如说装载在手机芯片上,
那这样一旦发生的话,
讲的话就像大型机一样,
它变成了PC机。
所以听起来现在咱们大模型的这个发展,
肯定最大的一个卡点,
这个阻力是在咱们的这个芯片上面,
然后可能是跟芯片适配的这些,
呃,
应用方面的这个和咱们的这个软件层面的这个协同是不是高效,
我觉得这个应该是现在大家业界主要研究的这个方向,
或者想改进的方向,
对吧?
那刚才呢,
就是提到还是这个算力的问题,
对吧?
可能由于一些一些外在的因素,
我们的呃不能获取更多的这样的一个像英英伟达的这样的一个芯片或者算力,
那么但是呢,
呃,
我们国产的算力,
像华为的生成算力的话,
呃,
其实还是非常充沛,
源源不断的啊,
那么我们现在大模式的训练呢,
绝大多数都是在自己的这个生成算力上这个完成的,
而且呢,
呃,
随着这个我们的生成算力和源源不断的补充,
现在呢,
可能有这个,
比如说几千卡这样的一个生成算力的一个支持,
那将来的话,
我们可能有几万张啊,
甚至几十万张这样的生。
盆芯片的这样的一个算力的一个支持,
因此的话,
在算力方面来讲的话,
在相当长的一段时间内的话,
是有充沛的啊那个自研的这样的一个算力来支持的,
并且呢,
我们的这个生成算力来讲的话,
呃,
可能通过算子的优化来讲的话,
优化以后呢,
它的这个算力的发挥会呃再提升50%甚至一倍以上,
比如说用我们的这样的一个生成的算力去更好适配合大模型的训练,
然后您刚刚讲其实是大模型是人工智能的底座嘛,
然后我又想到其实咱们啊盘古大模型它的这个泛化性是非趁的,
因为前段时间我们也跟其他的一些这个嘉宾也聊过,
其实泛化性跟这个记忆性两者是,
呃是有一些这个tradeoff的,
我不知道这块是怎么样来理解,
就我们在什么样领域应用上面是我们需要更加泛化的,
或者什么样我们要它的记忆性更强,
呃,
我这块能不能帮我们来详细解释一下。
这个泛化性和积极性并不矛盾,
本身的话,
大模型的优点我们是想说是在于它的泛化性强,
也就是说过去的话,
我们的开发的这种小模型啊,
也可以说它的记忆有限,
对吧,
因为这个大模型就是因为我叫做我可能见过所有的数据对吧,
我基本上就是所有的这样的一个pattern,
所以呢,
他现在新的场景中的话,
它只要加一些少量的这个数据进行微调,
它就可以针对性的去提高它的这样的应用的一个精度,
在小模型的话,
因为它的记忆不够,
对吧,
所以的话,
它的这个泛化领就比较弱,
在未来来讲的话,
就是说大小模型是可以更好的协同的,
嗯,
这个怎么讲呢?
因大语言模型啊,
它更像一个内脑中枢,
不同专家,
小模型呢,
呃,
它是更像一些,
呃,
具体的小功能,
那么就是说,
因为我把大模型训练好了之后的话。
通过大模型,
我的语言中枢,
我知道我内脑中枢,
那我知道去在不同面对不同问题的时候,
去调用什么样的这样的一个专家小模型,
所以这样的一个大小模型的协同,
就是说大模型呢,
作为中枢决策系统来调用各种小模型来解决这个行业的问题,
也是将来这个非常值得这个探索的一个方向。
魏田老师,
您自己是CV领域的这个大拿专家,
不知道咱们其他的团队成员是一个什么样子的构成呢?
首先呢,
这个盘古团队啊,
是过去三年从呃,
应该说是呃,
各个高校啊,
那个吸引和招聘回来的都是一群朝气蓬勃的年轻人,
盘古团队呢,
平均年龄不到30岁,
嗯,
他非常年轻,
都是最好的年龄啊,
正值这种创新的一个巅峰期嘛,
因此呢,
呃,
同学们呢,
有这种国家的无限的活力和这个信心来挑面对各种挑战。
那么并且这种这个年轻的团队的话,
通过几年这样的一个磨合啊,
当然我们刚说我们打造了这种盘古的系列的模型嘛,
比如说我们现在有五大类啊,
新加的搜索推荐,
就是在LPCV多模态科学计算,
预测决策,
比方过去五大模型方面,
团队呢,
也经过几年的这样一个磨合啊,
他们经常在一起碰撞,
经常在一起相互的这个牵连起对方,
就这些呢,
都是这个盘古大模型能够能够不断取得一些进步,
往前推进的一个理由,
那到了这个最后一块,
其实是想要跟呃田老师,
然后我们展望一下未来,
其实现在来看的话,
我们刚刚其实也聊到了一些现在可能在行业应用上的瓶颈,
然后包括一些这种,
呃,
我们现在是被这个算力,
被这个芯片制约的这样的一个现状,
我不知道嗯,
哪一些行业还能通过这个大模型,
然后大幅度提效吧,
这么说在跟行业的客户聊的这个过程当中,
哪一些还是我们可能在积极。
和对方一起在共同在探索的这样的一些行业领域啊,
就是说刚才在你前面提到,
就是说我们已经看到大模型啊,
在这个AP视觉中取得的一些呃,
显著的这种效果提升,
但是将来的话还有很多能够为大模型就开发的这种这个领域,
比如说医疗健康。
商业及金融啊,
环境科学啊,
内容创作这几个方向,
比如说在医疗健康的话,
我们可以使用大模型来进行一些医疗影像的分析啊,
对CT啊,
MR图像呢,
进行这样的一个深度学习啊,
以便更准确的检测疾病的这些早期迹象吧,
或者对疾病进行更这种精确的分析,
我们也通过也可以通过大数据和复杂的算法呢,
来预测个体的这个健康风险。
或者分析基因变异呢,
对个体健康的影响,
那就是大模型呢,
在健康医疗健康领域的这样的一个,
呃,
一个提效,
那第二个来讲的话,
比如说在商业及金融领域,
呃,
大模型呢,
可以用来帮助提高决策的精度或者效率,
尤其是在需要处理大量数据和多个复杂因素的这个情况下,
比如说在考虑一些投资决策,
供应链的优化运行管理,
那么可以用大模型呢,
对对对市场趋势进行一个预测,
大家也知道我们的投资决测,
或者用大型企业呢,
可以利用大模型啊,
它进行来优化我们的供应链的管理,
对吧,
通过预测需求和分析各种因素,
比如原材料价格、
运作成本,
来确定最佳的生产和配送的策略。
那么在第三个方向来讲的话,
我们想到的这个是环境科学对吧,
那模型呢,
可以用来来模拟全球的气候系统,
那预测未来的这种气候变化啊,
甚至长期的气候变化,
比如。
说半年一年对吧,
那全球是变暖还是今年的冬天是一个呃,
暖冬还是一个寒冬,
这就是非常重要的一个事情,
这样的话可以帮助我们更好的去理解,
并且做好全球这种变暖和变寒的一个应对,
那最后的话就是说我们想呢,
就是在内容创作的这个领域,
现在大家知道这个生成是AIAIGC的这个大模型能力的提升,
那么动漫的从业人员呢,
将能够利用这种AIGC的大模型,
比如说进行这种语言,
图片啊,
视频、
音频,
3D啊等内容生成,
加速内容行业的这样的一个发展啊,
当然我相信还有很多了,
也是提到的一些啊,
嗯,
听起来好像很多领域其实都是一个需要咱们这个多模态的这个大模型的持续的发展才能达到的一个未来,
特别是在刚您讲的最后的这个内容创作领域,
还有这个健康医疗领域,
其实不仅仅只是可能我们现在大家已经谈。
嗯,
谈的太多的这个NLP领域了,
那如果我们最后一个问题想要再再请教一下这个田老师,
那如果可能是在底层,
因为整个的呃,
拆GB的发展是离不开这个transformer的这样的一个基础的这个研究,
它的这样的一个进展,
我不知道咱们现在在科研领域前沿还是哪一些是可能我们会攻克的,
或者大家正在这个挠头的这个希望攻克的这样的一个能够呃,
这样一个领域,
能够让我们在到达下一个,
呃,
让人这个惊叹的这样的一个进步,
我觉得这方面来讲的话,
可以这样讲,
就是说大家看到了东欧态势未来,
那么我们现在GPT的话,
这样的一个,
它代表的一个纹身纹这样的一个一个大模型的,
我们也看到aic呢,
确认一些纹身图对吧,
纹身视频,
那么我我认为呢,
现在的变化是什么呢?
就相当于把清春GPT把它叫做黑白的无声电影,
变成将来动模态的彩色的有声电影,
黑白呢,
就是说现在还是一个文本对吧?
那么将来呢,
会有图像,
会有视频。
是彩色的,
那么将来加上语音的话,
这就是有声,
所以就说从从传统的黑白电影变成彩色有声电影,
这个事情是一定正在发生,
而且一定会发会实现的。
那么它里面的一个难度在哪里呢?
就在于我们现在的比如说我们的CV,
我们的AOPP,
呃,
宣在是传方法架构,
但还是不同的网络来处理不同的输入,
我的LP是文本的输入,
对吧?
那么我视频的输入,
我将来这个语音的输入,
那将来呢,
是希望呢,
我有一个在多模态上统一的一个架构,
就一个网络,
一个unify的网络,
就统一的网络,
可以take不同的输入,
或有视频的输入,
文本的输入,
我有一套统一的架构,
但这个统一架构到底应该怎么做呢?
应该是现在很多研究人员都在努力去去做的一件事情,
它最主要来讲的话,
就是说可能这个效果还没有还没有出来,
所以呢,
统一的这个多模态的这个TC的架构,
可能未来。
到三年这个研究的一个主要的一个方向,
其实我们刚刚也稍微聊到,
就是他,
呃可以理解成他ton这样的一个过程是吗?
就不管是你的这个视觉还是其他的一些这个呃,
音频或者视频偷奶,
我是把这个把图像把这个比较视觉的问题转变成了这个程序列的问题,
但实际上的话,
我们知道就是说语言呢,
它是一个时间序列的,
问时间序列对吧,
但是图像视频来讲,
它还是有很多空间信息的,
那么如何保证这些空间信息不丢失的情况下,
来把它当成一种这种长序列的问题呢?
这个也是也值得考虑的一个一个问题。
嗯,
也是在大家在研究的一个重要的领域和方向,
那么在行业意义来讲的话,
可能啊还有一些研究方向值得大家关注啊,
那刚才讲的第一个呢,
就是我们还是提到大小模型的要协同,
对不对?
刚才讲了,
那么还有一些问题来讲的话,
就是如何做垂育数据的高效标注和模型的微调,
比如说将来我们行业应用来讲的话,
如果从通用的大模型到行业大模型,
因为需要灌注具体的这种行业数据的进行微调,
才能解决这个对应的行业的问题啊,
比如金融行业呢,
我需要呃,
需要金融的数据,
电力行业需要电力的数据,
呃,
因此第一个呢,
就是如何构建高效的垂育数据标注系统,
是一个非常值得研究的一个方向之一啊。
第二个来讲的话,
有了行业的锤育数据以后呢,
如何进行模型的高效微调,
也是呃这个有价值的研究方向,
那么在这个合适的这个模型微调方式的。
它能够有效的降低这数据标注需求量和模型训练的这个代价啊,
这这是大讲,
第二个问题就是垂育数据的高效标注与模型微调,
那么还有一个问题,
刚才也讲了,
就是在大小模型的问题,
就是说因为我们很多的应用可能是在端测或者边测,
因此呢,
大模型的量化减值蒸馏啊也是非常重要的,
因此大模型在具体的一些行业的落地过程中,
要考虑模型的复杂度,
它的推理速度,
它的运算成本,
因此如何做到大模型的这样的一个减脂蒸馏,
这个去适配,
或者这个端测边测的这样的一个场景,
也是这个重要的研究方向。
那么还有一个方向来讲的话,
就是如何进行外部知识和增强,
对吧,
我们讲了我们的基础模型呢,
它是一个通用的这样的一个知识库,
它是在海量的数据中进行训练归纳而来的啊,
也就是说大模式的能力呢,
它是受限于这种训练的语料,
但一些行业知识并没有出现在这个训练的语调中呢,
那么它就缺乏相应的这样的一个能力,
那么写因此呢,
如何去利用外部的一些知识增强,
比如说额外的专业这个知识图谱啊,
就是我们加入搜索引擎啊,
得到的这样的检索的一些知识,
在提升大模型的能力,
在实际的行业中也是也是值得非常探索的一个方向吧。
嗯嗯,
所以很多这些其实是需要跟不同的行业,
他的个体的这个需求,
然后在跟我们的这个研究人员是一起在往前在探索的,
嗯,
刚刚您讲到有一个比较专业的这个术语,
什么端测,
鞭测的一个什么,
什么推流那块,
我没有太明白,
不知道能不能再稍微再解释一下,
我们说模型的,
比如说部署呢,
可以在云测云端嘛,
啊,
通过提供这个APIAPI的方式供大家调用大模型的能力,
将来比如说你想把它部署到手机上,
就是现在是很困难的,
对吧,
因为手机的容量,
手机的带宽,
那么如何把大模型小型化,
对吧?
你比如说你想做一个图像去照,
你需要一个合适大小的模型,
能够在手机端随时调用。
那么就是这次叫做大模型的需要做一些啊这个量化对吧,
做一些减值和蒸馏,
得到一个合适的小模型部署到这个这个端侧的设备上,
那边侧来讲的话,
就是际上无人驾驶一样,
呃,
这边侧相对于端侧可能呃算力会大一点,
但是呢,
它还是跟预测就是的算力能提供算力是不一样的,
理解了,
这个就是人们的这个专业术语,
对,
其实就是说呃还有一个很好的一个应用来讲的话,
我们讲大模型就是预训练大模型,
其实它主要是两个阶段,
一个是预训练的阶段,
对吧,
预训阶段用海量数据进行对预训练,
还有一个叫叫,
就是这个叫微调与部署的阶段,
微调大很明白,
就是我用行业数据针对性的进行调优,
对这某个应用,
那么部署,
我们就刚才说的,
就是说我要在云测或者边测和端测进行部署,
嗯,
其实还有一个很重要来讲的话,
实现就数据模型啊,
这种全生命周期的一个迭代,
就是大模型,
你希望它越用越好,
那新的数据的话,
遇到。
源源不断的产生,
如何把新的数据加到原来的因训练的大模型中,
这个非常重要,
对吧?
所以还存在着一个大模型的一个迭代,
这样的一个新的一个一个形成一个闭环,
那么在实际应用中的话,
我们会发现我们其实面对非常多的这种小样本的场景,
对吧?
这样工业质检这个,
比如说嗯,
我们在煤矿的矿山模型的部署中,
那么我们可能在这个一条主运输皮带上啊,
它可能是小样板,
比如说这个是矿架模型呢,
它可能会部署在不同的煤矿里面,
比如说我这个,
我有上百个煤矿,
甚至上千个煤矿,
那么我都有这样的一个小样本的场景,
如果这个时候能实现更好的端云协同啊,
就或者边云协同,
那么我在端测或者边测这些典型的小样本场景中,
我收集到的一些样本,
把它反馈到我的从L2反馈到我的L1上的方讲查中,
如从的部署模型反馈到我的这个。
行业大模型上来讲的话,
那么我就可以从许许多多的小样本场景中反馈回来一些数据,
在我的行业大模型上进行这样一个更新,
更新以后呢,
再把这个更新的模型再下发到这些小样本的场景,
那么就可以更好的实现这样端运系统解决这种这个狭用的的一个问题。
明白明白,
所以他可能是在这个开发成本上肯定是最最优的,
因为你不需要重新再开发这个大模型了,
而且这个可能不是说所有的人都会需要这个细分场景的这样的一个检测的数据,
所以这样其实是把它分开解决,
分好分三步解决问题,
对他主要是说,
呃,
如何让大模型在新的数据源源不断增加的情况下呢,
能够实现大模型的这样一个增量学习啊,
实现这个将来的这种大模型的一种终身学习,
那其实现在目前有很多的企业都有训练大模型的需求,
田老师能不能给我们揭秘一下华为云的盘古大模型是怎么样,
这个训练的,
怎么样练成的,
我们在训练盘古NP,
一个就是2021年4月份发布的大模型的时候呢,
我们当时训练了两个模型,
一个呢是盘古一个大概1100亿这样的一个模型,
还有一个就是另外一个模型,
就是啊盘古阿尔法的一个模型,
大概是个2200亿的。
一个参数的,
那么这两个模型呢,
都是在升腾算力上一个训练完成的,
那么我们当时用到了最多呢,
用到了呃,
将近4000块四千九幺零的一个算一个这个芯片来进行训练,
当训练当时花了呃几个月的时间,
那那首先的话,
这个盘古大模型的训练构成了需要海量的数据,
那这过程中的话,
我们收集了上百TB的这样的一个百科知识,
文学作品,
程序代码这些文本数据啊,
收集了可能数十亿张这种图像和这种图文对的数据啊,
由于多模态的训练对吧,
以及刚才讲的气象方面来讲的话,
我们收集了数百TB这样的一个全球的气象数据,
用于支撑各个大模型的这样的训练。
那其次呢,
在盘古大模型的训练的过程中呢,
需要海量的算力,
那么我们的大量的计算资源呢?
呃,
来来训练我的模型,
这里面就包括使用这个像NP跟华为的这样的一个生成算力,
当然我们也有一些基于GPU的一些训练,
以及分布式计算集群这样的一个高性能的计算设备,
包括呢,
使用这种并行计算的框架来加速这个倒模型的训练过程。
另外呢,
我们基于华为全站自研的这样的一个生成芯片和一站式的这种AI开发平台,
我们的啊,
进行这个超大规模的训练,
盘古的这各个系列大模型呢,
基本上都要使用大概几百张甚至上千张的生成芯片,
训练四个月的时间。
啊,
那当然的,
华为的算力和这个平台团队呢,
为我们提供了这种强有力的保障,
最后来讲的话,
就是我们训练大模型的话,
还要对训练好的模型进行综合的评估和测试啊,
以确保它的实际应用中的这种性能和可靠性,
那整个过程呢,
也需要充分利用海量的数据和计算资源,
才能达到最好的效果啊,
这个前面提到了海量数据啊,
海量的算力,
那么当然了,
我们还是需需要优异的这种模型架构和训练算法,
呃,
因为这种好的模型设计和训练算法呢,
会起到事半功倍的效果,
呃,
比如说呢,
我们在设计和训练盘古的模型的时候呢,
我们基于这种我们讲的transform的这个模型架构呢,
我们做了很多工作,
比如说对位置编码,
激活函数做了改进,
通过啊我们的一系列的叫做比如张量并行,
流水线并行算子融合的方式来提高大规模分布式训练的效率,
在整个盘古的训练呢,
你看需要海量的数据,
海量的算力。
啊,
很好,
优异的模型架构和训练算法,
除了这些以外,
其实呃,
盘古大模型的一个一个成功的话,
其实一个核心还是离不开这种优秀的这个团队的这些同学,
好的,
那今天非常谢谢田老师帮我们科普了很多关于华为云盘古大模型的细节,
那我最意外的其实应该是这个团队大家都好好,
大家都好年轻啊,
都不到30岁,
那另外一点我觉得是对我有在思想认知上的一个启发,
就是听老师说这个大模型会是人工智能的一个操作系统,
就不管未来我们有更多的软件啊,
或者是硬件的升级迭代开发等等,
都会通过API更好的适配这个,
呃,
这个大模型,
呃,
另外其实一点我觉得我也受启发的,
就是其实现在的这个大模型,
不是说每个行业,
每个公司都要重新训练一遍,
其实可以根据这个,
呃,
像是华为这种L0的模型,
L1的模型,
L3的模型,
它是一个基础的,
行业的和细分的这样的一个区。
对别其实互相打配合,
然后对不同的行业的需求或者场景,
呃来来配合就好了,
不用所有人都重新开始这个呃开发和训练,
然后包括像是这个细分的场景的这样的一个小模型,
可以反哺到这个大模型里面,
这个还是我觉得蛮有意思的一个点,
那除此之外呢,
也非常感谢这个田老师帮我们介绍了现在已经有的一些案例了,
包括这个电力,
电力巡检,
然后这个秒级预报的这个就1.4秒这个数据啊,
非常快的能够预测现在的气象啊,
那当然了,
最后我觉得可能让我呃比较有印象的就是咱们华为云强有力的技术支持,
特别是这个算力的支持,
其实是来自呃华为的自研芯片,
7月7号举办的华为开发者大会上面,
华为云发布了全新升级的盘古大模型,
那今天听我们节目有兴趣的听众朋友们可以去关注一下,
好了,
那我们今天的节目就到这里了,
好的,
再次感谢田老师,
谢谢啊,
也非常感谢丁教啊。
这期whatnext科技早知道就到这里了,
听完之后如果你有任何的想法,
欢迎在评论区里面给我们留言,
我们每一条都会认真的看,
如果你喜欢我们的节目,
请记得给我们五星或者好评,
分享给更多的朋友,
也会对我们非常有帮助。
你也可以单独写邮件给我,
邮箱地址是听tingat声点FM,
我都会一一回复。
那同时公众号和微博也可以搜索声动活泼盛世声音的声节目相关的更多信息会在公众号里出现,
微博和公众号都会有不定期的福利给到大家。
如果你想要跟我们更加紧密的讨论和分享,
或者想要认识和你一样有求知欲的新朋友,
可以加入我们的微信群。
进入听众群的方法是在公众号文章中扫码添加,
或者是公众号后台回复科技早知道即可获取邀请码,
期待你的加入,
我们下期见。