声音碰撞世界,
生动活泼,
欢迎来到科技,
早知道我是杜晨,
作为音频工作者,
我最近其实是一直也在关注AI对于我们所在的这个行业,
这个领域会带来哪些变化,
然后如果大家是我们生动活泼旗下另外一档非常受欢迎的节目生动早咖啡的听众,
大家应该记得国庆节之前我们曾经在节目里播报过骁龙跟腾讯音乐天琴实验室的一个合作,
他们当时是在手机本地用芯片AI计算的这个能力去跑一些算法,
然后能够实现听歌的这个音质的显著提升。
当时他们这一套合作里边的这个DEMO,
我用我的安卓手机也试过,
呃,
感觉到非常的震撼。
所以这次呢,
在可早的节目里边,
我们请来了一位来自高通负责这个合作项目的朋友chart刘刘晓光,
在这次聊天中呢,
他跟我说在年轻的时候就通过科幻作品对AI产生了强烈的兴趣,
但他未曾预料过AI会像今天这样如此的发达和普及。
我还深深记得我在电影院看的第一部星球大战的情况啊,
当时你知道这个电影结束之后,
我在原地鼓了10分钟的掌,
就激动的都流下眼泪,
那是我第一次的人工智能启蒙啊,
当然,
呃,
当时还是因为旷哥看电影被请的家长,
然后被胖揍了一顿,
这也是让我印象最深的一个一个场景,
他还告诉我,
其实现在在音频技术领域呢,
已经有了非常多的AI应用的场景,
对于不同的用户能够带来非常有趣和有用的效果,
比如声音对焦技术,
它可以把在影像对焦的那个物体的这个声音就可以把旁边。
噪声给去消除掉,
你即使在很嘈杂的地方录一个相对比较远的人在说话的时候呢,
也可以做到录音就是追着他一样。
当然作为博客创作者呢,
我也想问问他,
在我们这个领域,
AI在将来能够带来哪些更酷炫更实用的应用场景,
AI可以在你做播客的时候帮你去做自动记录,
就是当你发布的时候,
大家会就会帮看到什么以言摘要、
重点,
甚至我想听哪段,
我点就可以去跳过去了。
好的,
那么接下来让我们进入节目正片。
啊,
欢迎chart来到科早,
诶大家好,
那要不首先介绍一下你自己在高通的这个工作,
以及主要的工作内容有哪些?
我在高通主要是负责产品技术、
软件生态合作相关的工作,
我另外一个重要的任务就是要了解和分析移动软件生态发展对芯片的需求,
对未来芯片的设计方案提供指导。
因为软件和APP开发和硬件的设计周期有很大的不同,
我举个例子,
当APP开发者去开发一个应用,
它当它有一个新的灵感或者发现一个bug的时候,
可以马上就会去动手,
然后最快可能几天就能完成,
并且上线更新。
但硬件的设计,
尤其是芯片的设计周期就相对比较长,
我们现在可以看到市场上最新发布的芯片的所有的这些能力设计,
在2年甚至于更长的时间前就需要预先做好规划,
所以这也是我平常要花很多精力的地方,
呃,
差点一上来给我们一个非常highlevel的对移动芯片的研发做了一个非常全面的这个介绍。
那么我们知道其实。
一些音乐流媒体平台,
他在这个推销他们的高级付费会员的时候,
他们也会用所谓的这种像超清牡丹啊,
CD音质啊等等这些会员权益嘛,
啊,
然后我听说有一些平台,
他们也是在通过这个神经网络的算法来提升这个音乐的采用率,
那这次骁龙跟腾讯音乐天琴实验室的这个合作,
能不能够具体解释一下,
呃,
我们具体用骁龙处理器的里边的这个高通AI引擎去做音质的提升,
他的这个具体的工作原理是怎么样的,
跟流媒体平台或者说软件开发商,
他自己去做基于算法的音质优化有怎样的不同,
有多大的提升?
在现实里边,
由于录制条件以及这传输条件的限制,
经翅引起音质的损失,
为了能够去把这种损失做到最小,
我们和业内的合作伙伴共同一起去做出很多努力啊,
就像你刚才提到的跟腾讯音乐天琴实验室的合作,
腾讯音乐天琴实验室用它的AI音乐增强技术做的真品音质方案,
把压缩过的音乐音质进行有效的提升,
给用户带来了highrise级的听觉感受。
这个音质优化AI算法是在手机上运行的,
为了能够达到最好的用户体验,
这次我们和腾讯音乐深度合作,
把AI模型算法全面的迁移至高通咽引擎上运行,
不仅仅能够让音频编解码处理和音频细节还原的处理速度更快,
而且还降低了手机的功耗,
让用户听得更爽更安心。
做一个对比啊,
就是像在显卡在玩游戏的这个领域呢,
最近就有一些基于深度学习的这个技术,
比方说像英伟达的这个DLSS,
他们是用基于深度学习的能力吧,
去做一些啊超采样,
就比方说在一个1080P的这个画面里边。
啊,
去把这个呃像素插到一个2K甚至4K的水平,
甚至是在这个低帧率的时候,
做这个插帧的这个技术,
让这个整体玩游戏的这个帧率提高,
同时对硬件的性能不会产生太大的影响,
我不知道咱们这次的这个技术是不是有点像,
呃这个DSS,
但是它从视频变成一个像音频一样的一个感觉,
诶你说的特别到位啊,
实际上这次我们就是用了类似的技术,
我们把这个统称为叫超分辨率,
也就是补充细节。
AI有一个很神奇的地方,
它就是可以通过深度学习来知道如何能更好的预测以及补充去世的信息,
呃,
这个领域实际上在很久之前就在研究了,
在1955年的时候呢,
最早的这个文献就是关于光学成像,
第一次提出了超级分辨率的概念,
不过以前的传统算法效果不是特别好,
尤其是在一些很复杂的场景,
呃,
随着这个技术的不断的进步,
尤其是深度学习以及神经网络的利用,
这方面有了很大的飞跃,
除了你刚才提到的游戏超分场景,
在视频拍照。
音乐等领域应用也是越来越普遍啊,
这次咱们聊的音乐增强就是利用的这个技术,
可以把原始音乐的受损的细节给补充回来,
那其实如果要听真正的超清母带音质的这个音乐,
它肯定是需要一个很大的一个音频文件,
这个我们自己做播客的时候,
就是我们的后期的小伙伴也经常吐槽,
就是您也看到了,
我们在用这个顶级的录音设备选择文件的这个音质呢,
其实也是最高的。
然后有的时候我们在节目里会做一些非常复杂的这个呃声音设计,
比方说做一些泛音的设计,
比方说在这个呃声道之间的这个切换的这些设计,
但是当我们想要把文件上传到我们博客的托管平台的时候,
它其实只支持最大的是100MB的这个文件,
而且必须是MP3,
所以其实它已经是被压缩了嘛,
导致就是说我们一期节目有的时候比方说40分钟一个小时,
有的时候最长的时候一个半两个小时的时候,
会导致这个上传文件压缩的非常厉害,
里边丢失了很多的东西,
我猜想。
在音乐领域应该是也有这样的情况吧,
就是因为文件压缩格式的这个原因,
会让歌曲失去很多微妙,
但嗯,
可能是在创作者看来非常重要的这种细节,
对,
因为我也注意到你们那儿这个设备特别专业啊,
我们经常能看到一个几分钟市场的原始的未压缩的母带音质的音乐,
通常就要几十兆甚于上百兆这个存储空间,
呃,
为了能够节省存储和无线传输流量的消耗,
呃,
现在广泛在利用压缩技术,
尤其是有损压缩技术去解决这个问题,
比如大家通常见的MP3文件,
实际上就是对音频细节,
尤其是高频部分进行压缩,
呃,
这样虽然可以做到几倍甚至于十几倍的压缩效率,
呃,
但是换来的就是音质和听感的损失。
那现在既然我们已经跟呃一个音乐流媒体平台去合作了,
我就在想你们这套技术的这个套用能力大概是怎么样的,
理论上是不是可以跟更多其他的流媒体或者是音频内容平台去合作,
就比方说在博客的这个场景。
情况下会不会以后呃,
用户听播客的时候也能够提高音质,
这个没有任何问题,
我们骁龙移动平台集成AI引擎应演进到了第8代,
性能、
适应性以及泛化能力都非常强,
不仅仅能够帮助把播客节目的音质提升,
还可以做出很多很实用的功能,
呃,
譬如录制时的降噪能力,
因为有的时候咱们做播客的会在各种地方去录制,
对吧?
有时候咱们会在户外,
户外的时候会有很多的这种噪声,
包括风声啊,
人声,
对吧?
有的时候其实会对节目会有一些影响,
那么我们的降噪能力的话,
就可以尽可能的把这些噪声给去去除掉,
让你在很嘈杂环境里边,
你去做博客的话,
你的这个声音都会非常清晰,
呃,
听上去就像在一个像咱们这儿特别专业的这种录音师一样,
那可太好了,
那还有就是譬如说有的时候你不得不做的比较远,
呃,
旁边噪声比较大,
这时候就需要叫声音对焦的一个功能,
呃,
尤其是咱们可以看到在有的时候在这种摄像里边,
它会比较常见,
当我想去拍远。
出了一个朋友在说话,
但是他有点远,
旁边有很多噪声的时候,
我想尽可能把他说的话的声音给录清晰,
那么现在的话,
通过这个AI的算法,
除了叫影像对焦,
还可以叫声音对焦,
它可以把在影像对焦的那个物体的这个声音,
就可以把旁边的噪声给去消除掉,
这样的话就是你即使在很嘈杂的地方录一个相对比较远的,
你的这个说话的时候呢,
也可以做到录音,
就是追着他一样啊。
比方说现在很流行内容创作者,
他们录vlog这种东西,
这个麦克风有的时候因为收音比较难,
他们会用这种小蜜蜂,
但是以后是不是就是说,
如果我们用一个手机,
他在拍摄一段视频的同时,
呃这个芯片,
它就能够去识别画面当中的主体,
并且在呃芯片层面去做一些AI的算法,
去能追踪到它的声音,
这我理解的对吗?
对,
他就是利用了这个AI算法,
可以让视觉对焦跟音频对焦能够同步,
就是把这个视觉的这个焦点也当成录音的,
我的这个。
聚焦的地方啊,
明白它所有的这些计算都是在芯片层面去呃去完成的,
它不需要额外的这种外设的设备嘛,
当然就是高通我们的芯片能力很强啊,
就是我们现在在降噪方面,
我们在手机上有多个麦克风,
多个麦克风组成麦克风阵列的话,
呃,
可以从不同的角度去识别我的声音,
这样话其实就可以做到这种可以把不同相位的,
包括不同方向的声音能够去收集起来,
这样的话算法就可以更好的去把一些我需要的声音和不需要的声音能够给区别出来,
然后给去做更好的这个处理,
比如我突然咳嗽一下是吧,
实际上这个在录制过程中间难免会碰到后期处理是一个很麻烦,
我要把所有的地方有咳嗽地方,
我要给去消除掉,
那么我们AI能力就可以,
它遇见特定的声音,
它就可以去识别出来,
并且给你做自动消除啊,
除了咳嗽声,
包括开门声,
其实你还可以定义好多种声音,
你都可以让他去,
呃,
帮你主动的识别出来,
然后去给去掉,
这个时候我就特别想要见到高通能够跟我们在用的这个录音设。
在厂商zoom如果能去合作,
把这个芯片的能力直接用到像我们现在在用这个录音台里边的话,
那肯定是非常了,
不过对之前因为我之前在美国的时候,
呃,
有一次跟我们的联另外一个联合创始人,
我们在美国当时是一个非常随机的一个环境,
我们在街边上录音,
然后我是其实是直接拿着自己的手机作为我这一个音轨的这个录音消除这个街边像什么他们开车路过的这个声音啊,
然后旁边的这个道路施工的机械的声音消除的这个效果也挺不错,
当时我其实就对咱们的这个呃音频AI算法有一个非常深的这个印象了,
是其实我最希望就是呃,
在有机会一起做录音的时候,
其实咱俩就每人面前摆着一个手机,
然后在一个咖啡馆里是吧,
边喝咖啡边休闲的,
咱们就把这个录完了,
虽然可能呃环境这些有很多噪声,
但实际上最初的效果的话,
然后我希望能够跟咱们在这儿是一样,
对,
而且那个环境是最自然的,
对吧,
对,
还可以做到改变声音能力,
就是现在有很多的这种变声软件。
啊,
比如说我的声音不太好,
当然我希望我在这个博客里上具有不同的声音,
对吧,
那么这时候的话,
其实用AI算法就可以去帮助你把声音给去改变掉,
那么咱们也看到过以前的一些变声软件,
其实那些的话,
用用传统的算法声音就会去很不自然,
但是随着这种在手机的这种AI能力越来越强的话,
那今后这方面会越来越做逼真,
基本上就是大家就认为真的是另外一个生命,
人再去讲这个事情,
对还有包括TTS,
就是文字转语音,
文字转语音,
对,
因为有的时候难免会有感冒啊,
可能是声音沙哑的时候,
但你如果你要就是录个节目,
或者是你有一些要出很大段的节目的时候,
其实未来TTS是一个很好的一个能够帮助播客做节目的一个东西,
因为呃,
咱们可以看到现在有的时候有一些听书软件,
它其实就是这样生成的,
对吧,
但是越来越好了,
咱们几年前去听一个TTS声的时候,
你会发现非常。
就是,
就是几乎没有任何感情语气,
而且声音是一种很这种机器的声音,
没错,
我知道我身边有一些听书的朋友,
他们其实特别喜欢就是这本书的原作者去讲这本书,
但是有的时候这个原作者可能他并没有那么多的时间,
或者他的声线,
就像您刚才提到,
他并不一定是一个很好的一个声线,
让他讲完自己写的整本书可能是很累的,
那之后他们就可以大规模的去采集作者的这个声音,
他可能只说3句话或者5句话就足够把他这个声文提取出来,
然后我们大批量的把我们库里边所有的这些书都用原作者的这个声音去转化成一个语音书,
会是一个非常好的一个体验。
最近几年你会听到有些其实做的相当不错,
呃,
专业人士能够去听出来那个是机器,
但是普通人其实已经很难听出来它是机器做的,
就是它可以把这个声音的这种声文跟真正的这种人其实几乎很相似的,
而且甚至于把里边语气呀,
情感都能够去带出来。
那还有就是AI可以在你做播客的时候帮你去做自动记录啊,
因为有的时候你做播客的时候,
可能你会很随意,
那么你希望我说的这些播的节目里边能够把它我的说的全自动记录下来,
那这种叫语音识别,
这种能力其实现在已经非常普遍了,
那再加上现在大模型能力,
其实可以做到我在边去做博客的时候,
边去整理讲的大纲,
去整理出来,
嗯,
最后当你发布的时候,
大家会就会把看到什么以言摘要重点,
甚至于我想听哪段,
我一点就可以去跳过去了。
没错,
这个是一个我超级需要的场景,
因为我们做完一期节目,
需要写一个文字的介绍,
需要整理一个时间轴,
我们在不同的时间点讲了什么样的这个东西,
但如果以后这一套东西能够自动化生成的话,
那简直是一个非趁的一个让我们的工作,
呃,
可以说复杂程度浪费的时间大大的降低,
没错,
未来其实AI都可以为咱们的博主服务,
让博主去把所有的精力运用在怎么去策划,
呃,
包括从大纲。
从整理或者是创意上去下功夫,
呃,
当然这里边有些前沿技术我们还在探索中,
我们相信未来一定会在移动设备上能够体验到。
呃,
我们欢迎博客平台的APP都来跟我们一起合作啊,
让博客节目的制作以及收听越来越方便,
效果越来越好啊。
那刚才其实您提到的这些,
我我的理解是更多的是用,
呃,
就是从AI的角度去解决音质的这个事情,
除了AI之外呢?
呃,
为了让用户听到更好的一个音质,
从其他的技术角度,
高通还做了哪些事情呢?
呃,
另外就像你刚才说的,
把高品质的音频内容原汁原味的传到用户的头里也是非常重要的。
我觉得有这么几点,
呃,
特别值得关注啊,
第一就是高采样率,
呃,
我们现在支持的阿斯比特96千赫兹的高分辨率蓝牙串流,
这个已经突破了安卓自己本身的码率和微身了,
是吧?
是这是非常厉害的,
就是咱们知道就是CD的采样率是16比特44千赫兹,
那的话其实也就是大家现在所谓的这叫无损音质,
那么我们比他们的这。
呃还要指标还要去高,
所以用户就可以去感受到无损音质的这种所有的这种听觉效果,
那第二呢,
就是D10,
目前我们在语音回传通道上可以做到低于20ms的极地实验,
因为做音乐的人,
你然后你像你们肯定特别敏感,
就是当这种呃回传延时呃超过35ms的时候,
其实就能够去感觉到,
所以就是现在其实很多的这种蓝牙耳机的这个延时都比较长,
那么我们的技术就可以把它做到20ms啊,
甚至于更低的这种水平,
那这样的话呢,
就是在很多场景,
当然可能听歌的话,
因为它呃只是一个单向音频,
这会儿其实还好,
但是有很多特别关键场景,
比如说是看视频,
你当你去看演唱会的时候,
对吧,
你看到的这种视频内容一定要跟你的听觉要去同步起来,
你稍微有点差异的话,
你就会感觉到这个不是特别自然的这种啊,
以及还有是不是玩游戏的一个场景也是,
就比方说我在跟人吃鸡的时候,
我屏幕。
我看到我被别人打了,
但是过了几秒钟,
哦,
或者是呃几十毫秒,
我才听到这个枪声过来,
那是一个非常糟糕的一个体验,
没错,
那个会极大的去抵消你玩游戏呀,
看演唱会这种所谓的这种沉浸感,
这个是我们在呃这个延时上我们做的工作,
三是动态头部追踪,
支持空间音频啊,
这个的话,
呃就是你们肯定非常熟悉了,
对吧?
对,
这个一下就是让你有这种360°的这种环绕感,
身临其境,
感觉是是我们有一个cast的一个广播音频的技术,
我对这个印象特别深,
是不是经常就是比方说我们在呃健身房健身的时候,
看到屏幕上在播放一个东西,
或者是我们去呃机场,
在候机的时候,
看到屏幕上正在播放一个新闻,
有的时候他没有开声音,
这个时候耳机就可以连连到那个屏幕上面,
没错,
其实这个我感受特别深,
因为我有时候在休息室在等飞机啊的时候,
就是有时候其实我看见节目挺有意思的,
嗯,
但是呢,
就是他就是一个没有声音的。
状态,
如果咱们用了这个技术的话,
就是所有支持这个的蓝牙耳机,
我带上的话呢,
其实我就可以去听到里边说什么,
但是同时又不会打扰到旁边休息的,
其实我觉得这就是一个特别好的技术,
而且它还是一个单一声音员同时向多个耳机或者多个音响输出的一个技术,
对吧?
没错,
这个就是让我想起一个特别有意思的东西,
呃,
以前我不知道你有没有,
呃见过有一种,
呃比较早的时候,
还是有线耳机的时候,
有一种叫虐单身狗的神器,
从一个耳机线分出,
我们这儿就有,
我们这儿就有一个,
我们能一分6就这种环境,
就是特别适合这种广播的艺术,
50混合自适应降噪,
这个的话呢,
是可以去具有自动检测语音的功能,
以及自动语音检测功能的自适应透传模式,
就是呃,
咱们有的时候戴着耳机的时候,
跟人说话的时候,
那你做的动作是你要把你的音乐关掉,
或者把声音调小,
说完话的话,
那你再给换回来。
但是如果你要是。
呃,
不是持续的,
你要偶尔去跟别人对话的话,
这个就会非常麻烦,
对一直要暂停播放,
暂停播放,
呃,
这样的话,
其实我们这个新的技术就可以识别到,
如果发现有语音说话的时候,
它又可以自动把音乐给去降低,
然后呢,
你就可以很清楚的听到别人的这个说话,
当你说话时没有的话,
他再把音乐恢复回去,
这样的话其实就可以去解决,
你在听音乐的时候需要跟人说话,
但是你又不用去做很多的这种很复杂的这种这种工作,
它会影响到你的这种听歌这种情绪。
说完了音频这些事儿,
然后我想进一步的去跟您聊一聊跟AI有关的这些东西,
就是呃,
我们现在差不多有一个讨论的基础,
就是说在这个音频的这个事情上面,
呃,
前面的阻碍还有很多,
呃我们已经在利用一些AI的这个技术,
但是还是会面临一些物理法则的限制吧,
但是在其他的领域呢,
AI的这个使用案例已经是层出不穷了,
像我们听友已经不能更熟悉的这个大模型这个东西,
他现在已经发展出了这个端测AI端侧大模型的这个路线,
然后并且已经可以运行在这个智能手机上面,
而且是很高效的这个运行了啊,
能不能请差的先给我们讲一讲,
就是端测AI,
端测大模型到底是什么,
它跟云端AI有什么样的区别,
对于用户来说有怎样的好处啊?
在很久以前的概念里,
人工智能好像都是有很庞大的机器去运行呢,
现在一个小小的移动芯片就可以拥有非常大的算力,
我们推出的高通AI引擎能够在骁龙和高通平台上实现终端侧的AI加速。
不只是。
有专有的数据处理单元,
高通爱引擎采用了异构计算构架,
还可以把传感器中枢呃,
GPU和CPU都协动起来,
在终端测快速高效的运行AI应用,
呃端测AI的话,
能够去带来包括成本、
能耗、
性能、
隐私和安全和个性化方面各个优势,
就是从距离上而言的话,
它就是在用户身边,
因为呃它在端测运行,
它就在你手机里,
或者是你身边的这个设备里,
这样的话呢,
就是它最大好处就可以保护隐私,
因为你所有的数据啊,
包括你的一些个人的消息,
呃,
比较重要的文件,
那它都是存在端测,
它不会去上传到云测,
所以这个对隐私保护非常重要啊。
另外一个就是它是非踌快速的响应,
因为就我举个例子,
比如拍照,
拍照的话,
其实是你在按下快门的时候,
他需要瞬间处理,
如果这时候你要通过云的话,
那经过延时的话,
这个用户通常是接受不了的,
所以他要在第一时间他要把它处理的。
好,
所以这个一定是在端测的,
利用端测的这种AI能力,
呃去做这些事情,
还有一个好处就是在于呢,
没有网络的时候也可以工作,
比如说是呃,
我们在呃飞机上高铁可能信号断断续续不是特别好的地方,
那么我们也可以把这个呃手机端测的AI能够去运用起来。
另外功耗的话呢,
也是一个优势,
因为云测的AI的话,
它通常需要至少几百万,
是因为它是在服务器里边算的,
呃,
对,
没错,
这样的话,
其实在手机上的话,
功耗就会非常低啊,
那从成本上而言的话,
大家知道如果你去用去做云测的话呢啊,
通常你要去有服务器的成本,
你还要把它放在IDC,
你会有很多成本,
那么在手机上的话,
其实以你一个手机,
可能几千块的手机就可以去做很多这种能够去AI赋能的事情啊,
当然就是我们并不是说端测AI和云测AI他们之间冲突,
其实我们是更希望去看到。
而且我们正在。
引领叫混合AI的这个实现,
这个就是云端结合,
因为呃对隐私和安全要求比较高的终端测工作负载可以继续,
咱们在端测去运行,
完全由端测处理,
那么其他的一些比较大量运算的工作,
包括在隐私上不敏感的工作的话呢,
我们可以跟云的服务商去结合,
共同去完成,
在不影响他到他的用户体验的话,
可以把整个的这个工作的这种效率可以去最大化。
嗯,
混合AI的优势就是在于即使在不同终端处理能力不尽相同,
而且仍然能够提供相似体验的时候的话,
可以同时带来包括成本、
能耗,
隐私与安全个性化方面的优势。
呃,
说说这个端测大模型,
他们这个领域现在已经发展到了怎么样的一个程度啊,
我主要从高通的角度说一下我们目前在端测大模型技术方面的进展,
高通也经实现了10亿到15亿参数模型在终端测的部署,
那今年我们二月份在世界移动大会上啊,
高通也展示了首个在安卓智能手机上运行的啊,
Speed球院是一个参数超过10亿的超大神经网络基础模型啊,
咱们在网上看到很多的这种爱生成很漂亮的图片,
都是基于这个模型去做的,
之前非常的一个模型,
基本上跟GPT可以说是并驾齐驱的一个一个东西是没错,
咱们之前看到的很多都是在服务器,
呃,
有些人在他的个人电脑,
但是一个性能非常强的一个跟电脑上去跑起来的,
那么我们今年在2月份实际上就是一在手机上去跑起来,
而且当时我们演示的时候是用的飞行模式,
运行都是在本地的,
然后我们可以实现在。
15秒之内完成20步的推理啊,
然后生成的这个图像质量也也相当不错,
嗯,
今年六月份我们在CVPR上展示的最新的controlnet在手机上的一个演示啊,
它是一个图像到图像的一个模型啊,
用户输入一个图形以及一个文本啊,
就可以改变图像的风格哦,
明白了这个这个风格迁移这种感觉吧,
对啊,
目前大模型的形态非常丰富,
已经出现了多模态的这种模型啊,
譬如说有包括最经典的文本生成图片,
文本生成文本,
而且还有这种现在大家可以看到就是很新颖的文本生成视频啊,
还有甚至还有这个图片生成文本,
图片生成视频,
文本生成音乐等等方式,
今后都会给移动端带来全新的体验,
我们的合作伙伴也在积极的进行端测打模型和探索工作啊。
小米在今年8月份的产品发布会上宣布了他自研13亿参数的端测打模型,
效果在部分场景下可以媲美行业60亿。
参数,
嗯,
没错,
这个他们的AI实验室的负责人王斌,
他们在这个节前刚刚上过,
我已经给你们剧透了,
对对对,
是的,
当时他们讲的一些东西让我感觉非常厉害,
以及他们也有提到,
就是说在这个里边骁龙扮演了一个非常重要的一个一个角色吧,
是最重要的就是我们合作伙伴在我们的骁龙芯片上跑起来,
这个是一个我们特别开心的事情。
呃,
既然说到这里,
那我就想问问,
在这个端测,
就是在移动端上面跑下算法,
特别是我们今天讨论的这些10亿参数量级别的大模型,
最大的挑战是什么?
就是你们是怎么去啊迎接这些挑战的,
性能、
功耗、
效率、
资源一直是端测跑A,
尤其是生成是AI模型的重点关注的因素,
这点不得不说啊,
高通是目前做的最好的,
将参数规模、
算力需求巨大的模型压缩到在资源非常有限的手机上去处理,
关键的挑战就是如何在既定的功耗下实现最高效的处理能力。
对,
因为这个手机的电池。
是有限的嘛,
而且你也不能因为在端侧要跑一个大的模型,
导致这个非常严重的这个发热,
这些在服务器上是完全没有任何问题的,
它有无限的这个供电,
它有外部的这个降温,
但是在手机上面我们面临其实是非常多的硬件上面的这些限制,
所以其实我能理解这个功耗啊,
性能这块其实是一个很大的挑战,
是高通把生式AI模型部署在终端侧,
采取的核心策略就是通过量化编译以及硬件加速进行模型的优化。
呃,
在云测服务器上训练通常是用FP32浮点运算,
呃,
这就意味着在模型的推理时候需要大量的内存以及算力,
因为终端受到这个资源的限制,
它不可能有无限的这种算力和内存,
对吧,
去运行这种这么庞大的这种这种神经网络,
呃,
那基于transformer的这个大语元模型,
在量化到8位甚至到4位整数运算之后,
往往能够去获得很大的效率的提升。
我们实际上在。
去年的芯片旗舰芯片就已经实现了INT4的能力,
那么in特4能够在不影响准确度和性能表现的时候,
可以节省更多的功耗,
这个对高能耗推理是至关重要。
不少升值AI的模型量化到in尼4之后,
与IN8相比,
性能能够提升90%,
能效提升大概能够去达到60%,
这是一个很惊人的一个数字。
那生爱的话,
在手机上其实会有很大的用武之地,
这样话其实可以把你的手机真正的变成你的个人助理,
就是有很多事情的话,
他都可以去帮你去完成,
比如说就我举个例子啊,
就是说呃,
现在我正在开会中,
我不方便接听电话,
那么以前有外接来电的时候,
通常的话呢,
我只能拒绝,
那么还有一些就是比较紧急的事情,
比如说我点了一个外卖到了,
但是我又不能告诉他说你给我放到什么地方,
今后有了这个生成爱的话,
其实他可以去帮你做这些助理工作,
比如说外卖的话,
他可以自动的用语音告诉那个外卖员,
诶说这个现在不方便,
你能不能放在附近的快递柜里,
并且把快递的这个柜的这个号告诉我,
包括可能有人来电话的时候,
他能去跟那人对话,
做一些这种呃问询工作,
比如说你有什么事情啊,
呃,
我什么时间能够打给你啊,
然后或者是能不能呃,
你把问题记下来,
到时候可以通过什么方式再去回复你,
因为我记性不太好啊,
很痛苦。
指的就是我可能需要,
呃,
把我之前的记录,
可能聊天记录啊,
我的电话录音,
我要一条一条去给去查出来,
那今后有了大模型的话,
其实他就可以帮助你把你之前的所有你的个人信息全都去做整理,
当你去查询的时候,
比如说呃,
我是去年,
然后和谁什么时间聊着什么样的业务,
他能非常好的能够去帮你给去找到,
并且帮你总结出来,
其实我觉得这个都是让手机能够为我们的用户能够带来这种更新颖,
更创新的一些服务。
除了咱们刚才提到的这些领域的话啊,
那在机器人方面其实也是一个非常好的一个陆地场景啊,
咱们知道现在有很多机器人都是叫服务型机器人,
或者是陪伴型机器人,
他需要这个机器人跟人有很强的交互能力,
那大模型的这种理解能力以及生成能力的话,
可以让这种他们的交流特别自然,
我觉得大模型能够做到的一个比较好的事情,
就是之前我不知道你有没有听过一个很糟糕的一个例子啊,
就是在医院里边有一个接待机器人,
然后当时他旁边有一个应该是病人家属吧,
就是非常着急,
可能是因为这个家人的这个病情非常的严重,
然后这个机器人跑过去说你是不是不开心,
要不要我给你讲个笑话,
我简直不能再糟糕了,
就是很明显这个机器人你知道他是被program去做一个好的事情,
但是他无法理解正在面对的这个用户,
他所处的一个情况,
他的上下文是什么,
是因为我也看过这个新闻,
我当时我记得网上还有一个。
铁特别逗,
他说这个可能是第一次的战斗,
原来AI的第一次战斗,
嗯,
这个的话,
有了大模型之后,
其实今后可以非常好的解决这个问题,
因为现在大模型的话,
它不只是对语言有很好的理解能力,
它可以对图像,
对视频,
就是也有非常好的理解能力。
呃,
像刚才举的那个例子,
就是在于如果这个机器人他可以去看到那个那个老人,
那么那么那个老人的当时的表情是不是忧伤的表情,
还是焦急的表情,
如果机器人有这个能力,
可以分析出他的情绪,
并且能够去识别到这个人,
能够去从系统中间查询到他的病例,
知道他需要什么样的服务,
那么我想肯定就不会发生刚才咱们提到那个不是太好的,
就是很糟糕的这种场景,
嗯,
能够更好能够为这些患者提供服务,
那我知道其实hexag杠这个处理单元是高通AI引擎里边非常重要的一部分,
Hexag这个项目从开始研发开始算的话,
那高通布局这个DP。
以及易购计算的这个时间已经有将近20年了嘛,
啊从你的角度,
你觉得在移动AI加速计算啊,
这么多年以来发生的变化有多么的天翻地覆,
然后在使用场景和体验上有没有哪些特别直观的提升和改变呢?
我觉得有这么几点呃,
特别值得关注,
第一就是算力和能效的进步,
第二就是AI运算专元结构的进步啊,
最早的话,
神经网络都是在一个专有的神经网络处理器,
那随着高通AI引擎的不断的进步,
现在我们的异构运算已经可以把AI能力去分布在各种的我们的单元上啊,
所以这样的话,
一起协同工作的话,
可以让手机的AI能力能够去满足各个方面的需求啊。
那么第三就是算法的进步啊,
包括我们最早只是支持先N的网络啊,
那么随着后边的话,
我们有更多的这个算子以及结构的这个变话,
我们可以支持RN啊,
现在最新的我们可以支持到transform啊,
那么从用户体验而言的话呢啊,
然后我觉得用户感。
最大的第一就是计算摄影啊,
在拍照上,
这个确实是一个非常大的用户能够去感知到的进步,
呃,
然后我记得我最早使用手机的时候,
那会儿的拍照,
其实你就可以把它的能力看成一个网络摄像头,
我第一个手机可能才是30万像素,
现在的咱们可以看到咱们的用手机去拍照都可以去接近到单反的这个水平,
那么还有包括暗光,
呃,
就是现在去拍夜景的话,
发现效果非常好,
甚至于有的时候眼睛看不到的这个场景都能可以很精细的给你拍下来,
这些其实都是哎去赋能的,
包括感知爱以及相册里处理,
就是我的手机里我有很多相片,
其实我就可以输入一个文本,
输入一个描述,
我就可以去帮我把我需要的相片能够非常准确的去给搜出来,
那么随着这个生世人爱的这个大漠性兴起的话,
可以做到更好,
它能够精确的找到我想要的照片。
呃,
视频对这样的话,
其实对我去使用手机是一个特别大的这种提升,
那么在NP方面的话,
这个也是有非常大的进步,
包括今天的手机的语音识别和翻译能力,
其实已经做得非常好了,
这个的话,
呃现在离线翻译的这个水平已经跟呃云上的水平其实已经非常接近了啊,
那在游戏以及视频上,
那么其实也是有非常多的这种AI赋能,
包括咱们刚才提到的这个游戏的超分,
然后以及插帧。
现在看视频的话,
我最近看到一个很有意思的功能就是呃现在用户想看恐怖片,
但我害怕看恐怖片,
对吧,
经常可能会被里边一些情节去吓到,
那么现在我看到有一个,
呃视频公司提供一个特别好的一个能力,
就是在于呢,
它可以动态的识别到恐怖的这个场景,
在那个场景的时候,
它可以把声音变小,
可以把亮度提高,
这样话就可以让呃这些人看那时候不那么害怕。
这些我觉觉得都是这种AI能力,
能够去很有趣的场景,
对,
能够去帮助用户,
能够去提高这个用户体验的一个特别好的这个地方,
我知道你在高通其实工作很多年啊,
就是具体跟AI有关的这个工作大概做了多久了,
一开始有没有预料到AI会像今天这样高度发达,
并且非常的普及,
呃,
我做的第一个人工智能项目是在1998年,
诶,
那是一个手写和语音识别系统,
是在摩托罗拉,
对,
没错,
那会儿有叫惠比有点印象,
以前用过PDA的这个,
这个都知道,
都熟悉,
是呃,
当时我就非常震惊人工智能的强大,
我当时也是去坚定人工智能一定是后边一个重要的一个发展方向,
当然对于人工智能的未来,
说实话,
我并没有感到太大的意外,
呃,
主要可能是得益于我看了很多关于人工智能的科幻电影,
我还深深记得我在电影院看的第一部星球大战的情景啊,
当时你知道这个电影结束之后。
活在原地鼓着10分钟的掌就激动的都流下眼泪了,
那是我第一次的人工智能的启蒙啊,
当然,
呃,
当时还是因为旷哥看电影被请的家长,
然后被胖揍了一顿,
这也是让我印象最深的一个一个场景。
但是对于人工智能领域发展的如此之快,
今天的生存片能够这么强大,
我还是蛮震惊的,
毕竟那些科幻电影是几十年前的人去写出来的,
他们对外的预测,
呃,
跟实际的进展肯定会有些偏差,
但我觉得这个大方向我们看到了都是非常准确,
尤其是在人工智能这个方面的话,
他们的描述跟今天我们能看到近期景象非常的一致。
呃,
加入高通之后的话呢,
其实我也是在很早就接触了AI相关的工作啊,
高通在AI领域的话,
已经去耕耘15年了啊,
我到高通的话呢,
做的第一工作就是在于我们用干网络。
啊,
以及vai的技术去做编码的生成,
当然那会儿的话,
芯片的能力不如现在去好,
所以当时我们运用了很多的优化方法,
把它控制在了1亿参数以内,
但是当时的效果就已经做到非常好了,
在呃,
很早的芯片上就可以做到非常好的编辑码的能力,
当然到了现在芯片能力加强之后,
我们做的一定会去有一个质的飞跃。
刚才我们说了这么多端测大模型在移动端跑起来能够呃驱动的这些非常厉害的这些使用场景,
为什么骁龙处理器能够高效的完成这个端测大模型的推理工作,
AI引擎在计算上面会有哪些比较厉害啊,
或者是独特的这个设计和能力呢?
高通业引擎是我们终端测AI的一个非常核心的优势,
有很多创新的技术啊,
那我挑几个值得说的给大家介绍一下啊,
首先是它有一个专有的供电系统啊,
大家都知道,
就是在手机里边能耗是一个最重要的关键的因素,
呃,
不同的部件在运行的时候,
其实是它跟其他部件的协同是很重要的,
但是在有的时候有一些部件它再去工作的时候,
另外一些部件其实并没有工作,
如果他用一套供电系统的话,
这个会造成这个干扰,
其实就会造成一些功耗损失,
现在在我们的专有的神经处理单元是用单独供电的,
这样话他再去处理啊,
我们的神经网络去进行大规模的运算的时候,
它就不会跟其他的这个部。
去做干扰,
相当于让它满血运行,
相当于它有一个独立的单间,
对它可以不跟其他有干扰,
那么还有一就是刚才提到就很重要的就是我们能把很大的模型,
这种生值AI模型给放到手机里,
最重要就是可以把它从IP32量化到IN4,
我们从去年开始就在手机上去支持IN4,
这样的话,
这个是一个能够去让大模型在手机上跑的很好的一个非常重要的一个基础啊。
还有一个就是直连的技术啊,
大家知道就是在数据量很大的时候,
呃,
当需要多个芯片部件协同的时候,
呃,
往往内存会成为瓶颈,
就是因为不同部件再去交换数据的话,
都会通过内存,
内存就会去有很大吞吐,
这样的话不止功耗,
而且造成的这种带宽的这种限制啊,
现在的话呢,
我们把我们的神经处理单元跟其他的部件。
有了直连,
这样话其实就可以不通过中央内存,
当我NPU,
比如说要跟GP去系统的时候,
它可以把数据直接去送过去,
这样话可以第一是高效,
第二是省电,
呃,
另外我们还有微切片的技术,
这样的话其实就像刚才咱们提到直连一样,
它可以去极大的降低DDR上的这个负载,
这样的话就是它也可以同样去做到节省功耗啊,
同样他可以减少吞吐量。
刚才咱们提到的这几个能力,
就是我们AI引擎的核心能力,
以及我们异构计算的基础,
当这些能力去结合在一起,
它能够去让所有的AI的模型,
尤其是现在的生成人的模型能够去更高效的去运行,
可以去让所有的系统能够在最佳的状态下能够去提高用户体验。
聊了这么多AI的东西,
最后我还是想再回到一开始我们聊的这个音频的层面,
就因为我们是做播客的嘛,
最近我们观察到的一个比较厉害的AI技术,
就是说。
能把一个播客的节目啊,
把它生成一个另外的语言的版本,
而且仍然是用的我们主播原本的声音,
这个技术我看到有一些小的创业公司在做,
然后最近海外的一个最大的一个流媒体,
加上博客的平台Spotify他们也在推,
那我就在想,
如果在将来,
当我在听播客的时候。
呃,
我的手机能够直接对一个正在播放中的一个播客的音频,
或者是任何一个音频的文件,
对它进行现场的一个翻译,
再或者是另外一个场景,
就是说,
比方说我马上要去呃日本旅游,
然后但是我不会日语,
我能够起到一个效果,
就是我对着这个手机说中文,
它能够以一个比较短的一个时言,
甚至是现场实时给我转化成另外一种语言,
但是同时还是用我自己的声音,
在你看来,
我们有朝一日能够实现这样的功能吗?
它需要呃哪些技术的进步才能够实现呢?
呃,
这个是一个特别有意思的场景,
呃,
实际上我们在探索这个技术啊,
这个技术主要是分为三个基础,
一个就是语音识别,
就是把播主的原始的音频识别成文字,
然后再利用翻译的技术,
把识别出文字翻译成目语言的文本,
最后呢,
就是利用TTS,
就是texttospeech,
把目标语言的文本再变成语音念出来啊,
当然注意。
这里有一个特别的能力,
就是TTS可以通过训练学习博主的语音的声文,
呃,
并且利用这个声文去做渲染,
这样的话最后的语音听上去就跟博主的这个声音是完全一样,
呃这样的类似的技术其实我们已经在手机终端上已经去实现了,
呃,
我们2019年就和OPPO以及有道一起合作的通话翻译手机就是这个功能,
咱们可以利用这个功能,
他可以去跟一个呃国外的朋友打电话,
这个手机就可以把他的说的中文,
然后去给变成文字,
再翻译成对方的语言,
最后通过TTS送给对方,
对方听完之后再说英语,
之后再用同样的方法再去回传到咱们的会说中文的用户首页,
就是双方都可以用自己的母语进行一个对话,
然后中间所有的heavylifting全都被这个手机去接管了,
没错,
这就是另外一个场景,
但是实际里里面用的技术就是跟刚才你说的类似的这个技术,
然后去呢?
啊,
我们和小米合作的叫离线的AI字幕功能,
其实也是有类似技术在里边,
当手机去看视频的时候,
可能只有英文版的片子的话,
他就可以利用这个技术,
可以在手机端测,
实时的就把呃语言翻译成他希望的这个语言啊,
去年的话,
我们跟小米就一起把它完全在端测去运行,
刚才提到两个都是端测AI的能力,
全链路去实现的,
而且是实时的啊,
声纹模拟部分的话,
未来我们相信也可以在手机上去运行起来,
现在支持AI计算能力的这个智能手机,
以及内置的AI功能的这些手机的APP越来越多嘛,
像我们刚才已经提到非常多的场景,
比如说拍照啊,
翻译啊,
语音处理这些的技术已经被很多的用户所体验到了,
展望未来,
在这个端测AI计算能力的这个应用方面,
高通还在探索哪些全新的,
就是能够让大家体验到实实在在的这个AI的强大之处的这样的一些场景吗?
你们还有跟哪些其他的合作伙伴在?
做一些更有意思的事情吧,
我们正在跟广大的生态合作伙伴一起去推动生成式AI在中端上的落地,
我们在Microsoftbuild大会上在骁龙的笔记本上做了的演示,
我们也正在和Meta合作去一起优化拉matwo大语言模型,
呃,
让他可以直接在智能手机、
PCXR以及汽车等终身上执行,
啊,
不需要再完全依赖于云服务,
那这样听起来可以说所有的这些至少是最近一年里边这些比较大比较流行的这种,
呃,
大语言模型都已经在这个骁龙的这个平台上已经跑起来了,
我们骁龙的用户大概什么时候能够体验到呢?
我们希望我们的用户在今年年底就可以在最新的旗舰智能手机上啊,
去体验到上世爱的应用,
并且在明年在车上也可以去体验到,
我们每年的骁龙峰会都会去发布我们最新的产品,
呃,
今年的峰会将于夏威夷时间10月24号到26号举办,
我们将带来每年最重磅的新品发布啊,
同时我们也带来高通在AI以及生成水验方面最前沿的创新成果,
最后跳出刚才我们聊的所有这些东西啊,
从你自己的角度,
现在有哪些最新的产品啊,
技术让你感觉到非常的兴奋,
让你非常期待科技的未来啊,
我觉得首先就是跟生值爱相关的,
就叫通用人工智能啊,
Gii的话,
我相信未来一定是一个呃,
非常有前景的方向,
呃,
我特别期望啊,
今后未来的话,
不只是我从电影里看到像讨好玩家啊,
熊团战战黑锅帝国,
包括阿丽塔这些这些科幻电影,
我先。
我特别希望在未来的某一时刻,
我真正的就是生活在那个年代里,
对,
还有包括像元宇宙,
这个也是我们认为未来的一个,
呃,
是一个非常重要的一个使用场景,
高通在这方面我们也做了很多布局啊,
包括在SR领域的这个芯片,
以及我们人工智能怎么去帮助SR领域能够去把它的内容能够去做到最好啊,
那么还有就是多设备互联,
其实几个设备之间去使用啊,
去同步信息是一个很头疼的事情啊,
未来的话,
我相信咱们所有的设备都可以很好的协同在一起工作,
而尤其是有有AI去赋能的话,
可以让设备之间很能的可以把所有的这种工作能够去安排好啊,
这个也是一个我觉得能够在今后的生活能够去体验到,
并且能够对我生活有这种非常非常大的帮助的一个事情啊,
那还有最后一个就是移民火星,
我们都在想这个事情,
也不知道他什么时候开始卖票啊,
是这些。
第一个梦想啊,
就是真是希望有生之年能够去到另外一个求去看一看,
好的,
那么非常感谢char今天做客我们的科技,
早知道从他的角度跟我们聊一聊AI端测,
AI大模型等等这些非常流行的话题,
我觉得特别重要的是,
呃,
我们作为播客的主播和制作人,
跟音频打交道的这些从业者,
呃今天从char的分享里面让我们看到了高通在研发和生态运作上面,
呃这些方面的努力,
呃让这个我们习以为常,
就是以为日光之下无心式的这个音频的领域,
呃让我们看到其实也正在迎来一波新的技术革命,
给我们的创作者以及收听端的听众都能够带来一些呃很有用或者很有趣的这种体验的提升,
我也希望听众能够从我们今天的聊天当中有所收获,
最后我也echo一下刚才chart提到的,
如果我们的听友当中有数码爱好者,
有关注AI进展的朋友,
请一定不要错过高通在下周即将开幕的骁龙峰会。
好的,
那么再次感谢Cha今天做客科技早知道。
啊,
谢谢主播啊,
大家回头见,
这期沃next科技早知道就到这里了,
听完之后如果你有任何的想法,
欢迎在评论区里面给我们留言,
我们每一条都会认真的看,
如果你喜欢我们的节目,
请记得给我们五星或者好评,
分享给更多的朋友,
也会对我们非常有帮助。
你也可以单独写邮件给我,
邮箱地址是听tingat生点M,
我都会一一回复。
那同时公众号和微博也可以搜索生动活泼盛世声音的声节目相关的更多信息会在公众号里出现,
微博和公众号都会有不定期的福利给到大家。
如果你想要跟我们更加紧密的讨论和分享,
或者是想要认识和你一样有求知欲的新朋友,
可以加入我们的微信群,
进入听众群的方法是在公众号文章中扫码添加,
或者是公众号后台回复。
科技早知道即。
呃,
获取邀请码,
期待你的加入,
我们下期见。