• 推荐
  • 排行榜
  • 歌手
  • 歌单
  • 电台
  • 新碟
搜索历史
大家都在搜
爱在圣诞
重如尘埃-黄子弘凡
蔡健雅
reason 郑
晴空
无限 的士高
风若是拦不住
JINGWEI
最难是求人的饭
爱像垃圾被你丢弃
白菜对我笑(DJ加速版)
爱如火-那艺娜
花不会一直开
天真的橡皮(DJ版)
关中王
蛋糕店里买蛋糕
偏偏喜欢你
我有我爱你
你往南走
没有我你怎么办
热
搜
词
山风山风等等我 你有没有真的爱过我 思念漫过海岸线 你往南走 如果累了就回故乡 琵琶曲 五百年沧海桑田 今生劫换来生缘 泪海 时间能不能走慢点 甲乙丙丁 岁月如笔写春秋 梦的翅膀受了伤 你怎么舍得让我的泪流向海 慢品人间烟火气 ora 早春晴朗 人间逍遥仙 你不该权衡利弊 黄昏
00:00/00:00
 高速下载歌曲音频  下载歌曲到手机 下载LRC歌词
随时随地任意搜索并下载全网无损歌曲
扫描右侧二维码下载歌曲到手机
扫描下方二维码下载歌曲到手机
免费获取更多无损音乐下载链接
外链地址
http://www.eemp3.com/audiofile/b68cc9fc20b586d4f0be2bfe8973d915.mp3
点击复制

本字幕由TME AI技术生成
用声音碰撞世界
生动活泼
欢迎来到whats nex 科技早知道第八季
和全球创新第一时间同步
Hello
大家好
欢迎大家来到新一期的whats nex 科技早知道
我是亚贤
自从拆gbt 横空出世
几乎所有关于大模型的讨论都离不开transformer
那transformer 架构呢
也支撑了这一轮新的生成式ai 的快速发展
然而在看似唯一解的架构背后
行业也遇到了难以回避的瓶颈
推理和训练成本居高不下
长上下文能力依赖庞大的显存和算力
端侧部署和商业落地也面临着困难
Transformer 的困境让神经网络的另一条路径得到重新审视
那就是rnn 循环神经网络
今天我们请到的嘉宾是原始智能的联合创始人和coo 罗旋
最近几年
他与另一位创始人彭博一起持续探索基于循环神经网络的可扩展架构rwkv
或者叫软库
软库呢
被称为可大规模训练的inn
也是当前最活跃的开源架构之一
软库架构能否在transformer 面临的核心问题上提供一种可替代的解决方案
基于软库的模型在全球有哪些实际落地的场景
新的模型能否给端侧模型发展带来更大更多的机会
今天
我们就和螺旋一起
从底层架构设计出发
聊聊inn 的可扩展性
软库架构的发展
以及下一代大模型可能的走向
Hello
罗总你好
先给大家打个招呼
做个自我介绍吧
Hello 雅贤 哎
各位 大家好
我叫罗旋
呃
我是来自原始智能的联合创始人
我是一个ai 的连续创业者
我之前做了一家机器人公司
主要是做自主移动机器人
然后二三年开始呢
跟软库的作者彭博一起成立了这家商业公司
叫原始智能
我们就是在做一个新型的大模型架构
我们把自己定义是一个新型的rn 的架构
呃
我再往前的话呢
就是在一些大厂呢
我之前在腾讯是做qq 的产品经理
后来在
呃
猎豹移也是做工具产品的产品负责人
然后从二零一六年开始呢
我就all in 到了ai 这个赛道
也算是国内相对早一点的做ai 这个赛道的从业者
然后
呃
二零一六年是在阿里的
呃 机器人
后来在阿里ai lab 做天猫精灵
那可以大概给大家介绍一下软库这个神经网络的架构吗
刚刚提到rnu 是全球首个rnn 的大模型架构
在此之前呢
大家都从传统的rnn 转到了transformer
就是核心
就是因为transformer 能够高效并行训练
软库呢
是第二个解决了这种神经网络高效并行训练的问题
同时它的效率
效果都是比transformer 要好的
然后从二零二二年
呃
年底的时候
Raq 的作者彭博
他就训了一个七十亿参数的rau
Oou 的模型啊
在当时已经是非常大参数的一个模型了
最近无论是学术界还是工业界
都广泛的在
呃 应用 我一个
我在开头时候也提到
就是transformer 现在也面临一些瓶颈嘛
所以逼迫着大家也去思考一些
不管是优化transformer
还是走一些非transformer 的神经架构路线
罗总
这边能不能给我们介绍一下
就是transformer 它现在面临的主要的一个挑战是什么
呃 主要的
我认为至少有四到五个挑战
呃
可能有的是大家知道的
有的可能大家没有那么
呃
清晰的认识
第一个是性能差
效率低
这个点大部分从业者都知道的
因为transformer 在推理一测是一个n 的平方的一个复杂度
就二次方复杂度
空间的复杂度也很高
呃
所以它时间复杂度是n 的平方
空间复杂度优化完以后呢
依然是一个快速增长的一个内存和显存的占用
所以这是跟它本质的这个attention 机制相关的
Attention 机制的本质就是在推理的过程中
它在不断的翻书
嗯
它不断的遍历之前的上下文
所有的上下文
那么就意味着什么呢
就是它的上下文会越来越长
就导致你需要处理这个上下文的转力和存储的需求就会越来越大
如果你是一个固定的专利或者固定的存储空间的话呢
那么就意味着你的速度会越来越慢
显存或者内存很容易就爆掉了
这个是大家可能从业者都能够理解的
Transform 的计算效率比较差
这也是为什么过去两年多
大家都在拼现在买算力去
无论是训练还是推理
以及甚至有很多海外的公司
呃
海外的投资公司在投一些能源的技术建设
因为他不但算力需要很高
而且还需要大量的能源
这是第一个问题
但是第二个问题是
去年真正暴露出来的就是skcheing w 的预训练的transforskcheding law 已经遇到了瓶颈
其实很多的从业者在两年前是知道的
但是真正的公开或者是大家形成共识值
就是在伊尼尔在某一个会议上提出来说预训练的skin 诺没没有了
这个skcheno 是什么意思呢
它包含了两个概念
零skcheo
一个是就模型的参数变得越大的话
它的效果会不会变得更好
第二个是它训练的数据更多的话
它的效果会不会变得更好
Ok
我们拆解这两个问题
现在都遇到了困难
第一个是参数变得越大
比如说语言模型
Denance 六十五b
它如果再翻一倍
参数翻到一百三十b 的话
它的效果实际上并没有明显的变得更好的
过去有很多公司做过测试的
所以你现在看到
无论是稠密模型还是所谓的moe 模型
Moe 模型本质上是稀疏模型
它的激活参数大会超过七十b 的
就是因为参数的skcheing 遇到瓶颈
另外一个呢
数据的skin law 也遇到了瓶颈
在哪里呢
就是现在整个互联网上的优质的文本数据
大概就是二十t
基本上都都已经训到模型里面去了
那么这个数据的增长速度是赶不上这个模型接下来需要更多数据的这个前提要求的
当然了
我个人认为
后面这个数据的skchelow 是有点扯淡的
为什么呢
就好比打个比方
一个人说全世界的粮食都不够我一个人吃
这是粮食不够导致的吗
这肯定不是
这肯定是你这个人有问题啊
全世界的优质数据都不够一个模型用的话
那就意味着这个模型本身有问题
对对对
第三个问题在哪里呢
就是整个的商业模式其实是有问题的
过去两年
其实真正在赚钱的主要就是英伟达
大家所有人都在
对吧
用英伟达的卡去训练
甚至用英伟达卡在做推理
核心原因是因为所有的人都在调云端的api
模型没有办法部署在端侧
而且每一个任务都要用云端的算力
而云端的算力又非常的昂贵
导致了整个经济模型变成了所有的做应用的厂商
大部分都是不断真的
而传统的个人电脑到智能手机
我们会发现
大部分的计算其实是在终端上面的
你的pc 和手机其实就是一个计算终端
那到这次ai 的发展过程中
发现终端的算力并没有被用起来啊
所以我觉得端上部署模型遇到困境
因为像松某的计算复杂度原因
导致端侧难因落地这个问题
导致了现在的商业变现困难
这是核心的第三个问题
但第四个问题是过去很少有人提的
就是transformer
虽然大家都在用
呃
全球都在用
而且是一个写成论论文
大家都广泛的在使用的各行各业
但是transformer 它的是有专利的
它的专利是在google 这家商业公司的
而且transformer 的这个专利
它是有做全球部署的
包括在国内
中国国内也是有专利的
它只是现在google 没有把专利拿出来让向大家收钱
所以它在开放开源的这个程度上来说
它是不够的
大家其实是未来可能会面临到google 的诉讼
这就是我刚刚提到的transformer 的可能需要关注的几个问题啊
因为我们数次提到in
其实rnn 是在transformer 之前
其实也是一个蛮主流的神经架构
可不可以介绍一下rnn 跟transformer 机制它有一个什么样的不同
以及我们基于rnn 搭建的这个rack 的模型是做了一些哪些改进
就为什么大家放弃的cor nn
改用transformer 的核心
一个原因是因为传统的rnn 它是没有办法scare up 的
就没有办法训更大的参数的模型
会遇到梯度消失
梯度爆炸的问题
第二个点就是因为rnn 的它的上下文的能力是看上去是不如transformer 呢
所以很多人认为a transformer 的上下文能力很强
尤其是第一个原因吧
因为第一个原因是零和一的区别
嗯
其实就是因为rnn 在预测下一个token 的时候
它只base on 前面一个token
而不是像transformer 一样
把之前所有的
呃 上下文
就像你说的
遍历一遍
就是像读书一样
所以它的记
它的 呃
记忆是有限的
记忆有限这个事情
其实以前iostm 其实是解决了的
嗯 对
它有长短记忆的问题
它可以把一些之前的信息通过压缩的方式放到这个state 里面
就lstm 就已经做了
但只是说没有办法scare up
以及它的上下文能力弱于ansansformer 这两点
导致大家放弃了啊
尤其是第一点
不能够scare up
因为大模型
大模型讲的就是它有更大参数
软库也是借鉴了transformer 的这个结构
但是它没有attion tion 然
你可可不以给我们介绍一下
就是不同代际的这个软库都做了一些什么样的改进
嗯 呃
我们还是从比较成熟的软固第四代开始吧
软固第四代呢
它是一个这个推理测
是一个循环
Dig Grnn
然后呢
它是一个固定大小的state
然后它的state 是一个非常小的
呃 罗总
我来试图一些理解一下state 这件事情
State 其实就是固定大小的内存
就是你不管有多少的input
它都是用这么大的内存来存储它前面的这些信息
嗯 对
你可以认为它是工作内存
我们也会跟很多人打比方
你比如说
你把一个模型看成是一个电脑
那这个state 就是一个你的工作内存啊
你的工作内存是固定大小的
Transform
不是
Transform 是它是不断的有kv catch
Kv catch 也会不断的变大
所以它没有办法用一个固定的大小的内存去管理它
对
其实在transformer 模模型里头
它这个所谓的空间复杂度
就是它这个kv cash 会随着它上下文的增长而增加
没错 没错
但是在 在
在软库这个模型里头
由于它在占用的内存是固定的
所以你即使给他很多的input 的很长的这个上下文
它也不会占用更多的kv cash 或者说内存
没错 没错
这就是一个空间复杂度是常数的一个核心原因
工作内存是固定大小的
所以你一开始可以为这个state 预先分配一个内存
然后 呃
然后第四代
它的关键点是
第一个是state 的大小
它是一个向量
State 本身是一个向量
第二个呢
是它的容量是非常小的
第三个点是它的时间衰减
因为我们刚刚说的
它这个工作内存是固定大小的
那么你上升为越来越长
哎
你为什么还能够用一个固定大小的空间去存储它呢
那就意味着它有信息的衰减
有信息的一些丢失
你可以认为是某些维度上的丢失
那么这个信息丢失的
或者是叫信息衰减的这个机制是什么呢
从第四代的时候
是一个指数衰减
每一个信息的衰减速度都是一个指数衰减
然后第五代呢
改变了一个东西
就是把这个state 从下量改成了矩阵
那它的空间就大了很多
大了几十倍
那它就可以存更多的信息
那它的记忆力就会比第代代要强
后第第代代在第五代的基础上
把信息衰减机制做了调整
就是第四代是指数衰减
第六代的话呢
它的衰减机制变成了基于数据的衰减
就每个数据它的衰减速度都不一样
就打个比方
比如说我
两年前 呃
我遇到了一个很重要的一个事情啊
有一个很重要的人物出现
但我一定现在还是记住住他的名字
他的手机号码
包括当时发生的很多事情细节
但是你要我记住
比如说上周一
某一个人跟我讲了什么话
讲的第一句话的第一个字是什么
这种细节我是记不住的
所以每一个数据
它的衰减速度都是不一样的
这是第六代
第七代的改变是什么呢
就是它的信息不但是衰减的
而且它的信息还会去实时去做学习
举个简单的例子
过去大家的脑子里面都知道
小sformer 可以用来学模型attention 与多元力的对吧
那么在我们在交流过程中
大家会发现
哎
除了传输门以外
还有一个架构叫软酷
这种新型的rnn 也可以训练大模型
相当于是修改了你之前的记忆啊
这就是我们叫呃
信息的一个演化
它不单单只是一个衰减啊
它会覆盖
它还会增强等等
这是第七代的一个机制
然后第八代的话
我们现在公开了一些
但还没有完全公开
比如说我们第八代公开了一种新的稀疏方案
这个稀疏方案呢
能够保证你稀疏的同时
它的显存的占用还是恒定的
所以我们这个系数的方案
非常适合在端侧部署一个稀疏模型
但还有很多新的技术我们还没有公开
嗯
节目中间也跟大家同步一下我们青少年付费节目那妈a 世界
上周更新了三期解读
聊一聊ai 为什么会出错
飞机退役后会去向哪里
以及伊朗声称要封锁霍尔木兹海峡
这个海峡跟我们的日常生活又有哪些关联
其中a 这一期可以免费关联
其果你感兴趣
欢迎在本期简介中找到节目收接
喂
哎
那我之前听mini iax 零一的网络架构负责人的访谈啊
他当时就说
Rnn 对上下文的召回能力其实是比较差的
那mini mi max 零一呢
就是采用了在七个线性的rnn 的后面叠加一个attention 机制
这种混合架构的方法呢
就能够比较的解决这个retrieval 的问题
那可不可以跟我们说一下这是一种什么样的方法呀
Ok
就是rnn 加attention 的混合模型啊
我们之前跟其他朋友打过一个比方啊
我们把它类比车
传统的transformer 的attention 机制for attention 的这种模型呢
我们认为它是就像是传统的燃油车
而纯的rnn
新型rnn
比如说酷的这种纯的酷的模型
你可以认为它是一个电动车
新能源车
那么中间还有一类叫混动车
混动车就是rarar nn 加attention 的混合模型
比如最近国内大家都知道的像miniax 的零零和另另外最新出的一对吧
还有腾讯说的那个tyb s
他用的是memba mbmber 加attention 的混合
Member 其实也是一种新型达人
不
虽然他自己把自己叫做ssm
还有海外其实也有团队在做这个事情
包括google
包括open ai
其实很多人认为open ai 的for o 这个模型是一个rn 加atation 的混合模型
当然了
它不开源 呃
但是国内和海外有很多的人都在说这个
认为从token 生成的延迟曲线来看
它应该是一个rn 加attention 的混合
还有google demand 最近发的论文就是patenons 加attention 的混合
这个都是他们有论文的啊
我说混混合模型在现在这个阶段是一个最优解
现阶段
比如说用racq 的第七代加attention 去混合
我们最近也公开了一个我们的混合方案
Tv 开始的大小大概是mla 的九分之一
但是我们个人是非常接信rnn 是中矩的
我们相信纯电才是未来
我们希望第八代
就是一个纯的inn 的模型
就能够超过transformer 的所有能力
包括上下文的能力
Inn 可能是未来
现在已经成为业界的共识了嘛
我们其实知道
一年前其实海外已经成为共识了
但是国内的话呢
包括member 对吧
Member 其实在学术界蛮有名的一个架构
Member 是berkeley 的组开发的
那个也是啊
基于rnn 的一个架构吧
他们叫ssm 对吧
他们不是bercley
应该是plastand 的人
他们其实核心都是以前斯坦福rain 实验室的人
然后他们以前做的叫s four
呃 然后呢
他们在s four 的基础上
呃
往软户这个方向做了一些优化
然后它本身应该叫s six
但是呢
它改了一个新的名字
叫member
这member 是其中一个比较知名的
国内的话呢
应该就是
呃
Mini max 和这个
腾讯这一次用到了它的模型训练里面
做混合模型啊
让大家更加熟悉了
这个啊
因为你说r 然其实也现在也可以
呃
Scalup 了嘛
现在的模型
最大的模型可以scale up 到多少呀
嗯
我们看参数的话
一定不要模型公司告诉你的参数
你要看它的激活参数
我们激活参数里面
最大的公开出来用raw 库的
现在是三十b
是中国电科
中国电科今年三月份公开了他用软酷讯的三十b 的模型death 模式
然后私底下跟我们说的
比较确定的
有一家是用了软酷讯的七十b 的子模
是一家海外的dea i 编程的独角兽
但他希望我们现在不要公开
哎
那transformer 现在最大的模型需要多少啊
基本上都是在次模型激活参数七十deb 左右
其实更多的是三十b 甚至十五b 的
为什么呢
首先 第一个 它
我刚刚说了
它天花板就就是六十十b
激活六七十b 的推理成本很贵的
因为三十b 和七十b 的差距已经没有那么大了
那大家
大家都用三十b
其实很多就是用的一个三十b 激活的一个mov 模型
那可以帮我们总结一下酷这个架构它的优势吗
第一个肯定是性能的
我们刚刚说transformer 的这个计算效率很低
呃
我们可以对比一下啊
全 呃
软酷跟transformer 的性能消耗的一个对比
其实你可以把rack 库看成是一个固定上下文六十四的sliding window attention
Transformer 它的消耗就固定上下文三刷
呃
这是一个非常低的消耗了
很多模型一开始训的是
呃
四k 的一个上下文
另外第二个点呢
就是我们的能耗是全球上低的
我们比比如transformer 这种lama 的模型的能耗要少百分之三十
但是这还不是最重要的
最重要的是接下来我们看好的下一代的芯片
比如说存类计算的芯片
净存的芯片
它会帮助软酷这种rn 的架构带来十倍以上的能效提升
第三个就是效果
我们现在欢迎大家来公平的对比
因为有很多人不太相信啊
说软酷的效果哎
你为什么会比曹聪梦好
我们软库从第七代开始
除了上下文能力这一点比transformer 弱以外
其他的能力
我们都可以跟全phm 去做公平的对比
怎么公平的对比呢
就是拿相同的参数
相同的训练token
就是训练数据集
其他都相同
你甚至超参调的一样的都可以
就这更更合理的应该是各自有各自最合适的套餐
有很多家模型公司已经在用我们的架构在做这种对比测试啊
确实证明了我们说的那一点
我们的训练出来模型的效果
这个效率
都是优于他们现在看到的其他的模型现有的相同的情况下
这是三点
还有几个就是其他transformer 模型不具备的能力
第一个能力
大家能够想到
就是因为它的推理的时间复杂度
空间复杂度非常的低
所以它可以做非常长的cot
哦 思维链 对
做思维链的推理
唉
Transformer 是很难的
因为它的思维链的话
它每次都变成一个上下文
它上下文越来越长的话
它的资源消耗很快
因为它是一个n 的平方的复杂度的啊
就跟什么呢
就跟我们这个
这个
嗯
我之前打一个很有意思的比方
就是在棋盘上放米粒的故事
嗯
你第一个棋盘放一粒米
第二粒平方放两粒米
放到最后 哎
全世界的米都不够你用了
恰我就是这样一个低效的一个一个算法
所以无限长的cot 是软酷这种inn 的独特优势
你可以看到
像前段时间萨卡乃耶
他公布了一个大用大模型解速读的一个榜单
速度游戏
你会发现穿梭模的模型的完成率不到百分之十五
而软酷这种rn 的架构的话呢
它是百分之百准确的
我们已经开源了这个模型
包括训练代码
训练数自己都公开出来了
在去年的九月份
我们就证明了
做做这个非常长的raacc ot 是非常有优势的
其实还有很多独特优势是在中国是不具备的
关于transformer 本身
它也有一些优化
比如说你像deep sik 他们用的那种稀疏注意力啊
然后moe 架构
或者说是优化gpu 的使用啊
这些啊
你怎么看待这这些对transformer 的优化呀
我认为吸疏到的是一个好的一个一个方向
但它并没有本质上的解决attention 带来的这个时间空间复杂度的问题
呃 因为
因为我们刚刚说了
就是transformer 里面分成了time mixing 和china mixing
对吧
Time mixing 这块就是包含了attention
我们相当于是改了time mixing 里面attention
China mixing
所以所谓的
呃 Mlp
或者我们叫
我们把它叫ffn 这个领域的话呢
就包含了
现在你可以把它改成moe
它有一些优化
但是并不解决彻底解决这个你的存储占用的问题
你依然是内存
显存占用会越来越大
那时间复杂度就更不用说了
你并没有改太选对
所以
我们也可以做moe 的啊
软乎也是可以做moe 的
我们第八代的技术
其中一个
就我刚刚说的新的技数方案
就是用来替代moe 的
我们因为认为现在的moe 还是有很多问题的
比如说像 呃
Open ai
或者说像google 这样已经训练了非常大参数的这种transworer 模型来讲
他们有这种动力去从零开始
基于一个别的架构来训练一个大参数的模型吗
呃
我觉得有两种方式可以去做吧
第一种是
如果你已经训了一个很大的参数模型的话
你最低的最保守的方案是可以直接升级现有的模型
就是把现有的训练出来权重
加上一部分之前训练的数据
再加上一点点算力
比如说你加上百分之十的之前训练数据
再加百分之十之前的训练的算力
你就几乎可以达到完全的转换
就效果几乎不丢失
现在海外有很多团队就是这么在做的
海外有很多的团队占用现有transformer 的权重转成软库的权重
现在好几个团队
他们可能还没有这个国内的这些公司的资源多
他们只训练了不到百分之零点一的数据量
然后呢
也拿也没有拿到原始的训练数据
他们但是他们训练出来的raw 转换出来的软库的这种模型的效果
就已经达到这个原始权重的这个模型效果的百分之八十
这是一个非常低的成本
那前面也提到说基于软库架构的推理成本特别低嘛
那它是不是就特别适合端侧部署
对
因为端口也刚好也是个空白市场
呃
实际上很多人之前也说要走单
但实际上发现做单测没有那么容易的
呃
我们认为raco 这种nn 的架构会更适合做单测
包括手机
Pc
眼镜
巨身智能
对 机器人 嗯 车
包括iot 等等
现在有很多机构都在
包括端侧芯片厂商
包括做这个端侧的硬件的公司
都在尝试用软q
我刚刚提到了一家
应该微软windows 里面内置了raw
这已经是对对软le 端测能力的一个非常大的一个背书
就是啊
Office
他们那个co pilot
呃 对 它是 呃
因为我们那块的代码都开源出来了
所以office 直接用了我们开源的代码
我
我们看到它有模型调用的这个动态接接库
有端测cpu 加速的针对对软的ccpu 加速的动态连接库
Gpu 加速的动态连接库
它那个文件又在office 的目录下面
所以我们猜测
它是在office 的本地的这个一个ai 能力上面
因为他们有没有找我们
因为是美国总部的
从比如说现有的大模型里头
现在也有
比如说做一些蒸馏
蒸馏出来一个几b 或者几十b 的小模型
也可以用在端测呀
呃
当然可以啊
但是重点还是看你的这个资源消耗啊
在端终端就意味着它的资源是受限的
有几个点
第一个是算力
第二个是内存
第三个是
呃 那个电池
呃
这三个都是非常受限的
如果你这个底层架构导致你这个模型在使用过程中会越来越慢
而且会越来越吃内存的话
它就没办法持续的去跑对吧
它也没有变成一个没有办法变成一个持续在用的一个比如说cooperoate 也好和agent
甚至未来大家如果想把模型内置到操作系统层的话
这也更难了
就
就打个比方
就像以前我们用电脑的时候
刚开始用电脑的时候
经常会遇到一类软件
用着用着就死机了
对吧
这类软件就是它的因为算法本身或者是代码本身的bug
导致它把内存吃掉了
或者让cpu 放机了
如果你的未来的模型会把本地的内存吃掉了
会越来越慢
直接卡死的话
那它不是一个很好的落地的一个一个底层
那你觉得以后云端和端侧是会都用同样的模型吗
还是说
比如说可能云以后云端还是基于transformer 架构的模型
然后在端侧用racd 的模型
嗯
我对云端和端侧是这么看的
我们先不说架构
我认为端侧呢
它的职责是快速响应对吧
因为它实反响应应度要快
第二个就是它端侧的话呢
大部分的成本是让用户承担
比如说你可能我的未来的它是百分之八十的ai 的计算是在端侧
它变成一个co pilot t 者变成一个个整的端端的的agct
是的 好的
那么云端到底是什么
我们要要想好
云端的定位是什么
就跟现在互联网的云端到底是什么
现在互联网的云端是一堆的云服务给到这些app
或者是给到一些to b 的企业
To c 的用户提供服务的
那么未来
我认为ai 的云端是一大堆的agent 或者是mutty agent 的一些服务提供给大家
那我们再来看现有的模型
现有的架构
能不能够支撑agent 的平台
或者支持martty agent
所以
从这两个角度来说
第一个
端侧最适合的肯定是新的架构
因为它的速度恒定
内存占用也是恒定的
能耗又低
而且未更适合未来的芯片啊
云端的话呢
云端现在就是我刚刚也提到
Transformer 的scanning law 到了一个瓶颈
你要突破这个瓶颈
你才能够做更多端测做不了的事情啊
这是第一
第二个的话
你现在market agent
通用agent 的能力
是否用transformer 能够做到
如果能做的话
当然
云端要未来也是有可能有transformer 架构的模型
那么你如果做不到的话
大家也会考虑尝试新的架构
这是我个人的看法
但是我内心认为
云端未来也会切成新架构的
就是我刚刚说的a 通用agent 和martin agent 这些
因为测试嘛
可能会很难
嗯
你们其实也在做一些基于端侧应用的这种商业化嘛
你们做了一些什么工作
或者你们看到一些什么特别好的机会吗
在端侧
端测有几个点嘛
第一个就是传统的互联网的这个商业模式
跟现在的大模型的软件的这个商业模式其实完全不一样的
你会发现
以前的互联网的产品
它的编辑成本很低的
你服务一个客户和服务一万个客户
你需要付出的可能就是一台服务器
你编辑成本几乎为零
但是这次大模型的用户就不一样了
对吧
你的每一个token 都是要为云端的算力付费的
那它
它编辑成本是非常高
类似于什么呢
类似于当年移动互联网刚出来的时候
我要买流量
就是按kb 收费
上不封顶
然后这个编辑成本太高了
所以
我觉得第一个端测模型的机会
就是能不能够把现在这个大模型的这种编辑成本打成跟移动互联网一样
那你至少可以照着移动互联网的这种产品的商业模式去做
Pmf 到pmf
这是第一
第二个就是增量的市场
我们其实
其实一直在看增量市场
现在pc
手机
呃
为主体的互联网和移动互联网
其实都是巨头的游戏
你进去以后
巨头看到你在做什么
他自然而然会觉得
哎
这个做的挺好的
哎
那我是不是也可以做
对吧
而且它有一个优势
也有渠道
渠道优势也有钱啊
人
人才也很多
那作为一个创业公司的话
你这个应该找的是增量的市场
而且这个增量的市场是巨头现在还不太轻易敢进去的
对 所以
我个人认为
现在像空间计算这个有可能是一个增量市场
你说空间计算是什么
跟机器人
Arxr 那样的空间计算
其实我认为至少包含三类终端
第一类终端是xr 对吧
Xr 包含了a
呃
Ararvrmr 等等
我但是我为了认为这类就叫xr 吧
嗯
还有一类就是机器人
机器人本质上也是一个空间计算
嗯
然后还有第三类
当然是车了
但因为车本质上就是一类机器人
所以我们认为
这三类都是空间计算的机会
但是属于创业者的在哪里呢
我们现在看到很多的是在做居身智能对吧
也有一部分的公司在做xr
因为车这个领域
其实巨头太多了
对
也有上一波做新能源的
已经也在尝试做空间计算这块
我的
所以我觉得大家可以看看增量的机会吧
不要在存量的市场里面内卷
嗯 最后
嗯
你做出来的
也都是巨头的市场
哪些应用或者说是业务属于存量市场呀
举个简单例子啊
就浏览器啊
浏览器不就是一个存量市场吗
为什么是你的呢
为什么不是现在这几家做浏览器的公司的市场
他为什么
他就没有能力做吗
他是没有技术呢
还是没有人才呢
还是没有钱
还是说他本着你做好了以后直接超面
我觉得浏览器不见得是一个创业公司的机会
当然了
有可能卖给一家大企业也是有可能的
这说不定是一个退出的机会
一个是浏览器
另外就是像open i 这种chilt boat 来
这种chilt boat 其实也是一个巨头都在做
豆包 阿里 阿里
阿里其实也是其他形式在做
他们那边也有突c 的产品
日活也挺高的
对
因为我觉得这种存量市场
你要跟巨头掰手腕是很难的
嗯 对
我们之前其实聊过一期那个ai coding 的节目
其实ai coding 现在这个也是一个红海的市场
然后巨头一下场
基本上创业公司也很难存活
对
你要找那个巨头
现在还没有看清楚
但
但未来是方向的一些机会
巨头的弱点就是它反应比别人慢一点
或者即使反应过来
他也不敢下注
但是创业公司的优势是灵活
敏锐
这是创业公司的优势
就像您刚刚说的ai 编程
那ai 编程
比如说海外都叫s oropic 的模型对吧
都去做一个ai 编程
我无论oever ver cooparity ty agency 也好
你做出来的效果
你能赶得上athropic 自己做吗
对
比如说curser
Curso 做的很好
科所也也
也有很
很高的营收
但现在athropic 自己做cloud code
那你科嗽怎么跟它竞争的
因为你都是用它的模型
所以
你认为现在
比如说空间计算
还是一个相对比较新兴的市场是吗
对
空间计算可能是一个大家都在观望
没有办法决定是不是下场下注的一个一个阶段吧
至少 大厂 对
我们并都并没有看到哪些国内的大厂正在下注在做这个事情
有可能自己也在做啊
我听说自己也是在做
但是其他几家好像并没有特别下重注在做这个事情
海外meter 在做对吧
嗯 呃
Google 呢 也
也 也 也在做
可以 呃呃 苹果
苹果也在下注在做
对 然后
空间计算是其中一个吧
那即使不是这种大的这种范式级或者是计算终端级的机会的话
你即使在传统的这些终端上面
你能不能够做一个跟别的不一样的东西
你一定要有自己的优势
无非
无非是你短期内的技术优势对吧
你看到了一个技术
别人没用
你用了
你的技术领先
第二个就是
无非是你的产品做了别人更好
而且你的产品的话呢
有先发优势
比如像腾讯的微信
它有先发优势
它占了百分之三四十的市场
以后整个市场都是他的了
有
有这个网络效应
第三类就是你有渠道的优势
比如说做
做这种智硬硬件
比如说你一开始就非常了解像anchor
呃
很很早就了解那个亚马逊的玩法
对吧
整个的推荐机制都非常熟悉
所以这是它的一个优势
那么 呃
创业公司的优势在哪里
软q 可能会是大家的一个现阶段一个优势
无论论mini max x 好也好
腾讯用mmba 也好
其实也是侧面证明了我们这个方向在不断的被工业界接受
嗯
虽然它不是直接用的软q 的这个这个架构
但是也是用的rap 库类似的架构
开源有一个好处就是
只要有一家证明了它的优势
其实很多家都会来逐渐的占用
你觉得以后这个rack 库的架构会替代transformer 吗
软库还是在不断的迭代的
一个架构
刚刚说的
从第一代到第二代
真正变成二零
到现在已经到第七代
马上发第八代
包括第十代以后到怎么发展
其实我们是有一个非常清晰的路径的
呃
我们认为架构还有很大的空间
往agi 的那个路
有很大的发展空间能够去去挖掘的
所以
我认为软库事业还有大量的工作
无论是架构设计的工作
还是在各个领域落地的一些工作
是值得做的
所以我们不着急
但是我们已经看到了
软库在不断的替代transformer
刚刚提到的
包括学术界也有很多的
超过一百篇论文在各行各业在用库去证明比ratransformer 和其比其他架构更好
我们认为以会未来会有一个关键的点会会加速这个替代的一个效应
就是芯片
新的芯片的出现
新的芯片跟raw 库这种新兴的rnn 的这个深度的结合和优化的话
会帮助raw 库的生态快速发展
会比transformer 的整个的投入产出比提升可能几个数量级
这个时候如果比如说假如提高两个数量级
十倍到一百倍的效果
可以让一个现有的生态完全转移到另外一个生态
如果用transformer 的应用来打打比方的话
这个raq m 们现在发展到一个什么样的阶段呀
我觉得现在就需要有一个到继续拆gpt 的一个过程
所以很多人也在预测rau 的这个
呃
拆gpt 时刻什么时候到来
如果让你预测一个时间的话
你觉得什么时候这个racu 的拆gpt 时刻会到来啊
呃
我认为第八代我们公开以后呢
就会在市场上发生一个非常大的反响
这个时候呢
就会有人来帮我们实现恰集vt 时刻
或者我们自己实现恰恰vt 时刻
对
我其实刚刚说的都是比transformer 的这个更好一点的地方
其实还有很多东西是
呃
就是transformer
我刚刚说的是rap 会比transformer 更好的地方是可能是七十分到八十分
或者甚至到九十分的区别
但是有很多东西是只有rap 能做做transforformer 不做做做的
这个才是大家未来要关注的
包括之前杨丽坤提到的
他认为现在的这个transforma 架构的这种模型
他现在是跟agi 是有很大的距离的
因为他提了四个点吧
第一个是没有久久记忆
第二呢
是没有真正的推理能力
没有真正的规划能理解
有没有对物理世世的理理解
大家未来会发现
软酷这种信息
安根这四个能力都有
我认为未来还是要回归到什么是智能
智能到底是什么才是关键
第二个就是人的这个结构是什么
人的整个思维方式是什么
我们为什么非常看重rap u 这样的一个新型的rng 架构
因为我们认为人的推理方式跟这个架构是非常接近的
我们为什么看重存类计算的芯片
因为存类计算是存内芯片的一个特性
因为类脑可能还会更更远一点点
但是存类计算这个可能会很快就会落地的芯片出来
第三个就是新的模型泛食
所以未来是不是会有一个像人一样的不断学习
不断不断进化的一个新的agent 的出来
这是所谓的杨丽坤在一直在提的这个智
呃
世界模型的概念对吧
因为世界模型的概念不是一个一成不变的一个权重
宪法的权重就在那里
用的是他在跟外部的世界交互的过程中
不断的学习
因为我们之前也跟很多的老师也交流
我们一致认为
真正的智能不是说你背了多少题目背在脑子里面
而是你有多强的学习能力
学习可能才是智能真正的关键词
所以智能的概念
包括我们认为真正的要回归到什么是智能
才能够知道接下来的路该怎么走
否则我们的人工智能可能又停留在一个瓶颈的一个阶段了
嗯
希望这个新的架构能帮助我们实现这一点
虽然我觉得新的架构可能是一个必不可少的一个东西
但它不是一个充分条件
它是一个可能是个必要条件
我们也正在往agi 的方向正在努力
好的
那我们今天就这样
好的 好的 谢谢
好的
谢谢罗总 好
那今天就这样
拜拜
这就是我们今天的worts next 科技早知道
欢迎大家在评论区和我们留言互动
加入到科技和创新的下一步讨论中来
那我们下期再见
展开显示全部歌词
上一首歌:帽子反戴(Feat. 吴克群)MP3下载
下一首歌:秋日胜春朝(氛围版)MP3下载
热门歌手
王菲 周杰伦 周深 海来阿木 半吨兄弟 李荣浩 林俊杰 凤凰传奇 魏佳艺 程响 怪阿姨 陈奕迅 G.E.M.邓紫棋 薛之谦 张学友 小阿枫 刘德华 Beyond 汪苏泷 张韶涵
其他人正在听的歌
我和我的祖国 廖昌永&谭晶
逆战(DJ版) DJ
不肯上交的魂魄(八戒) 檬小妖
More Than Words Various Artists
归途的星光(女生新版) 曹越红
奔波生活到底为了谁 杨小萌
别来无恙 任素汐
她行(Live) 叶童&邓萃雯&陈德容&曹颖&王蓉&侯佩岑&倪虹洁&Noon Woranuch&江一燕&王珞丹&李晟&谭薇&何泓姗&马吟吟&黄英&蒋梦婕&彭小苒&张小婉&祝绪丹&房琪kiki&管乐&卡琳娜&蒋一侨&罗予彤&刘禹彤&吴宣仪&小辣李嘉琦&宋妍霏&VaVa毛衍七&李艺彤
天龙八音 黄霑
无限的士高 Various Artists
我的爱情给了贼(对唱版) 麻山伙&安小彤
网站地图 RSS地图 百度地图 360地图 头条地图
声明:本站不存储任何音频数据,站内歌曲来自搜索引擎,如有侵犯版权请及时联系我们,我们将在第一时间处理!
下载FLAC音乐网 桂ICP备xxxxxxxx 版权投诉 请联系我们 liukaymail#foxmail.com