• 推荐
  • 排行榜
  • 歌手
  • 歌单
  • 电台
  • 新碟
搜索历史
大家都在搜
街角的晚风
ASTER
心似烟火
ASTER,Jeiff
in the shadow of the sun
umbrella
最美的期待
cry for me
NIGHT DANCER
RUN
一别两宽
失忆
渡月桥思君
sun kiss tuide
那天下雨了 周杰伦
李甜
Never Be the Same jessica
Never Be the Same
忘情牛肉面
风若是拦不住
热
搜
词
五百年沧海桑田 琵琶曲 山风山风等等我 你往南走 时间能不能走慢点 甲乙丙丁 如果累了就回故乡 你有没有真的爱过我 泪海 今生劫换来生缘 思念漫过海岸线 梦的翅膀受了伤 岁月如笔写春秋 你怎么舍得让我的泪流向海 ora 慢品人间烟火气 早春晴朗 黄昏 周深 大梦归 这一生走到了秋天
00:00/00:00
 高速下载歌曲音频  下载歌曲到手机 下载LRC歌词
随时随地任意搜索并下载全网无损歌曲
扫描右侧二维码下载歌曲到手机
扫描下方二维码下载歌曲到手机
免费获取更多无损音乐下载链接
外链地址
http://www.eemp3.com/audiofile/224bf0be8e2cb13348148e271354e1ff.mp3
点击复制

本字幕由TME AI技术生成
用声音碰撞世界
生动活泼
hello
大家好
我是丁教
欢迎大家来到第九季的wattsnex
科技早知道和全球创新第一时间同步
hello
大家好
欢迎来到我们今天的科技早知道
我们以往啊
其实是聊DI模型有多强
应用这些方面我们聊了非常的多
但是今年我感觉其实我们一直没有聊的就是数据AI起来之后
他底层的数据有没有改变
然后对数据库行业有没有什么新的变化
那像原来可能是这种非常干净啊
然后有非常结构化的数据
是不是已经就变化了
或者已经不够用了
那现在动不动就是可能很多图片啊
语音啊
甚至有就是什种实实新数据流
那这样子的新的一些市场的要求
对于数据库行业有没有些什么新的挑战
那今天我们就请来了OCEANAE的CTO杨川辉
然后日照总
然后来给我们聊聊这个话题
那虽然说可能我们聊数据库一般来说不是一个特别面向大众的
但是一个比较干货的话题啊
但我也希望今年我们能够跟日照总把这个话题聊的稍微轻松一些
我那我先来介绍一下日照总
他之前是在百度开发过云计算的整个架构
算分布式系统
嗯
然后后面其实就是加入了OCENAbase的队队后
是这个oceanbase的创始成员之一
做分布式数据库大概有接近二十年年了
从零到一
落地了蚂蚁集团服务器
对
就从零到一去把OEENASE所谓个刚开始是一个技术产品
然后慢慢到一个这种商业产品
就经历了整个发展的一个阶段吧
那我们再回到今天的AI的这个主题的方向
那现在在AI的时代
对数据是不是有一些不同的这种要求和这不同的一些挑战呢
AI时代啊
大家对数据的需求
其实是以前的需求的一个延展
就以前的时候呢
我们做交易也好
做分析哈
它处理的数据都叫结构化数据
所谓的结构化
其实就是打标过的数据
比如说这个一张图片来了之后
哈
那这张图片它到底里面有什么样的一个有价值的信息
我是通过人工的方式
现在可以用AI把它里面有价值的东西抽取出来
然后打标
存在一个阶格格
这是以前处理的这个数据
那AS带来了之后呢
除了这些打标之后的数据
也有很多是这种半结构化或者是一些无结构化的数据
那这些数据的话
以前可能这些数据就丢掉了
那现在我们有一些强大的AI技术
可以用一种自动化的方式去直接处理
或者说把它用AI打标的方式
把它变成这种结构化的数据
这个方式就对这个数据的底座带来了一个很大的一个变化
第一个变化是数据底座要处理这个数据的种类
数据的类型它变多了
因为它原先处理打标过的结构化嘛
那现在很多其他的一些半结构化并且无结构化也需要处理
那第二个是它这个对数据的规模也变大了
因为AI的应用
它是每年都在爆发
那未来还会是一个每年非常高的速度再去增长
那第三个是这种数据使用的方式也会发生一些变化
那原来我用这种打标过的数据啊
都是在数据库里面都是用c口SQL
它是一种这种结构化的查询语言
我们以前在大学的时候
只要学过计算机的人
应该都会写sircl
但是在AI时代的话
它好多时候怎么是处理这些无结构化数据
半结构化数据
它有的时候是需混混查查询
因为它有的数据据能是这种像
像c口处理的结构化数据
有一些是半结构化
无结构化数据
它要在一种查询里面查询很多种不同的这种数据类型
需要支持这样的一种混合负载的处理
所以有数据规模的数化
这个数据维度
数据种类的一个变化
也包括这个查询负载的一个变化
挑战蛮大的
对
因为我们其实在想说
现在整个在国内做大模型
其实大家真正跑出来有落地商业模型的
其实并不是很多
可能AIcoding我们前几期不是聊过了吗
大家觉得这个是一个确定的赛道
大家总会你不管是公司付钱
还是开发者自己付钱
它总是其实是验证过了
咱们数据赛道
其实是不是也是另外一个非常确定的领域
数据赛道
我觉得首先是非常全确定的
因为它是不同的层次
就比如说AI编程
包括AI去做营销
AI去做安全
它其实在上层的应用层
那数据赛呢
它其实在中间的pass层
最底层是pass层
pass层就是做大模型
大模型首先肯定是非常确定的
只要我们相信AI未来会好
对吧
它是非常确定的
然后在网上的pass层也是确定的
因为不管应用怎么变
最后一定要有数据处理的能力
pass层的难点在于说
它会相对来讲啊
会比较集中在几家企业手上
可能应用层的话
它会比较分散
pass
层也是确定的
只是层也是确来
所以层层层是不确定的
好的 好的
我觉得可能下面得请日照总帮我们来给几个案例吧
因为好像我看到咱们很多企业
其实过去它并不是没有数据
它数据可能是就是没有整理过的数据
它没有结构化
它有很多这种所谓的叫做数据债
没有办法能够做分析
没有办法能够这个实时的做一些很多其他的工作
我不知道现在这块是跟以前变化在哪里
嗯 就今天
我们真的把企业的数据用起来
你会面临大家都知道的
像数据孤岛的一些问题
数据规模的一些问题
数据安全的一些问题
历史遗留系统legacysystem等等一系列的一些问题
这些问题仍然在
但是今天有一个不一样的变化在于说
我们的系统处理的能力增强了
这些系统处理能力增强
既包括像OCENASE这样的一些分布式的能力
它得到了增强
因为我们有分布式的这个系统啊
有办法通过分布式的方式
一体化的去处理各种不同的工作负载
所以呢
我可以把这些数据都放在oceanbasee一套系统里面来
不需要去单独建很多个不一样的系统
那变得更简单
这是一类
那第二类呢
是AIAI其实更偏这种怎么去处理数据
怎么去做计算
那没有大模型之前呢
可能我们针对不同的数据啊
我们需要写不同的AI的算法
不同的场景需要一种AI的算法
那这是很麻烦的
那大元模型
它最大的一个好处啊
它是一种比种AI的一种方式
能够处理所有的场景
它的泛化能力做的比较好
所以呢
我因为它的泛化能力做的比较好
所以它比较容易能够去实现这些数据处理的一个自动化
对
这是两个基础上的
就还不提到这个自然语言
然后 呃
通过自然语言来处理这些需求是吗
对
因为这个数据本身它里面就有文字嘛
那那个文字就是自然语言
如果用AI的话
我去直接用AI处理这些原始的数据
不就相当于在处理这个自然语言嘛
所以以前我处理这些自然语言
就是可能说
做风控的
我要写一个算法
做营销的写一个算法
那它这种方式的话
它是都是需要靠程序员的
没有办法做自动化啊
大语言模型的AI来了以后
这个门槛就变得特别的低
相当于呢
它把AI这件事情啊
这个数据处理这件事情变得更加的普惠
嗯
并不是还要等技术团队需求往上面排这个时间表
就可以自己直接操作了
有的时候可能
嗯
举个例子啊
比如说我们以前想做一个这种报表
那我是个业务人员
那往往我是没法做报表的
我需要先提一个需求
把这个需求提给一个专门叫BI的一个程序员对吧
那个BI程序员帮我做完这个报表
最后我才能看到这个效果
这里面交互是蛮复杂的
就每个公司都有很多这样的一些人
那如果我这个大语模型做的很好的话
可能说
我要做报表
我自己通过自然语言可能就做了
当然他不可能今天还没有办法做到百分之百都用自然语言来做
可能有百分之假设有一半的场景
他可能用自然语言的方式
就能达到这个业务人员想要的一个效果
那就避免去做编程嘛
可能未来老板也是不太需要层层汇报
老板直接输入一个需求
要看哪的数据据就是直接打哪了
所以
刚刚是不是那个连
连这个
呃
分析师的这个工作也没对
呃 我
我觉得不管是分析师也好
包括程序员
很多的工作
他会被重构
可能有些工作
尤其是一些重复性的工作啊
它可能确实会减少的
但是我觉得大家也不用担心
因为这些工作去减少
一定会有其他的一些更有创意的工作的
这个我是确定的
其实有一部分是特别需要数据
它的准确度是非常高的
可能像是金融方面的这种高频次的这种处理啊
但我感觉好像前者是AI的这种幻觉啊
或者是AI的精确度
可能并不能够完全处理到那一部分的业务是吗
在高频交易这块
其实还是没有特别多的业务或者需求
首先
不管AI怎么去发展呢
AI也不是万能的
因为呢
这个AI它是一个大大言模型嘛
它本质上是预测下一个token嘛
那预测下一个token
它的这个效率是比较低的
所以呢
AI是适合用在它擅长的场景
比如说
AI用在做一些总结
做一些这种文本的生成
做一些这种没有办法有规则的一些场景
它没有办法用人工的去拿到一些规则
只能自动处理的这样的一些场景
这些场景是非常适合用AI的
那这些场景也往往都是一些这种无结构化的一些数据的场景
那如果有很多的一些场景
它已经很好的实现了这种信息化
或者实现了打标
比如说这种交易的场景
甚至包括部分的分析的场景
它已经做好了结构化
其实用这种sql
用这种数据库的一些传统的使用处理的方式
它不管是准确性啊
还是这个成本啊
都要比以前好非常非常多
嗯
但是在这个刚刚讲的前者
就是讲的在处理交易这块
其实AI往后走
可能会不会有一些这个对他的助力呢
就如果是做这个交易本身呢
我觉得它是一个完全确定性
可能说一行数据都不能丢这样的一个场景
那这里面的话
AI去做这个引擎肯定是不合适的
但是AI基本上对包括做交易本身
它里面也会有一些辅助性的工作
也会有一些价值的
比如说我们要做一个交易系统
那引擎肯定是一个数据库对吧
但是呢
我们怎么拿到这些数据库的结构化的数据
这些结构化的数据也是通过一些信息化的系统把它拿到的
那这里面是能够大量的去用AI的能力去给它提效的
那我们做一个引擎
它做好了
那这个引擎周边还有很多的一些工具呢
这些工具可能是帮助用户更好的去使用这个引擎的
帮助DBA开发的
帮助我们做运维的
那帮助我们可能更快去理解这些引擎的
那这些东西的话
它可以用AI去帮着去提效的
所以现在可能还是以怎么样通过AI对数据提效的这个角度可能更多一点
它本身在分析上面
我们还是正在探索
对
因为AI它我把AI还是看成一种叫口拍了这样的一种模式
它更多的时候
它是相当于是人类或者是我
是这些系统的一个助手
它没有办法这个完全替代这些系统
它能够替代的
只是那些对准确率要求比较低
相对来讲人类并不擅长的一些场景
它是能替代的
但是大部分这种人类已经做的很好的
尤其是结构化数据这一类的场景啊
AI肯定是只是一种辅助
还不行
还不能完全替代
呃
AI现在应用为很多嘛
本身对数据库的这种要求也更多了
但是不是指AIfordata
还是dataforAI
这个您怎么看
嗯
我觉得其实是双向的哈
首先
其实AI的核心其实两块嘛
一块是这个模型本身
尤其是我们发现类似deepsiica
类似千万这种
它是一些真正去做这个基础大模型的公司
做模型的预训练
它的模型本身是很有价值的啊
那另外一块
其实就是怎么去处理数据
因为只有把这个数据跟模型结合在一起啊
最终才能真的把这个AI在企业里面跟用起来
那这里面到底是AIfordata
还是dataforAI
我觉得两个都有了
就是一方面你需要把一些data的能力
需要处理好data
把有价值的这些data以类似提示词或者是微调的一些方式输入到模型里面
帮着这个模型变得更准确
那另一方面
它确实AI也能去辅助这个data
因为我data在做处理的时候啊
以前我有的很多的一些这种无极化数据
我是基本上没有办法去很好的处理
就人工标注问
对 人工标注
其实很麻烦嘛
那有了AI以后
它好多这种人工的事情
可以变得自动化
可能也有什么像是自动诊断啊
这个
其实这一部分就能提交不少
对 自动诊断
包括这种自动运维
也包括我们要学习一个新东西
学习一个新东西
往往都是需要有这个领域特定的知识的
那以前怎么办呢
以前DBA会告诉我们说
我现在要下载你的文档
然后来开始去从文档里面找我想要的东西
这是以前干的事情
那有了这个AI以后呢
可能我们学习一个新东西
我就给他构建一个知识库就好了
那他就开始问问题
我需要什么就回答什么
他比以前要方便很多很多
明白
就是现在其实像大模型公司
它也慢慢在增强他们的数据方面的能力
像不是前段时间openi也是在说
把checkGGPT的那个reg
他们的这个记忆其实提升了不少
就大家最后还是增强的还是一个数据
他比用户
终端用户的数据嘛
所以 在这块
是不是您也看到了更多的业务从这个AI公司这边来
是的 是的 是我
我觉得啊
首先
所有的数据公司
它本质上也这个AI公司
所有的AI公司
本质上也是一个数据公司
就数据跟AI永远都是不分的
只不过呢
这些公司大家会去做数据跟AI的不同阶段的事情
那大模型公司呢
它更多它是做这个数据跟AI的数据
公有数据
就公网上的数据的一个预处理的这件事情
它因为它主要是做预训练嘛
要个基础模型
它因为偏数据类的公司呢
它其实也是AI公司
那他做的是这个预训练之后
后后训
包括微微
包括强化学习啊
也包括这种我们叫reackIIG
就用数据去增强它的模型
因为这些数据呢
它往往是企业的一些敏感的私有的数据
其实在大模型做这种基础预训练的时候
是拿不到的
对
您刚刚讲的
其实这个数据公司更天然适合这个拥抱AI
如果跟大模型公司相比的话
对现在这种AI时代
对于数据公司
甚至是对于这种oceanbase是什么样的一个机会呢
就是我认为
其实大模模型公式啊
也有分为几类啊
那有一类还是做这个基础模型的公式
比如说我们deepsika
包括千万
包括openII们本质上是做最有挑战性的的模
这一一分分
那一部分分话话
们们可能还是会比较专注的
它有点像是做这个数据加数据乘以AI的一个IS层
那除了这个模模以外的其他的公司啊
不管它原来做模型型还是做数据的啊
实管抽抽象的角度
它有点像是做这个data以AI的pass层
那相当于说是有了这个基模以后
我怎么把这个基模应用到各个行业各个领域
那应用到各个行业各个领域的话
最核心的点就是要把这个数据跟AI结合在一起
那第一
AI很多时候都是开源的
它的最核心的能力确实是掌握在一些做基模的公司手上
那怎么用起来呢
其实这个关键是怎么把这个开源的这些模型啊
跟企业的数据处理的能力结合在一起啊
是不是中国已经跳过了所谓这种中间件的时代
就AI时代来临之后
它很多中间层的这些技术服务商啊
或者他其实就不可能就不复存在了
这个边界就越来越模糊了
我觉得AI肯定确实会把我们这个IT行业的一个分工啊
这个边界变得更加的模糊
因为我们发现
可能说一家大模型的公司
它能直接去对壳
它不会像以前一样
哎
我是先是一个s层机器
然后在一个pass层
可能会有一些中间件在a上
应用层
应用层又分好几类
可能是先是一些这种通用的这种sars在网上是可自独立部署的一些应用
那AI明显会打破这个边界
AI它因为它把这个很多的事情啊
变得机器能够自动处理了
机器能够自动处理
它以前的分层
是为了使人类的从机器的角度
它不需要分层
机器radable跟这个humanradable
这是两个概念
所以
当这个边界变得更加模糊之后呢
我觉得一方面肯定对中国的企业是一个机会
因为在以前那种分工的模式之下
这个中国的很多软件公司
它的客户
它是上一层的软件公司
这个赛程软件公司付费意愿是比较弱的啊
那当把这个边界模糊之后呢
大家能够找到更多的一些机会
去直面一些中端的用户
那这个时候呢
相对来讲
我们toc的付费意识是比以前要好的多的
所以
整体是带来了一个更好的一个机会吧
因为从这个用户的角度
大家肯定在将来是想把这个大模型给用起来的嘛
那几个方式
一个方式直接调大模型
但直接调大模型对于严肃的这个场景是不太现实的
因为客户的这些数据啊
他首先就不愿意去放到公网里面去
那他一定会有自己的一个大模型
那自己的大模型可能是放在公有云部署
也可能是放在线下部署
那有了自己大模型之后呢
他接下来就是要怎么把这个自己的大模型在自己这家企业用起来
那怎么去用起来呢
他就需要把自己的数据给处理好
那这个时候有两类公司
一类是原来干大模型预训练的
但是后来呢
反正他就不干预训练了
开始去做这种数据处理
那还有一类公司呢
是原来做数据处理的
那现在还是帮客户做数据处理
并且呢
把这个大模型给用起来
从客户的一个积累也好
包括技术的积累也好
肯定是做数据的公司在这种方面的实力要强很多的
因为客户需要的就是做数据处理
客户需要的不是做公网的数据处理
是做企业自己的数据处理
它跟OB这样的这个以前做的事情是比较相似的
不是
您觉得现在这样子
AI乘于data这个领域
是未来主要的业务会来自于像中小企业这样的需求会更多呢
可能还是会是大厂
因为感觉好像大厂这块
大家的竞争也非常厉害
每一个大厂都有自己的云服务
云生态 对
我不知道您怎么未来看这种竞争的格局的
嗯 我
我是觉得说
今天AI
它跟以前的这个数据库
以前的data
它的这个格局会比较相似的
最后一定会有这些最大的一些企业
包括中等的一些企业
跟这个中小企业
那对于这种要像消费者这样
我们希望成为世界级的一个数据库这样的一个或者叫数据底座吧
这样的一个厂商来讲
我们肯定是大中小都得做
那最终往往提供服务呢
它往往会比较有优势的场景
可能是这种中等网上这样的一些企业
这是我们会更有优势的一些企业
这可能有这种高并发的这种业务的
其实只只能是中等网上的些企业才有这样的需求
也包括这个因为一体化
它就不仅仅是高并发嘛
一体化也包括我是各种不同的一个工作负载
但是这些最大的一些企业呢
它有的时候啊
会有自己的一些工发团队
他会自己定制一些对他来讲最优
但是没有办法通用的一些解决方案
只要是通用的解决方案
它往往会最大的那几个去掉中等跟中等往上
这是利润的主要部分
中小企业
这是生态的主要部分
数据库是这样
数据底座也都是这样
一样的一样的
其实这两年我觉得o旋base发展还是蛮快的哈
尤其是我们从二零二零年六月份开始从这个蚂蚁集团独立出来
成为一家对外提供数据库服务的公司之后呢
其实从这个技术的产品技术的一个角度
其实我们一直在做一个叫一体化数据库
那我们以前呢
做这个数据库啊
有做交易的
有做这个分析的
那做交易呢
就用交易的数据库
做分析呢
就用专门的分析的数据库
那o旋贝ase呢
我们希望用一个一体化的方式
用一套架构来同时支持做交易
做分析
包括我们未来可能会一一些做AI呀
这种AI时代的一些这种多多种模型的一个工作负载都放在一套引擎里面
做到今天为止呢
欧旋base啊
它最早是只是在蚂蚁集团
在支付宝那
到了现在的开开始内部的一很很大的这个问题需求
然后把它变成了一个产品
对这个数据库
其实它也没有什么特别大的一个窍门
它的本质上
我叫应用驱动技术创新
它的理论呢
可能是五六十年前
三四十年前就慢慢在图灵量得出
都是三四十年前得出来的
那慢慢的
它就需要用这种最顶尖
压力最大的一些应用
比如说双十一
去打磨这样的一个数据库的技术
慢慢通过应用驱动创新
当时是把我们的分布式的能力给打磨出来了
因为当时是移动互联网嘛
那移动互联网它的特点就是它的这个请求量特别大
它的并发量很高
所以呢
为什么中国的分布式数据库做的很好
那接下来
可能我们现在其实已经有除了这个支付宝以外
有超过两千家这种企业在把欧全币置用在它的一个核心系统里面了
这里面涉及的行业也蛮多的
所谓金融啊
政企啊
物流啊
打车呀
基本上每一个
包括我们每个的听众啊
我觉得你肯定我会用到偶像贝斯的服务
其实我们节目之前也请过databreak
然后也有聊过这个很多snowfake
我不知道
这两年其实他们在AI领域也是不断的在攻城略地啊
然后像是这个snowfake
它其实是一个这种不断在扩自己的生态的这样的一种状况
然后包括databirak其实也收购了像是mozc
IML这样的这个产品
所以我不知道
他们其实是走的还是蛮早的
但他们会不会也有或者一些这种盲区
或者大家的这个路线是怎么样的
如果是跟 呃
ceceanbase比的话
嗯
我觉得其实三家最典型的公司
一家是oracle
他原来是做交易为主
可能看起来跟OC为是更像一点
他也是在打磨一些AI的能力
另外一家是snowflag
做这种云上的数仓嘛
还有一家是DWS
他其实原先是做大数据的
就有点像是数据中台
他也在这个收购一些大模型啊
做一些AI的一些能力
我刚才其实讲一个观点
叫每一家数据公司
他也是一家数据层AI或者是AI的公司
其实数据公司跟AI公司
他在未来
我觉得只要是最top的
一定是分不开的
不管你原来做交易
还是做分析
还是做大数据
最终你一定是一个data跟AI的一个结合
那每家公司呢
他最终会有每家公司擅长的一些东西
比如说oracle
他原先在这个交易这个场景
他有很多已有的一些客户
那这些客户的话
如果oracle的AI做的还可以
那理论上他给你优先会选oracle已有的一个产品
因为能跟他以前的一些场景
它能结合在一起的
大家都用这个mysql用惯了
就已经是这样子的
对 对
数据已经都在他那里了
所以很多时候呢
其实我们数据为什么做数据公司在AS的很有竞争力啊
其中有一个很关键的点就在于说
数据颁布骤它据要搬
它比这个搬计算要难很多
做snowflag
它做分析
那做分析
它有做分析的生存指导
那data
BUKS
它已经做大数据肯定了
大数据天然也是做一些机器学习的
只不过以前的机器学习呢
它是偏这种传统的一些方式
就面向不同的场景
会有不同的算法
现在大元模型泛化能力要做的更好
那oceananasease我们肯定也是一样
第一
我们很很好的一个这种installbase
我们会有一些能力
是像oracle啊
跟 跟
跟snoflaladaalux都没有的
我们最主要的能力有两块
第一
是分分析的一个原生的能力
我们叫原生分布式
这一块我们是世界领先的
那第二块呢
我们叫一个一体化的一个能力
我们能够在一套引擎里面
同时处理这种交易分析
包括一些这种多模片半结构化数据的一些处理
那这样的一些能力
我觉得在AI时代
可能是代表未来的一个趋势的
因为在传统的一个时代啊
这个信息时代
他这个交易分析跟这种大数据分的是比较开的
但到了AI时代
好多时候呢
反正也是新的业务场景
那第一是新的业务场景
第二
这个时候像OCENAase这样的一些很好的一体化的基础设施已经出来了
那从用户的角度来讲
他不怎么关心到底这是TP
这是交易
这是分析
这是大数据
他希望你都给我做掉
那这个时候
对于OCENAE来讲
我们就面临一个更大的一个机会
因为就是一个能帮用户简化技术战
能让这个开发者更简单的一个机会
但您觉得这是这是一个共识嘛
还是一个非共识
我觉得从开发者的视角来看
是一个共识
但是从企业的角度来讲
不全是因为有的企业它做不了一体化
因为一体化它其实对技术的挑战是比较大的
因为以前我们做一个这种standalone哪个系统
你只需要做一个模块
相当于今天我们要做一个系统
要把很多个模块块都合在一起
揉合十个模块
它的难度不是乘以十
可能是乘以一百
甚至乘以一千
那再加上要做这种混合搜索呀等等
那这些东西就涉及到很多不同的技术
所以我们有个理念
叫把简单留给用户
把复杂留给我们自己
就他其实能把这个事情做的简单
是因为复杂留给了我们自己
但是呢
中国很多的一些包括做数据类的一些研发的公司啊
很少有像欧轩贝斯这样
有一个这么强大的一个研发团队
可能是几百上千号人投入进去
去做一件件情情做十五年
基本上除了OBY
估计也找不到第二家
所以呢
相对来讲
我觉得我机会会大一些
但是也有一些其他的企业也会有机会的
大家应该是一起做
海外我觉得也分哈
就是第一是亚洲人
比如说日本
韩国
这个东亚三国
其实他跟中国人习惯蛮相似的
亚洲人往往都喜欢一体化的一些产品
但是欧美人啊
坦率来讲啊
他跟这个亚洲人习惯还不完全一样
所以欧美人他目前来看
还是喜欢用特定的系统做特定的事
我的一个观察
从这个数据库研发本身来讲
研发实力来讲
oceanbase在全球是最顶级的
对我们的这个研发能力啊
包括这个投入啊
基本上也是一个顶配
我其实认识一些chnono
flag的一些偏华轮街员工啊
他们到了snooflake以后
他们都跟我讲
OB的技术要强很多
但是技术强
包括以前
比如说我们的新能源车
技术也很强
电池也很强
技术强到别人认为你是标准
技术强到一个商品强
这个过程是很大的一个gap的
所以我觉得
今天你说纯粹这些技术性能指标
这个研发的迭代的一个效率
OB就是最顶级的
但是能不能建成这个生态
那就看我们未来几年的一个发展
对
当你开新能源车开习惯了之后
你不太会回到这个传统的汽车的时代
但是确实
别人先做的是传统的汽车
所以呢
怎么去控制这个车啊
都是一些这个机械的一些方式
用电器的方式
它也是后来才去取代掉
虽然它更符合这个用户的一个天然的习惯
但是呢
它就替代掉
花了很长的时间
让大家去习惯
咱们中国其实也是这个大家用户消费习惯更容易变化的一个
对对对
而且我觉得中国的创新其实要领先于全球
迭代的也很快
迭代的非常对
嗯
一体化的这样子的数据库
它是一个以起来很好
它是共识
那为什么可能机会是只属于OB的
也不能完全说机会只属于OB吧
就是
首先我觉得一体化一定是用户的一个需求
但是它改变了今天行业的一些分工
因为今天我们的行业
从这个分工的角度来讲
还是这个以前美国人他最早做数据库呢
也不能创造出来的
可能每一家公司会有自己做交易的一些团队
也会有做分工的一些团队
还会有一个做大数据的团队
它其实都是美国定义的这个全球标准
但是从这个开发者的视角来讲啊
我作为一个应用
其实我不想这么麻烦的
所以呢
我觉得我们要基于AI时代
也包括基于像deepstik千万这样的一些技术啊
合在一起
最终慢慢的也建立一些更适合开发者
包括更适适合人类的一个正常的逻辑的一个这种不一样的标准吧
对
但是标准之争其实很难
那这个一体化这样的一些标准
符合了用户的需求
那这个机会呢
属于OB
也属于其他的
我们想把这个事情做的更简单的一些
对
因为我知道
咱们其实一体化并不是今年才提出的
并不是基是只有AI之后才提出的这样的一个新的策略
为什么好像就把它又重新拿出来
在AI这个时代下面再再来讲
其实OB的话
我们一直都是坚持的是一个一体化这样的一个策略的
那有了这个AI时代之后呢
这个我们处要处理的数据啊
它会由这种结构化
半结构化延伸到一些无结构化数据的一些处理
但是呢
我们还是想要用一套这样的一个引擎去处理这种结构化
半球化
大无极化数据
所以还是一个一体化的一个策略
为什么会一直去做这样的一个一体化的一个策略呢
因为这个一体化
它对用户变得更简单了
它能够帮助用户去简化技术站
能够用户写一个查询就能去访问不同的一个工作负载
您给我具体举个例子啊
就比如说可能原来在双十一这个时候
然后这个我又要同时并发
我还要随时看数据
是这样子的一个查询嘛
就是我双十一的时候
同时并发
又要看数据
这其实是一体化的处理交易跟分析
那未来随着这种多模态的一些数据的话
可能说我还要一体化的处理这种分析跟偏这种AI的一些查询
偏AI的查询
有的时候可能是一些这种向量的一些查询啊
一些搜索的一些查询啊
举个例子啊
比如说我们只要是做AI
都会有一个东西叫AI的agent
那为了做AIA卷的话
它里面的一个这种查询啊
就是一些混合查询
不是一个对单一这种向量数据库
混单一一的一个这种交易数据库的一个查询
假设我想通做一个AIagent
这个AIagent我想去找到我们附**分在四分以上的我比较喜欢的餐馆
有这要简单的一个查询
这里面就涉及到两类数据
第一类数据是四份以上
这是一个结构化的数据
有点像这个找交易
那还有一类是这种我喜欢的
我喜欢这个东西
它不是个结构化的系性定义的的线定义的
对
它可能是一个这种可以用AI去看
啥叫喜欢呢
它就把它给做成一个向量来把它表示出来的一个东西
所以如果我有了这种一体化的一个产品呢
我可以用一条收购语句
一条查询就完成这样的一个工作
如果没有这样的一个产品
其实对开发者来讲是很复杂的
它需要部署好好几套不同的系统
需要去做不同的运维
需要去做开发
是四分喜欢的
再查这个喜欢呢
就还得做合并
还得写一些这种软件
写一些这种算法
这个是我们讲的一个逻辑
叫把简单留给用户
留给开发者
把复杂留给我们自己
当然
这里面所谓的把复杂留给我们自己
其实是有一个比较深层次的含义的
因为我们让用户变简单了
那总有人是代价对吧
那我们就代价
那这个我们需要在一套引擎里面处理各种不同的工作负载
这些工作负载怎么做到最优
每一种这个工作负载都不太一样的
那也可能涉及到这不同的工作负载之间
到底选哪种工作负载
以及这些工作负载怎么去组合
这里面也涉及到很多的一些技术
这些技术都是我们要在这个引擎里面把它给包掉
包掉了之后
开发者才简单
对 您刚刚讲
其实整个OB它慢慢在把自己整个组织架构变成一个AI的公司
它其实是一个延伸
并不是一个转型或者怎么样
为什么不开始说
我们可能先从产品角度来试一试
或者先从一个什么先去先建一个AI组
我们来试一试
就是我们首先我们不把我们这样一个AI公司
我们把我们这样一个data乘AI公司
就是我们之所以能做这样的一些数据基础设施啊
首先是因为我们的data的能力
所以呢
我们所谓的这个dataCAI
是在我们data的基础之上
用我们的data的优势
去把这个已有的AI的一些现有的一些好的一些工具
好的一些成果融入进来
帮助客户更好的处理它原先处理不了的数据
那这么一看
你就发现
它其实自然就是一种处理的一个能力的一个自然的一个延伸
跟拓展
所以呢
因为是延伸跟拓展
所以我们的组织结构不应该建一个新的组织
说做一件新的事情
而是所谓的老的组织都应该去延伸
去扩大我们的一个能够做的一个事情的一个面
而且您好像也是把数据库然后变成了一个数据底座
就这样子一个文字上面的一个转换
但它其实是在战略上面其实是有蛮多深意的
因为我们都知道
大家在大学的时候就学过数据库嘛
只要讲到数据库
大家的脑海里面的第一印象就是是做交易或者做分析的
但是在AI时代呢
我们要把数据处理这个能力啊
做一定的延伸
所以我们干脆先从这个名词这里定义这里先给它延伸掉
否则只要跟客户说
只要跟我们的
包括我们内部人员说
说起来也非常的难
对
只要一讲数据库
大家就知道
哦
你是干这个的
你是干交易的
你是干分析的
那当我们说数据底座的时候
他就问 嗯
啥叫数据底座
然后我们有一次解释的机会
告诉这叫数据底座
对
就在销售上面一个非常好的策略
对
所以你刚讲的其实是这样子一个战略上的延伸
或者是一个在名词上面的迭代
但是从技术上面来看的话
它是怎么样的一个一个迭代
或者有没有这样的过程当中有没有一个挑战
对 其实有
还是有蛮多技术挑战的
它其实是一个多模数据库的一个这样的一个概念
它不觉得是只是交易
指示 分析
它其他的这种不同的数据模型也都要能够支持
要在一套系统里面去做这么多种不同的模型
而且底层要共享一个分布式啊存储的一个架构
这本身就是一个很大的一个技术挑战
那另外一块的话
我们有了这种多种的数据模型之后呢
我们需要支持AI时代的一个混合搜索
那这里面到底怎么把这个搜索
这个查询做的更高效
以前数据库里面有一个东西叫优化器
那怎么把这个优化器选出最好的一个执行计划
这些东西也都是一些大家正在探索的一些问题了
所以有没有一个具体的案例
我来举一个这种混合搜索的案例啊
比如说我们现在想要给北京市东城区所有年龄在十五岁到二十五岁的男士发一封根据他的一个性格生成的用大语言模型生成的一封邮件
如果说我们是用多种不同的系统的话
我们首先要去找到这样的一些人
那年龄是什么样啊
他在哪里啊
然后他是男的还是女的啊
这是以前的数据库里面的查询
那找到了这些人以后呢
把这些人的一些信息给带出来了
输入到大模型里面去
那最终才能去发邮件
那这个过程对于开发者来讲是非常非常复杂的
如果有这种混合搜索的话
那我们需要干的事情
我只是在o旋贝子这样一一套系统里面写一条cirll语句
这条circle语句就是把查找这些人
以及给这些人根据他的一个比如说性格发送自动生成的邮件全部给做掉
那这个东西对用户其实是变得特别的简单了
因为用户统一的技术站
那用户的话
他也统一了开发语言
他只需要写一条语句查找
简简单就是都是自然语言把就听写来的口
因为它有一部分是这种数据库的查询嘛
有一部分是相当于掉了这个大语言模型的一个推理
但是呢
这个对OCEANAase本身来讲
我们变复杂了
我需要又要做保存这些结构化的数据
人名啊
等等一系列的东西
这是要精确的
也得保存一些大语言模型这样的一些能力
这两个都弄在一起之后呢
sql优化器它也需要去看那态就们样的才是最高效的
唉
其实都是一些基础的问题要去解决掉
还有根据性格的这一部分
对对对
嗯
所以他就可能之前本来说是有好几步的工作
就一步就可以把它现现在完成了
而且可能再往后发展
甚至是这个自然语言就可以直接跟数据库来交互
对 嗯
那这个是下一步嘛
对
这个我觉得我们核心还是让这个OCanBASE在所有的企业去使用
因为呢
对于我们这样的一个数据库也好
数据底座也好
其实最关键的是一个生态
生态就意味着说
到底是几千家还是几万家
还是几百万家在用OCEBasee这样的一个产品
那等到我们这个生态不断的成熟啊
我们用户越来越多的时候
我们就会根据我们的用户的一个需求来去做我们的功能的一个排期
我觉得很多时候呢
它都是一个优先级的问题
就是不是下一步
取决于我们的用户到底是不是最紧急的需求
对
那可能如果是在开源这个生态的支持上面
现在您看的是哪一家做的更好
一些
从开源的角度啊
中美肯定是有差距的
因为美国的产品呢
就是世界的
OCEAAbase是中国最流行的开源数据库
我们在华人社区还是一个知名的世界级数据库
但是呢
我们在全球的角度来讲
我们还需要破圈
但先在开ceanbase
这个您是怎么看的
因为这OCEANASE其实是也是一个开源的产品
开源的话
是OCENAase的一个最核心的一个策略了
因为我们这样的一个数据库跟数据底座
它能不能成功
其实就是生态做的有多大
所先OCENAE我们已经做了有十五年的一个时间啊
就是我们未来可能还会再做十五年
甚至更多
那这样的一个产品之所以会做这么久啊
是因为我们还是想做成一个世界级的一个开源数据库
那想做成世界级的影响力啊
就必须走开源开放的一个路线
不止中国的这些企业
中国的用户
也包括海外的企业
海外的用户
都来去比较方便的来去使用我们这样的一个产品
我对OCENAE开源我还是很有信心的
因为刚才我们也讲到了嘛
就是mysql这样的一个生态体系里面
mysql本身它被oracle收购之后
其实发展是比较慢的
那OCEANASE能够填补整个生态里面AI时代兼容mysql这样数据库的一个空白
这是对我们来讲一个特别大的机会
那出到海外
它的竞争环境可能就更不一样了嘛
就比如说是也有一些强劲的对手
当然咱们可能会有一些那些差异化的这个优势呢
嗯
我觉得有几点吧
就第一点
是一体化的一个能力
就我刚才讲的
在一套系统里面处理各种不同的工作负载
这个海外的产品它往往做不到
这样的一个可能就是现在某一个细分领域先聚焦
把这个做到最好
对
他们往往在某一个细分领域聚焦做好了之后
他们就能活得很好
但是中国的产品很难
中国的产品一般来讲
它要做的比海外的产品要好很多
因为同样的一件事情
我已经算过一次账啊
就是做同样一件事情
在美国它能赚二十块钱软件
中国只能赚一块钱
所以这就是为什么我们刚才也事情
为什么sars很难做起来
并不是汇率的问题
不是汇率的问题
不是汇
汇率只有七
对吧
这是第一个点
一体化的能力
第二个点是我们的这种对数据的处理的能力
我们不管是小数据还是大数据
我们都能在一套系统里面去把它给处理掉
这个在AI时代尤其重要
因为AI时代它数据量变大了嘛
而且要真的要做到混合负载的话
它的数据总人也变多了
它数据需求是无止境的
mysql单机它根本就搞不定
第三类呢
是我们的这个性价比
就如果你原先用mysql或者用其他那些产品
只要搬到oceanbase里面来
往往往觉得降本增效
所以这几个点合在一起
我觉得我们的产品竞争力在全球是很强的
需要的是一个改变心智的过程
因为今天全球的一些企业
它往往都觉得美国的是好的
是不是好的呢
反正认为它是好的
但是这里面改变心智呢
也不全是靠OB一家企业
也包括我们中国的很多的企业
其他的一些企业
包括我们今天看新能源汽车
这个明显就是新生的一个势能
那很多都用我们的新能源汽车
但是你要放到五年前
大家会觉得应该用中国的新能源汽车吗
不会
所以我觉得有一个需要过程
过程 嗯
但是开源其实是不是一个比较好的
更加容易建立community
但可能就得花一点时间
对 开源
而且是更加容易建立信任
尤其是今天这样的一个世界的一个形式
哈
所以未来您是觉得OB他可能就是未来的AI时代的mysql的这样子一个愿景嘛
嗯
我觉得肯定
我们叫像AI时代的数据底座嘛
那个mysql只是打一个比方
就是我们希望还是成为AI时代的下一代的数据底座
真的能像这种mysqlpostclLESql一样
成为世界级流行的一个开源的数据底座
这是我们的一个愿景
它要成为这样的底座
可能我们使用oceanbste的企业要达到千万级
千万家企业都去用OCEBASE构建它AI时代的数据底座
这个挑战是比较大的
好像是不是东南亚有一些国家
你们已经出海到那里了
然后其实是有一些客户在那边
其实我们在东南亚
尤其是东南亚的一个支付领域
OCENAS是做的特别的领先的
就是东南亚它有很多的国家嘛
它每个国家也有一些这个当那个国家的一个本地版的支付宝
对
这个是不是也是蚂蚁集团整个出海的这个战略系统之一
你们可以这个抱团集中出海
因为抱团这个出海的核心
我觉得就是要形成一个势能
对啊
最终大家要做这种不管是软件还是其他的一些产品
整个中国的企业要抱团出来
就一家企业就出海
其实蛮难的
就是我前一段时间
我在带这个OB海外的一个业务
我们跟很多客户聊
第一个客户都会觉得说
哇
OCENASE这么厉害的一个产品
他能做到把所有的工作负载都给接住
并且呢
还具有一个很好的一个扩展性跟稳定性
然后性价比也好
他们很想用
但是oceanbasee在当地的一个知名度
包括生态还是不够够
因为他要要用ceanbase的话
虽然是个好东西
但是他要把他原来那个东西啊
搬到OOEanbase里面来
这个搬的成本太高了
然后当地的这个开发人员
不像中国
有大量的工程师
当地要找到一个能搬这个数据库的一个工程师是很难的
所以呢
最终我觉得中国企业整个要在海外取得一个更大的一个成功啊
一定是要靠所有企业一起抱团
对
因为我们今天其实是应该这两天早咖啡吧
我们另外一档早间的那个资讯的节目
其实也在说
现在滴滴啊
美团出海到巴西啊
然后这个墨西哥其实很大程度上发现他们的这个支付金融设施是非常不健全的
然后甚至是可能就是只有百分之不到十的当地的居民
他是没有账号的
就是银行账号的
而且他们就是没有办法说是直接给他们进行付款
然后 当然了
这个乘坐的这些人
或者是买外卖的这些人
也没有办法直接用这个付款
所以其实是整个的
我们在中国可能待了太久
我觉得很多事情是理所当然
但是海外的这样的机会或者工作还有很多
我觉得也是所有中国企业的一个机会吧
因为可能再过五年
大家就会发现
可能像您刚才提到了什么巴西啊
南美啊
等等很多的国家的基础设施
它可能是一个当地的一个公司做的
但是你会发现
那个公司的这个背后
可能好多是华人
因为中国整个包括华人
包括中国人
其实在不断的去走品牌出海
技术出来
这个过程是发展的非常快的
这几年
特别是可能在过去两年
这个AI出海也是一个特别火热的话题
对
AI出来可能是一个更大的一个机会
就是我们以前这个软件出来
有一个比较大的挑战
在于说
中国我们的软件行业
真正领先的技术
其实没有那么多的软件它要做到领先
一个核心是应用驱动技术创新
就你有最领先的应用
你才能做出最领先的软件
所以我们为什么在分布式数据库领先
因为我们我们的应用
对 对
就是AI
不一AA
它是一个更大的一个场景
那这个场景整体中国国跟美国两个国家明显是要领先全球的
那中国跟美国可能就是第一名
第二名这样的一个程度
从这个角度来讲
AI整个出海
包括AI下面的这个数据公司啊
包括AI上面的一些应用公司等等
合在一起
这个机会要比以前软件出海要大很多
对
刚刚其实咱们也讲了
中国其实是没有sas行业的
对
所以这个是不是也是中国开发者或者中国的软件创业公司
那么更加好的一个机会就是大家一起抱团
我们出海
做全球的生意
我觉得 呃
第一是AI来临之后呢
对这种saars类的企业
在国内也会有个更大的一个机会
因为通过AI这样的一些工具啊
它可能会把原来saars里面需要做定制的东西
变得更可以自动化的去做处理了
那以前我们国内做saars有个比较大的挑战
就是客户的需求很高
他往往需要定制成他想要的一个服务
就变成一个服务型公司
并不是一个saars公司
并且不不是一个产品型的公司
那是AI
它把部部分务型公司
它做做的一些事情啊
变成产品型
这个也是一个机会
再加上刚才讲的这个
随着出海
那这里面合在一起
会有一个比较大的一个爆发
嗯
这次您在发布会上发布的是产品品
可以给我们聊一下
对 嗯
分为几块吧
第一块还是OCENbase数据库本身的一个能力
包括我们以前大家对oceanbase的认知是做交易做的很好
那今天其实oceanbase做这个服务
我们也做的很好
可能这一块我们会有一些比较大的一些发布
也包括我们会发布我们叫存储
计算分离
在云上把它给很好的给用起来
做这种service
做弹性扩容
弹性缩容
这是数据库本身的一块
那第二块呢
是数据跟AI结合在一起
那数据跟AI结合在一起的话
就包括我这个向量数据库
包括这种混合检索的一个产力
oceanbase的向量数据库呢
其实也已经做到了
从这个性能啊
包括成本啊
都是业界一流了
这个的话
在发布会之前
可能大家了解的比较少
那我们在发布会也发布了这样的一些产品
第三块呢
我们也会有一些比如说是更偏AI的一些rag的一些服务
通过reg这样的一些能力呢
我们发布了一个产品
叫powerreg
让用户啊
我们的开发者能够非常简单的直接使用这个oceanbabe来做reg
那最后
我们在这个请您给未来五年看到了跟OB一样同时看到了这样的机会的开发者或者创业者
您觉得现在是进入比据行业的好时机嘛
我觉得肯定是
因为现在是一个data乘以AI的一个时代
AI的应用也好
包括数据类的应用
肯定是在爆发
而且现在还是一个比较早期的一个阶段
我想对这些新入行的一些不管是企业还是开发者说
我觉得我们一定要用一个比较开放的心态去学数据
学AI 用数据
用AI
好了
那我们今天的节目也差不多呢
非常谢谢日照总今天来我们的节目做客
就是如果大家对发布会发布什么更细节的东西
然后今天我没有聊到了
也可以去我们售no
到时候点击我们的链接去看
嗯 好好
今天就到这里里
谢谢谢谢谢
这就是我们今天的wortsnext科技早知道
欢迎大家在评论区和我们留言互动
加入到科技和创新的下一步讨论中来
另外
如果你想支持我们在播客内容上的探索和创新
欢迎大家加入我们的生动胡同会员计划
详细的加入方式和信息请查看本期节目的收no
那我们下期再见
嗯
展开显示全部歌词
上一首歌:琵琶曲MP3下载
下一首歌:ORA(阿黛尔)MP3下载
热门歌手
王菲 周杰伦 周深 海来阿木 半吨兄弟 李荣浩 林俊杰 凤凰传奇 魏佳艺 程响 怪阿姨 陈奕迅 G.E.M.邓紫棋 薛之谦 张学友 小阿枫 刘德华 Beyond 汪苏泷 张韶涵
其他人正在听的歌
街角的晚风 陈小春
skarby bezcenne (feat. Krzysztof Koziarski) Dns&Aster&Krzysztof Koziarski
Aster 明透
AZAS! Aster
History(中韩混合版) EXO&EXO-K&EXO-M
Lost In(Original Mix) 에이케이&아스터
Santuario (Faster ) Alexandre Verand
Faster Agatha is Dead!
Faster MP
kids(Explicit) aliswa&Aster
プラリネ / 果仁糖 asteR
网站地图 RSS地图 百度地图 360地图 头条地图
声明:本站不存储任何音频数据,站内歌曲来自搜索引擎,如有侵犯版权请及时联系我们,我们将在第一时间处理!
下载FLAC音乐网 桂ICP备xxxxxxxx 版权投诉 请联系我们 liukaymail#foxmail.com