• 推荐
  • 排行榜
  • 歌手
  • 歌单
  • 电台
  • 新碟
搜索历史
大家都在搜
慢慢喜欢你
passion
电台情歌
忽然之间
STYX HELIX
春桥与志明
忽然之间 半杯
这世界那么多人
转弯
阴天
思念漫过海岸线
你怎么舍得让我的泪流向海
岁月如笔写春秋
山风山风等等我
Assumptions
伍佰
看淡
打工人
爱与恨的悲伤
都怪这秋风又轻轻吹起
热
搜
词
如果累了就回故乡 你往南走 思念漫过海岸线 山风山风等等我 琵琶曲 你有没有真的爱过我 五百年沧海桑田 岁月如笔写春秋 周杰伦 泪海 甲乙丙丁 梦的翅膀受了伤 庄周一生梦一蝶 你不该权衡利弊 你怎么舍得让我的泪流向海 时间能不能走慢点 时光你等等我 看淡 No photo of you left to survey 空心
00:00/00:00
 高速下载歌曲音频  下载歌曲到手机 下载LRC歌词
随时随地任意搜索并下载全网无损歌曲
扫描右侧二维码下载歌曲到手机
扫描下方二维码下载歌曲到手机
免费获取更多无损音乐下载链接
外链地址
http://www.eemp3.com/audiofile/d80c00f5aef6b6bbd529fa10ee586e8e.mp3
点击复制

声音碰撞世界,
生动活泼。
hello,
大家好,
我是丁,
欢迎收听全新一季。
大家好,
我是科技早知道的科左主播哈维徐徐浩,
今天的节目我非常有幸的邀请到databreaks的联合创始人我的好朋友reno的心来一起聊一聊他创业九年来的艰辛坚持,
当然还有巨大的成果。
databreaks目前是一家估值380亿美元的超级独角兽公司,
核心团队就是当年RK的核心团队Spark,
至今为止仍然是最大的大数据开源框架。
Renault会回顾一下公司成立以来所赌对的三个大方向,
第一赌了云,
也就是我们说的SAS,
第二个赌了给数据工程师来提供工具,
而不是做数据仓库,
第三个做标准化产品,
不做定制,
他会详细解释一下。
坚持这三点非常不容易的几个原因,
作为一个开源项目,
是不是能够商业化?
Databris其实是走过坑的,
最开始他们认为既然亚马逊能够把Spark拿去,
马上就能够商业化,
那他们当然也行。
其实现实并不是那么完美。
debris走过的弯路不止这一个,
他们在销售方法论上面也是有过弯路,
为什么从一开始的自下而上的销售到后来的自上而下的销售?
另外微软成就了databreaksdatabreaks也成就了微软的azure云。
为什么这么说?
很多时候像这样的初创公司跟大公司是可以合作,
可以互相双赢的。
renold对数据产业有非常的动。
碰见我们就详细聊了一聊,
另外SQL语言,
SQL语言为什么renald认为它是一个非常重要,
但不会是数据行业唯一的标准语言。
另外我也问了reynold,
今天有成千上百个数据公司在那边,
他们以后会不会合并或者是前景如何?
什么样的人应该创业,
什么样的人不应该创业?
另外,
从一个技术领导转为一个经理人,
会走过一些什么坑?
我相信啊,
不管你是创业,
已经在创业,
或者想创业,
还是坚持在职场上面打拼的人士,
你都会收获不想。
大家好啊,
欢迎你,
Reynold好,
你好,
你好,
能不能介绍一下,
因为我之所以想问一下,
因为之前我在跟你聊天的时候,
我记得说过,
诶,
那个硅谷有两个比较知名的开源公司,
呃,
一个是databreaks,
一个是docker,
对吧?
这两个公司都是属于好像是卖tshirt,
卖公司conferenceticket展会票子好像比卖产品还要多的一个,
呃,
两个公司我估计也是事实,
呃,
能不能讲一讲,
就是说database最开始的时候的给我们分享一下可以吗?
可历史给大家简单介绍一下,
在公司成立之前呢,
我们都是这个UCbeley一个实验室里头专门做大数据和机器学习,
人工智能研究的博士生和这个教授,
然后当时我们大在2010年的时候,
那其实在我去到beie,
我是2010年到的berkie,
在我到之前的时候有这个项目,
陈晓的项目叫Spark啊,
那么Spark成立的呃最初原因呢,
是当时有一个叫Netflix,
呃,
Challenge的一个比赛,
那么neflix把这个他们这个所有的用户给电影评分的呃数据都给保存了下来,
然后他们希望用这些数据来训练一些更能够呃推荐电影给新的用户的这个呃算法,
那么对于NetflixNetflix来说,
如果这个train算法算法可以有一定这个质量上的提升的话,
其实对他们的RAM也是有很大的帮助的,
因为可以让提高用户的粘度。
然后他们就。
做了一个公开的比赛,
把这些数据都anonymized了之后做,
呃,
放到公开做一个比赛,
谁可以做做出更好的算法,
谁就可以赢100万,
100万美金。
那么当时实验室里头有一个学生叫laststy,
他决定要去参赛,
那么他参赛碰到第一个问题就是跟以前学术界的数据不太一样,
这个数据非常的大,
他没有办法在一台机里头就他,
比如他笔记本电脑或者说ectwo上一台机来训练这个机器学习的模型,
然后当时也没有所谓的比如说什么tenfour啊,
Piorch啊这些东西啊,
所有,
然后有second软件,
Second只是一台一台机,
单线程,
完全无法处理这样的数据,
所以呃,
他找到了实验室里头另外一个章,
另外一个学生说这个我们可以一起参赛,
但我们需要做一些新的这种系统,
能够处理这样子的大数据和这个机器学习呃的算法。
所以SPA最早诞生的时候是因为这个呃,
Last之后并没有赢得。
比赛啊,
但是他跟第一名其实并列第一,
从算法的这个角度上,
但是呢,
晚交了20分钟,
所以输掉了100万,
或者说没有赢到100万,
但Spark从此呢,
慢慢慢的变成了一个就不纯粹是一个学术界的系统,
而是当时整个团队都非常希望能够做出一个软件,
让业界能够使用,
而不纯粹是一个写paper发用的这个系统,
慢慢慢到20122013年的时候,
呃,
我们其实花了很多时间跟业界联系,
怎么样考虑Spark可以解决真正实际上大家碰到的跟大数据,
跟这个人工智能相关的问题,
后来慢慢慢有一些小有名气吧,
虽然在2012年13年的时候,
然后13年,
当时也因为SPA在业界的这个部署,
我们看到了很多处理大数据和AIscience的一些挑战,
然后我们觉得那我们应该有能力来,
或者是有使命和能力来成立一个公司。
专门针对这。
一些挑战,
解决这些问题,
让这个未来大数据人工智能的这个处理可以更简单,
所以成立了这个公司,
在2013年的时候,
公司成立初期呢,
其实我觉得从大方向上我们做了三个决定,
这三个决定并没有错,
但是从商业化的角度上有一些很大的主力吧,
这三个大方向我觉得没有错的呢,
是第一是我们决定针对云,
因为当时在2013年的话,
我觉得绝大多数成立的公司其实是针对这个线下部署,
针对这个,
或者说做的这个是的对,
像cloud啊,
这几个公司都是属于做大数据非常有名,
可能那时候的名气比你们响一点,
比我们想做的,
对对,
然后那个那时候其实是有很多争论的,
就是说诶那个大数据在那个onpla做是有很多的商业的机会,
但是大家同时也看到云也是可能是未来,
但你们能够。
或在这么早就是只做云,
其实上是一个蛮蛮大的一个决定,
你们内部有没有争论过,
我们内部在早期的时候争论过一下,
后来我就我们有一个叫所谓的disagreeandcommit的这个culture,
这个我们争论了之后,
我们就决定我们呃应该针对云,
然后针对云呢,
其实很多内部的这个决策呢,
我们考虑的是从长期的角度来说,
呃,
什么样是正确的决定,
世界会往哪个方向走,
那么我们针对那样子来做决定,
所以当时做了云的决定,
我们觉得就从当时的角度来,
我们考虑云可以做到更快的部署,
而且从软件的角度来说,
这个软件维护本身是一件很复杂很麻烦的事情。
所以我们觉得语云这个未来不管是从对于我们自己部署角度,
还是对于客户的这个value来说都会比较大,
所以呃,
决定了之后一直没有后悔过,
但是每年我们招一个新的executive进来的时候,
他们都会重新挑战这个啊,
这个假设,
然后每次我们融资的时候也会这VC都会问啊,
这个云虽然是未来,
但现在不是,
现在我们已经确定你真的不要加紧这个,
呃,
你做了一定的时间的云了,
你应该现在开始做到onprime,
那一直到什么时候大家不来挑战你了,
还是说到现在还是有人会挑战,
现在没有了,
因为现在大家都发现其实云肯定是未来,
而且就算即使到现在,
可能onpre这个不同企业投入的这个钱还是可能在prime稍微居多一点,
但是从云的角度,
它增长的非踌,
这非常明显,
未来是云的未来,
一直到20182019年的,
差不多在2019年的时候吧。
我觉得关于。
云的质疑就烟消云散,
在之前每一次,
每一年都会有这个外界的压力,
然后也有客户的压力,
比如说这个我觉得2017年的时候,
可能,
呃,
我们当时跟客户说,
我们其实只只做云上,
没有办法帮你这个解决你比如说promise的问题的时候,
他们会非常失望,
2018年的时候变成了客户的回答,
是啊,
我肯定会上云,
但我不知道什么时候会上云啊,
2019年的时候就变成OK,
我们现在也要上云。
所以说你们那个在2013年成立的时候,
就做了这么一个决定,
就是只做云,
其实当时候我是觉得这是属于可能业界里面少有的几个公司,
那这是第一个,
你觉得是比较正确的决定啊,
另外两点呢。
对,
另外一个是我们决定不针对,
因为因为其实数据说到做到analytics这一边的厂商的话,
可能绝大多数都会想说,
那我做这个datawarehouse,
其实就算是cloudde跟hoteltonworks,
你刚刚提到两个公司在他们如日中天的时候,
他们的绝大多数revenue都是来自于这个datawarehouseinthewarlo,
然后我们在2013年的时候决定我们不会去做way个world,
因为我们觉得这个way其实一个竞争非常激烈的这方向啊,
有很多就云,
首先云厂商本身自己在有对data韩国爱好非常大的投入,
我们决定针对datasciencedataengineering还有AI这个方向做我们的第一个产品。
那么这个其实在当时来说是一个也不算特别被看好的一个方向,
因为datascience这个词吧,
其实可能就是在2012年,
2013年的时候才被逐渐被大家听到,
对对的,
你去每个公司,
你说啊,
我做了一个datascience的产品,
这些公司可能说我们根本就没有scientist,
就你如果在lid作为这个datascientist,
因为这个名词当年是dFacebook的人提出来的嘛,
你如在LindaFacebook,
你可能有一些,
但你去到这个主流的这个大企业,
大家都没有听过这个词,
但是后来接下来的过程就是因为数据的大量爆发,
然后因为你需要有很多人能够真正的去了解数据,
Datasun这个职业慢慢慢慢真的起来了,
然后这个其实也让我们的第一个产品有一个得天独厚的优势,
因为根本市面上没有这个任何竞争的产品。
在这开始。
对,
所以说第二个决定就是不去做数据仓库啊,
数仓就像你说的,
其实竞争蛮激烈的,
有亚马逊的RAshift,
对吧,
然后那个tdata是一个老牌的prime本地部署的那个已经很多年了啊,
所以说你是相当于做一个新的市场,
我们在寻找一个,
呃,
新的,
但是当时还比较小,
但是我们觉得会有,
就是爆炸性增长的一个市场,
所以说是给那个数据工程师提供一个非常有用的工具,
就好像你们刚开始做起来的时候,
其实也是给neflix竞赛比赛去去做一个工具,
对吧,
其实就是把这个工具给云,
第一点是云化了,
第二点就是专注于做这一个工具,
因为你是觉得这一个市场是当时候是小,
或者说是emerging刚刚起来,
但是以后会逐渐逐渐变大,
那第三点呢,
就是你们做的决定,
第3点主要是我们,
呃,
可能跟第一点有点相关,
但是我们决定不做任何跟死活相关的事情。
或者说不纯粹做support或者professionalservices,
这个说起来很容易,
这三个我觉得都是,
就说起来很容易说,
但是你真的要确定实施下去的话,
其实是比较难的事情,
因为我们碰到的是Spark,
当时就作为一个开源项目已经小有名气,
或者说到201415年的时候,
可能已经就是属于你,
你想做dataenginedatascience的话,
你你一定会用Spark,
这个时候每一个公司都会来找我们说啊,
我不一定用你的云的东西,
我甚至也在云上,
但是用其他的东西,
我希望直接给你做,
甚至我可以砸,
比如说1000万,
这个1000万美金对于我们当年来说是个非常非常大的这个,
但是然后你可以支持我这整个datacenter,
我都不需要你的软件,
但我们一直都说noabsolutelynowedon'twantto,
就我们不希望作为呃,
Support或者这个咨询的公司,
我们更望作为一个产品,
作为一个平台啊,
我觉得你们这三个决定其实都是非常胆子比较大的。
第一个坚决。
云只做云,
第二个是做一个给数据工程师用的一个工具,
而不是做一个数仓,
第三点其实就是不去做定制化的项目,
定制化项目其实机会很多,
但是你想做一个产品,
这三点其实如果我总结起来就觉得就是不是去赚快钱,
就是马上去赚钱,
而是看准了一个历史朝哪边走,
那这里面我比较好奇啊,
这三个都是比较胆大的决定,
这几个都是你们几个博士生自己做的决定,
还是说有很多是你们也是受了一些,
不管是投资人也好,
或者说你们的一些业界的专家的,
就是你觉得有多少是因为是你们一群年轻人就觉得,
诶,
我们就是要要胆大啊,
这这个决定是怎么做出来的?
可能起码有90%以上是因为本身团队的这个决定吧,
我觉得这其实呃和团队本身也有关,
就团队不完全是全部都是博士生啊,
也有就是一两个教授在里头,
这其实跟beie当年的环境有关,
就是在云计算考computer上有一篇非常有名的论文,
这篇论文有名到了我的我的老婆,
她在商学院,
她不是做技术的人,
他在商学院里头读到那篇论文,
那篇论文叫theburleydealofcloudcomputing可能有几万天这个引用,
那篇论文呢,
是在20,
如果没记错呢,
是2009年或者2010年的时候写的,
然后当时就是包括了daybreaks的个别几个,
不是所有的。
联合创始人,
个别几个创始人都在上面,
然后他们当时就写出了一篇,
这个就是未来云计算会不可避免的会这个取代几乎所有的机率,
所以我觉得那篇论文本身,
或者说其实不光不是因为读过那篇论文,
而是参与到看到了这个很多啊,
我觉得未来走向看了那篇论文本身就是从基础的这个economiceconomics的角度,
这为什么商学院会去读这篇,
它不纯纯是一个技术论文,
其实就阐述了为什么这个未来一定会变成云计算为主的,
所以那个对我们其实有很大的影响。
另外一个是就是我刚刚说到可能在Spark开始之后,
我们跟业绩有非常多的交流,
甚至直接在比如说不同公司做咨询啊,
做这个,
呃,
Internship,
做culture,
去把SPA应用到这个生产线上,
那个时候我们就碰到了很多很多,
我觉得作为啊,
你如果要自己设计这个数据中心是一件非常麻烦的事情啊。
所以也被那。
一些影响嘛,
但是我觉得一方面你可以说我们非常有远见,
另外一方面呢,
也是我觉得也有一定的运气成分,
因为你可以知道说未来是这个方向,
但你很难知道未来究竟会在五年之后到来,
还10年之到来,
还是20年之后到来。
呃,
Cloudra你刚刚提到的公司对吧,
他的名字叫cloudra,
他其实在最开始2008年,
因为我跟这个cloudra的创始人什么都还是有一些交集的,
他们在最开始成立的时候,
之所以名字叫卡尔,
是因为他们也觉得云是未来,
但是在20082009年的时候,
如果你尝试去做一个云计算的公司,
会头破血流,
除非你是阿,
你可也会头破血流,
然后他们就更改了他们的决定,
其实他们从当时,
呃,
卡德尔后来的这个去Charles,
可能当时刚从哈佛商学院毕业,
卡德尔招他就来做了很多这个市场调研。
肯定,
他觉得这个肯定是一个在现在是不可能做到的事情,
然后当然投资者,
其实最早投资者不反对这个事情,
对我们也是有帮助的,
如果你有这个投资者,
每次meeting都在说这个你们应该去网的话,
那就当这也非常难让这个创始人完全从头到尾兼职。
至少他给了你一些耐心,
对,
我觉得这个故事讲的特别好,
一个clouderror,
它这个名字英文就是一个云时代,
对吧?
Clouderror,
但最终还是屈就于现实,
当时200,
就像你说的2008年应该还没有datascientist,
呃,
数据工程师这个概念,
那即便如此,
你们的前两年三年还是苦哈哈,
对吧?
我觉得能不能讲一讲苦哈哈的时候,
你自己内心有没有质疑过自己,
或者说是怎么想法,
或者说你你你太太虽然说她读了那篇文章,
是不是也说,
哎,
那个reno,
你在搞什么?
我上次跟你聊天的时候,
我们讲到了为什么会哭哈,
但是刚刚这个可能从这听众的角度他们还不太清楚,
其实我们从三年呢,
呃,
从外界的角度上看,
可能没有什么问题,
但是从内部的角度,
甚至内部工程师们基本上都不知道,
但是从这个revenue的角度来说,
呃,
因额的角度来说,
其实是非常大的问题,
呃,
我们可能在头三年,
你刚刚说到了,
我们这个产品的营收其实远低于我们这个做Spark大会的这个Spark峰会的这个营收啊,
所以在硅谷有这个所谓的David,
或者说docker,
你刚刚提到了有点像卖T恤的公司,
因为从这个community的这个Spark上面开大会卖票的钱都多于这个产品,
我们这几天还在聊,
当时候docker跟那个datas都是属于这两个databreaks,
当然最近几年是发展很好,
Do也是,
最近一段时间稍微有点recover啊,
前几天也announce了,
他们融资有了新的融资,
大概20亿美元,
也不错啊,
对吧,
但但是比起。
还是,
呃,
从今天的角度差很多,
对,
但是我就想听听你内心看到有那个营收差那么多,
你内心在想什么?
我觉得我们其实做了一些,
从大方向上,
我们可能把握住了正确的这个方向,
做了正确决定,
但很多细节上其实是有问题的,
也甚至不是细节,
我觉得是在中间层面的这些东西,
比如说我们过分的依赖开源,
当时的这个想法呢,
其实是因为从卡德尔跟howork的角度来说,
他们这个当时可能Intel尔投资了7个亿给卡德尔,
他们已经是个50亿公司,
价值50个亿的公司,
这对我们来说,
这是一个就是非常巨型的一个大数据公司,
我们觉得啊,
那如果cloud尔他们可以通过开源做到这么大,
那么database当然也是可以了,
但是有一个巨大的问题,
其实就是啊,
卡德尔之所以做了这么大,
很多其实是因为support对吧,
就是你做开源,
做定制。
做这个售后支持,
但是那些东西其实从真正商业角度来说,
其实不是一个这么好的,
呃,
商业决策,
因为这些东西都是跟人来这个scale的,
就是你需要有更多的这个营收的话,
你需要更多的人,
呃,
而软件最大的好处是其实软件是不需要通过人的SQ,
而是这个所有东西都是自动化的,
对吧?
那么你做服务做支持的话,
你必须要跟人一样,
而在云上Amazon,
呃,
其实不光Amazon,
三大云厂商都有这样的事情,
但Amazon因为是体量最大的这种啊,
他们可以直接把一个开源软件这个拿过来,
然后呢,
做一些很简单的封装,
然后把它做成一个service卖出去,
这个时候,
而且Amazon因为不需要做任何的关于这个开源服务的这个投入,
对吧,
他们只需要做他自己的产品,
所以他从工程的角度来说非常的低,
他甚至不需要任何的这个招,
懂这方面的人,
他只需要做一些很简单的这个control,
能够把这个。
东西啊,
服务部署起来就可以了,
说的好听一点就是很容易借过来用,
对不对?
那么所以他可以就是以非常低的价格把这个卖出去,
打个比方啊,
比如说我们如果要这个成本可能是一块钱,
Amazon只需要1毛钱的成本,
那么这个时候就会发现啊,
很多客户很可能他觉得啊,
我非常想用这个开源原厂商的产品这个deliver做一些新的东西,
这个可以支持SPA,
让我在deliver上面做一些简单的PRO,
但是当我需要做大规模部署的时候呢,
这个时候我当然去找一个最便宜的厂商了,
我已经把东西开发完了,
为什么需要去继续给datare这个比如说一块钱的东西呢,
我去花一毛钱就够了,
而且尤其是对于很多这个生产线上来,
就对于大数据来说,
你可能需要非常非常多的这个计算量,
所以这个价格的优势对Amazon来说其实是一个非常大的优势,
这个其实在很大一部分原因上导致了我们头三年就是营收非。
机场的迪啊,
只有一些零星的一些真就是客户,
或甚至说甚至有一些大客户,
但是他们真正的这个大头都去了Amazon那边,
而不是在dailyBRI片啊。
还有一个问题就是我们在最早的时候,
从企业软件的角度来说,
一般有所谓的bottomup跟topdown这个sales吧,
在top其实就是你会有这个销售人员专门出去,
然后去push,
就传统说,
比如说跟客户打高尔夫啊之类的去push一个这个产品从CIO的角度啊,
而不是说从底层的去卖,
对另外一个呢,
是从这个包含吧,
从就是说我这个产品基本上可以自己卖自己这个,
我把这个产品的好处都列在网站上,
你可以直接signup,
然后可以这个开始使用这个产品,
然后你会得到特别大的value,
然后慢慢这样可以滚越滚越大,
呃,
我们是非常想做后者的,
因为我们觉得后者这个不需要有销售人员啊,
我们全部都是工程师,
我们工程师当然希望公司就有工程师。
但是从我们的这个层面,
因为我们做是非常基础的,
这个就是D,
这个基础设施其实是很难通过,
比如说一个人涨到两个人,
涨到三个人,
涨到整个公司,
比如说几万几十万人的公司,
这个呃,
越基础的东西越需要这个上层的这个push,
不管是CIO,
这个VPofit,
或是这个VPofengineering,
需要这样子的push,
所以这是另外一个呃原因,
导致我们可能早期呃前几年的时候,
我觉得从商业化上并不是很成功,
对所以说那个从开源本来是觉得,
哎,
我开源我我是Spark的发明者,
大家都会用我的这个开源的一个就是云上面提供的服务,
但是你后来发现其实大家有可能是用,
但是有大规模部署的时候,
其实就不去用了,
这个对你们来说其实就是一个营收,
苦哈哈的一个很重要的。
但是这一点你们其实也。
改变我的理解是,
就是说开源是有,
但是你们做了开源很多更多的东西,
那些那部分是不开源,
能不能稍微展开讲一讲,
对,
我们自从大概在2015啊116年左右的时候,
我们当时就做了两个大决定,
第一个呢是我们会,
呃开始引入这个真正的这个topdown的这个sales,
到现在我们其实有个挺大的这个销售团队啊,
另外一方面比较重要,
从产品的角度来说,
就开始考虑怎么样可以做一些竞争壁垒,
而就是真正的竞争壁垒,
从我们当时的定义,
我们我们提出了这个词叫Sparkedge,
就是竞争壁垒,
不是说你做一个随随便便的不开源的东西,
因为Amazon不是傻子,
对吧,
这个你如果做了一个东西,
Amazon肯定会去尝,
如果这个东西很有价值,
对客户来说,
那么Amazon肯定会尝试去复制这个东西,
所以真正的竞争壁垒呢,
是你可以做到的,
而且是你有德。
天独厚的优势,
可以做到的这个壁垒让Amazon非常难去扶制,
这个其实就很多涉及到比如说开源厂商肯定是有一定的优势,
因为你对这个开源产品非常的熟悉,
你知道它有什么样的缺陷,
你知道它有什么改变,
可以改善的地方,
你知道有一些在它之上可以做到一些东西,
很可能别人非常难做到,
当然一切都是软件,
对吧,
你有足够多的钱,
有足够多的人,
什么东西都可以做到,
但是这个起码对于一个小公司来说,
你只要可以呃做的更快,
然后可以把有一定时间的这个壁垒,
你就可以去投资做更大的壁垒,
然后慢慢越滚越大,
所以在我们当时我们其实看了很,
我们就是对很多比如说从性能的角度,
这个的角度,
从安全性的角度,
很多企业就真的会比较在意的东西上做了很大的投入,
然后这些东西呢,
其实变成我们竞争壁垒那一部分。
你觉。
呃,
Amazon做的当然任何事情都能做,
就像你说的,
但是做的可能性会跟你们比起来,
竞争优势会少一点,
是为什么呢?
就是做这些performance,
做scaleability,
是因为他毕竟不是Spark的初始的作者,
所以说他的理解比你们浅,
还是能不能讲一讲,
对我觉得两方面,
一方面是他理解比我们浅,
另外一方面就是Amazon的这个模式他不需要,
他其实Amazon一般不会招特别好的这个engineer,
绝大多数的Amazon的他,
因为他需要做的东西比较简单,
它就是把这个拿一个开源的软件过来,
然后我想说怎么做controlplay,
怎么样能够部署这个开源的软件,
他不需要进到这个开源软件内部,
去,
想说我怎么样去,
比如说提高这一个非诚核心拈的性能,
这些东西其实需要比较好的安上来做,
因为其所有的公司其实都是一样的,
就是你希望expand到一个比较容易赚钱的地方,
就是你不希望你的最开始的时候是打的头破血流,
你希望。
比较容易的expand,
那么从云的角度来说,
Over尔现在有特别多的多亚马逊可以去进入的地方,
但是就照我说的,
如果这个比如说JeffBA突然间哪一天决定我一定要针对这个,
那么Amazon当然是有能力去做到这样的事情,
但这可能是几年之后了,
对吧?
这其实就属于小公司跟大公司竞争的,
这个我我觉得是没错的话,
是大公司如果专注在一块的话,
他多半可以做的比小公司好,
但是大公司有需要太多需要专注的东西啊,
他并没有办法去专注每一块他做的产品,
所以这个我觉得是小公司有非常大的这个优势。
那我们刚才开源讲了已经很多了,
但其实我还是在想深挖一下,
其实你们的被外界认为的是一个开源公司,
但实际上从我的理解,
很多你们做的东西已经是必源的,
或者说是可能90%、
九十五的东西是必源的,
但是你们有这么一个perception,
就是外界对你们的一个认知,
是一个开源的公司,
实际上这个开源对你们是非常非常重要,
能不能跟我们的听众分享一下。
首先先就是呃,
谈清一件事情,
就是这个我们可能绝大多数人做的东西都是园的这个项目,
但是这很多里头其实是去到了这个,
比如说我们的这个cloudservice啊,
因为你你要去scale一个cloudservice本身需要很多很多人,
这些基础设施本身需要很多的人,
就运维不只是写程序,
也要去运维这个程序,
这个运维是有很大的一部分的程序在里面,
我们的运维基本上都是程序化,
就都自动化,
但是那些东西本身需要很多的,
比如说我给个数据吧,
我们每天会在三大云上Amazonazure和GCP上launch,
呃,
1200万台BM,
就一千二二百万台虚拟机,
那么管理这1200万台机器其实是一个非常非常呃大的工程,
我们不是由人去管理的,
而是我们有几百号工程师,
这几百个人的专职就是他们编写程序去维护这。
千二百万台虚拟机对吧,
所以这些本身就非常非常多人做这些东西,
然后这些其实在某种意义上已经变成了一个竞争壁垒了,
因为非常难有其他公司可以,
比如说尤其对于小公司,
非常难有一个小公司出现,
然后能够支持这么大规模的这个基础,
但是我们我觉得database作为一个呃,
或者是称database或一个开源厂商其实是没有错的,
因为我们的很多核心的这个产品都是基于开源项目而诞生的,
而且从很多比如说呃,
我们有一个所谓的基本上所有的API在上都是开源的,
所以你如果有一个work在data之上的话,
这个word可能用比如说开源的Spark的API,
用开源的MLflow的API,
开源的DeltalakeAPI啊,
有可能底层的实现呢,
有一部分是开源,
有一部分不是开源的,
但是这个API本身你是可以随时比如说利用开源项目来重新实现,
然后跑在其他的地方上的啊,
然后我觉得这个API开。
源更深的底层实现开源的一个最大的好处是因为我们可以这个培养一个非常就是或多个非常大的开源社区,
比如说在20132014年celebrateabber只有几十个人的时候,
我们当时开的大会可能就有几千个这个听众,
全球各地跑来旧金山参加这个大会,
还不包括像我这样在YouTube上面听你们那个那个Sparkconference的sum特的那个人,
对。
所以其实当时比如说mid上可能有100多万人在全球不同的这个mid上,
所这个带来几点吧,
第一点是当然他给带来了一个topoffunel的这个有一点像bottomup的这个感觉啊,
当然它不完全是一个bottom。
另外一方面是它让企业,
我觉得很多企业其实现在也是慢慢越来越开源化,
就只用开源的软件啊,
因为呃,
尤其在基础设施这一层,
因为基。
这是场你需要招人对吧?
现在所有公司都在招很多跟data相关的人,
那么这个人才越来越少,
人才不够多,
那么人才不够多怎么办呢?
你如果去用一个开源的东西,
学校里头也在教这个开源的项目,
比如学校里头在很多,
可能全球有,
我觉得起码几千家大学都在教Spark的这个,
呃,
编程啊,
呃,
所以你可以找到很多人才,
我们甚至有一个客户不太好说名字,
但是美国一个非常大的公司,
当时他们的CP跟我们说,
呃,
我为什么要从某一个proprietary的这个软件改到呢?
是因为我觉得下一个就是nextgeneration,
大家都是呃学的Spark长大的,
那么现在来说在可能是两年前吧,
两年前的时候啊,
当然现在也是真的就是这个,
我如果想基于SPA来开发我的这个数据平台的话,
那么当然是最好的选择,
所以这个其实就给一个我觉得小公司从这。
上面带来了一种先天性的这个优势,
让一个小公司可以有更大的这个力量去撬动这整个业界,
那这是早期,
那S走了几年以后,
也是比较到了某一个moment,
我相信你会感觉到,
诶这个公司不再是苦哈哈了,
你觉得有什么样的,
不管是一个事件也好,
或者说是外界的一个发生了什么事情啊,
影响到你们,
比如我自己所在的zscale,
对吧,
Thisscale也是说诶我要把那些安全的产品放到云上去,
但是十几年前大家听了就是笑笑而已,
对吧,
还是还是在本地不署我我们啊,
谢谢谢谢。
然后到了大概呃20可能151617年的时候,
那个邮件都到云化了,
当那个邮件云化的那一刻,
就大家意识到,
诶我既然我的那个主要的一些,
呃,
Server的负载workload已经在云上了,
然后人也那么分散了。
我为什么还要把那个安全的东。
就放在本地好像不怎么makesense了,
所以说其实这个officethreesixtyfive变成很大的转折点,
所以说我想听听像databreakswhat'stheequivalent,
就你们的那个officesixtyfivemoment,
就你们的转折点是什么呢?
从我们的角度来说,
可能外界的转折点并不是那么多,
就很多时候,
其实比如说后来营收也是一步一步打下来,
并不是说因为我们签了某一个客户之后,
或者说有一个有一个瞬间让全世界都觉得这个de是一个非常好的产品,
然后或者说呃,
数据科学非常的重要,
因为像我刚刚说的,
其实在一我们13年成立到一五年的时候,
可能也没有特别大的营收,
但那个时候,
呃,
亚马逊自己的那个产品emmark,
呃,
已经开始后Spark,
而且针对Spark可能已经有几个亿的营收了。
从这个角度上来讲,
你跟我想象的其他的一些公司可能不一样,
比如说你们那个你们的友商之一Fla,
他就是至少从外界的角度来讲,
他2017年大概capitalone成为一个他的重要客户以后,
大家就觉得诶这个产品好像是蛮不错的啊,
连那么大的那个一个银行都愿意去用它的产品,
说明这个产品不错的。
但你们可能不一样一点,
因为你们你们这个Spark已经是大家觉得这是一个蛮不错的产品,
已经很多年了,
因为Spark的名声已经在那边了,
所以说可能转折点是会不一样一点,
对,
所以你那个时候就我们觉得这个需求其实是存在的,
而且客户这未来比如说能做到多大,
当时并不是很清楚,
但是已经明显已经有,
不管是从cloud尔或work还是这个Amazon上,
他们三家赚的钱都比dailybert多很多。
从Spark角度,
然后慢慢慢慢开始,
我随着我们开始制造竞争壁垒和这个开始加大投入。
从销售人员的角度上说,
营收。
慢慢增长,
你刚刚说capitalonecapitalone呃也是一个DEB最早的一个大客户,
但是我觉得并不是说因为capitalone有一个决定性的因素,
在2016年17年的时候,
当时我们在想说,
啊,
那我们开始有一定的起色,
因为我随着我们这个产品策略跟这个销售策略的改变,
但是怎么样可以加快这个增长,
然后当时我们就想说,
OK,
以最早说我们只在Amazon上,
那么我们可不可以去到这个其他云上,
因为毕竟有三大云,
对于我们来说,
呃,
我们当时也在考虑,
那么长远来说,
这三大云应该都不会消失,
而且应该会三足鼎立,
因为AmazonAmazon有已经非常成功,
呃,
微软可以有无限的资金投入,
因为他们有office跟Windows的这两个,
就是cashcount,
可以一直投入他们的云,
直到把云做好为止,
那么Google也是一样,
他有这个APP的,
这个在美国号称硅谷,
是大家说开玩笑叫moneyprinter,
三国鼎立,
这个局势是满铁板钉钉的,
所以说。
啊,
都应该是你们合作对象,
所以当时考虑的就是,
那我们做M软之后,
我们可不可以在其他云上做起来,
然后当时我们就想到,
如果我们要在其他云上做的话,
我们是不是可以找这个第二第三名,
因为大家都想变成第一嘛,
然后当时呃,
开始和微软就是谈合作,
这一方面到17年的时候应该是谈下来了,
这个叫A的一个合作,
所以A是一个非常独特的产品,
它是这个虽然由databreaks来开发和运营,
但是它是一个微软的这个产品,
为什么我叫它叫微软的产品呢?
它是由微软的销售人员去销售啊,
但这本身还不是很特别,
因为微软可以销售其他的这个,
这个常见的有partnership是你可以销售其他的产品,
但是他直接在这个微软的这个所谓的enterpriselicensing里面,
你可以把你一个企业,
一般来说,
比如说一个企业,
它会每年基本上世界上所有的大企业都跟微软有这个一。
他说我每年比如说我有1000万这个budgetloc在了,
这个就已经批给了这个微软E上了,
很多呢,
是Windowsoffice,
但是的这个E就导致了客户可以直接把他们这个已经批好的这个Windowsoffice的这个转向到这个上,
那么对于我们来说呢,
当然这是一个非常大的优势,
因为很多时候这个企业软件negotiation啊,
Budgetproval,
这是一件非常长的事情,
就微软的销售人员去帮我们卖,
首先第1点我们自己不需要那么多的销售人员,
那么就让这个呃利润提额更高,
另外一方面呢,
是这个时间会缩短,
然而对于微软来说,
这也是一个非常大的互利的合作吧,
因为微软的云毕竟是第二位嘛,
不同角度上可以第二或第三位,
那么在微软云上其实一直没有一个特别好的大数据跟这个数据科学的这个平台,
而变成了一个微软产品。
所以微软相当于从完全没。
有竞争优势到变成了一个比,
咱从我的角度来说,
这个A要比这个亚马逊自己的这个产品好,
所以他们相当于在一年之间从无到有,
而且不光是有,
而是做成了一个可能业界领先的这个产品,
所以也这个东西本身也对微软带来了很多的这个营收,
而且abers非常成功,
具体数字我不太好说,
但是是这个微软云上最成功的一个呃服务之一,
所以对双边都带来了非常大的好处,
对我们来说有时候也是一个比较大的转折点,
并不是说databreaks会不存在,
或者说会是一个呃失败,
如果没有这个东西的话,
但它肯定是啊,
给我们的这个增长带来了非常大的这个帮助。
据说是azure上面百分之几十的那个虚拟机,
每天跑起来就是因为databreaks的原因,
所以说曝光带来的就是adata这边的帮助,
而是它带来非常大的就是underlineingcomputerstorage,
从计算存储层面的这个提高。
那我们再讲讲今后databreaks已经是一个fairlyninebillionDollar390亿美元那个估值的一家那个硅谷的高科技公司了,
应该说是已经做的体量也好,
各方面都是很不错了,
根据我的经验啊,
像这么一些不错的公司,
其实自己还认为我其实还是在早期,
嗯,
然后其实我还有很多路要走,
能不能跟我们介绍一下那个很多路要走,
呃,
有些什么,
因为我记得,
呃,
前一段时间跟你聊的时候,
你讲了一个观点,
就是那个C孔lright,
就是SQL是isthateverythingright,
就是说有些公司起来就selisonsel,
就是他们把那个公司就堵在seql,
但你的一个观点就是说selisnoteverythingwellit'ssomethingrightisimportant是重要的,
Sel是重要的,
但是啊,
并不是所有,
所以说我希望你能不能给我们啊分享一些。
啊,
就是你对未来的展望,
嗯是是怎么看的,
其实呃de在过去几年我觉得是变得越来越,
呃ambitious啊,
野心越来越大,
而且做的东西也越来越全面,
那么最开始的时候我们做SPA,
其实属于一个计算层面的,
就是处理数据的一个东西,
然后后来呢,
我们发现存储器,
因为我们最开始成立公司的时候,
我们觉得这个存储其实一个已经这个soPRO就大家已经没有什么困难了,
非常简单。
后来从这个处理层面,
我们发现很多客户其实碰到的问题,
可能2018年左右我们查的时,
我们看的时候,
可能客户有一半的问题跟底层存储有关,
那么存储不是我们提供的,
是其他的云厂商或者其他的这个系统,
然后当时我们就觉得,
那我们可以给客户带来很大的这个价值,
如果我们可以把存储做的更好,
所以这诞生了我们的第二个大的看项目叫Deltalake,
然后后来有一些机器学习方面的拓展。
直到最近我们有一些。
且最终我们决定我们要做这个dailyelse型数仓啊,
因为我们发现我们看到的绝大多数的这个企业客户,
因为现在我觉得de其实已经到了一个我们基本上可以看到整个市场的感觉啊,
虽然可能不一定每个公司都是我们的客户啊,
基本上绝大数企业客户的这个数据架构呢,
都是他们利用databreak或者其他的这个数据,
Datalake相关的这个解决方案,
比如卡尔或works,
把呃所有的数据都存储在这个数据之中,
然后呢,
数据会做一些,
比如说daybreak上会常见的一些datadataengine,
然后呢,
他们会有呃一个这个数据仓库,
呃,
这个数据仓库里头呢,
可能就有数据湖的10%或者5%的数据这些,
尤其是就是跟business比较相关的数据,
然后他们利用数据仓库来给这个。
啊,
数据分析师作为这个后端,
那么你可以做一些BI啊,
可以做一些这个简单的数据分析,
这个架构属于现在我觉得可能最流行的架构,
但这个架构本身有很多的问题,
因为这个架构其实,
呃,
我们当时我其中一个客户跟我解,
我最开始我觉得这只是个技术问题,
因为你需要把数据从一个地方拷贝到另外一个地方,
你需要确保你的这个权限管理,
还有一样的权限管理,
那么这些的确是挺复杂的,
当然你问所有的技术人员,
他都会告诉你,
我希望有一套系统。
可以做支持所有的这些不同的这个,
但是我的客户从business角度跟我解释这个问题,
他说这种数据分裂在两个系统上,
最大的问题是啊,
你会有,
比如说有一个呃,
BestPRO,
你需要去解决,
你需要去分析,
这时候会有不同的团队,
不同团队有不同的权限,
他们会看到不同的数据,
就同一份数据里头,
他可能看到不同的版本,
看到不同的这个呃,
细节,
然后当他们得出的结论是不一样的时候,
因为他们的数据源不一样,
这个时候就会导致做商业决策的团队不再相信数据,
而导致整个底层的这一些做it,
做这个数据platform的人没有办法更好,
因为你下一次再碰到一个问题,
大家就会说我真的可以相信这个吗?
所以这其实可能是最大的问题,
当然还有很多细节问题,
比如说啊,
我这个刚刚说到权限管理啊,
或者说比如说你从数据从一个地方一挑到另外一个地方可能需要时间,
你可能需要有更快,
你你希望。
还有比如说在有秒级的这个,
呃,
数据新鲜度,
但有可能你多了一个一条方,
变成了比如说小时级或者千级,
这些都是,
但其实真正最大的问题是就是从商业的角度来说,
你会不会或者从公司的决策角度来说,
你会不会停止不再相信你的数据,
所以我们觉得像之前想要说这个未来会什么样,
那么我们一开始觉得未来是云计算,
未来是这个会有越来越多数据科学家,
数据工程师,
我们现在觉得是未来会是这个所谓的胡昌一体定义的这个lakehouse的这个词,
而是未来的数据架构不会是有一个分开的data类跟一个分开的datawarehouse,
甚甚至有其他更多的系统在中间,
未来数据架构是有一个统一的数据平台,
这个数据平台本身可以支持所有的不管是从warhouse的workload还是这个dataworkload,
其实可能简单一点就是从BI到AI。
那么现。
在的话呢,
我觉得并没有一个产品可以说100%的支持这些受的东西,
从数据仓库的角度来说,
他们可能可以非常好的支持BI,
但是你一旦碰到,
比如说跟机器学习相关的,
你一旦碰到有非常呃需要比较复杂处理的一些数据的时候,
数据呃仓库是没有办法支持那些东西的,
那么从呃,
Database这边的角度来说,
因为我们之前focus很多在这就是专注在这个数据库这一边,
那么可能可以做很好的数据工程,
数据科学,
甚至做这个机器学习,
但是从做设BI啊work方面呢,
其实支持的非常不好,
所以在过去年我们宣布了一个新的产品叫SQL,
那么这个东西呢,
其实专门针对呃数据仓库这一边的应用,
我们并不是去做了一新的数据仓库的解决方案,
而是我们做了一个新的产品,
这个产品在我们现有的平台上面可以支持,
可以更好的支持数据仓库的这些应用,
而。
以此达到我们所谓的这个就是lakehouselakeout名字对吧,
第一个是lake就是dead。
House呢是datawarhouse,
所以是数据湖,
数据仓库,
胡仓一天这个词,
呃,
我们其实最开始提出这个概念的时候,
可能是在三年前吧,
当时其实我们的产品也也不到位,
但是我们提出了这个概念,
就像其实在labor过去八九年里头提出了不少概念,
不是每个概念都会被这个有,
呃业界就是到,
但是呃,
Lakeout这个词呢,
现在虽然慢慢慢其实已经我觉得在对业界有比较大的影响,
像你前两天你跟我说这个A的这个关于数据的这个呃生态的分析里头就提到了这个词,
其实不光是他们的三大云厂商,
这个Google,
呃,
Amazon和azureMicrosoft都你如果搜的话,
你都可以找到lakeout的这个概念,
而且现在在国内其实也有不少厂家就是基于这个概念,
不管是新的创业公司,
还是这个大的云厂商,
也基于这个概念,
然后开始想,
呃,
设计怎么样,
他们未来的产品。
所以说对databreaks来讲,
起家是做一个给数据科学家的一个工具,
不牵涉到存储,
但是后来发现,
诶,
其实这个存储跟那个我的工具,
或者说我提供的数据壶,
所有的东西其实是要连在一起,
如果不连在一起,
出了问题谁负责,
然后是不是有足够的信任,
所以从这个角度上来讲,
做一个一体化的,
嗯,
就有点像那个苹果对吧,
以前是买英T特尔的CPU买谁的,
现在就是什么东西都自己做,
做一个一体的,
能够做一个用户体验做到非常好,
那我想估计你们也是想给那些做AI的人,
做bii的人,
做到一个用户体验能够极致,
然后效率呃也很高的这么一个平台,
对吧?
那我其实有一个问题,
其实你也跟我提到过,
你说那个snowflake提倡的是SQL,
但是你提到的一个观点,
就是SQL哪些东西你觉得不是一个,
就是为什么SQL不是一个所有。
首先我觉得很重要,
对于比较简单的数据分析和BIwork来说是一个非常非常重要的标准。
但是我觉得过去10年或者甚至20年的历史其实告诉我们这个世界上跟数据相关的这个应用远超于简单的,
比如说出报表,
然后也很可能你的数据从很多不同的这个数据源过来,
然后你需要把它们整合起来,
这些东西其实非常的复杂。
那么CQL作为一个语言来说,
它并不是设计来做复杂应用的工具,
如果去读当年CQ这个最早那篇paper的话,
它定义了一个更像最终用户非技术人员用的一个语言,
比如说你要做一个regressionanalysis在secret就是非常非常困难,
相反Python其实是非常非常的火,
如果你看一下这个怎么pyon面其实现在已经比多了。
Python作为一个计算语言来讲,
已经是连续好几年是第一大语言了,
所以最终回到了就是数据上面的不同,
下层的应用有非常的多样性,
而如果CQL是主要的语言,
很多东西要么就非变得非常复杂,
非常难做,
要么就根本没有办法做,
就有些东西你可以做到用C,
比如说在十几年前的时候,
Greenpo尝试把机器学习都做进po的数据库里头,
然后他们写了一篇论文叫melon,
当时用了很多脚本加上优质的发function来做机器学习,
但是你就会发现可能有几千行的SQL,
大多是SQL的语句,
连一个就是stepstepdebug都没有,
这时候你怎么样去,
就算你能写得出来,
你万一有bug,
你要去查那个bug本身都是一件非常难的事情,
更不要说比如说很多性能上的问题。
那我相信也是有一些其他的工具也好,
高级语言也好,
它能够自动的去帮你,
你就给我一些lowcode的nocode的一些东西,
然后我可以帮你转换成为SK,
不也是已经够了吗?
因为我之所以问这个问题,
我猜想啊,
就是说你们的友商snowflake是以一个S是作为一个最主要的或者是它的基本面,
现在databreaks的想法就是说SQL是很重要,
但是是有很多东西是morethanseq比CQL多得多,
所以说我这个平台可能是更有用,
这个我是能理解的,
但是不可以做到,
就是所有的其他的灵活的那些语言,
也最终也把它翻译成为一个C口,
你觉得这个不可靠吗?
这会有很多问题,
呃,
其实正好前两天我们还在讨论,
就是说究竟能不能把SQ周围narrow很多拍ython相关的大数据处理上面都放到SQ上,
我觉得从工程量上来讲其实非常难,
一个简单的例子,
就比如说你写程序,
你总不可能永远出错对吧,
出错了之后你怎么debug,
这就是一个非常难做到的事情,
如果你的中间是只有最上面是拍on的话,
然后呃,
你刚刚也提到,
那么so,
其实现在也在做这个pon的支持,
但我觉得比较难的事情就是因为其实一个架构一旦如果已经定了,
那么ssnowic,
包括其他所有这个数据仓库的架构都是SQSQL,
那我怎么样加一个新的这个,
比如说language或在上面的,
这其实是一个比较大的这个架构改变,
大概是一年多前吧,
可能是我们科技早知道的一个节目里面其实也提到一个观点,
我觉得现在是被印证了,
应该说那个snowflake跟databreaks各方。
点都蛮不一样的,
但是今后几年或者说现在吧,
可能还是说会有很多直接竞争,
呃,
你们会做一些更多的C的support做得更好,
然后他们会派ython的support也会做进去,
那从这个角度上来讲,
其实去年年底的时候有一个activity,
就是你们两家就互相比benchmark这件事情其实让我就想到了20多年前,
当年Oracle跟他的几个预言家对头撒贝也好,
也好,
在当年90年代是属于几家鼎立的那个数据库公司,
感觉每周每个月都在比benchmark,
包括硅谷的101的高速公路上面就会有撒贝斯跟那个Oracle互相比较有趣的在comment的一些广告,
但这两家公司都是让我非常respect的,
就是都是从一个提倡一件事情在开始的时候业界并不认可,
但是你们还是做做到今天这样一个程度,
那我们今天其实聊那个数据已经聊了很多了。
我们有很。
很多的听众是想创业的,
或者做工程师,
或者怎么样,
我觉得你的一些经历其实是可以让他们有些借鉴的,
因为你也在大公司做过,
然后你过去9年时间在创业,
相信你是会有蛮大的一个感悟,
就是说哎,
我们今天有很多工程师在大公司工作,
你会给他们一些什么样的advice?
我觉得从职业的角度来说,
就是没有所谓的究竟一个人应不应该创业的这个呃说法,
我觉得这个其实很看个人创业在绝大多数时候有能上线会稍微高一点,
但是呃也会非常的艰难。
第一个可能就比如说我们2013年的时候,
对吧,
BRI的每个创始人,
我记得我应该每年拿的年薪是8万块钱吧,
那么作为一个berleytSD,
作为一个比较不错的软件工程师,
我觉得去Google或者是Facebook的话非常轻松,
可能这个三四十万在第一年应该挺容易的吧,
然后如果增长比较快的话,
几年之后到上百万美金都不是一个很难的事情,
那么当时我每年大概就拿着8万块钱,
每天大概工作可能是45个小时吧,
那样的强度可能持续了,
我觉得起码有4年吧,
这不是每一个人都能去做到的,
而且比如说你已经有家庭,
你需要负担这个家庭经济支出。
你并没。
哦,
能力去,
比如说以非常低的工资,
所以说你的太太是还是支持你的,
这很重要啊,
对对对,
我的太太也是比较支持我的。
另外一个是就从工作强度上来说,
我觉得你一定要准备好,
因为到时候这个会变成你的一切。
还有我其实是比较反感为了创业而创业的,
你要有能力能够坚持下来,
我觉得你需要有一定的使命感,
世界上有很多不同的问题,
不管是技术的非技术的,
那么很多东西都可以被大量的改善,
如果你觉得那个东西是一个,
你有特别有大的激情去改善这个世界,
在那个方向上的话,
我觉得这是一个比较好的动力,
我觉得这样才可以支撑你多年非常高强度的工作。
然后另外一个是我觉得比较重要的是创业的时候有互补的联合创始人,
呃,
像阿力我们的CEO,
我个人觉得一个公司有founder做这个创始人做CEO的话是一个比较重要的事情。
那么在创始人里头能不能有一个适合做CEO的人,
我在创业之初的时候,
其实最早的时候我就觉得啊,
这个每个人其实最后都应该成为一个CEO,
对吧?
大家都想成为CEO,
但是其实不是每个人都适合做CEO,
也不是每个人都想做CEO,
当你真正碰到那样的职位的时候。
你之前会有些那个不一样的认知,
就是说不是所有的人有能力做CEO,
也不是所有的人有这个想法,
就比如说我觉得好像你是蛮对技术一直是蛮有兴趣,
就是一个创业团队里面需要你这样的人,
但是也需要一个对商业模式、
商业更加敏感的人,
其实一个公司集旦进了规模之后,
很多东西其实是运营跟这个efficiency,
当然很多东西我也去做,
但是我觉得这个对于我来说,
如果作为一个负job的话,
就算我擅长,
也不是一个我最想去做的事情,
所以你需要有人真的会非常有激情的每天看着不同的report。
对对对,
所以说我觉得就是一个你自己的兴趣是非常重要的,
我是非常认可你说的,
不要为了创业而创业,
否则的话,
即使databreaks,
今天390亿估值的一个公司,
也是经过几年暗无天日,
也不知道是不是有希望,
你要支撑这一个,
光是靠想做创业,
这是不够的,
而且我觉得像你们是最初的三年,
其实有的公司这个暗无天日的可能不一定是最初三年,
可能最初三年做的不错,
后面三年做的不怎么样,
所以说这个每个公司都会需要有这样的挑战,
我是非常同意的。
你刚才提到了还有一个观点,
就是不管这个世界怎么发展,
世界上有很多问题都是需要有几个数量级的提高,
如果你能够发现这样一个问题,
然后你是有激情的,
那就很适合,
那你刚才也提到招人这一点啊,
蛮有自己的想法的,
有一个想法就是,
诶,
我那个招人不只是用一个传统的愤怒的想法啊,
你对招人招好的员工是怎么想的?
普通业界绝大多数公司当然都是一个非常单的一个方法,
就是你想像所谓的一个有点像销售一样一个final,
那么在这个最顶的时候呢,
是大家申请漏大家申请,
那么呢,
然后ru或者Harrymanager,
呃,
审核这个简历,
然后审核完之后呢,
开始做电话面试,
电话面试之后做当场的面试,
然后最后做这个有些公司直接把这一部撬掉了,
Offer,
然后negoti,
然后入职,
对吧?
那么我们其实对于大多数,
尤其是对这个leadership来说,
有一个比较特别的过程,
这个其实很像学术界的一个招聘形式,
那么学术界尤其在美国有一个比较就所谓的taual模式嘛,
就教授你一旦进了一个学校,
拿到taual之后,
你就终身制了,
所以当教授们在招新的教授的时候,
他需要考虑的不是说我是不是招一个同事。
他需要考虑是我是不是招一个终身的合作者,
那么这个时候你不希望找到错误的人,
因为学术界的大多数人其实都是可能在比如说其他的导师下面毕业的博士生,
然后呢,
可能做了一些博后啊之类的,
大家做法就是那我们去直接打电话问其他学校的教授,
知名教授,
他们现在有什么新的博士生出来,
这个博士生有什么样的长项,
这个其实占了绝大多数的比重,
那么我们其实是结合了学术界招聘的这个模式,
加上业界普通招聘的模式,
所以比较特别的一点是打比方我想招一个做,
比如说数据库存储的这个T,
或者说一个director,
这个时候呢,
我们会直接问业界我们知道的做这一方面的专家,
然后我们会问他,
那请问你觉得什么样的人最适合这个职位,
给我3个名字,
然后呢,
我会去亲自去联系他们,
然后。
把他们说服进来,
然后每一个一般愿意开始面试的时候,
其实我可能对他已经有非常深的了解了,
我知道这个人比如说是可以写特别多代码,
可能还是特别适合做design的呢,
还是特别这个他的这个personality什么样的,
他会不会比较难共处,
其实基本上我们在其实在面试之前就已经都知道了,
然后面试的时候,
当然我们需要我们自己需要有一定的这个审核来够了解这个人具体因为你也不能说100%去相信其他的的话,
然后结合这些之后再进行我们最后招聘的决定,
第一个你可以招的比较好的人,
因为其实面试来说几个小时对吧,
其他人和这个人共事了几年的话,
可能可以给你带来更大的这个信息,
另外一个是他也比较高效,
因为你不再需要去找,
比如说几百个人来就有一个职位,
你只需要找到几个人,
然后说服他们进来,
在他们进来的时候,
可能已经有百分之七十八十的比例,
这是一个真正合适这个职位的。
其实我觉得这个硅谷其实还是有不少公司,
或者说至少不少公司,
他们的早期也是非常注重推荐制度,
包括当年我们vmGoogle在最开始的几百个,
甚至可能到1000个工程师吧,
也是有大概百分之六十七十都是自我推荐,
但你是把这件事情是做的更加方法论一点了,
因为据说你还是给很多sixasixteenz的那些portfolio公司去做这么一个报告啊,
或者说是教他们怎么去招人是吗?
对对,
而且我们在公司内部细节把这个流程化了,
我觉得大多数因为做ru出身的人其实不是这么考虑的,
那么一个公司在的时候呢,
你一旦你说的流程化是什么意思啊?
呃,
有几个,
第一个是当我对内部给所有的这个engineermanager做这个培训的时候,
我就讲到了,
呃,
你需要考虑,
首先你需要feel什么样的role,
然后带这个road,
呃,
你不是去盲目的找人,
你应该直接。
因问你所有能找到的人,
最适合这个职位的人都是哪些人,
然后你去把他们抓进来,
然后还有的就是我们的,
比如说Henrycommittee里头,
尤其对比较资深的人的话,
会非常的侧重其他人对这个K的评价,
包括我记得最近一两年你也经常给我打电话,
那些人后来怎么样,
应该也是我的不错吧,
对,
就是我们其实内部是有很多数据的,
如果有就是强烈的,
然后很多其实就是我们直接找的其他人问说这个人怎么样的时候,
然后有非常正面的评价的话,
那么这个人会是一个比较成功的人才的,
这个概率是非常非常高的。
就是我们说的来推荐,
因为正面的提供,
那么当然提供的会是面对吧。
那你们那个现在后门的那个reference也已经被流程化了是吗?
我觉得呃,
不是100%必须吧,
但是在很多就是尤其比较资深的人上面,
其实是比较重要的。
我觉得你给不管是给自己内部的那个管理者做培训,
还是给那些其他的硅谷其他公司都做这方面的培训,
不错,
那我最近其实也在给一批firstmanager做一些培训,
就是说他们是本来是GoogleFacebook这样中大型公司的顶尖的技术人才,
然后最近一年成为了职业经理,
相当于这个转型并不是那么容易的,
因为有些人其实还是会碰到一些坑,
我比较好奇,
因为你自己也是创业的,
这一个过程当中也有这么一个转型可以跟大家分享一下,
什么样的坑是比较容易掉进去,
但有什么方法论啊,
或者怎么样的啊,
我觉得这跟公司文化其实有关系啊,
还有跟职位呃有关系,
但是常见的问题,
第一个是因为你做技术为主的时候呢,
你会非常希望做到一些比较影响力大的事情,
而当你作为呃一个管理者的角度来说呢,
最重要的不是。
你的输出,
而是你整个团队的输出,
所以这个时候其实你需要做的很多,
甚至是比如说最无聊的事情,
你应该揽上来,
最后就看的不是你个人输出,
我觉得这是一个很多人转型时候碰到的问题,
因为他们觉得啊,
我怎么感觉好像我自己做的这个东西远没有我以前啊,
每天我干的事情好像只有忘了忘吹一下别人,
然后还有一点就是并不是管理不适合每一个人,
有一些人他如说是一个非常好的这个architect,
非常好的designer,
但是他不擅长去这个,
比如说跟别人说havetoughconversations,
这个时候有两种选择,
第一个是呃,
你硬着头皮做下去,
另外一个是你可以选择,
因为在硅谷我觉得一个比较独特的东西,
现在很多中国的这个公司也是这样子,
就是你有两条不同的路子,
对吧,
你不是说一定要做成管理者。
我个人在这方面转型比较简单,
因为可能因为found的关系,
我一直都需要去,
比如说宣传一个公司啊,
周围angelism嘛,
但是从一个IC变成manager的时候,
你需要有很大的我觉得sell的能力,
这sell不是说你一定要去,
就是卖钱,
对吧,
而是你需要去motivate,
不管是你自己现有的团队,
还是这个未来会来加入你这个团队的人,
那么这个东西很多时候其实变成了一个peopledynamics是需要完全不同的这个处理的方法,
因为人是一个不稳定的系统,
然后计算机程序是个非常稳定的东西,
你知你知道这个我们的在我们公司的一个同事是我们的总裁阿米,
他经常说一句话就是所有的问题对他来说最终就是人的问题,
对对,
其实从manager往上走的时候,
会有一个比较大的,
我觉得是一个变化,
但是一旦有了规模之后,
其实人它又变成一个稳定的系统。
比如说你有几十个人的时候,
你很多需要考虑的时候,
更多是process怎么做,
一个就是流程的设计,
什么样的这个流程可以让更好的达到这个呃效果,
所以那个时候其实更多你可以把整个这个团队当成一个系统,
然后用系统设计或者优化的方法来考虑你怎么样来优化这个,
比如说招聘也是一样,
对吧,
这个recruiting,
我们刚刚说的这个漏洞,
那我说到了你可以怎么样提升这个漏斗的效率呢?
你把最后一步放在第一步,
其实从工程管理的角度上来说,
很多也是一样子。
对,
说起流程,
其实我还想听听你一点的分享,
就是像databreaks,
现在虽然说已经是一个390亿美元估值的公司,
但其实还是一个飞快发展的公司,
包括像我们this啊,
虽然说是已经上市了,
其实还是属于一个hypergrowth发展巨快的一个公司,
在这个时候其实有一个比较有趣的挑战,
就是这个流程。
今天work了,
今天是好的流程,
到了明天或者说呃,
下个月或者说过几个月就变成不好的流程了,
这个流程也是不断的在变化,
你是怎么思考对这个流程变化,
就是怎么去应付那样的一个挑战的,
呃,
我觉得这是一个就是增长的必须的一个事情。
首先如果你有几个人的时候,
公司几个人或者几十个人甚至几百个人的时候,
你不应该把Google的流程拿过来用,
因为Google流程不是为了一个几十个人的公司高效做决策而设计的,
但是你几十个人的时候,
可能你公司的每一个人也都互相认识,
信息流通非常的快,
这个你作为创始人,
或者说作为一个呃工程总监,
你可以非常清晰的知道这个,
呃内部有什么样的问题,
一个design非常简单,
大家都可以看到,
但是等我几百个人的时候,
这已经突破,
这有什么doublestop啊,
反正你突破了这个极限,
你没有办法再看到一切的东西,
这时候你需要一个不同的这个。
流程,
但是从就是流程设计的角度来说呢,
其实我觉得绝大多数公司都是非常不高效的,
因为每所有东西都在变,
就算你公司不增长,
外界环境在变,
客户在变,
所以你为了某一个时间段设计的,
就算当时是最高效的东西,
过了6个月、
一年之后可能就不高效了,
但是你没有可能去把每一个这个缺陷改正,
因为你没有足够多的时间,
就没有一个公司是没有任何的inefficiency的啊,
有时候还有比如说localefficiencyglobalefficiency,
我觉得作为一个管理者,
你需要考虑的其实也跟系统优化一样,
对吧,
你说系统优化,
你说哦,
我要把这个latencybringdown,
你会做什么呢?
你会去找最大的这个bottlene。
然后你去解决它,
然后你去找下一个bobman,
然后去解决它,
其实从管理的角度也是一样的,
就是你需要找到现在来说对于你公司或者对于你这个组织最大的这个呃,
Inefficiency,
然后你想怎么样去解决它,
然后继续下一个包,
继续这样也一个一个的解决过去,
所以另外一个问题就是如果一个人太过。
就是完美主义的话,
其实做管理会有很大的挑战,
因为他会发现这个所有地方都有问题,
那么呃,
他会可能会觉得非常痛苦,
然后稍微难一些的地方,
就是因为可能从这个技术上,
比如说你要查laency这东西,
有非常多的这个instrumentation的方法,
有非常多的系统,
但是从人的角度来说,
你要去怎么debug这个不同的这个究竟什么地方布这个呢?
这是我觉得就需要有很多的这个oneononeSKleveloneonone需要去了解,
然后你需要有好的这个我觉得judgment的人,
然后你把他们的这个不同的,
我觉得在不同位置的人的这个信息都综合起来之后,
你可以做一个呃,
我觉得ization的决定。
对,
我们今天其实聊了很多话题,
但其实主要是两个方向,
一个就是从一个数据这个产业,
Databreaks是数据产业里面的一个龙头吧,
龙头之一,
至少从一个完全是从营业额来讲,
还不是最大的一几个,
但是我觉得是今后10年data属于这批公司当中比较优秀的,
然后你们这一路走来的一些经历分享了一下,
我觉得非常好。
另外一个其实是你个人的,
不管是对创业,
对职场的一些看法,
对一些方法论的一些看法,
呃,
我觉得是也是很不错的,
那我们最后在就是其实把这两个这几件事情都串起来,
就就我想问一个问题,
现在不管是在美国还是全球各地,
还是中国,
我们有很多也是国内的听众,
有可能他们现在是在做工程师,
大公司做,
但有可能想创业,
或者说现在已经在一个创业公司里面了,
那我们就讲一个具体的问题,
你看即使是数据这个行业。
啊,
我们前两天也聊了,
感觉就是至少是已经是几百,
说不定几千个公司,
数据公司在那边了啊,
我有几个问题啊,
一个是需不需要那么多几百个,
几千个公司,
然后对于一些可能现在还在职场早期的吧,
我们就说reynoldtenyearsago,
十年前的reynold,
对你你是希望,
诶我是那个希望今后做出一点什么成绩来,
嗯,
你会给他一些什么样的advice,
我觉得这两个问题啊,
不完全一样,
但是有一一丁点的联系。
第一个问题,
我觉得虽然可能是大数据大家已经说了很久了,
现在可能已经不新这个词了,
然后现在更新的说AI跟machinelearning对吧,
但是我觉得总体来说,
从数据AImachinelearning角度来说,
这还是一个比较早期的,
整个业界都其实比较早,
呃,
很多产品都不是很成熟,
我说一个很简单的例子,
你要去这个,
比如说monitor,
你的data,
然后当你data出现。
这个比如说异常的时候给你发封邮件,
这是一个非常难做到的事情,
在现在啊,
所以我觉得有很多很多的公司呢,
我觉得这只能代表说现在有很多很多的机会,
从历史上的角度来说,
那么一个常见的这个pattern,
这就是你会一个比如说一个新兴的这个方向,
会有非常非常多的公司,
那么慢慢慢慢的随着这个方向越来越成熟,
会有很多的这个consolidation,
对吧,
比如说小公司会被买掉,
因为他们的这个可能针对的实在是太。
呃,
专业了,
有些其他原因,
是因为你两个公司会有非常大的synerg,
然后会被合并,
所以我觉得短期来说我们会见到更多的,
在接下来几年会见到更多跟数据,
跟这个机器学习相关的公司,
然后从十年的角度来说呢,
我觉得会少掉很多,
我前两天也跟你就开玩笑的说,
你问我说为什么有这么多公司,
说我说在groupon在美国一家独大之前,
在中国有5000多家这个groupon的这个竞争对手,
所以我觉得类似的,
当然我觉得其实数据跟AI是比groupon是一个要大很多很多的一个市场,
而且是一个高利润的市场,
因为它是一个纯软件的东西,
不需要有线下这个规模,
所以可能会有更多的公司,
但总体来说我觉得是会。
就是往上,
然后会慢慢慢慢往下,
随着这个业界越来越成熟,
所以从一个长期的角度来讲,
我们这个in不需要几百几千家做数据的,
但是从一个短期来讲,
这些公司从各个层面跳出来,
你觉得还是,
呃,
至少不少公司还是解决一些当前蛮有必要的,
包括你刚才提到的dataobserve,
这个data是不是有DRFT,
有没有对那个你做AImodel有没有影响,
其实你并不知道你怎么去能够系统性的能够去了解是不是数据有些变化,
其实这些都是一些呃,
没有解决的啊问题,
对,
但我个人认为,
就比如说那个例子,
可能觉得哇,
为什么连这样都做不到,
就想起来还这感觉是一个非常简单的事情,
所以我觉得会有很多这样的公司,
但长远来说,
这些公司我觉得很难做为一个独立存在的公司,
因为它这实在是一个太细的一块,
而且会更多的需要依赖于一个,
所以说你的意思是说他们以后都会是databreaks里面的一个。
Feature,
它不一定是的一个feature,
但他肯定需要是一个更大的平台的一个feature,
这不代表这些公司会失败,
会失败,
因为很可能会,
比如说是非常大的股资,
是很可能是这个,
嗯,
并购,
对对,
我有一个朋友,
我记得很清楚疫情,
两年前一段时间一看那个已经是很多人了,
现在已经是一个独角兽了啊,
就是做你刚才说的那些dataobsability那那一块的啊,
确实是那个,
那再讲讲就是说,
诶那个觉得中国做一个,
呃,
Databreaks有没有机会,
我觉得随着现在的国际大关系,
未来趋势可能是有更大的分裂,
对吧?
所以从这个角度来说,
其实很多美国的厂商,
企业软件,
我觉得在中国可能都需要有本土化的这个公司,
但是我觉得有一点我不是很确定的,
就是这个,
呃,
商业模式上,
因为在美国SaaS其实是一个非常。
已经被验证了,
商业模式在中国sa不完全,
尤其是如果往下走到数据这一块的话,
不是一个完全已经被验证了。
我个人感觉从未来的角度来说,
这是一个历史的所趋吧,
但是很难说究竟像我刚刚说历史究竟是20年之后到来呢,
还是3年之后到来,
还是5年之后到来,
所以有一些大环境上的东西,
这个我不太好预测,
但是我觉得长远上来说的话应该是,
呃,
应该是会有。
你有什么last可以给我们听众讲的,
我觉得就是还是要做自己有兴趣,
有刚刚说的这个passion东西吧,
因为只有这样子你才可以,
呃,
当然如果运气特别好,
天上一直往上你头上掉,
你往你面前掉钱的话,
那么你不需要听我的任何话,
但是呃,
我觉得呃做一切事情,
如果第一个我觉得可能持久比较重要,
不管你是创业还是在一个公司里头做一个项目,
我觉得一个东西要从零做到成功,
或者说从这个1做到100,
这需要很长时间的事情,
然后这里头一定不是一个一直一帆风顺,
呃每天都很开心的事情,
所以你需要有一定的这个激情,
然后能够确保你自己能够这个支持下去,
然后呃,
也不要太容易放弃啊,
我觉得这个可能是最后比较重要的事情,
我在dailyBRI,
其实内部我们招聘的时候,
我们也说我们希望我们不希望jober。
因为我们希我们不希望这个员工,
比如说碰到一个这个困难处者说碰到一件这个不开心的事情就直接离职了,
因为这样非常难做出真正的成绩啊,
需要有这个impact的话,
不管是创业还是这个在公司内部,
我觉得都需要有一定的这个,
呃,
持之以恒跟这个啊,
或者兴趣或者激情,
其实说穿了就是不管是创业还是做任何事情啊,
没有什么太多赚快钱的,
然后看一个自己认可的方向,
我觉得你们是坚持了,
就像你最开始说的那个公司创始的时候有一个cloud,
对吧,
不做本地部署,
做那个云部署啊,
第二个是给数据工程师,
呃,
提供那个价值啊,
那一块是新兴的一个一个产业吧,
相当于,
然后还有一个不做定制,
坚持不做定制,
做一个产品,
这都是需要有一个,
呃,
长期的才能够看到今天390亿美元这么一个估值的公司,
如果是当初是赚点快钱做一些定制,
你当。
初试可能前两年能够啊营收不错,
但是今天不一定,
或者说很可能不一定那么成功,
但同时我觉得就是啊,
这个大的方向看准了以后,
其实还是有一些小的地方你做不断的,
不管是我们前面说的方法论对吧,
招聘还是企业流程的那个方法论不断的引进,
而且其实还是有一些大的啊决定你也是在看市场,
也是在变化,
包括你们从一个自下而上到一个自上而下的一个销售途径,
其实这就是一个看了市场,
然后去被市场打脸以后去去做的一个变化。
还有一个像开源对吧,
就是一开始认为开源就我们是开源,
这个Spark的老大,
是一个行家,
人家会来付钱,
但后来发现诶,
并不是这样子的,
然后从本质的问题去看,
那你们到底在这个开源的Spark上面能够提供一些什么样的价值,
是一些大厂,
包括亚马逊这样的大厂都很难,
或者说是今天。
他们当时候的,
呃,
那个基础是比较难去跟你们竞争匹配的时候啊,
去去做这些事情,
所以说我是觉得啊,
分享这些东西对我们啊,
那么多的想创业的,
可能创业的啊,
或者是正在一些公司做开源的闭园的啊,
那些公司的那些工程师也好,
或者说是那个做管理者也好,
其实都是有很大借鉴,
所以说谢谢你的时间,
好的好,
谢谢,
再见,
OK,
拜拜,
这期沃next科技早知道就到这里了,
听完之后如果你有任何的想法,
欢迎在评论区里面给我们留言,
我们每一条都会认真的看,
如果你喜欢我们的节目,
请记得给我们五星或者好评,
分享给更多的朋友,
也会对我们非常有帮助。
你也可以单独写邮件给我,
邮箱地址是听tingat生点,
我都会一一回复,
那同时公众号和微博也可以。
搜索生的活泼声是声音的声,
节目相关的更多信息会在公众号里出现,
微博和公众号都会有不定期的福利给到大家。
如果你想要跟我们更加紧密的讨论和分享,
或者想要认识和你一样有求知欲的新朋友,
可以加入我们的微信群。
进入听众群的方法是在公众号文章中扫码添加,
或者是公众号后台回复科技早知道即可获取邀请码,
期待你的加入,
我们下期见。
展开显示全部歌词
上一首歌:再一次见面MP3下载
下一首歌:今生劫换来生缘(串烧慢版)MP3下载
热门歌手
王菲 周杰伦 周深 海来阿木 半吨兄弟 李荣浩 林俊杰 凤凰传奇 魏佳艺 程响 怪阿姨 陈奕迅 G.E.M.邓紫棋 薛之谦 张学友 小阿枫 刘德华 Beyond 汪苏泷 张韶涵
其他人正在听的歌
慢慢喜欢你(R&B氛围男版) 我期待的不是你&Dr.Phonk
慢慢喜欢你(r&b) 白慕寒
慢慢喜欢你(微醺版) 苏晚星
慢慢喜欢你(烟嗓女版) Dr.Phonk&阳之忻
慢慢喜欢你(r&b) 白慕寒&冷若汐
电台情歌(R&B版) 梦境里的算法official&大头钉
忽然之间(RNB版) 李清和
忽然之间(R&B版) Ami
忽然之间 烟大叔
忽然之间 (热播) 琉璃之夏abc
STYX HELIX MYTH & ROID
网站地图 RSS地图 百度地图 360地图 头条地图
声明:本站不存储任何音频数据,站内歌曲来自搜索引擎,如有侵犯版权请及时联系我们,我们将在第一时间处理!
下载FLAC音乐网 桂ICP备xxxxxxxx 版权投诉 请联系我们 liukaymail#foxmail.com