本字幕由TME AI技术生成
大家好
今天我们要介绍的是一本叫做大数据时代的书
副标题
生活 工作
思想都发生了巨大的变化
众所周知
流感病毒传播速度快
传染性强
处理起来非常麻烦
往往会在短时间内夺去无数人的生命
但是
很长一段时间以来
卫生部门只能事后控制
一旦发现了疫情
就会采取措施
隔离病人
研发相应的疫苗
总之
人类的速度似乎比病毒慢了一拍
然而
作为世界上最大的互联网公司
谷歌却做出了一个出人意料的举动
他们比卫生部门更早的预测到了流感爆发
怎么会这样
原来
谷歌作为全球最大的搜索引擎
拥有多年的搜索记录
每天收集三十亿一条搜索指令
正是这些记录使得预测成为可能
谷歌科技人员对二零零三年至二零零八年间的所有搜索记录进行了整理
发现人们在流感爆发前经常搜索诸如咳嗽
发烧等关键词
在二零零九年
这些关键词又集中出现
因此他们推测另一场流感即将来临
而事实也确实如此
嗯
从这一点来看
预测工作似乎很简单
为什么以前没人这么做呢
最难的是
想要准确的预测
必须要有足够的数据才行
在这方面
几乎没有任何机构能够与谷歌相提并论
谷歌所使用的这项技术被称为大数据
相信大家对大数据已经非常熟悉了
从科技文献到国家发展规划
都提到了大数据
那么大数据是什么
它的应用将带来哪些变化和挑战
今天这本大数据时代的书就是要回答这些问题的
其中一位是维克托
迈尔
舍恩伯格
现任牛津大学因特网研究中心教授
早在二零一零年
他发表了一系列有关大数据的专题文章
在业界引起很大反响
经济学家们也称赞他在大数据领域具有权威的发言者
同时
维克托也是大数据商业应用的重要推手
微软 惠普
IBM等知名科技公司都曾向他咨询过这个时代的发展战略
而现在
维克托已经实现了很多关于大数据应用的预言
这也是业界将其称为大数据时代的先知
这本书的另一位作者名叫肯尼斯
库克耶
是经济学家杂志的资深编辑
常年负责科技创新
在TED大会上也是一位很受欢迎的演讲者
今天我们要介绍的这本书
可以说是了解大数据的必读之作
它能让外行人了解到大数据将会给这个世界带来怎样的变化
在谈到大数据的影响之前
我们先来谈一下大数据最重要的两个特点
第一点
就像它的名字一样
海量的数据
在过去的十多年里
人们通过新技术制造出了越来越多的信息
仅仅一个搜索引擎就能处理数十亿个词条
那么今天有多少信息呢
公元前三世纪
埃及的一位国王为了建立亚历山大图书馆
花费了毕生的精力
而现在
地球上每个人的数据量大概相当于三百二十个亚历山大图书馆
大家都说
量便引起质变
数据爆炸式的增长
使得我们在数据应用方面也有了质的飞跃
第二
大数据的核心功能是对未来的预测
刚才提到的谷歌预测流感数据就是一个例子
再比如
如果我们能够收集到人们过马路的速度
以及他们不遵守交通信号灯的次数
并将这些数据应用到自动驾驶汽车上
那么他就能知道哪里该减速
哪里该加速
总之
大数据专家的工作就是从海量数据中看出人们的行为模式
从而预测未来
那么
这项技术将带来怎样的变化呢
嗯
维克托教授相信
第一
大数据将改变人们对数据的看法
第二
数据将成为商业领域新的价值源泉
催生了大量新兴的大数据企业
第三
随着大数据应用的不断深入
一些问题和威胁会在我们的生活和社会生活中产生
首先
让我们看看人们如何看待数据
作者这里所指的人
主要是指数据研究者
因为大数据的出现
直接改变了他们的工作方式
其中最明显的变化之一
就是他们开始学习如何处理大量的数据
而不再是单独的样本数据
这意味着什么
当我们谈到大数据时
其实隐含着一个小数据的对比
小数据技术中最典型的例子就是我们高中时学过的随机抽样
举个例子
如果想知道同一批生产的方便面是否安全
我们并没有把每一包都拆下来
嗯嗯
而是由质检人员随机抽查一部分产品
如果这批样品是合格的
那就是全部合格
再举个例子
电信公司如果想了解客户的使用习惯
通常不会一个一个的打电话
而是制作一个问卷
随机访问一批用户
最后根据问卷调查结果得出结论
小数据是一种很流行的调查方法
因为他不需要花费太多的时间和金钱
只需要使用部分数据
就可以相对准确的掌握整体状况
只要数据具有足够的随机性
人们就能放心使用
与之形成鲜明对比的是大数据时代
人们不再需要随机抽样
而是可以把所有的数据都用上
在小数据时代
样本是数据的一部分
而在大数据时代
样本就是所有数据
比方说
谷歌预测流感的时候
使用的是全球范围内的搜索结果
而非随机时间和地区数据
其次
随着数据量的增加
研究者必须学会接受模糊性
在小数据时代
数据是非常稀少的
稍有偏差就有可能导致结论的严重偏差
因此数据的精确性要求非常高
至于大数据
因为数据量太大
所以不能保证每一个数据都是准确的
但是反过来想一想
如果我们拥有十万个数据
即使其中一百个数据有误
也不会有太大的影响
举个例子
如果你想知道你的心跳是否正常
可以去医院做检查
用精密仪器测量
这个时候
机器必须要保持灵敏
医生们必须全神贯注的记录数据
才能保证数据的可靠性
但是
可穿戴设备的出现
为我们提供了另外一种选择
比如智能手表
它还能记录心跳和全天候
到了这个时候
我们手上的数据已经足够多了
就算设备出现故障
或者数据不准确
也不会影响到最终的结果
最后
在大数据时代
研究人员不再执着于数据之间的因果关系
而是关注事物之间的关系
在小数据思维中
如果AB这两种现象经常同时出现
那么我们就要思考为什么他们同时发生
以及他们背后的原因是什么
然后他们会收集样本来验证这个猜想
但是大数据就不一样了
直接调出全部数据
看看在什么情况下
甲和乙会同时出现
这样可以预测下一次甲和乙出现的场景
简单的说
小数据的目的在于回答为什么
而大数据仅仅解决了什么
美国连锁超市巨头沃尔玛拥有庞大的数据库
该数据库不仅记录顾客的消费额度和消费内容
还包括购买日期
甚至天气情况
通过对数据的分析
沃尔玛发现
在台风来临之前
除了应急手电筒的销量会增加之外
顾客们还喜欢买一种蛋糕
为什么顾客更喜欢买蛋糕而非其他食品
沃尔玛对此毫不关心
对他们而言
这种联系本身就更重要了
之后
每年台风来临前
超市里都会把这种蛋糕和手电筒放在一起
果然销量大增
让我们对第一部分进行总结
大数据与小数据相关
小数据通过随机抽样获得少量精确数据
从而了解现象背后的因果关系
至于大数据
那就是纸面上的数据了
虽然单个数据可能会有一些偏差
但是通过大量数据
我们可以看到事物的全貌
并从中找出他们之间的联系
如果这些想法听起来很抽象的话
那么大数据对商业世界的影响却是巨大的
维克托教授指出
数数据本身已经成为一种具有巨大商业价值的新资源
相信很多人对信息技术并不陌生
但人们更关心的是科技
认为科技的进步会带来经济的增长
直到有了大数据
人们才意识到
信息也是很有价值的
当然
并不是所有的信息都是有价值的
这是什么意思啊
我们可以举个例子
想象一下
如果有一台电子阅读器
我们就可以不用买任何纸质书
就可以把书里的内容数字化
此外
该机器还能记录用户阅读某本书所需的时间
你在哪个部分停留多久
读过多少同类型的书
这就是量化用户行为量化结果就是数据
别小看了这些数据
这是一笔不小的利润
比如说
出版社可以根据阅读器提供的数据来改进文本内容
如果读者在某一部分停留的时间特别长
那就说明大家都很喜欢这样的内容
出版界允许作家迎合大众的喜好
写出更多的作品
从而提高销量
反过来
如果读者只是简单的跳过某一部分
那么出版社可以告诉作者
这样的内容应该少写
以免影响销量
由此我们可以看到
数据已经成为能够影响商业决策的商品
在维克多教授看来
这只是大数据应用的冰山一角
第一个玩法就是利用大数据
同样的数据放在其他场景中
效果会完全不同
比如沃尔玛超市
商品销售数据原本是用来管理仓库的
但当我们重新组合后
发现蛋糕销售与天气有关系
再举个例子
为了保证准确度
谷歌地图会定期派警车去各个街道拍摄街景
收集位置信息
这段时间里
它已经收集到了大量路面数据
后来谷歌开始研发无人驾驶汽车
这个时候
这些数据又派上了用场
为什么谷歌能够领先于无人驾驶的发展
这就是道理
第二个游戏就是重新整合数据
有的时候
有些数据只有和其他数据结合起来才能发挥作用
丹麦癌症协会于二零一一年发表了一篇文章
指出
使用手机并不会增加患癌症的几率
丹麦人早在一九八五年就开始使用手机
几十年来留下了大量的用户信息
包括手机使用频率
时长等
同时
丹麦医疗机构将全国范围内的癌症病人资料全部记录在案
也研究者以此为起点
调出一九九零至二零零七年间的两组数据
试图找出两者之间的关联
他们想知道
使用手机的人是否比不使用手机的人更容易得癌症
使用手机的人患癌症的几率会增加吗
但数据显示
两者之间似乎并没有什么联系
这个实验中使用的两组数据是很早以前产生的
但是为了验证医学上的猜想
研究者们激活了它
重新整合
给了我们新的灵感
第三
就是那些看似无用的数据
也有可能被有心人开发出来
行业中有一种叫数据废弃的术语
指的是人们在上网时产生的一种副产品
包括我们停留在页面上的时间
鼠标停留的位置
输入的字等等
这些行为在互联网公司的后台都能看得一清二楚
可是这玩意儿能干嘛
比如搜索引擎就可以通过废弃的数据优化搜索结果
在搜索过程中
我们经常会碰到这样的情况
点击页面上有关键字
但是却找不到想要的东西
对于搜索引擎公司来说
这是绝对不能发生的事情
员果没有大数据技术的帮助
员工必须亲自点击每一个链接
检查内容是否与关电磁相符
一旦数据被废弃
只需要监控特定数据即可
比如点击次数最多的页面
以及点击后退出的时间
如果大家都点到同一个页面
却没有马上退出
那就说明这个页面是大家想要的
应该把它放在搜索结果的最前面
当然
那些擅长大数据的公司也会有各种各样的玩法
下面让我们看看美国亚马逊如何利用大数据技术销售图书
在美国
亚马逊是第一家在线书店
一开始
公司聘请专业的书评人员
通过专家的推荐引导读者购买
后来
来亚马逊的杰夫
贝索斯想出了一种省钱又省力的办法
有这样的想法也是正常的
因为每个在亚马逊购物的人都会留下很多痕迹
比如他们买了什么书
放进购物车里却没下订单
这些记录在后台都能看得清清楚楚
所以
亚马逊从顾客开始
推荐同一种商品
这是第一种数据玩法
利用普通的销售数据
可是结果却是惨不忍睹
推荐和推荐都是一样的
用户完全不买账
后来他们改变了思路
决定从商品入手
追踪所有商品之间的联系
这才是数据的第二种玩法
重新整和看似无关的数据
看看能否找到新的关联
比如系统发现
购买海明威小说的人
往往都会选择购买迪更斯的作品
因此亚马逊调整了自己的推文逻辑
当你买了老人与海的时候
你会推荐双城记
而非哈利波特
系统并不知道顾客为什么会有这样的消费习惯
不过他要做的事情很简单
那就是把所有商品的搭配都看一遍
然后推给读者
这个算法的确让营业额有了很大的提升
最终
亚马逊公司放弃了人工建树
当然
亚马逊也不会放过这些看似无用的数据
他们的网站会二十四小时记录用户的活动
包括停留时间
是否查看评论等等
并利用这些废品改进网页设计
比如说
用户在某一页上停留很长时间
那么它一定有什么吸引人的地方
可以在以后的设计中使用
事实上
亚马逊网站的布局
颜色以及其他的设计
都是经过反复测试的
既然有了新的玩法
那么新的大数据公司也就呼之欲出了
大体上有三种大数据公司
一种是处于信息流上游的大数据公司
拥有庞大的数据库
以各种社交网站为代表
第二类公司没有数据
但是拥有先进的数据处理技术
例如咨询公司
第三类是拥有大数据思维的公司
他们既没有数据
也没有技术
却善于发现数据的潜在价值
能够提出可以变现的点子
有些企业是三者的结合体
比如谷歌
比如谷歌
比如亚马逊
比如中国阿里巴巴
比如百度
比如腾讯
值得一提的是
这些互联网巨头在大数据时代的优势
他们的核心竞争力就在于活跃用户带来的海量数据
让我们来总结一下
信息时代
数据将会是一个新的近况
我们可以在不同角度反复使用同一组数据
而且只要脑洞足够大
那些看似无用的数据说不定就会有意想不到的价值
这就是大数据改变商业世界的秘密所在
然后就出现了大数据公司
这些大数据公司要么掌握了数据
要么拥有分析技术
要么拥有大数据思维
大克托教授坚信
只有数据才能赢得市场
可是
凡事都有两面性
在描绘大数据美好未来的同时
维克托教授也没有忘记提醒我们大数据带来的危险
总之
我们必须注意以下三大威胁
一是隐暴露
二是过度预测
三是迷信数据
首先
让我们谈谈大数据对隐私的威胁
一般来说
商业公司在使用用户信息时
都会有特定的目的
并征得用户的同意
比如我们在使用网络服务之前
就会看到大量的服务协议
上面会告诉你数据的用途
因司在使用数据时会保护用户的隐私等
但大数据技术的出现
给传统带来了极大的冲击
因为大数据应用的特点
无心插柳柳成荫
很多公司在得到数据的时候
都不知道自己以后会用到什么地方
所以都会拿着这些数据去做实验
试图挖掘出这些数据的价值和隐私
法律规定
一旦企业使用用户数据
就必须与用户重新签订协议
但是对于企业来说
这是一项费时费力
几乎无法完成的任务
比方说
在预测流感方面
谷歌使用了数亿用户搜索词条
但是他能去问这些人吗
不太可能
怎么办
不需要许可直接使用
因此
我们面临一个两难的选择
一方面
互联网企业通过大数据技术为人们提供便捷
个性化的服务
但是另一方面
我们每买一件东西
每一次旅行都要花掉很多钱
我们吃的每一顿饭都会暴露
我们把私人信息留在网上
却不知道他们会做什么
这些数据可能会被出售给广告商
帮助他们准确的投放广告
这也是为什么当我们打开网页时
看到的都是定制的广告
而且是相对无害的
可是一旦网络公司的数据泄露
或者是黑客入侵
那么我们的行为习惯就会暴露
后果不堪设想
说完隐私
再来看第二个大数据带来的麻烦
预测过度
我们都知道
大数据的核心功能是预测
那么它是否可以预测犯罪行为没问题
比如美国一些城市的警方通过大量的数据分析发现
在某些特定事件发生前后
犯罪率都会有所上升
他们根据这些规律安排警力
效果非常不错
可是用这种方法去预测一个人是否犯罪
却是有问题的
因为这是把整体趋势强行套用到个人身上
正如维克托教授所言过度预测一样
一位来自美国宾夕法尼亚大学的教授建立了一个大数据模型
可以预测被释放的囚犯是否会再次犯罪
通过大量的数据输入
可以计算出罪犯的年龄
犯罪原因
入狱时间等等
准确率达到了百分之七十五
但问题是
假设一个人在预测到犯罪的时候
确实是犯了罪
但在他真正动手之前
我们能不能用算法把他抓起来
这样做虽然省事
但是却等于是惩罚了一个人
这明显违背了法律的精神
很有可能会被冤枉
况且
既然数据能够准确预测人们的行为
那我们还有其他选择吗
因此
过度预测也会彻底的否定我们作为人的自由意志
说起来
这只是科幻小说里才会出现的事情
比如说保险精算师
根据大数据发现
五十岁以上
男性患前列腺癌的几率更大
如果你不幸在这个范围内
即便你没有患过这种病
也要支付更多的保险费
这只是一种过度预测
但后果并不严重
最后
我们再来谈第三个大数据带来的麻烦
数据迷信
不知不觉
大数据已经渗透到我们生活的各个方面
在这个过程当中
很多人都变得非常依赖数据
甚至是迷信
即使结果与常理不符
举个例子
最近几年穿戴设备很流行
很多人都会用智能手环来测试睡眠质量
嗯
手环会记录我们的生理数据
比如心跳速度
睡眠时间等等
但是这样的计算难免会出现一些误差
睡觉时给个差评
尽管如此
仍然有许多人坚信数据不会说谎
放弃自己的感觉
并对糟糕的数据结果产生怀疑
言归正传
如果现在国内爆发了流感
情况非常危急
卫生部门必须马上确定主要发病区域和人群
然后隔离
或许有人会想
既然大大数据可以提供准确的信息
那么政府应该和搜索引擎公司合作
找到那些正在搜索流感症状的人
然后送到隔离病房里
这不是解决问题的办法吗
但实际上
这种做法存在着极大的问题
因为大数据的模糊不清
所以那些被隔离的人可能只是听到邻居打喷嚏
然后上网查了一下预防流感的相关信息
如此一来
大数据不仅帮不上忙
反而会帮上忙
麻烦就大了
总之
大数据的出现
给社会治理带来了巨大的挑战
谈到大数据
我们不仅要关注数据带来的利益
还要关注数据引发的问题
以及如何解决这些问题
但不管是好是坏
大到大数据
小到精准的广告
大到国家政策的制定
可以说
大数据在我们看不到的地方发挥了巨大的作用
不过正如维克托教授所言
数据本身就是一座漂浮在海洋里的冰山
一眼望去
只能看到冰山的冰面
而绝大部分都隐藏在冰山之下
随着计算机技术的不断更新和更新换代
未来的大数据将会带来怎样的创新应用
也许时间会告诉我们