最具影响力的数字化技术在线社区

168大数据

 找回密码
 立即注册

QQ登录

只需一步,快速开始

1 2 3 4 5
打印 上一主题 下一主题
开启左侧

我理解的大数据,以高一个维度的视角毫不讲道理的直捣黄龙

[复制链接]
跳转到指定楼层
楼主
发表于 2014-12-2 20:58:32 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式

马上注册,结交更多数据大咖,获取更多知识干货,轻松玩转大数据

您需要 登录 才可以下载或查看,没有帐号?立即注册

x
编者按:本文来自道哥的黑板报,微信ID:taosay,原文是分为两天撰写完成的,为了大家的阅读方面,我们一次性整合在一篇文章了,推荐大家关注作者的微信号。
(一)
很久前就想写一篇关于大数据的文章,但总是因为觉得自己功力不够所以迟迟不敢动笔。再到后来发现大数据的概念已经烂大街了,现在只要是个做产品的,收了点用户数据,就敢把自己叫大数据,似乎不这么说的产品都是非主流了。
我也不想老生常谈的讲数据到底要多大才能称得上大数据,因为这似乎只是一个相对的值。我也不想讲大数据应该搞多么牛B和复杂的算法,因为似乎一二十年前大学计算机课本里的《机器学习》就一直在讲这些东西,很久前互联网上就在用贝叶斯算法过滤垃圾邮件了,今天看起来也没有什么本质的改进。
后来我琢磨了很久,发现大家讲的大数据其实没有什么特别的,就是数据特别多,再加上点算法分析,就能叫自己大数据了。每当这种时候我就会怀疑是不是自己出了问题,因为别人都讲的挺来劲的啊?
但真要说有什么特别的,我觉得还是有的,只是不知道其他人的想法是否和我一样。我认为的大数据,是一种思想的改变,是一种不一样的观察这个世界的角度。因为数据化让我们看到了事物的整体,所以我们看问题也从局部变成全局了,这会让我们面对同样的问题时,比过去要高效很多。
举个简单的例子,围棋这个游戏,是典型的「a minute to learn,a lifetime to master」。初学者和职业棋手之间的差距,不仅在于天赋和经验。对于围棋的初学者来说,熟悉规则后,下棋的过程是跟着感觉,爱怎么走就怎么走。但是真正的职业棋手不是这么下的,他们每天都会做大量的死活题,在他们的脑海里,因为记忆了几万道死活棋型,以及很多定式和手筋,所以面对初学者时,基本上能够做到出现什么局面,都有对应的一种应对方法。
职业棋手已经可以做到部分穷举棋盘上的变化,所以面对初学者时,就像一个高维度的智慧体面对低维度的智慧体一样轻松。这种对棋盘变化的穷举和记忆,我认为就是大数据。
同样的,在电影「中国合伙人」里有这么一个片段:新梦想(新东方原型)面对美国人的起诉,美国人认为中国学生作弊了,他们不可能考出那么高的分。此时成东青(俞敏洪原型)拿起了一本书,让对方随意翻到某一页,他就能把那页的内容背诵出来 — 这是在来时的飞机上闲的蛋疼就把那本书给背了 — 美国人都看傻了。美国人可能永远都无法想中国学生在面对GRE考试时居然会采用背字典这样的笨办法。
像这种背字典、大量题海战术的方式,我认为也是大数据。这样的方式背后的付出是艰辛的,数据量和「计算量」都很大,不会背字典和题库的美国学生当然会考不过中国学生了。
所以,我认为大数据最终带给我们的,是一种全新的思考方式。一方面我们看问题的角度从局部扩展到了整体,今天的计算能力已经足够支撑我们去看到事物的全部;另一方面,我们又可以根据这种思路,去创造和收集过去被我们忽视的数据。
大数据,不仅仅是大而已。
(二)
昨天偷懒了少了一次文字排版,没想到好多朋友发消息来说字体变小了不习惯,看来坚持大一点的字体还是有好处的。
虽然很想保持高频率更新,但没想到回阿里后工作竟然比创业时还忙。经常回家得比较晚,再加上每天脑力使用过度,所以竟是硬生生的断更了两周。在接下来我想如果可能的话,把更新的时间调整到周日的晚上,周末可能会稍微空闲点。
在此也再征集一下大家想看的话题,可以向我提问,我会选取部分作为接下来文章的选题。
延伸一下昨天关于大数据的话题。在安全行业里未来真正会具备核心竞争力的,我认为正是这样的全局视角带来的改变。
比如近年来兴起的「撞库」攻击。因为各大公司用户数据的泄露,黑客手上已经拥有了数十亿条用户数据,其中20%包含了明文密码。在过去黑客想破解一个用户的密码,可能会通过字符的排列组合生成一部字典,逐个尝试,这样破解的效率无疑是相当低的。但现在因为有了全网用户的「密码库」,只需要简单的查询用户名,多半就能知道密码是什么,简单粗暴。
大数据就应该这么简单粗暴的应用,以一种完全不讲道理的方式直接达到效果,根本不需要什么精巧的算法,就像「把大象装进冰箱」里一样。
类似的,国外一家安全公司Akamai宣称他们能非常有效的阻断DDoS攻击,原因是他们通过和运营商合作的方式获取了全球30%左右的流量,从而能有效的监控到全球所有的恶意IP,发现有攻击过来,直接根据IP信息就阻断了。这也是大数据的一种典型应用。
再举一个例子,数据可能来自于过去没有注意到的地方。对于电话诈骗的传统解决思路,一般是从用户的来电号码着手,或者是从周边信息比如短信、传播来源入手。这些传统方法已经逐渐的变得效率低下。但目前有一种解决思路是根据用户的「声纹」信息进行有效识别,这样只要积累了一个用户的「声纹信息库」,就能够在每个用户通话时,直接识别出被标记为诈骗的那个用户。
所谓「声纹」就像是指纹信息一样,每个人说话的声音其实都是独一无二的,通过数字化的方法能够有效的识别出来。目前国外一些安全公司会把这种技术用在Call Center中进行反欺诈。但声纹信息和指纹信息一样,会成为国家安全基础设施的一部分。比如国外的一些机构,一旦掌握了所有中国人,包括政府领导人的指纹信息,会酿成什么后果很难想象。这也是为什么中国政府的工作人员会禁用苹果手机的原因,至少苹果收集用户的指纹信息会威胁到国家安全。
所以,我理解的大数据,和各种复杂的算法没有直接关系,那最多只是锦上添花。我理解的大数据,就是这么简单粗暴,以高一个维度的视角毫不讲道理的直捣黄龙。
两点之间什么最短?在二维空间是直线最短。但到了三维空间,两点之间距离可以为零(虫洞),比如把一张纸上的两点对折后贴起来。


楼主热帖
分享到:  QQ好友和群QQ好友和群 QQ空间QQ空间 腾讯微博腾讯微博 腾讯朋友腾讯朋友
收藏收藏 转播转播 分享分享 分享淘帖 赞 踩

168大数据 - 论坛版权1.本主题所有言论和图片纯属网友个人见解,与本站立场无关
2.本站所有主题由网友自行投稿发布。若为首发或独家,该帖子作者与168大数据享有帖子相关版权。
3.其他单位或个人使用、转载或引用本文时必须同时征得该帖子作者和168大数据的同意,并添加本文出处。
4.本站所收集的部分公开资料来源于网络,转载目的在于传递价值及用于交流学习,并不代表本站赞同其观点和对其真实性负责,也不构成任何其他建议。
5.任何通过此网页连接而得到的资讯、产品及服务,本站概不负责,亦不负任何法律责任。
6.本站遵循行业规范,任何转载的稿件都会明确标注作者和来源,若标注有误或遗漏而侵犯到任何版权问题,请尽快告知,本站将及时删除。
7.168大数据管理员和版主有权不事先通知发贴者而删除本文。

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关闭

站长推荐上一条 /1 下一条

关于我们|小黑屋|Archiver|168大数据 ( 京ICP备14035423号|申请友情链接

GMT+8, 2024-5-5 04:23

Powered by BI168大数据社区

© 2012-2014 168大数据

快速回复 返回顶部 返回列表