随着数字信息技术的不断发展,“网络匿名”有可能会变成“数学上不可能”的事。

1995年,欧盟出台的隐私法例将“个人资料”定义为可以直接或间接识别一个人的信息。很显然,当时立法者考虑的是那些带有身份标识号的文件资料之类的东西,这些标识号就好像人的姓名,而立法者们希望它们可以得到保护。

如今,“个人资料”这一定义所包含的内容已经远远超出当年那些立法官员的想象,甚至可以轻易地超过18年前他们通过这项法例时整个世界的数据量。

来看看到底发生了什么。首先,这个世界每年所创造的数据量在以指数形式增长,去年,这一数字则达到了2.8ZB(1ZB =10244GB),听起来就很可怕的数字,而且据知名信息行业咨询服务商IDC称,这一数字将在2015年翻一番。此外,这些数据中的3/4是由个体人在创造或移动数字文件时贡献的。举例来说,一个标准的美国上班族每年可以贡献180万MB的数据量,平均每天则有约5000MB,这其中包括下载的电影、文档、电邮以及这些数据通过移动或非移动互联网传播时所产生的附加数据量。

互联网的数据量进入了高速增长期。图片编译自MIT TechnologyReview

尽管这其中的大部分数据都是不可见的,似乎也并不携带任何个人信息,但事实并非如此。现代数据科学已经发现几乎任何类型的数据都能用来识别创造它的人,就好比指纹一样。比如说你在网上下载的电影、你的手机发出的定位信息,甚至是你被监控摄像机所拍下来的步态都可以用来识别你。实际上,数据越多,其中可以称得上隐私的就越少。普林斯顿大学的计算机科学家阿尔文德·纳拉亚南(Arvind Narayanan)称,只要有合理的商业动机来推动数据挖掘的进程,任何形式的隐私都是“算法上不可能”(algorithmically impossible)的。

可以说,我们已经在这条不归路上越走越远。那些以往被我们认为是个人资料的信息——姓名或者信用卡号——如今都已经被安客诚(Acxiom)公司这样的数据代理商用作交易,它拥有500多万名分布在世界各地的消费者的个人信息。人们在填写了某些调查表或者注册了一些服务后,相应的数据就进入了公共领域。这也是这些代理商的数据来源。

安客诚可以利用一些信息来推测你的生活方式、兴趣爱好和日常活动,比如你的汽车品牌和使用时间、你的收入和投资状况、你的年龄、受教育程度以及邮政编码。所有这些信息可以将你归类为70种不同的“PersonicX”集群中的一个。除此之外,你最近有离过婚吗,或者你刚刚变成了一名空巢老人?这些“人生大事”更可以将一个人从一个消费阶层转移到另一个,而这正是安客诚及其广告客户的关键兴趣所在。安客诚称其可以通过分析数据来预测3000种不同的行为及心理倾向,比如说一个人会在某两个品牌间做出怎样的选择。

虽说听起来很厉害,但这些数据代理商如今已经被认为是过时的了,尤其是跟Facebook这样的互联网公司相比。Facebook已经可以实现对个人信息收集的自动化与实时化,其首次公开募股时的财务档案显示,Facebook上每位用户的图片和视频资料数据量约为111MB,而Facebook的用户数如今已经超过了10亿,这可是整整100PB(1 PB = 10242 GB)的个人信息数据!在一些法律案件中,Facebook所记录的数据也派上了用场,其中包括涉案人发过的文字信息、点过“赞”的东西以及所用过的电脑的IP地址等,这些资料加起来足有800页,这800页就又给每位用户增加了几MB的数据量。

线上和线下的数据如今正在逐步融合,进而帮助营销人员更精准地进行广告投放,这也是众多“数字隐私”拥护者的烦心事。今年二月,Facebook宣布与包括安客诚在内的多家数据代理商展开合作,通过整合各自的数据资源来构造现实世界与虚拟网络之间的联系。一个月后,安客诚的首席科学官在一次投资者会议上称他们的数据已经与全美90%的社会档案建立了链接。

这些数据往往被描述为“在某种程度上具有匿名性”,但是牵涉到的信息越多,这样的说法就越显站不住脚。就拿移动通信运营商来说,他们会记录用户的位置和手机号码,然后再将这些综合数据卖给商家。尽管位置数据的匿名化是可以实现的,但是来自MIT的伊夫·亚历山大(Yves-Alexandre de Montjoye)和塞萨尔·A·伊达尔戈(César A. Hidalgo)却发现只要通过同一手机的四个不同的位置数据点就可以精确定位其拥有者。不光是移动通信运营商,你所用的浏览器也会“出卖”你的个人信息,就连最近刚刚兴起的可穿戴设备(如Google Glass)也被认为会引起隐私担忧。

毫无疑问,可以获得的个人数据量越多,其中的信息量就越大。只要拥有了足够多的数据,我们甚至可能发现有关于一个人的未来信息。去年,来自美国罗彻斯特大学的亚当·萨迪克(Adam Sadilek)和来自微软实验室的工程师约翰·克拉姆(John Krumm)发现他们可以大致预测一个人未来可能到达的位置,最多可以预测到80周后,其准确度高达80%。为此,他们收集了32000天里307个人和396辆车的GPS数据并建造了一个“大规模数据集”。

两人想象了一下这一研究成果的商业应用,他们说到时候会出现这样的广告:“需要理发吗?四天后你就会在这家发廊周围100米内,届时它将会有优惠活动哦!”

这两人还为他们的系统起了一个名字——“遥远未来”(Far Out),没错,这也正是大数据时代下的个人信息将带我们去的地方。

本文作者:Hubert2014

来源:51CTO

大数据时代 我们还有隐私吗?相关推荐

  1. 大数据后从此再无隐私_大数据时代没有个人隐私?

    作为一名大数据领域的从业者,我来回答一下这个问题. ​在大数据技术的推动下,随着数据价值的不断提高,关于个人隐私的安全问题受到了更多的关注,关于如何在大数据时代保护个人隐私(数据安全)也是目前不少研究 ...

  2. 本地差分隐私 随机响应_大数据时代下的隐私保护

    本文作者程越强.孙茗珅.韦韬 1 引言 在大数据的时代,越来越多的服务和产品是围绕用户数据(隐私)建立的.这样虽然带来了个性化的服务,提高了服务质量和精度,但是在数据收集.使用以及公布的过程中,用户隐 ...

  3. 大数据时代,个人隐私如何保护?杨幂,张若昀纷纷斥责隐私遭到泄露......

    30日上午,张若昀在微博上发文斥责艺人隐私遭到泄露的现象.他在文中透露,自己因为隐私信息被泄露,导致自己在过去几年换了两次家庭电话.不仅如此,自己在拍戏时多次进组,因发现酒店房间门口有人,被迫更换酒店 ...

  4. 大数据时代下的隐私保护

    本文作者程越强.孙茗珅.韦韬 1 引言 在大数据的时代,越来越多的服务和产品是围绕用户数据(隐私)建立的.这样虽然带来了个性化的服务,提高了服务质量和精度,但是在数据收集.使用以及公布的过程中,用户隐 ...

  5. 信息贩卖黑色产业链猖獗,大数据时代谁给隐私上锁!

    网上约车.叫外卖.购物.导航--互联网给人们提供生活便利的同时,也让大家成为了一个不折不扣的"透明人"--微信昵称.头像.位置.通讯录,甚至身份证号码.银行账户都"祼奔& ...

  6. 大数据时代我们的隐私真不重要吗?

    想象一下有人在你背后谈论你.现在设想一下,这样的谈话就悄悄发生在你家客厅里,而你却无法听到. 这就是印度创业企业SilverPush的做法,该公司在电视广告里嵌入听不到的声音.广告播放时,会发出一种高 ...

  7. 隐私成“皇帝的新衣”,大数据时代谁能成用户隐私的保护伞?

    随着大数据时代的到来,隐私泄露的问题也逐渐显露出来.特别是今年隐私泄露案件更是层出不穷,从3月闹得沸沸扬扬的Facebook用户隐私泄露案再到6月A站疑被黑客盗取用户数据,似乎我们生活在大数据时代根本 ...

  8. 大数据时代,谁能成用户隐私的保护伞?

    大数据时代,谁能成用户隐私的保护伞? 随着大数据时代的到来,隐私泄露的问题也逐渐显露出来.特别是今年隐私泄露案件更是层出不穷,从3月闹得沸沸扬扬的Facebook用户隐私泄露案再到6月A站疑被黑客盗取 ...

  9. 从刷支付宝乘地铁谈起,浅议大数据时代的隐私安全

    作者 | Elaine_z 来源 | FreeBuf.COM " 高速发展.高吞吐量的大数据时代,绝大多数人都的所有行为逐渐都能在信息世界之中留下数据足迹,无论是用户主动留下的数字脚印,还是 ...

最新文章

  1. 【数据平台】基于pyhs2库Python作为client driver连接HiveServer
  2. MYSQL: DML/DDL/DCL
  3. Unity3D客户端和Java服务端使用Protobuf
  4. 数据结构与算法之树的遍历
  5. 医院网络安全管理方案
  6. hdu1411知六边长求四面体体积
  7. 计算机语音发展,计算机语音合成技术研究及发展方向
  8. discuz模板文件说明
  9. firewalld 规则配置
  10. 摘自一博主的牛逼面试总结 !!! 五颗星(阿里(分享面试过程))
  11. 产品运输和使用振动环境的分类
  12. [坑] FileZilla下载按钮为灰色
  13. 计算机应用团队,【计算机应用论文】团队合作学习下计算机应用论文(共3025字)...
  14. TSINGSEE青犀视频构建pion webrtc运行broadcast示例的步骤
  15. Windows安全日志
  16. 硕士论文各章节的篇幅多少比较合适
  17. 2006年主流建站系统及其典型网站演示(CMS篇)
  18. pycharm删除文件后怎样找回
  19. html5游戏引擎国内文献综述,html5论文参考文献范例借鉴
  20. 龙格现象 matlab,龙格现象的matlab实现

热门文章

  1. 7.STM32中对DMA_Config()函数的理解(自定义)测试DMA传输数据时CPU还可继续工作其他的事
  2. 基于可靠消息方案的分布式事务(四):接入Lottor服务
  3. 4.3. postForObject
  4. 【Visual Studio】如何在VS 2012中打印变量值到输出窗口
  5. 在Nginx上配置多个站点
  6. 使用DatagramSocket发送、接收数据(Socket之UDP套接字)
  7. 全面理解java异常机制
  8. MVC ScriptBundle自定义排序。
  9. C#.NET 大型企业信息化系统集成快速开发平台 4.2 版本 - 能支撑10万以上客户端的数据同步下载问题...
  10. 打造轻量化的View Controller