如何让数据流动起来,让数据拥抱数据

茶茶第五人格 2024-05-25 21:40:40
最佳回答
围墙里的大数据注定成为死数据。大数据需要开放式创新,从数据的开放、共享和交易,到价值提取能力的开放,再到基础处理和分析**的开放,让数据如同血液在数据社会的躯体中长流,滋润数据经济,让更多的长尾企业和数据思维创新者产生多姿多彩的化学作用,才能创造大数据的黄金时代。我的大数据研究轨迹我做了4-5年的移动架构和j**a虚拟机,4-5年的众核架构和并行编程系统,最近4-5年也在追时髦,先是投入物联网,最近几年一直在做大数据。我们团队的大数据研究轨迹如下图所示:2010-2012年,主要关注数据和机器的关系:水平扩展、容错、一致性、软硬件协同设计,同时厘清各种计算模式,从批处理(mapreduce)到流处理、big sql/ad hoc query、图计算、机器学习等等。事实上,我们的团队只是英特尔大数据研发力量的一部分,上海的团队是英特尔hadoop发行版的主力军,现在英特尔成了cloudera的最大股东,自己不做发行版了,但是**优化、开源支持和垂直领域的解决方案仍然是英特尔大数据研发的重心。从2013年开始关注数据与人的关系:对于数据科学家怎么做好分布式机器学习、特征工程与非监督学习,对于领域专家来说怎么做好交互式分析工具,对于终端用户怎么做好交互式可视化工具。英特尔研究院在美国卡内基梅隆大学支持的科研中心做了graphlab、stale synchronous parallel**m,在mit的科研中心做了交互式可视化和scidb上的大数据分析,而**主要做了spark sql和mllib(机器学习库),现在也涉及到深度学习算法和基础设施。2014年重点分析数据和数据的关系:我们原来的工作重心是开源,后来发现开源只是开放式创新的一个部分,做大数据的开放式创新还要做数据的开放、大数据基础设施的开放以及价值提取能力的开放。数据的暗黑之海与外部效应下面是一张非常有意思的图,黄色部分是化石级的,即没有联网、没有数字化的数据,而绝大多数的数据是在这片海里面。只有海平面的这些数据(有人把它称作surface web)才是真正大家能访问到的数据,爬虫能爬到、搜索引擎能检索到的数据,而绝大多数的数据是在暗黑之海里面(相应地叫做dark web),据说这一部分占数据总量的85%以上,它们在一些孤岛里面,在一些企业、**里面躺在地板上睡大觉。数据之于数据社会,就如同水之于城市或者血液之于身体一样。城市因为河流而诞生也受其滋养,血液一旦停滞身体也就危在旦夕。所以,对于号称数据化生存的社会来说,我们一定要让数据流动起来,不然这个社会将会丧失诸多重要功能。所以,我们希望数据能够像“金风玉露一相逢”那样产生化学作用。马化腾先生提出了一个internet+的概念,英特尔也有一个大数据x,相当于大数据乘以各行各业。如下图所示,乘法效应之外,数据有个非常奇妙的效应叫做外部效应(externality),比如这个数据对我没用但对ta很有用,所谓我之**彼之蜜糖。比如,金融数据和电商数据碰撞在一起,就产生了像小微贷款那样的互联网金融;电信数据和**数据相遇,可以产生人口统计学方面的价值,帮助城市规划人们居住、工作、娱乐的场所;金融数据和医学数据在一起,麦肯锡列举了很多应用,比如可以发现骗保;物流数据和电商数据凑在一块,可以了解各个经济子领域的运行情况;物流数据和金融数据产生供应链金融,而金融数据和农业数据也能发生一些化学作用。比如google analytics出来的几个人,利用美国开放气象数据,在每一块农田上建立微气象模型,可以预测灾害,帮助农民保险和理赔。所以,要走数据开放之路,让不同领域的数据真正流动起来、融合起来,才能释放大数据的价值。三个关于开放的概念1、数据开放首先是狭义的数据开放。数据开放的主体是**和科研机构,把非涉密的**数据及科研数据开放出来。现在也有一些企业愿意开放数据,像netflix和一些电信运营商,来帮助他们的数据价值化,建构生态系统。但是数据开放不等于信息公开。首先,数据不等于信息,信息是从数据里面提炼出来的东西。我们希望,首先要开放原始的数据(raw data),其次,它是一种主动和免费的开放,我们现在经常听说要申请信息公开,那是被动的开放。tim berners lee提出了数据开放的五星标准,以保证数据质量:一星是开放授权的格式,比如说pdf;其次是结构化,把数据从文件变成了像excel这样的表;三星是开放格式,如csv;四星是能够通过uri找到每一个数据项;五星代表能够和其它数据链接,形成一个开放的数据图谱。现在主流的数据开放门户,像data.dov或data.gov.uk,都是基于开源软件。英特尔在mit的大数据科研中心也做了一种形态,叫datahub:吉祥物很有趣,一半是大象,代表数据库技术,一半是章鱼,取自github的吉祥物章鱼猫。它提供更多的功能比如易管理性,提供结构化数据服务和访问控制,对数据共享进行管理,同时可以在原地做可视化和分析。广义的数据开放还有数据的共享及交易,比如点对点进行数据共享或在多边**上做数据交易。马克思说生产资料所有制是经济的基础,但是现在大家可以发现,生产资料的租赁制变成了一种主流(参考《lean startup》),在数据的场景下,我不一定拥有数据,甚至不用整个数据集,但可以租赁。租赁的过程中要保证数据的权利。首先,我可以做到数据给你用,但不可以给你看见。姚期智老先生82年提出“millionaires’ dilemma(百万富翁的窘境)”,两个百万富翁比富谁都不愿意说出自己有多少钱,这就是典型的“可用但不可见”场景。在实际生活中的例子很多,比如美国国土安全部有**子名单(数据1),航空公司有乘客飞行记录(数据2),国土安全部向航空公司要乘客飞行记录,航空公司不给,因为涉及隐私,他反过来向国土安全部要**子名单,也不行,因为是**机密。双方都有发现**子的意愿,但都不愿给出数据,有没有办法让数据1和数据2放一起扫一下,但又保障数据安全呢?其次,在数据使用过程中要有审计,万一那个扫描程序偷偷把数据藏起来送回去怎么办?再者,需要数据定价机制,双方数据的价值一定不对等,产生的洞察对各方的用途也不一样,因此要有个定价机制,比大锅饭式的数据共享更有激励性。从点对点的共享,走到多边的数据交易,从一对多的数据服务到多对多的数据市场,再到数据交易所。如果说现在的数据市场更多是对数据集进行买卖的话,那么数据交易所就是一个基于市场进行价值发现和定价的,像股票交易所那样的、小批量、高频率的数据交易。我们支持了不少研究来实现刚才所说的这些功能,比如说可用而不可见。案例一是通过加密数据库cryptdb/monomi实现,在数据拥有方甲方这边的数据库是完全加密的,这事实上也防止了现在出现的很多数据泄露问题,大家已经听到,比如说某互联网服务提供商的员工偷偷把数据拿出来卖,你的数据一旦加密了他拿出来也没用。其次,这个加密数据库可以运行乙方的普通sql程序,因为它采用了同态加密技术和洋葱加密法,sql的一些语义在密文上也可以执行。针对“百万富翁的窘境”,我们做了另一种可用但不可见的技术,叫做数据咖啡馆。大家知道咖啡馆是让人和人进行思想碰撞的地方,这个数据咖啡馆就是让数据和数据能够碰撞而产生新的价值。比如两个电商,一个是卖衣服的,一个是卖化妆品的,他们对于客户的洞察都是相对有限的,如果两边的数据放在一起做一次分析,那么就能够获得全面的用户画像。再如,**是一类长尾病症,有太多的基因突变,每个研究机构的基因组样本都相对有限,这在某种程度上解释了为什么过去50年**的治愈率仅仅提升了8%。那么,多个研究机构的数据在咖啡馆碰一碰,也能够加速**的研究。在咖啡馆的底层是多方安全计算的技术,基于英特尔和伯克利的一个联合研究。在上面是安全、可信的spark,基于“data lineage”的使用审计,根据各方数据对结果的贡献进行定价。2、大数据基础设施的开放现在有的是有大数据思维的人,但他们很捉急,玩不起、玩不会大数据,他不懂怎么存储、怎么处理这些大数据,这就需要云计算。基础设施的开放还是传统的platform as a service,比如amazon aws里有mapreduce,google有big query。这些大数据的基础处理和分析**可以降低数据思维者的门槛,释放他们的创造力。比如decide.com,每天爬几十万的数据,对价格信息(结构化的和非结构化的)进行分析,然后告诉你买什么牌子、什么时候买最好。只有四个phd搞算法,其他的靠aws。另一家公司pr**matic,也利用了aws,这是一家做个性化阅读推荐的,我专门研究过它的计算图、存储和高性能库,用l**p的一个变种clojure写的非常漂亮,真正做技术的只有三个学生。所以当这些基础设施社会化以后,大数据思维者的春天很快就要到来。3、价值提取能力的开放现在的模式一般是一大一小或一对多。比如tesco和dunnhumby,后者刚开始是很小的公司,找到tesco给它做客户忠诚度计划,一做就做了几十年,这样的长期战略合作优于短期的数据分析服务,决策更注重长期性。当然,dunnhumby现在已经不是小公司了,也为其他大公司提供数据分析服务。再如沃尔玛和另外一家小公司合作,做数据分析,最后他把这家小公司买下来了,成了它的walmart labs。一对多的模式,典型的是palantir——peter thiel和斯坦福的几个教授成立的公司,目前还是私有的,但估值近百亿了,它很擅长给各类**和金融机构提供数据价值提取服务。真正把这种能力开放的是kaggle,它的双边,一边是10多万的分析师,另一边是需求方企业,企业在kaggle上发标,分析师竞标,获得业务。这可能是真正解决长尾公司价值提取能力的办法。当然,如果能和我们的数据咖啡馆结合,就更好了。 20210311
汇率兑换计算器

类似问答
  • excel如何让数据按照特定的顺序来排序
    • 2024-05-25 19:06:03
    • 提问者: 未知
    1打开excel,例如制作如下图所示的表格。2选择排序的数据区域,点击“数据”选项卡,然后点击“排序”图标,打开“排序”对话框,设置排序的**,然后点击“确定”。3按照“升序”排序完的结果如下图所示。4按照“降序”排序完的结果如下图所示。5如何自定义排序的顺序呢?例如现在想要按照“华东区”、“华南区”、“东北区”来排序。从这一步给大家演示。点击菜单栏的“文件”,弹出下图界面,点击“选项”。6打开“...
  • 如何在网页上抓取数据,表格里的数据
    • 2024-05-25 22:47:09
    • 提问者: 未知
    不是有历史页面嘛,直接复制粘贴就可以了,选中你要的数据,右键复制,在表格中右键粘贴
  • 如何在excel2010中对数据进行数据分析
    • 2024-05-25 10:51:39
    • 提问者: 未知
    excel中数知据分析方法有很多,推荐用数据透视表进行数据分析。软件版本:office2013 数据透视表数据分析法: 1.选择数据区域,点击插道入菜单中的“数据透视表”: 2.设置透视表放置位置: 3.在右侧回对话框中,将字段放置到合适的标签中: 4.这样,就完成答了对数据的一个基本分析:
  • 做数据分析如何保障数据的准确性?
    • 2024-05-25 03:03:30
    • 提问者: 未知
    从业多年,在数据准确性上摔过不少跟斗,总结了一些切实...那么启动点的采集就应该既包含点击app图标启动又包含后台呼启,其中后台呼启与上一次退入后台的时间间隔应该至少...
  • 如何同步mysql数据库数据
    • 2024-05-25 04:12:16
    • 提问者: 未知
    1第一步打开mysql的客户端 这里使用n**icat,连接数据库,等到n**icat主页面,双击需要操作的数据库连接2第二步登录到数据库主页面后,点击左侧的数据库链接,打开数据库,可以看到可以操作的所有数据库3第三步这时有有两个数据库,目标是将数据1的所有数据同步到数据库2上,需要点击主页面上的4第四步打开工具菜单,选择数据库同步菜单,弹出数据同步的对话框,可以选择数据源,目标数据库5第五步选择...
  • 大数据驱动智慧农业发展,数据如何互联互通?
    • 2024-05-25 15:45:15
    • 提问者: 未知
    智慧农业并不是简单的一根网线,一个app,而是物联网技术与传统农业的深度结合。而其中数据的互联互通则是基础中的基础,物联网中的很多设备数据需要实时传导到相关大数据**,而其中1 0 1异构数据采集引擎可以将设备数据直接采集,实时传导到指定位置,以便做相应的判断。异构数据采集不能直接采集设备的数据,但是可以通过设备的客户端软件采集设备数据,
  • 如何获取获取金融数据比如股票等数据,有免费的数据库吗?
    • 2024-05-25 04:27:03
    • 提问者: 未知
    金融数据?任何的炒股软件里面都有。通常是f10键 ,有财务资料 等信息,各大财经网站上都有研报!央行有金融统计年鉴,**有年度**金融报告。。。。免费的数据库 倒是有一个 **统计局 ,数据查询里面。其他的都要钱!
  • 我想知道如何让电子数据成为有效证据?
    • 2024-05-25 18:51:57
    • 提问者: 未知
    电子合同已是国内网络借贷中介机构最常用的合同签署模式,目前国内第三方电子合同**一般具备身份认证、数字证书颁发、在线签署、存证保全、在线验签等服务。其中,存证保全是重中之重。除了提供电子数据的存证保全服务,第三方电子合同**也应提供出证服务,电子合同出证服务是保障电子合同法律效力和司法落地的关键。可是,第三方电子合同**也是企业,极有可能会出现服务不稳定或停业、倒闭等各种意外状况,为了保证存证信息...
  • excel数据库是什么-excel如何使用数据库数据-excel学习网
    • 2024-05-25 14:55:14
    • 提问者: 未知
    excel数据库是您的报表和分析可以轻松使用的简单列表或数32313133353236313431303231363533e58685e5aeb931333433646531据表。本简介将帮助您入门。microsoft excel mvp,2005-2014,电子表格仪表板报表之父 如果将数据保存在excel数据库中,则可以显着改善excel报告和分析。microsoft,oracle...
  • 数据流图分成哪三层数据流图
    • 2024-05-25 05:17:27
    • 提问者: 未知
    数据流图分层dfd编辑数据流图根据层级数据流图分为顶层数据流图、中层数据流图和底层数据流图
汇率兑换计算器

热门推荐
热门问答
最新问答
推荐问答
新手帮助
常见问题
房贷计算器-九子财经 | 备案号: 桂ICP备19010581号-1 商务联系 企鹅:2790-680461

特别声明:本网为公益网站,人人都可发布,所有内容为会员自行上传发布",本站不承担任何法律责任,如内容有该作者著作权或违规内容,请联系我们清空删除。