写点什么

获取数据科学需要的数据

  • 2016-09-08
  • 本文字数:1679 字

    阅读完需:约 6 分钟

Lukas Vermeer 是一名经验丰富的数据科学专家,同时也是 Booking.com 试验部门产品负责人。他认为,数据科学和你需要的数据有关;决定收集、创建或保留什么数据是基础。真正的创新始于提出重大的问题,然后就很容易知道需要哪些数据才能找到你寻找的答案。在 GOTO 阿姆斯特丹 2016 大会上,Vermeer 探讨了数据科学与数据炼金术。

Christine Doig 是 Continuum Analytics 的高级数据科学家。她在文章“作为一门团队学科的数据科学”中将数据科学定义为:

我喜欢将 [数据科学] 想象成胶水,它将不同领域和思路粘合在一起,通常用于解决数据相关的问题,并将信息转换成知识和可行的见解。

在 InfoQ 文章“ 2016 年数据科学家将扮演什么角色”中,Ed Jones 解释了为什么大数据和数据科学很重要:

我们已经处在大数据时代,这是无法改变的事实。随着数据量与日俱增,从这些数据中提取出价值的工作只会慢慢变得更加复杂和困难。大数据经济背后的逻辑,正在以无法想象或预测的方式重塑我们的生活;我们做出的每一个电子操作都将产生数据,并留下与自己生活相关的蛛丝马迹。

Vermeer 表示,“我们希望检验一下,人们是否喜欢我们对网站所做的修改”。Booking.com 借助试验和其他形式的数据收集不断地改进他们的网站,创建更好的客户体验。

Vermeer 指出,“你可以拥有大量的数据,但如果你不知道能用它们干什么,那就没有用。”更多的信息并不一定形成更好的决策。数据科学和你需要的数据有关,通常,那和你拥有的数据不同。Vermeer 说,科学受数据所限,而数据为工程技术所限。你必须考虑如何创建所需的数据,以便能够取得进展。

在演讲中,Vermeer 使用了太阳系科学史上的例子。为了展示数据如何为工程技术所限,他回顾了天文学研究的一段历史。托勒密没有发现科里奥利效应和恒星视差,因为他没有足够准确的测量设备,而且这两种效应都非常微弱。除了其他因素之外,缺少证据让他得出了地球不动这个结论。对于托勒密而言,有关这两种效应的数据明显是受当时的工程技术所限。关于这一点,回顾过去更容易看出来,但同样适用于今天。

Vermeer 认为,模型并非必不可少,但如果它们有助于预测未来,就是有用的。可能有多个模型可以解释已有的数据。但你无法使用自己拥有的数据证明哪个模型正确。确定哪个模型更接近真相需要你收集新的数据。

Vermeer 提到了 Kaggle.com。这是一个数据科学家社区,从中你可以学到如何解决复杂的数据科学问题,结识其他的数据科学家。

你可以通过分析客户评论并查找关键词(比如可以表明人们喜欢或不喜欢旅馆的词语)进行情感分析。但是,你也可以在评论表单里提供两个输入框,一个用于输入人们喜欢的东西,一个用于人们不喜欢的东西。Vermeer 表示,这种方法就解决了数据收集时的情感分析问题。

Vermeer 建议考虑你能够创建的数据。如果这份数据与已有的数据部分重叠,你可以选择保留那份数据,或者在需要的时候重新创建。成本和风险(比如泄露个人身份信息(POII)数据)是决定保留或重建的两个主要原因。保留数据的成本显而易见。可能还有其他方面的考虑,这取决于现有的数据。

也会有你需要但是无法获得的数据。作为一种解决方案,你可以使用代理数据:和你需要的数据相关而又可以获得的数据,那样,你就可以用它替代需要的数据。

Vermeer 举了一个例子。Booking.com 举办了一个邮件发送活动,使用个性化设置向旅行者宣传旅游目的地。有些客户认为,邮件的措辞令人害怕,因为它让他们觉得,有人逐个分析了客户过去的购买记录,才提出了那样的建议。实际上,那些建议是基于一个机器学习模型,而不是人的判断。在下一次活动中,邮件文本重新措辞,在没有对预测模型做任何修改的情况下,效果提升了两倍。

Vermeer 表示,由于数据科学是一门科学,而不是炼金术,所以决定收集什么数据以及如何收集是基础步骤。

“犯了错,你能承担得起吗?”“你可以不知道吗?”这是演讲结束时 Vermeer 向听众提出的问题。他引用了伏尔泰的一句话:“判断一个人凭的是他的问题而不是他的回答。”如果人们提出的问题让我思考以前从未想过的东西,那很好,Vermeer 如是说。

查看英文原文 Getting the Data Needed for Data Science

2016-09-08 19:001825
用户头像

发布了 1008 篇内容, 共 406.6 次阅读, 收获喜欢 345 次。

关注

评论

发布
暂无评论
发现更多内容

一文读懂Guava EventBus(订阅\发布事件)

京东科技开发者

架构 观察者模式 Guava EventBus 企业号 2 月 PK 榜

Seal 0.4 发布:软件供应链安全洞察更上一层楼!

SEAL安全

软件供应链安全 SEAL 企业号 2 月 PK 榜

政企服务机构如何进行数字化转型?

优秀

数字化转型

Apache Doris 1.2.2 Release 版本正式发布

SelectDB

大数据 数据分析 OLAP 分析型数据库 数据库·

DR-AP40X9-A-Qualcomm-IPQ4019/IPQ4029-2.4G&5G

Cindy-wallys

IPQ4019 ipq4029

软件测试/测试开发 | web自动化测试-PageObject 设计模式

测试人

软件测试 自动化测试 测试开发 Web自动化测试

软件测试/测试开发 | web自动化测试-文件上传与弹框处理

测试人

软件测试 自动化测试 测试开发 Web自动化测试 selenium

性能测试中获取JVM资源信息

FunTester

进击中的 Zebec 生态,Web2 与 Web3 世界的连接器

股市老人

Wallys /industrial wifi6 router/ Ipq6010 /ipq6018/ipq6000 2x2 2.4G & 5G

Cindy-wallys

IPQ6010 ipq6018 IPQ6000

为什么大多数团队推行自动化测试最后却不了了之?

Liam

测试 自动化测试 测试自动化

海泰方圆受邀参加中关村网信联盟会议并斩获三项殊荣

电子信息发烧客

Bytebase 体验官之勇闯新手村

朱亚光

IoT设备数据业务价值洞察实践——实践类

阿里云AIoT

阿里云 物联网 IoT

构建云边端一体的分布式云架构,软硬结合驱动边缘计算创新场景

Baidu AICLOUD

边缘计算 分布式云

聊一聊 gRPC 中的拦截器

江南一点雨

gRPC

CNCF社区首个!KubeEdge达到软件供应链SLSA L3等级

华为云开发者联盟

云原生 华为云 企业号 2 月 PK 榜 华为云开发者联盟

2022年最新数据库调查报告:超八成DBA月薪过万,你拖后腿了吗?

墨天轮

MySQL 数据库 oracle 工资 dba

如何在现实场景中随心放置AR虚拟对象?

HarmonyOS SDK

HMS Core

李宏伟 安警官的IP地址已经锁定你!IP地址究竟如何定位到莽村附近?

郑州埃文科技

IP地址 IP定位查询

rust入坑指南之ownership

京东科技开发者

rust JVM 内存 企业号 2 月 PK 榜 ownership

设计模式第六讲:责任链模式和迭代器模式详解

C++后台开发

设计模式 责任链模式 迭代器模式 后端开发 Linux服务器开发

Greenfield

股市老人

使用 NGINX 在 Kubernetes 中实现多租户和命名空间隔离

NGINX开源社区

nginx NGINX Ingress Controller NGINX Kubernetes Gateway 企业号 2 月 PK 榜

海量并发低延时 RTC-CDN 系统架构设计(上)

网易云信

实时音视频 音视频开发

软件测试 | 常用模拟器使用

测吧(北京)科技有限公司

测试

0源码基础学习Spring源码系列(二)——Spring如何解决循环依赖

京东科技开发者

spring 源码 初始化 二级缓存 企业号 2 月 PK 榜

GaiaX开源解读 | 表达式作为逻辑动态化的基础,我们是如何设计的

阿里巴巴文娱技术

开源 研发效能 服务端 多端开发

企业降本增效的催化剂:敏捷迭代

FinFish

敏捷开发 敏捷迭代 敏捷项目管理

获取数据科学需要的数据_大数据_Ben Linders_InfoQ精选文章