AICon 上海站|90%日程已就绪,解锁Al未来! 了解详情
写点什么

Hadoop + SQL Server + Excel = 大数据分析

  • 2013-01-31
  • 本文字数:1876 字

    阅读完需:约 6 分钟

几个月前,微软宣布了自己的用于大数据管理、分析和挖掘的 Hadoop 发布版 HDInsight 。InfoQ 联系到了 SQL Server 的高级产品营销经理 Val Fontama,希望进一步了解微软的企业级大数据到底如何。

关于企业中数据集规模的增长趋势:

数据的海洋一直在增长。有预测表明业务信息存储量每年都会加倍。例如,Gartner 发现全世界的信息量每年在以最少 59% 的速率增长,而其中大约 85% 的数据是“非结构化”的——比如视频剪辑、RFID 标签和网站日志。这些非结构化数据用传统的数据管理系统来处理并不容易。此外,在很多场景下,客户在实时收集新数据时发现数据增长速率还在增加。

客户将需要一个与业务及所收集数据的发展相适应的现代数据平台。对全球企业而言,大数据为从所收集数据(不管是结构化的还是非结构化的)中找到新颖可行的观点创造了大量商机。因为到最后,大数据的最大前景就是推动来自数据的、更智能的决策。而智能决策就要收集来自各类数据的观点。

HDInsight 是微软应对大数据的解决方案:

微软希望通过支持 Windows Server 和 Windows Azure 的 Hadoop 发布版,提供可移植、性能优越、安全且易部署等特性,促进 Hadoop 的应用。微软还将通过在 HDInsight 中集成 Active Directory 来增强 Hadoop 的安全性。此举将使 IT 部门能够将同样的一致性安全策略用于包括 Hadoop 集群在内的所有 IT 资产。

此外,通过与 System Center 集成,HDInsight 简化了 Hadoop 的管理,并支持 IT 部门在同一面板上管理 Hadoop 集群、SQL Server 数据库和应用程序。

基于 Hadoop 的 Windows 平台应用程序集成了如 Excel、Power View 和 PowerPivot 等微软的商业智能(BI)工具,可以很容易地分析大量的业务信息,从而创造独特的、差异化的商业价值。

为实现与 Apache Hadoop 百分之百的兼容性,微软的 Hadoop 发布版 HDInsight 是基于 Hortonworks Data Platform(HDP)构建的。因此,客户能够将其 MapReduce 作业从自己的 Windows 服务器移到云中,甚至是移到运行在 Linux 上的 Apache Hadoop 发布版中。目前还没有其他厂商提供该功能。此外,在 Windows Server 和 Azure 平台上提供这些功能,也使客户能够利用熟悉的工具(如 Excel、PowerPivot for Excel 和 Power View)轻松地从数据中抽取可行的观点。

SQL Server 如何适应这种解决方案:

在帮助企业处理大数据集方面,SQL Server 2012 与 SQL Server 2008 最重要的区别之一就是与 Hadoop 的兼容性。Hadoop 允许用户处理大量的结构化和非结构化数据并快速从中获得观点,而且,因为 Hadoop 是开源的,成本较低。Hadoop 与 SQL Server 2012 兼容的特性是微软与 Hortonworks 合作开发的,微软最近也宣布 Microsoft HDInsight Server 和 Windows Azure HDInsight Service 已经可以预览,这都使用户能够使用微软开发的 Hadoop 连接器来从数据中获得最好的观点。通过 Hive ODBC Driver 把 SQL Server 连接到 Hadoop,客户现在可以使用如 PowerPivot 和 Power View 等微软的 BI 工具在 SQL Server 2012 中分析各种类型的数据,包括非结构化数据。此外,利用 SQL Server 2012 中新的 Data Quality Services,客户可以通过将原始数据转换为适于建模的可靠且一致的数据来提高数据质量。

微软最近宣布了 Office 2013 中的一些新特性,并介绍了开发者应该如何利用这些特性来构建构建应用和处理数据的服务。不足为奇,微软自己在 Excel 正是利用这一点来提供大数据服务的:

Excel 是微软平台上支持大数据分析的主要客户端工具之一。在 Excel 2013 中,我们的主要工具是数据建模工具 PowerPivot 和数据可视化工具 Power View,而且恰好它们都构建进来了,无需额外下载。这支持各个层次的用户使用熟悉的 Excel 界面进行自助式 BI 分析。

通过 Excel 的 Hive 插件,我们的 HDInsight 服务很容易集成 Office 2013 中的 BI 工具,使用户能够用熟悉的工具轻松地分析海量的结构化或非结构化数据。

除了 Excel 之外,微软还提供了其他的大数据交互工具:BI 专业人员可以使用 BI Developer Studio 来设计 OLAP cube 或在 SQL Server Analysis Services 中设计可伸缩的 PowerPivot 模型。开发者可以继续使用 Visual Studio 来开发和测试用.NET 编写的 MapReduce 程序。最后,IT 运维人员可以使用他们目前所使用的 System Center 来管理 HDInsight 上的 Hadoop 集群。

总的说来,微软的策略看起来是要为客户使用大数据提供一种最简单的方法——扩展现有工具(如 SQL Server 和 Office 等),使之能够无缝处理新数据类型,从而允许各公司在处理新业务时能利用原有投资。

查看英文原文 Hadoop + SQL Server + Excel = Big Data Analytics

2013-01-31 04:5810323
用户头像
臧秀涛 略懂技术的运营同学。

发布了 300 篇内容, 共 140.5 次阅读, 收获喜欢 35 次。

关注

评论

发布
暂无评论
发现更多内容

【云原生】k8s 环境快速部署(一小时以内部署完)

Java你猿哥

Java 学习 k8s Spring Boot ssm

DSC:数仓SQL脚本迁移的神奇工具

华为云开发者联盟

数据库 后端 华为云 华为云开发者联盟 企业号 3 月 PK 榜

Sugar BI 增强分析能力全场景解析

Baidu AICLOUD

BI

MySQL创建用户与授权

源字节1号

软件开发 前端开发 后端开发 小程序开发

CTO问我如何规避MyBatis使用过程中带来的全表更新风险

Java永远的神

Java 程序员 面试 后端 mybatis

跟清华大佬用18个要点带你一步步学习springboot2微服务项目实战

Java你猿哥

Spring Boot 面经 校招 春招 java

2023年3月中国数据库排行榜:开源OTO揽获前三,传统达梦、GBase触机便发

墨天轮

数据库 opengauss TiDB oceanbase 国产数据库

Spring源码解析-Spring 事务

Java你猿哥

Java spring Spring Boot ssm spring 源码

图片无损放大:Topaz Gigapixel AI 激活版

真大的脸盆

Mac Mac 软件 图片无损放大 图片编辑 图片放大

关于服务器数据迁移,介绍在服务器数据迁移计划中的7个步骤

镭速

2023 MacBook Pro 与2021 Macbook Pro有哪些差别

互联网搬砖工作者

MacBook M1芯片 MacBook Pro M2芯片

Spring Boot 集成 Liquibase,数据库也能做版本控制!

Java你猿哥

Java spring Spring Boot java 编程

经验总结!朋友的阿里面经分享(内附题目+解析)

Java你猿哥

Java 校招 春招 阿里面经 Java八股文

家电类投诉高居榜首,拿什么拯救“投诉了个寂寞”的消费者?

Openlab_cosmoplat

工业互联网 开源社区 家电

从企业数据产品的演进,看指标平台发展趋势

Kyligence

数据分析 指标平台

Refit — 让Http请求变得更简单

青柚1943

微服务 REST API NET6 Refit

功能强大的数据库管理工具:DBeaverEE 激活版

真大的脸盆

Mac 数据库管理工具 数据库管理 Mac 软件 数据库分析

Tapdata Cloud 基础课:新功能详解之「授权系统自动分析」,一键定位任务报错原因,快速获取修复建议

tapdata

大数据

低代码平台的流程引擎设计指南

Baidu AICLOUD

低代码 爱速搭

Spring源码解析-Spring AOP

Java你猿哥

Java 源码 云原生 Spring Boot ssm

国产操作系统应用开发的趋势与挑战

没有用户名丶

2023年浸没液冷智算产业发展高峰论坛:OPPO发布两项白皮书

安第斯智能云

创新 OPPO 论坛 高新技术

量化交易(机器人)开发系统现货合约策略

薇電13242772558

量化策略

业务系统故障率居高不下:有哪些非常有效的治理大招?

TakinTalks稳定性社区

利用 ModelScope 社区开源模型,实现低资源场景下的零样本文本分类

阿里技术

深度学习 自然语言模型

请求响应--MQTT 5.0新特性

EMQ映云科技

物联网 IoT mqtt 订阅 企业号 3 月 PK 榜

报名开启!KunlunBase今年首场线下MeetUP,期待与您的见面!

KunlunBase昆仑数据库

Meetup kunlunbase 内核技术

实践Pytorch中的模型剪枝方法

华为云开发者联盟

人工智能 华为云 华为云开发者联盟 企业号 3 月 PK 榜

你值得拥有的IoT 物联网平台开发实用技巧(一)——数据价值类

阿里云AIoT

虎牙SRE谈可观测:如何做到比用户和老板更早发现业务异常?

TakinTalks稳定性社区

Hadoop + SQL Server + Excel = 大数据分析_微软_Roopesh Shenoy_InfoQ精选文章