写点什么

从 Snowflake 迁移到 Databricks,成本下降 50%?Snowflake 被迫解释

  • 2023-09-06
    北京
  • 本文字数:3265 字

    阅读完需:约 11 分钟

大小:1.50M时长:08:42
从Snowflake迁移到Databricks,成本下降50%?Snowflake被迫解释

如果成本能优化掉一半,那么总让人觉得有什么地方不对劲。

 

不久前,日杂百货配送公司 Instacart 在其 IPO 文件第 280 页处的一句无心表述,意外掀起了两家大数据厂商之间的口水战。

 

Instacart 公司董事会成员 Frank Slootman 同时也是 Snowflake 公司 CEO,后者是一家帮助企业客户在云端存储和管理大量工作负载的上市企业。Slootman 于 2021 年加入 Instacart 董事会,出于这层关系,Instacart 在招股申请中就必须年其与 Snowflake 之间的业务关系。

 

乍看之下,Instacart 的支出数字似乎令 Snowflake 颇感不安。

 


Instacart 方面表示,他们在 2020 年“向 Snowflake 支付了 1300 万美元”,这个数字在 2021 年迅速增长至 2800 万美元,到 2022 年更是为“基于云的数据仓库服务”支付了 5100 万美元。可时间来到 2023 年,开销数字似乎出现了逆转,Instacart 表示“我们预计全年将向 Snowflake 支付约 1500 万美元。”

 

这可是高达 71%的同比降幅,我们当然好奇背后究竟发生了什么。

 

但 Snowflake 公司则一再强调,这些数字并不能反映真实趋势,而是应当结合招股文件中更深层次的细节来还原真相。

 

但无论如何,混乱之门已经就此打开。

 

迁移到 Databricks 来节省开支?

 

今年 5 月,Instacart 公司发表一篇题为《Instacart 如何运用智能湖仓架构与 Spark 建立模块化数据管线》(How Instacart Ads Modularized Data Pipelines With Lakehouse Architecture and Spark,https://archive.ph/NLn3L)的博文。文章描述了用于支持 Instacart 广告基础设施的软件,还讨论了迁移至 Databricks 的智能湖仓技术和由此带来的成本节约效果。

 

“我们用 Kafka 和 Spark 取代了 Kinesis Firehose,以 Delta 格式将数据传输到 S3 上。”

 

“虽然还有其他可用的表格式,例如 Apache Hudi 和 Apache Iceberg,但我们发现 Delta 由于 Databricks 平台提供的成熟集成和支持而脱颖而出。”

 

“这意味着我们可以更灵活地选择最适合我们的数据量和 SLA 要求的硬件,从而显着降低成本(节省 50% 以上)。”

 


Instacart 的现代数据堆栈:https://www.instacart.com/company/how-its-made/the-next-era-of-data-at-instacart/

 

这些文章似乎暗示着,Instacart 在 Snowflake 上的支出减少,在 Databricks 上的支出增加。

 

Snowflake 的竞争对手 Databricks 的员工抓住机会发起猛攻。他们在社交媒体上大肆宣扬 Snowflake 收入明显下降,并表示这主要是因为 Instacart 开始将工作负载转移至 Databricks 基础设施。

 


Snowflake 方面的员工很快予以反击,称这些数字完全是断章取义,并指责 Databricks 放出的正不断蚕食 Snowflake 业务份额的消息纯粹是凭空捏造。

 

双方对喷之下,Reddit、LinkedIn 和 X(原 Twitter)上的不少相关帖子也被迅速删除。

 

就连 Instacart 也主动撤销了部分争议内容。

 

然而,随着 IPO 申请激发的网上热议,Instacart 决定删除这篇博文。如今,访问此帖的读者只能面对 404 错误。Databricks 也撤下了一份关于 Instacart 如何应用其技术的详尽案例研究报告,但其官方网站上仍保留在今年早些时候发布的相关演示。

 

Instacart、Snowflake 以及 Databricks 公司的代表均拒绝对此发表置评。

 

这场争议之所以会被曝光,单纯是因为 Slootman 身兼 Instacart 公司的董事会成员,同时撞上了 Snowflake 与 Databricks 在云、数据和 AI 等热门技术领域中激烈对抗的当口。之前社交媒体上就曾多次爆发过类似的冲突,以至于一位 Reddit 用户几个月前曾撰写文章,题为《Databricks 和 Snowflake:别在社交媒体上对喷了行吗?》(Databricks and Snowflake: Stop fighting on social.” A commenter responded)的文章,评论区也有用户打趣道“这到底是数据工程,还是职业摔跤?”

 


2020 年 4 月 7 日,马萨诸塞州法尔茅斯,Instacart 采购员正在新冠疫情之下为顾客送货。由于亚马逊、Instacart 等多家企业的员工要求提高工资、危险津贴和病假时长,相当一部分服务开始由个体卖家承担。

 

Snowflake 于 2020 年上市,凭借超 30 亿美元的资金筹集总额成为美国有史以来规模最大的商业软件 IPO。即使经历了去年的市场暴跌,Snowflake 的市值仍稳稳超过 500 亿美元。

 

Databricks 则仍处于私营状态,但也是目前最为风险投资公司看好的企业之一。2021 年,私人投资者对该公司的估值为 380 亿美元;而彭博社上周报道称,该公司正在就估值 430 亿美元的融资进行谈判。

 

为了拓展 AI 业务领域,Snowflake 最近以 1.85 亿美元收购了 AI 搜索引擎 Neeva;另一方面,Databricks 则砸下 13 亿美元收购了生成式 AI 初创公司 MosaicML。

 

Instacart 这边的开支下降究竟是怎么回事?

 

介绍了事件背景,下面咱们回头剖析 Instacart 文件中的开支下降问题。

 

虽然 Databricks 确实从 Instacart 这边分到了一部分预算,但 Instacart 在 S-1 文件中关于 Snowflake 合作关系的注释部分表明,这并不是导致 Snowflake 相关开支急剧萎缩的根本原因。

相反,这里最重要的其实是 Instacart 核算运营费用的具体方法(即 Snowflake 的实际业务数额)。该数额在 2021 年时为 2800 万美元,2022 年也是 2800 万美元,之后到 2023 年上半年为 1100 万美元。虽然今年之内确实有所下降,但按年化计算降幅比例约为 21%,根本不是恐怖的 71%。

 

更令人困惑不解的是,“关联方交易”下的脚注并没有提到 Slootman 或者 Snowflake,仅仅是用“软件供应商的执行官”来指代。

 

随着网上讨论热度的提升,Snowflake 希望出面澄清事实——至少他们自己是这么理解的。于是上星期,该公司发布了一篇解释性的博文,题为《关于 Snowflake 和 Instacart 的事实》(Snowflake and Instacart: The Facts,https://www.snowflake.com/blog/snowflake-and-instacart-the-facts/)。

 

帖子开篇就写道,“最近几天来,社交媒体上有人歪曲了 Instacart 使用 Snowflake 产品的范围和趋势。”文章中倒是没有一句提到 Databricks,这也是 Snowflake 的惯常作法了。即使是在财务文件中,Snowflake 也从来不会将 Databricks 列为竞争对手。

 

Snowflake 继续表示,他们正在与 Instacart 合作以“优化效率”,也就是说要用更少的资源完成更多任务。另外,其技术“得到了 Instacart 几乎所有内部团队的广泛使用,包括目录团队、机器学习、广告、购物服务、零售商、客户和物流组织等部门。”

 

之后,该帖又强调了文件脚注中列出的使用数据,声称“在某些社交媒体帖子中,作者错误将付款时间差跟实际使用量混为一谈,就此得出支出大幅下降的结论——实际情况并非如此。”

翻译过来,就是我们 Snowflake 的相应支出下降,绝不是因为业务被某家不宜点名的公司给抢走了。

 


Youtube 视频:Instacart 如何将 Snowflake 成本优化 50%

 

问题在于,展示客户如何能够“优化”他们的 Snowflake 工作负载也可以被解读为承认该公司的部署和收费模式能导致意想不到的高昂账单。

 

据之前的媒体报道,曾有内部人士表示,Snowflake 每个集群可以处理 8 个并发用户,这意味着当系统添加更多用户时,成本就会增加。“ Snowflake 的即用即付模式产生的成本不可预测,成本的不可预测性对 (使用 Snowflake) 的人们来说可能是一个巨大的冲击。”

 

对于 Instacart 这件事,有网友评论说,他曾在最近的两份工作中都用到过 Snowflake,“这个产品有很多让人喜欢的地方,但成本管理一直是一门‘魔法(black art)’。也许就是故意的。Snowflake 的内置成本管理工具非常差,根据我的观察,大多数客户最终不得不构建自己的工具。这是 Snowflake 需要改进的地方。”“也许他们更忙于为股东服务,无暇顾及客户……”

 

参考链接:

https://archive.ph/NLn3L#selection-1061.0-1069.55

https://www.linkedin.com/posts/alighodsi_how-instacart-ads-modularized-data-pipelines-activity-7066465465493057536-b6fc/

https://www.snowflake.com/blog/snowflake-and-instacart-the-facts/

https://www.cnbc.com/2023/09/02/instacart-ipo-filing-fans-controversy-between-snowflake-databricks-.html

https://www.youtube.com/watch?v=up3bTjrBvTA

https://www.theregister.com/2023/09/05/snowflakes_instacart_protestations_opinion/

https://twitter.com/GergelyOrosz/status/1697196428735504388

https://twitter.com/modestproposal1/status/1695177654822191184

2023-09-06 14:504314

评论

发布
暂无评论
发现更多内容

3D数字绘画和雕刻软件:Mudbox 2025 新功能介绍及安装教程

Rose

Mudbox 2025下载 Mudbox 2025新功能 Mudbox 2025安装教程 3D数字雕刻

2024多云管理平台CMP排名看这里!

行云管家

云计算 云服务 多云管理 云管

京东为openKylin新增SBOM利器,保障软件供应链安全和可追溯性!

京东科技开发者

招聘严峻期我最终拿到5个Offer的一些经验分享(附面试题)

测试人

面试 软件测试

Elmedia Video Player Pro 支持AirPlay的苹果mac视频播放器

Rose

媒体播放器 Mac软件 视频播放器 Elmedia Video Player Pro

topaz gigapixel ai怎么安装?Topaz Gigapixel AI激活安装详细教程

Rose

topaz gigapixel ai破解版 无损放大图像 Topaz Gigapixel AI 安装

【论文速读】| 通过间接提示注入危害现实世界中的LLM集成应用

云起无垠

使用云压测回放 GoReplay 录制的请求

腾讯云可观测平台

GOREPLAY

万界星空科技WMS仓储管理包含哪些具体内容?

万界星空科技

wms 万界星空科技 仓库管理系统

水杉3D建模工具:Metasequoia破解版 含永久注册码

Rose

水杉3D建模 Metasequoia 4 破解版 Metasequoia 4注册码

标准库unsafe:带你突破golang中的类型限制

华为云开发者联盟

Go golang 开发 华为云 华为云开发者联盟

一文读懂MES和ERP的区别

万界星空科技

制造业 ERP mes 万界星空科技 生产管理软件

hal库中串口常用函数介绍

百度搜索:蓝易云

云计算 Linux 运维 云服务器 HAL

Maya 2025下载 玛雅maya2025新功能介绍

Rose

Maya 2025中文版 Maya 2025下载 三维动画软件 玛雅2025新功能 玛雅2025破解

解析 WebSocket 与 HTTP 协议的关键区别

Apifox

编程 程序员 网络协议 HTTP websocket

【重磅干货】大模型时代,开发者云上成长指南

华为云开发者联盟

华为云 华为云GaussDB 华为云开发者联盟 华为云CodeArts 华为云盘古大模型

玩转云端|天翼云边缘安全加速平台AccessOne实用窍门之上传下载极速推进,纵享丝滑体验!

天翼云开发者社区

云计算 边缘计算 云服务 边缘安全

万界星空科技漆包线工厂生产管理软件

万界星空科技

mes 万界星空科技 漆包线mes 漆包线

人工智能降噪:topaz photo ai 操作系统 topaz photo ai中文破解安装包

Rose

智能降噪 Topaz Photo AI系统要求 Topaz Photo AI破解版

Windows自定义后台进程并设置为开机启动

GousterCloud

windows 自定义 后台进程 开机启动

就业寒冬,我是如何拿到5个offer的(附面试题)

霍格沃兹测试开发学社

实现以图搜货功能,淘宝API开发实战分享

tbapi

图片搜索接口 以图搜货接口 拍立淘接口

cad设计绘图Autodesk AutoCAD 2025完整版中文破解工具

Rose

AutoCAD 2025 CAD2025

殊荣双至,天翼云边缘计算再获两项大奖!

天翼云开发者社区

云计算 边缘计算 云服务 边缘安全

什么是Ubuntu LTS?与常规版本的区别

百度搜索:蓝易云

云计算 Linux ubuntu 运维 云服务器

Disk Drill for mac专业直装版 苹果电脑数据恢复工具下载

Rose

Disk Drill下载 Disk Drill mac 数据恢复mac版

Hazel for Mac自动化清理 含Hazel许可证

Rose

Hazel for Mac Hazel许可证 Hazel for Mac破解版 自动化文件整理

移动端提高pdf预览清晰度

京东科技开发者

AutoCAD LT 2025介绍(精简版cad2025)及中文版安装教程

Rose

Autodesk AutoCAD LT 2025 cad2025破解版 AutoCAD LT 2025介绍

新体验、高效能,星河零代码产线加速带动产业新质生产力

飞桨PaddlePaddle

百度 BAIDU 百度飞桨 产品更新 PaddleX

探秘Kubernetes:在本地环境中玩转容器技术

SEAL安全

Kubernetes 容器 云原生 本地环境

从Snowflake迁移到Databricks,成本下降50%?Snowflake被迫解释_数据湖仓_Tina_InfoQ精选文章