写点什么

英特尔开源分布式深度学习平台 Nauta,使用 Kubernetes 和 Docker 平台运行

  • 2019-01-24
  • 本文字数:1813 字

    阅读完需:约 6 分钟

英特尔开源分布式深度学习平台Nauta,使用Kubernetes 和 Docker 平台运行

1 月 24 日,英特尔发表博文宣布开源其分布式深度学习平台 Nauta。Nauta 使用业界领先的 Kubernetes 和 Docker 平台运行,以实现可扩展性和易管理性。


GitHub 开源地址:https://github.com/intelAI/Nauta


随着越来越多的企业探索在业务中使用 AI 来改善商业模式,AI 继续不断发展。根据 Gartner 最近一份报告显示,AI 部署已经产生巨大实际价值,2022 年价值有望达到 4 万亿美元。AI 中的深度学习也获得快速发展,据德勤一份 2018 年地调查显示,有将近 50% 的受访者表示已经采用了深度学习。虽然业务价值持续增长,并且企业对深度学习的兴趣显而易见,但集成、验证和优化深度学习解决方案仍然是一项复杂,有风险且耗时的工作。这就是英特尔使用 Kubernetes 为分布式深度学习引入 Nauta 开源平台的原因。

Nauta 是什么?

Nauta 提供了一个多用户的分布式计算环境,用于运行深度学习模型训练实验。它可以使用命令行界面、Web UI 和/或 TensorBoard 查看和监控实验结果。你可以使用现有数据集,自己的数据或在线下载的数据创建公共或私人文件夹,更轻松地在团队之间进行协作。


Nauta 使用业界领先的 Kubernetes 和 Docker 平台运行,以实现可扩展性和易管理性。为了让创建和运行单节点和多节点深度学习训练实验更简单,该平台兼容各种深度学习框架和工具的模板包(并可自定义),而无需标准容器环境所需的所有系统开销和脚本。


在模型测试中,Nauta 还支持批量和流式推理,所有工作在一个平台上完成。



(图 1:使用 Nauta 训练并部署深度学习网络)

面向开发人员,支持 Kubernetes 和容器化

英特尔在创建 Nauta 工作流程中考虑到了开发人员和数据科学家。Nauta 是一个企业级堆栈,适用于需要进行深度学习模型训练并在生产中部署团队。使用 Nauta,用户可以在单个或多个工作节点上使用 Kubernetes 定义并进行容器化的深度学习实验,并检查这些实验的状态和结果,以进一步调整和运行其他实验,或准备训练模型进行部署。

Nauta 特性

  • Nauta 使用户能够利用来自经验丰富的机器学习开发人员和运营商的共享最佳实践,而不会牺牲灵活性。

  • 在每个抽象级别,开发人员仍然有机会回退到 Kubernetes 并直接使用原语。

  • Nauta 让新手在有保障的情况下进行实验。精心挑选的组件和直观的用户体验减少了对开源 DL 服务的生产准备,配置和互操作性的担忧。

  • 支持多团队成员协作,作业输入和输出可以在团队成员之间共享,并通过启动 TensorBoard 来查看其他人的工作检查点,帮助调试问题。



(图 2:使用 TensorBoard 和 Nauta WebUI 监控作业)

创建指南

2019 年,Nauta 将在 Q1 及更高版本中进行更新,并通过landing page维护开发者社区,鼓励开发人员和数据科学家在他们自己的堆栈上尝试 Nauta。


有关最新的技术信息,包括安装指南,用户文档以及如何参与项目,参见 Github:https://github.com/intelAI/Nauta


构建 Nauta 安装包并在 Google Cloud Platform 上顺利运行,请关注Google云平台上的Nauta 入门


有关构建 Nauta 包的详细信息,参见如何构建指南


快速启动并运行,请查看入门指南


更多信息,请参阅以下文档:


Nauta、Kubeflow Pipeline、Azure Kubernetes、Acumos AI 对比

Nauta 是可以使用 Kubernetes 或 Docker 容器的最新发布工具,这种方法让从业者在通过内部部署服务器还是云端部署 AI 之间进行选择。


11 月,谷歌推出了一个 Kubernetes 工作流程 Kubeflow Pipeline,而微软上个月在公开预览中推出了 Azure Kubernetes 服务。


Kubeflow Pipeline GitHub:https://github.com/kubeflow/pipelines


Kubeflow 是一个使用 Kubeflow Pipelines SDK 构建的可重复使用的端到端 ML 工作流程,致力于使 Kubernetes 上机器学习工作流的部署简单,可移植和可扩展。


Azure Kubernetes:https://azure.microsoft.com/en-us/services/kubernetes-service/


Azure Kubernetes 简化 Kubernetes 管理、部署和运营,使用完全托管的 Kubernetes 容器编排服务。


另外,Linux 基金会的 LF 深度学习基金也于去年秋季推出了用于深度学习的 Acumos AI 平台和开源框架,可以轻松构建、共享和部署 AI 应用程序,标准化了运行开箱即用的通用 AI 环境所需的基础架构堆栈和组件。


参考链接:


https://venturebeat.com/2019/01/23/heartland-tech-weekly-indie-vcs-funding-model-could-be-promising-for-startups-in-middle-america/


https://www.acumos.org/


https://azure.microsoft.com/en-us/services/kubernetes-service/


2019-01-24 12:116115
用户头像

发布了 98 篇内容, 共 64.7 次阅读, 收获喜欢 285 次。

关注

评论 1 条评论

发布
用户头像
kube-batch inside :)
2019-01-26 18:47
回复
没有更多了
发现更多内容

为数据赋能:腾讯TDSQL分布式金融级数据库前沿技术 - 云+社区 - 腾讯云

腾讯云数据库

数据库 tdsql

腾讯云数据库TDSQL两篇论文入选数据库顶会SIGMOD,产学研结合助力国产数据库生态建设

腾讯云数据库

数据库 tdsql

TDSQL:关于未来,数据库大咖们都聊了什么?

腾讯云数据库

数据库 tdsql

TLS协议分析 (四) handshake协议概览

OpenIM

GetX代码生成IDEA插件,超详细功能讲解(透过现象看本质)

小呆呆666

带你认识数据库视图对象,下次不要再认成“表”了

华为云开发者联盟

数据库 sql 对象 视图 GaussDB(DWS)

TLS协议分析 (五) handshake协议 证书与密钥交换

OpenIM

搞懂现代Web端即时通讯技术一文就够:WebSocket、socket.io、SSE

JackJiang

websocket 即时通讯 IM

如何在MacOS上无缝切换Win11和MacOS?

Zhendong

MacBook m1 Parallels

颇具年代感的《JMeter中文操作手册》

FunTester

Jmeter 性能测试 自动化测试 接口测试 FunTester

TLS协议分析 (三) record协议

OpenIM

从源码角度分析 MyBatis 工作原理

vivo互联网技术

sql mybatis JDBC ORM

揭秘TDSQL-A:兼容Oracle的同时支持海量数据交互

腾讯云数据库

数据库 tdsql

朋友圈架构设计

XP

终于,基础软件领域的行业盛会来了!

Jessie

开源 云原生 基础软件 中间件 #数据库

从 CI_CD 到 DevOps

飞算JavaAI开发助手

DevOps 自动化 基础软件

学习Linux tar 命令:最简单也最困难

华为云开发者联盟

Linux 文件 Linux tar tar命令 存档

腾讯云 TDSQL 审计原理揭秘

腾讯云数据库

数据库 tdsql

【VueRouter 源码学习】第五篇 - 两种路由模式的设计

Brave

源码 vue-router 9月日更

EMQ 映云科技与 RT-Thread 达成战略合作,共建产业物联网平台

EMQ映云科技

人工智能 云计算 大数据 物联网 emq

2021云计算白皮书发布,腾讯云原生数据库TDSQL-C助力共建云上技术生态

腾讯云数据库

数据库 tdsql

Retrofit源码解读HTTP

Changing Lin

android 9月日更

模块(三)如何设计出合理的架构

我是一只小小鸟

论亚马逊QLDB与腾讯TDSQL对历史数据的管理和计算

腾讯云数据库

数据库 tdsql

一文读懂数据库最新技术趋势:TDSQL带你深度纵览VLDB 2019

腾讯云数据库

数据库

TDSQL:深度剖析数据库国产化迁移之路

腾讯云数据库

数据库 tdsql

Android技术分享| 开源Demo any自习室布局架构

anyRTC开发者

音视频 移动开发 在线自习室 Android技术分享

解读顶会ICDE’21论文:利用DAEMON算法解决多维时序异常检测问题

华为云开发者联盟

华为云数据库 时序数据 深度神经网络算法 DAEMON 轨迹分析

使用GO语言实现Mysql数据库CURD

Regan Yue

数据库 Go 语言 9月日更

学会这5种JS函数继承方式,前端面试你至少成功50%

华为云开发者联盟

面试 大前端 js 继承 函数继承

TDSQL:从自主可控金融级数据库看腾讯“智能+”技术中台之路

腾讯云数据库

数据库 tdsql

英特尔开源分布式深度学习平台Nauta,使用Kubernetes 和 Docker 平台运行_AI&大模型_英特尔官博_InfoQ精选文章