写点什么

Amazon SageMaker Ground Truth 不断简化标记工作流

  • 2019-10-01
  • 本文字数:2439 字

    阅读完需:约 8 分钟

Amazon SageMaker Ground Truth 不断简化标记工作流

在 AWS re:Invent 2018 上推出的 Amazon SageMaker Ground Truth 是 Amazon SageMaker 中的一项功能,可方便客户高效准确地为机器学习训练系统所需的数据集添加标签。

Amazon SageMaker Ground Truth 快速回顾

Amazon SageMaker Ground Truth 可帮助您快速构建高度准确的机器学习训练数据集。利用 SageMaker Ground Truth,可以方便地找到公开和非公开的人工标记者,并为他们提供用于常见加标签任务的内置工作流和界面。此外,SageMaker Ground Truth 还可以使用自动加标签功能将加标签的成本降低多达 70%,其中自动加标签的工作原理是利用人工加标签的数据来训练 Ground Truth,从而使这项服务学会独立为数据加标签。


Amazon SageMaker Ground Truth 可帮助您为下列目的构建数据集:


  • 文本分类。

  • 图像分类,即将图像分类为特定的类别。

  • 对象检测,即使用边界框找到图像中的对象。

  • 语义分割,即以像素级的精确度找到图像中的对象。

  • 自定义由用户定义的任务,允许客户对任何内容进行标注。

  • 您可以选择由标记者团队完成这项任务,并将加标签的请求直接发送给他们。如果您需要扩大规模,也可以直接在 Amazon SageMaker Ground Truth 控制台中提供相关选项,以便与组织外部的标记者合作。通过集成 Amazon Mechanical Turk,可为您效劳的公共劳动力将包含超过 500,000 名标记者。如果您的数据需要保密或特殊技能,您也可以选择由 Amazon 预先筛选并在 AWS Marketplace 上列出的专业标记公司。

推出新功能

自该服务推出以来,我们收集了大量来自 T-Mobie、Pinterest、Chang healthcare、GumGum、Automagi 等公司的客户反馈(目前还在继续收集!)。我们在此基础上定义了服务下一次迭代的雏形,而就在几个星期之前,我们刚刚发布了两个呼声很高的功能:


  • 多类别边界框(允许您同时为图像中的多个类别加标签)。

  • 三个适用于自定义工作流的新 UI 模板,共有十五种不同的模板,可帮助您快速构建图像、文本和音频数据集的标注工作流。


今天,我们很高兴地再宣布一系列新功能。这些功能可以让具成本效益的加标签工作流能够更加简便地构建和运行。让我们来详细了解这些新功能。

作业链

客户通常希望能在后续的加标签作业中利用先前加标签作业的成果。从基本上来说,他们希望利用所得的加标签数据集(以及所得的机器学习模型 [如果启用了数据自动加标签]),将加标签作业链在一起。例如,他们可能会在初始作业中识别图像中是否存在人类,然后在运行后续作业时,希望在人类周围绘制边界框。


如果使用主动学习,客户可能还希望使用生成的机器学习模型,以便在后续作业中引导实现自动为数据加标签。设置过程非常简单:只需一次点击即可将加标签作业链在一起!

作业跟踪

客户希望能够查看其加标签作业进度的状态。现在,我们已经能够近乎实时地提供加标签作业状态。


长期作业

许多客户选择由专家来充当标记者角色,并定期执行加标签作业。例如,医疗保健公司经常选择有临床医生充当他们的专业加标签人员,而他们只能在不工作时偶尔执行加标签作业。在这些情况下,加标签作业会需要运行更长时间,有时长达数周或数月。我们现在支持更长的任务超时窗口,其中每批标记作业可以运行 10 天,这意味着加标签作业可以延长到数月。

动态自定义工作流

在设置自定义工作流时,除源数据外,客户还希望插入或使用其他上下文。例如,在发送给标记者的任务中,客户可能希望在每个图像上方显示具体天气状况;这些信息可以帮助标记者更好地完成手头的任务。具体而言,客户可以利用此功能将先前加标签作业的成果或其他自定义内容注入自定义工作流。使用包含源数据和附加上下文的增强清单文件将此信息传递到预处理 Lambda 函数。客户还可以使用其他上下文来动态调整工作流。

新的服务提供商和新语言

我们在 AWS Marketplace 上列出了两个新的数据标记服务提供商:Vivetic 和 SmartOne。在这两家供应商加入之后,Amazon SageMaker Ground Truth 将增加对法语、德语和西班牙语数据标记的支持。


区域扩展

除美国东部(弗吉尼亚州)、美国中部(俄亥俄州)、美国西部(俄勒冈州)、欧洲(爱尔兰)和亚太地区(东京)外,亚太地区(悉尼)现在也可以使用 Amazon SageMaker Ground Truth。

客户案例研究:ZipRecruiter

ZipRecruiter 帮助求职者找到好工作,帮助雇主成立好公司。自 Amazon SageMaker 推出以来,他们一直在使用这项服务。ZipRecruiter 首席技术官 Craig Ogg 表示:“ZipRecruiter 的 AI 驱动算法可以了解每个雇主所需要的人才,并提供一组相关度和个性化程度较高且经过挑选的候选人。就市场中的另一方面而言,公司采用的技术还要能够将求职者与最相关的工作相匹配。为了有效地完成所有这些工作,我们需要一个机器学习模型,以便从上传的简历中自动提取相关数据。”


当然,构建数据集是机器学习过程的关键部分,通常会耗费大量资金而且非常耗时。为了解决这两个问题,ZipRecruiter 选择了 Ground Truth 和我们的一个标记合作伙伴 iMerit。


正如 Craig 所说的那样:“Amazon SageMaker Ground Truth 将大大帮助我们减少创建训练数据集所需的时间和精力。由于数据的保密性,我们最初考虑使用我们自己的一个团队,但这需要占用他们完成常规任务的时间,并且需要数月才能收集我们需要的数据。在使用 Amazon SageMaker Ground Truth 的同时,我们聘用了 Amazon 预先筛选的专业标记公司 iMerit 来协助完成自定义的标注项目。在他们的帮助下,我们收集数千个标注所需的时间与使用我们自己的团队相比只是九牛一毛。”

开始使用

我希望这篇文章能够提供丰富的信息,并且希望这些新功能可以帮助您更快地完成构建工作。请试用 Amazon SageMaker Ground Truth,让我们知道您的想法,并帮助我们构建这项出色服务的下一次迭代!


作者介绍:


Julien Simon


作为欧洲、中东和非洲 (EMEA) 地区人工智能和机器学习的宣传官,Julien 致力于帮助开发人员和企业将他们的想法变成现实。


本文转载自 AWS 技术博客。


原文链接:


https://amazonaws-china.com/cn/blogs/china/amazon-sagemaker-ground-truth-keeps-simplifying-labeling-workflows/


2019-10-01 08:00879
用户头像

发布了 1863 篇内容, 共 132.5 次阅读, 收获喜欢 81 次。

关注

评论

发布
暂无评论
发现更多内容

Linux之vmstat命令

入门小站

Linux

mysql 面试总结

yuexin_tech

面试

运维与微服务结合?深度解析微服务框架Tars整体解决方案

云智慧AIOps社区

DevOps 微服务 运维 云原生 TARS

前端培训:Vue 面试题分享

@零度

Vue 前端开发

小程序开发中使用网络请求

Speedoooo

大数据培训:Hadoop生态系统圈

@零度

大数据 hadoop

第九节:SpringBoot在线文档Swagger2入门

入门小站

springboot

关于如何构建 Go 代码的思考

宇宙之一粟

Go 语言 2月月更

设计模式【13】-- 模板模式怎么弄?

秦怀杂货店

Java 设计模式 23种设计模式

不会用SpringBoot连接Redis,那就赶紧看这篇

华为云开发者联盟

redis 开发 springboot Redis服务器

如何低成本测试云原生(K8s)应用?

Draven Gorden

微服务 云原生 联调测试 并行测试

一文带你了解数仓智能运维框架

华为云开发者联盟

运维 GaussDB(DWS) 智能运维框架 调度框架 任务调度器

固态存储行业领导者硅格半导体加入龙蜥社区,共同推动开源生态建设

OpenAnolis小助手

Linux 开源 社群运营

架构训练营 week10 课程总结

红莲疾风

「架构实战营」

百度手机助手存储资源优化实践

百度Geek说

后端 存储

架构实战营毕业总结

红莲疾风

「架构实战营」

一文搞明白直播和点播的区别 | 社区征文

liuzhen007

音视频 新春征文 2月月更

AI象棋,谁与争锋

乌龟哥哥

AI 2月月更

产品经理角色理解

wood

300天创作

在线ASCII流程图编辑器工具

入门小站

工具

一起玩转LiteOS组件:Pixman

华为云开发者联盟

LiteOS LiteOS组件 Pixman Pixman Demo LiteOS组件仓库

java培训:SpringBoot技术的理解

@零度

JAVA开发 spring-boot

B站员工猝死,审核员之殇,谁该反省?谁该惭愧?技术层面解构内容安全审核系统(python3)

刘悦的技术博客

系统架构 内容审核 Python3 应用审核 构架

领域模型设计该如何落地到数据库设计?

蜜糖的代码注释

Java DDD 领域模型 2月月更

Java异常处理:如何写出“正确”但被编译器认为有语法错误的程序

华为云开发者联盟

Java 代码 java异常处理 语法 Exception

王者荣耀商城异地多活设计

皓月

「架构实战营」

【架构训练营-模块二】

默光

微信朋友圈 架构训练营5期

react源码解析3.react源码架构

buchila11

React

再见丑陋的 SwaggerUI,这款开源的API文档生成神器界面更炫酷,逼格更高!

沉默王二

Java

读书笔记:查理芒格的思维模型

panda

这样才是代码管理和 Commit 的正确姿势! | 研发效能提升36计

阿里云云效

阿里云 云原生 代码管理 研发 Commit

Amazon SageMaker Ground Truth 不断简化标记工作流_语言 & 开发_亚马逊云科技 (Amazon Web Services)_InfoQ精选文章