写点什么

Amazon SageMaker Ground Truth 不断简化标记工作流

  • 2019-10-01
  • 本文字数:2439 字

    阅读完需:约 8 分钟

Amazon SageMaker Ground Truth 不断简化标记工作流

在 AWS re:Invent 2018 上推出的 Amazon SageMaker Ground Truth 是 Amazon SageMaker 中的一项功能,可方便客户高效准确地为机器学习训练系统所需的数据集添加标签。

Amazon SageMaker Ground Truth 快速回顾

Amazon SageMaker Ground Truth 可帮助您快速构建高度准确的机器学习训练数据集。利用 SageMaker Ground Truth,可以方便地找到公开和非公开的人工标记者,并为他们提供用于常见加标签任务的内置工作流和界面。此外,SageMaker Ground Truth 还可以使用自动加标签功能将加标签的成本降低多达 70%,其中自动加标签的工作原理是利用人工加标签的数据来训练 Ground Truth,从而使这项服务学会独立为数据加标签。


Amazon SageMaker Ground Truth 可帮助您为下列目的构建数据集:


  • 文本分类。

  • 图像分类,即将图像分类为特定的类别。

  • 对象检测,即使用边界框找到图像中的对象。

  • 语义分割,即以像素级的精确度找到图像中的对象。

  • 自定义由用户定义的任务,允许客户对任何内容进行标注。

  • 您可以选择由标记者团队完成这项任务,并将加标签的请求直接发送给他们。如果您需要扩大规模,也可以直接在 Amazon SageMaker Ground Truth 控制台中提供相关选项,以便与组织外部的标记者合作。通过集成 Amazon Mechanical Turk,可为您效劳的公共劳动力将包含超过 500,000 名标记者。如果您的数据需要保密或特殊技能,您也可以选择由 Amazon 预先筛选并在 AWS Marketplace 上列出的专业标记公司。

推出新功能

自该服务推出以来,我们收集了大量来自 T-Mobie、Pinterest、Chang healthcare、GumGum、Automagi 等公司的客户反馈(目前还在继续收集!)。我们在此基础上定义了服务下一次迭代的雏形,而就在几个星期之前,我们刚刚发布了两个呼声很高的功能:


  • 多类别边界框(允许您同时为图像中的多个类别加标签)。

  • 三个适用于自定义工作流的新 UI 模板,共有十五种不同的模板,可帮助您快速构建图像、文本和音频数据集的标注工作流。


今天,我们很高兴地再宣布一系列新功能。这些功能可以让具成本效益的加标签工作流能够更加简便地构建和运行。让我们来详细了解这些新功能。

作业链

客户通常希望能在后续的加标签作业中利用先前加标签作业的成果。从基本上来说,他们希望利用所得的加标签数据集(以及所得的机器学习模型 [如果启用了数据自动加标签]),将加标签作业链在一起。例如,他们可能会在初始作业中识别图像中是否存在人类,然后在运行后续作业时,希望在人类周围绘制边界框。


如果使用主动学习,客户可能还希望使用生成的机器学习模型,以便在后续作业中引导实现自动为数据加标签。设置过程非常简单:只需一次点击即可将加标签作业链在一起!

作业跟踪

客户希望能够查看其加标签作业进度的状态。现在,我们已经能够近乎实时地提供加标签作业状态。


长期作业

许多客户选择由专家来充当标记者角色,并定期执行加标签作业。例如,医疗保健公司经常选择有临床医生充当他们的专业加标签人员,而他们只能在不工作时偶尔执行加标签作业。在这些情况下,加标签作业会需要运行更长时间,有时长达数周或数月。我们现在支持更长的任务超时窗口,其中每批标记作业可以运行 10 天,这意味着加标签作业可以延长到数月。

动态自定义工作流

在设置自定义工作流时,除源数据外,客户还希望插入或使用其他上下文。例如,在发送给标记者的任务中,客户可能希望在每个图像上方显示具体天气状况;这些信息可以帮助标记者更好地完成手头的任务。具体而言,客户可以利用此功能将先前加标签作业的成果或其他自定义内容注入自定义工作流。使用包含源数据和附加上下文的增强清单文件将此信息传递到预处理 Lambda 函数。客户还可以使用其他上下文来动态调整工作流。

新的服务提供商和新语言

我们在 AWS Marketplace 上列出了两个新的数据标记服务提供商:Vivetic 和 SmartOne。在这两家供应商加入之后,Amazon SageMaker Ground Truth 将增加对法语、德语和西班牙语数据标记的支持。


区域扩展

除美国东部(弗吉尼亚州)、美国中部(俄亥俄州)、美国西部(俄勒冈州)、欧洲(爱尔兰)和亚太地区(东京)外,亚太地区(悉尼)现在也可以使用 Amazon SageMaker Ground Truth。

客户案例研究:ZipRecruiter

ZipRecruiter 帮助求职者找到好工作,帮助雇主成立好公司。自 Amazon SageMaker 推出以来,他们一直在使用这项服务。ZipRecruiter 首席技术官 Craig Ogg 表示:“ZipRecruiter 的 AI 驱动算法可以了解每个雇主所需要的人才,并提供一组相关度和个性化程度较高且经过挑选的候选人。就市场中的另一方面而言,公司采用的技术还要能够将求职者与最相关的工作相匹配。为了有效地完成所有这些工作,我们需要一个机器学习模型,以便从上传的简历中自动提取相关数据。”


当然,构建数据集是机器学习过程的关键部分,通常会耗费大量资金而且非常耗时。为了解决这两个问题,ZipRecruiter 选择了 Ground Truth 和我们的一个标记合作伙伴 iMerit。


正如 Craig 所说的那样:“Amazon SageMaker Ground Truth 将大大帮助我们减少创建训练数据集所需的时间和精力。由于数据的保密性,我们最初考虑使用我们自己的一个团队,但这需要占用他们完成常规任务的时间,并且需要数月才能收集我们需要的数据。在使用 Amazon SageMaker Ground Truth 的同时,我们聘用了 Amazon 预先筛选的专业标记公司 iMerit 来协助完成自定义的标注项目。在他们的帮助下,我们收集数千个标注所需的时间与使用我们自己的团队相比只是九牛一毛。”

开始使用

我希望这篇文章能够提供丰富的信息,并且希望这些新功能可以帮助您更快地完成构建工作。请试用 Amazon SageMaker Ground Truth,让我们知道您的想法,并帮助我们构建这项出色服务的下一次迭代!


作者介绍:


Julien Simon


作为欧洲、中东和非洲 (EMEA) 地区人工智能和机器学习的宣传官,Julien 致力于帮助开发人员和企业将他们的想法变成现实。


本文转载自 AWS 技术博客。


原文链接:


https://amazonaws-china.com/cn/blogs/china/amazon-sagemaker-ground-truth-keeps-simplifying-labeling-workflows/


2019-10-01 08:00838
用户头像

发布了 1855 篇内容, 共 124.2 次阅读, 收获喜欢 81 次。

关注

评论

发布
暂无评论
发现更多内容

原生APP开发的特点

北京木奇移动技术有限公司

软件外包公司 APP外包

京东API接口深度解析:如何高效获取商品SKU与关键词搜索商品信息

代码忍者

京东API接口 京东评论API接口

HarmonyOS Next 实战卡片开发 01

万少

鸿蒙

HarmonyOS Next 实战卡片开发 02

万少

鸿蒙

SQL优化的20招

采菊东篱下

Java sql

茶叶连锁店管理系统(源码+文档+部署+讲解)

深圳亥时科技

针对Flexus X实例云服务器的CPU和内存性能测评

轶天下事

远程软件怎么选?ToDesk、向日葵、Parsecd、TeamViewer评测结果公布

-亦世凡华、

由 Mybatis 源码畅谈软件设计(四):动态 SQL 执行流程

京东科技开发者

纯配时效服务-双Redis集群设计

京东科技开发者

阿里巴巴1688 API接口深度解析:轻松获取商品详情与高效执行关键词搜索

代码忍者

1688API接口 关键词搜索1688API

探秘驱动软件系统高效协同的高效协同之API接口

科普小能手

数据挖掘 软件开发 API 接口 API 文档 API 测试

轻松上手!PyCharm安装全攻略,编程效率翻倍!

测试人

软件测试

openGauss Summit 2024在北京圆满落幕,中国科学院院士钱德沛发表开场致词

Geek_2d6073

Java面试题及答案最全总结(2024版),全是面试官必问技术

采菊东篱下

编程 计算机 java面试

QT 软件项目的外包开发

北京木奇移动技术有限公司

软件外包公司 QT外包开发 QT开发

什么是数字化转型?

万界星空科技

数字化转型 数字化 制造业 mes 数字化工厂

HarmonyOS Next 实战卡片开发 03

万少

鸿蒙

Redis Sets 使用场景有哪些?如何实现共同好友?

架构师之道

redis java面试

京东商品评论数据接口(JD.item_review)丨京东API接口指南

tbapi

京东API接口 京东商品评论接口

SMART Utility for mac (硬盘检测工具)v3.2.7激活版

理理

字节还是那么喜欢考算法

王中阳Go

字节跳动 面试 go语言

AI安全的挑战:如何让人工智能变得更加可信

天津汇柏科技有限公司

AI安全 AI 人工智能

HarmonyOS Next 元服务新建到上架全流程

万少

鸿蒙

开源即时通讯IM框架MobileIMSDK的鸿蒙NEXT端开发快速入门

JackJiang

网络编程 即时通讯 IM 鸿蒙OS MobileIMSDK

Github上线11天,收获Star超60K+,Java岗最全面试攻略

架构师之道

Java 编程

AIP智能体人才市场:构建未来软件开发的新模式

大东(AIP内容运营专员)

人工智能

京东供应链创新与实践:应用数据驱动的库存选品和调拨算法提升履约效率

京东科技开发者

资源规划管理系统(源码+文档+部署+讲解)

深圳亥时科技

WebGL 开发 3D 项目的详细流程

北京木奇移动技术有限公司

数字孪生 软件外包公司 webgl开发

利用FIO工具测试Flexus云服务器X实例存储性能.

轶天下事

Amazon SageMaker Ground Truth 不断简化标记工作流_语言 & 开发_亚马逊云科技 (Amazon Web Services)_InfoQ精选文章