写点什么

阿里文娱资深算法专家任海兵:CV 落地最大的挑战是算法的稳定性

  • 2020-02-27
  • 本文字数:1687 字

    阅读完需:约 6 分钟

阿里文娱资深算法专家任海兵:CV落地最大的挑战是算法的稳定性

计算机视觉已发展多年,近年来,该技术已经成为了人工智能领域最为“吸睛”的方向之一,不仅吸引了大量的投资,也吸引了不少 AI 技术专家进行钻研。但是,随着整个 AI 行业“退烧”,落地难也成为了计算机视觉领域的难题,算法的质量及稳定性尤其引人关注。

在将于 7 月 24 日-25 日举办的AICon 全球人工智能与机器学习大会(上海站)上,阿里巴巴文娱资深算法专家任海兵将作为计算机视觉专题出品人,InfoQ 提前对任海兵老师进行了专访,请他来谈一谈深耕计算机视觉二十余年总结的经验与思考。


InfoQ:您是如何与计算机视觉结缘的,并在这个领域深耕二十余年的?


任海兵:本科五年级上学期的时候,我后来的博士导师徐光佑教授跟我说,计算机视觉是特别富有挑战性的研究领域,研究的课题都很困难,可以研究一辈子。我觉得:这个方向可以研究一辈子,感觉挺有意思的,所以就选择了计算机视觉做为我的直博专业方向。从此就跟计算机视觉结缘,一路下来二十多年了。


InfoQ:深耕计算机视觉二十余年,您能否用几句话总结下您的心得和收获?


任海兵:在这二十年中,我主要从事将计算机视觉算法落地工业场景的工作。最大的体会是,由于计算机视觉算法的局限性,我们需要对落地场景非常了解,定制化的设计解决方案,不能闭门造车。因为看似非常相似的落地场景,具体分析下来对算法的要求、评估方式等差别很大,常常需要结合实际场景定制化的去设计最优解决方案。那种希望用一种算法解决各种问题的想法是不切实际的。


InfoQ:过去一年中(2019 年),您认为在计算机视觉领域最值得关注的技术突破有哪些?能否谈谈原因。


任海兵:在过去的一年中,我最关注的技术是视频物体分割。2019 年出现的 space-time memory network 算法极大的提高了视频物体分割的准确性和计算速度,指出了视频物体分割技术的新发展方向。结合 CVPR 2020 该方向的论文投稿来看,视频物物体分割技术沿着这个方向将会有持续的提高,逐渐成熟起来。


InfoQ:能否请您用几个例子来谈谈,目前阿里巴巴在计算机视觉方面有哪些应用场景?


任海兵:阿里巴巴是个巨大的经济体,其业务涉及非常多的领域。其中很多领域中,计算机视觉起着重要的作用。例如智慧城市中的安防监控,智能交通中 3D 城市重建、文化娱乐产业中素材智能生产等。


InfoQ:在这些场景中,您负责的项目有哪些?有哪些重要的突破是您认为值得分享的?


任海兵:跟阿里文娱相关的场景是文化娱乐产业中素材智能生产。由于素材生产的目的是给人观看,因此不能有肉眼可见的瑕疵,这对素材智能生产提出了很高的要求。以前的素材生产,例如图像抠图,都是纯手工 PS,费时费力。这两年在图像分割领域取得了巨大的成就。既有图像语义理解、实例分割、全景分割,又有精细抠图(image matting)和显著性区域分割。综合这些技术,我们可以得到高精度的图像抠图解决方案。下面给出几个我们的抠图结果:


这些已经广泛用于阿里文娱的各项业务场景中。


InfoQ:从技术的研发到落地,您认为最大的挑战是什么?是否有可以分享的经验?


任海兵:我最近的工作主要跟视频内容智能生产相关,从这个方面看,目前最大的挑战还是算法的稳定性。在一个视频中,如果有一帧图像的结果不好,那么整个视频都是不合格的。我的一项经验是,有些领域目前业界算法还不能达到全自动的智能生产,例如视频抠图,但可以辅助很少量的人工交互,利用交互式视频抠图算法,达到效率和精度的一个平衡。


InfoQ:在您看来,计算机视觉接下来会如何发展?您和团队有什么重点规划?


任海兵:我认为,目前人工设计网络已经到达一个瓶颈阶段,接下来深度网络的自动搜索将引领计算机视觉登上一个新的高峰,我的团队也将在这个方向进行布局。


采访嘉宾介绍


任海兵,阿里巴巴资深算法专家,2003 年清华大学计算机系计算机应用专业博士毕业。先在三星中国技术院工作 11 年,先后担任计算机视觉和医疗图像算法团队负责人,曾带领团队获得 FRGC 人脸识别竞争第一名。2014 年加入英特尔中国研究院,从事机器人视觉感知研究工作。2018 年底,任海兵加入阿里文娱摩酷实验室,从事视频理解算法研究。任海兵在计算机视觉领域有 20 多年的研究经验,担任 CVPR、ICCV、ECCV 等国际顶级学术会议审稿人,发表 40 余篇论文,拥有 30 多项专利。


2020-02-27 15:071574
用户头像
陈思 InfoQ编辑

发布了 576 篇内容, 共 283.9 次阅读, 收获喜欢 1303 次。

关注

评论

发布
暂无评论
发现更多内容

国内首款! 亚信科技数据库AntDB亮相中国信通院性能测试工具发布会

亚信AntDB数据库

CRM重构项目

Mars

开源demo| 你画我猜——让你的生活更有趣

anyRTC开发者

音视频 互动白板 开源demo 你画我猜 社交娱乐

HTTP缓存协议实战

vivo互联网技术

缓存 浏览器 服务器 HTTP

前端技术分享:页面性能优化问题复盘

有道技术团队

前端

2022 年值得关注的 十大 DevOps 最佳实践

飞算JavaAI开发助手

如何通过测试用例保障交付质量

阿里云云效

阿里云 云原生 开发测试 测试用例 研发

在线YAML转JSON工具

入门小站

工具

网络编程懒人入门(十四):到底什么是Socket?一文即懂!

JackJiang

TCP 网络编程 socket IM 即时通讯IM

X6在数栈指标管理中的应用

袋鼠云数栈

Java 大数据 前端

【OH干货】如何向OpenHarmony社区提交代码

拓维信息

OpenHarmony

【C语言】一篇速通常量变量

謓泽

编程语言 C语言 2月月更 常量变量

云原生微服务技术趋势解读

阿里巴巴中间件

阿里云 微服务 云原生 中间件

翟佳:从技术工程师到「网红」开源创业者

腾源会

开源 开源公司

大数据培训:Flink全链路延迟的测量方式及原理

@零度

flink 大数据开发

文本检测算法新思路:基于区域重组的文本检测

华为云开发者联盟

文本检测 区域重组 文本检测算法 PixelLink TextSnake

3种基于深度学习的有监督关系抽取方法

华为云开发者联盟

文本检测 区域重组 文本检测算法 PixelLink TextSnake

Android 12 “致命”崩溃解决之路

阿里巴巴终端技术

android 崩溃分析 客户端 UC内核

第十二节:Springboot多环境配置

入门小站

spring-boot

微服务从代码到k8s部署应有尽有系列(二、网关)

万俊峰Kevin

微服务 RPC web开发 go-zero Go 语言

java培训:JVM 锁的优化和逃逸分析

@零度

JVM JAVA开发

如何选择充血模型和贫血模型

蜜糖的代码注释

DDD 领域建模 2月月更

web前端培训: Vue3面试考点分享

@零度

前端开发 Vue3

后端新手如何从 0 到 1 打造一款 Apache APISIX 插件

API7.ai 技术团队

后端 插件 Apache APISIX APISIX 网关

移动开发平台WorkPlus | 快速实现企业移动应用集成化

BeeWorks

mark: centos 镜像下载地址

webrtc developer

Linux centos

Java&Go高性能队列之channel性能测试

FunTester

Go 性能测试 队列 channel FunTester

【高并发】深入解析Callable接口

冰河

Java 并发编程 多线程 高并发 异步编程

与Karmada一起航行:海量节点的多集群管理

华为云原生团队

容器 云原生 k8s k8s多集群管理 多云管理

启发式智能任务调度的探索

鲸品堂

算法 函数 任务调度

运维安全是指什么?如何做好运维安全?

行云管家

运维 网络安全 IT运维 运维安全

阿里文娱资深算法专家任海兵:CV落地最大的挑战是算法的稳定性_AI&大模型_陈思_InfoQ精选文章