HarmonyOS开发者限时福利来啦!最高10w+现金激励等你拿~ 了解详情
写点什么

微信翻译闹笑话吴亦凡躺枪,AI 翻译为何总“翻车”?

  • 2019-03-05
  • 本文字数:2241 字

    阅读完需:约 7 分钟

微信翻译闹笑话吴亦凡躺枪,AI翻译为何总“翻车”?

昨天,有细心的网友发现,微信翻译出现故障,得出了很多让人啼笑皆非的翻译结果。比如流量明星们的名字被翻译成各种风马牛不相及的字眼,Cai Xukun 被翻译成“傻蛋”也真是非常尴尬了。



相比之下,谷歌翻译的同四个句子虽然效果也一言难尽,但是基本句式还是有据可循的:



但粉丝可就不干了,直接把这个话题顶上了微博热搜。截至今日,“微信翻译是认真的吗”这个话题仍然挂在微博热搜榜上,热度不减。



网友的评论区重点也是有点偏,俨然变成大型“反黑”现场,大量粉丝蜂拥而来表示“搬走”自家爱豆,众网友则是看热闹不嫌事大。当然,也有少数人没有偏离主题,把重点放在了翻译本身,有人对机器翻译水平表示担忧,有人给程序员小哥哥打气~


微信回应:翻译引擎误翻

事件发生后,微信团队迅速做出回应,称这是微信翻译引擎在翻译一些没有进行过训练的非正式英文词汇时出现误翻,导致部分语句翻译出现问题,目前正在紧急修复中。 ​​​​



经 AI 前线测试,目前正常的句式以及单词是可以正常翻译的,但是遇到不认识的词语,微信翻译干脆就“罢工”了,不知道仍然是故障状态还是说这是一个临时的解决方案?


全新神经网络翻译引擎

我们来看一下这里提到的微信翻译引擎。在早些时候,有消息称微信的英译汉功能由有道实现,其他语种则由微软负责。而据微信相关方面说法,目前微信聊天对话及朋友圈的英中、中英翻译已经替换成其自行开发的全新神经网络翻译引擎,但该神经网络的具体信息无从得知,AI 前线只找到关于它的零星信息。



据知乎一位自称是微信翻译引擎开发团队一员的用户透露,微信翻译功能是由一个不到 10 人的小团队开发,但是上线之时非常低调,甚至很多人不知道这个隐藏小彩蛋的存在。


当初上线之时,这位工程师就承认产品是有一定局限性的,很多翻译还不完善。


而在“如何评价微信翻译功能”这一话题之下,大部分评论对微信翻译功能的评价都不太友好,尤其是在姓名的翻译上,微信甚至会给你起一个英文名…



当然,也有人表示对微信翻译功能的支持,并真诚提出希望微信团队可以改善,甚至有人认为比百度、有道的翻译水平高。



虽然我们无从得知微信所使用的机器翻译引擎具体信息,但是可以通过机器学习翻译引擎的基本工作原理,了解一下为什么微信会在翻译一些没有进行过训练的非正式英文词汇时出现误翻,导致部分语句翻译出现问题。


机器翻译的原理可以看作是如下这张图:



翻译机器就是其中带有问号的黑箱,它的作用就是能够将一个语言的序列(如 Economic growth has slowed down in recent years)转化成目标语言序列(如 La croissance economique sest ralentie ces dernieres annees)。其中翻译机器在正式工作之前可以利用已有的语料库(Corpora)来进行学习和训练。


所谓的神经网络机器翻译就是利用神经网络来实现上述的黑箱翻译机器。它的架构如下图所示:



其中,我们用一个神经网络替换了上图中的黑箱。在神经网络中存在着大量的链接权重,这些权重就是我们要通过数据训练、学习的参数。训练好的神经网络可以将输入的源语言转换为输出的目标语言。我们要让神经网络学习的目标就是要能准确的翻译。(来源:知乎 ID:人工智能学习笔记)


我们是如何编写代码,让计算机翻译人类的语言呢?最简单的方法,就是把句子中的每个单词,都替换成翻译后的目标语言单词。下面是西班牙语-英语互译的例子,只需要逐字替代,就能够得到一个完整的翻译句子。但是由于上下文语境的关系,翻译结果并不完美。



为了解决这个问题,机器翻译系统需要使用了不同的方法,通过分析大量文本来分配文本中的规则,以改进结果。也就是教会计算机语法规则,然后让它根据规则翻译句子。


可惜事情并不是这么简单,饱受学习外语之苦的你肯定知道,规则总是有很多例外。当我们尝试为程序描写所有这些规则及其特例以及特例的特例时,翻译的质量就无从保证。


深度神经网络可以在非常复杂的任务(语音/视觉对象识别)中取得优异结果,但尽管它们具有灵活性,却只能用于输入和目标具有固定维数的任务。


在这个过程中,训练的重要性不言而喻,训练数据的多样性、完整性,以及数量、质量、时间等各种维度都会对系统最后产生的结果产生重要影响。



微信的翻译引擎出现误翻,按照官方的回应,是因为原文中出现没有进行过训练的非正式英文词汇,也就是说引擎系统“看到”了以前从未看到过的训练数据,因此影响了翻译的准确性也就不难理解了。

翻车不止一次

实际上,腾讯在翻译上不止翻过一次车。去年博鳌论坛期间,腾讯的翻译君就曾在会上闹过乌龙,AI 前线对此做过报道:《腾讯AI同传博鳌会上闹乌龙,技术界和翻译界怎么看?》。当时,翻译错误的地方多为常见的专用术语,如“一带一路”、“道路”等词汇,翻译还出现乱码结果,现场不得不再次聘请人工翻译“接盘”。



事件后腾讯承认,面对博鳌亚洲论坛复杂的语言环境和高大上的专业内容,“腾讯同传”确实出现了错误,答错了几道题。腾讯表示,作为创新孵化和落地的 AI 产品,“腾讯同传”还在不断学习和成长当中,但是不足就是不足,不足的地方就要继续加强学习。


不止腾讯,科大讯飞也曾深陷“AI 同传造假”事件,但事后以双方都确认误会的原因是同声传译人员在工作中把“讯飞听见”的转写功能错当成“机器同传”而告终。


不得不承认,虽然 AI 技术在不断进步,相关的自然语言处理技术也在不断取得突破,但仍然改变不了 AI 的智商不及四岁小孩的现实,尤其是在应用场景要求比较高的翻译领域,目前的技术水平还十分有限,不过,我们不应否认 AI 技术在翻译领域的成果,不积跬步,无以至千里,没有不断试错,就不会有成功。



2019-03-05 08:005525
用户头像

发布了 98 篇内容, 共 64.2 次阅读, 收获喜欢 285 次。

关注

评论

发布
暂无评论
发现更多内容

张小龙 的 22 年和微信的 8 年

池建强

微信 张小龙

论十三

十三

HTTP的德性

十三

我所想的跨平台开发:小程序+App+Web

曾伟@喵先森

flutter 小程序 微信小程序 跨平台

容器日志采集利器:Filebeat深度剖析与实践

傅轶

Kubernetes 容器 云原生 日志 Filebeat

Web3极客日报 #133

谢锐 | Frozen

区块链 技术社区 Rebase

Java并发编程系列——常用并发工具类

孙苏勇

Java Java并发 并发编程 多线程

以物理学思维破解分布式系统的本质

常平

分布式

为什么开源是基础软件的未来

顾钧

开源 基础软件

Block底层原理探析

Damien

ios 源码分析

重要:Kafka第3篇之一条消息如何被存储到Broker上

z小赵

kafka

如何表达自己的感情?

zkh

苟富贵,勿相忘

十三

科技 vs 隐私:瘟疫下“以健康为名”会将我们推向何方?

陶乐思

为什么最该祝自己劳动节快乐

石君

劳动 劳动节 励志

改变

一把梭

生活 随笔

Web3极客日报#131

谢锐 | Frozen

区块链 创业 独立开发者 技术社区 Rebase

消息队列Kafka - 基本应用

Java收录阁

kafka

Disruptor 高效的秘密-Sequencer

Rayjun

Java 并发编程 Disruptor

游戏夜读 | 2020周记(4.10-4.17)

game1night

思考如何节省时间,节省出时间进行思考

伯薇

思考 时间管理 思考力 工作效率 提升效率

程序员陪娃漫画系列——喂药

孙苏勇

程序员 生活 陪伴 漫画

没有了手机的诺基亚,过得远比你想象的要好

赵新龙

微软 手机 上市 诺基亚

Web3极客日报 #132

谢锐 | Frozen

区块链 创业 独立开发者 技术社区 Rebase

Web3极客日报#130

谢锐 | Frozen

区块链 创业 独立开发者 技术社区 Rebase

《我是余欢水》与《一个叫欧维的男人决定去死》

十三

如何成为一个靠谱的人

熊斌

个人成长 团队协作

消息队列Kafka - 原理分析

Java收录阁

kafka

面向兴趣编程 - 一条微博和一个小程序的故事

遇见

小程序 微信小程序 副业 面向兴趣编程

OKR实践中的痛点(3):破3旧,迎3新!

大叔杨

OKR Scrum 敏捷 敏捷开发 绩效

万字破解云原生可观测性

谭建

云原生 APM 可观测性 链路追踪 Skywalking

微信翻译闹笑话吴亦凡躺枪,AI翻译为何总“翻车”?_AI&大模型_Debra_InfoQ精选文章