写点什么

微信翻译闹笑话吴亦凡躺枪,AI 翻译为何总“翻车”?

  • 2019-03-05
  • 本文字数:2241 字

    阅读完需:约 7 分钟

微信翻译闹笑话吴亦凡躺枪,AI翻译为何总“翻车”?

昨天,有细心的网友发现,微信翻译出现故障,得出了很多让人啼笑皆非的翻译结果。比如流量明星们的名字被翻译成各种风马牛不相及的字眼,Cai Xukun 被翻译成“傻蛋”也真是非常尴尬了。



相比之下,谷歌翻译的同四个句子虽然效果也一言难尽,但是基本句式还是有据可循的:



但粉丝可就不干了,直接把这个话题顶上了微博热搜。截至今日,“微信翻译是认真的吗”这个话题仍然挂在微博热搜榜上,热度不减。



网友的评论区重点也是有点偏,俨然变成大型“反黑”现场,大量粉丝蜂拥而来表示“搬走”自家爱豆,众网友则是看热闹不嫌事大。当然,也有少数人没有偏离主题,把重点放在了翻译本身,有人对机器翻译水平表示担忧,有人给程序员小哥哥打气~


微信回应:翻译引擎误翻

事件发生后,微信团队迅速做出回应,称这是微信翻译引擎在翻译一些没有进行过训练的非正式英文词汇时出现误翻,导致部分语句翻译出现问题,目前正在紧急修复中。 ​​​​



经 AI 前线测试,目前正常的句式以及单词是可以正常翻译的,但是遇到不认识的词语,微信翻译干脆就“罢工”了,不知道仍然是故障状态还是说这是一个临时的解决方案?


全新神经网络翻译引擎

我们来看一下这里提到的微信翻译引擎。在早些时候,有消息称微信的英译汉功能由有道实现,其他语种则由微软负责。而据微信相关方面说法,目前微信聊天对话及朋友圈的英中、中英翻译已经替换成其自行开发的全新神经网络翻译引擎,但该神经网络的具体信息无从得知,AI 前线只找到关于它的零星信息。



据知乎一位自称是微信翻译引擎开发团队一员的用户透露,微信翻译功能是由一个不到 10 人的小团队开发,但是上线之时非常低调,甚至很多人不知道这个隐藏小彩蛋的存在。


当初上线之时,这位工程师就承认产品是有一定局限性的,很多翻译还不完善。


而在“如何评价微信翻译功能”这一话题之下,大部分评论对微信翻译功能的评价都不太友好,尤其是在姓名的翻译上,微信甚至会给你起一个英文名…



当然,也有人表示对微信翻译功能的支持,并真诚提出希望微信团队可以改善,甚至有人认为比百度、有道的翻译水平高。



虽然我们无从得知微信所使用的机器翻译引擎具体信息,但是可以通过机器学习翻译引擎的基本工作原理,了解一下为什么微信会在翻译一些没有进行过训练的非正式英文词汇时出现误翻,导致部分语句翻译出现问题。


机器翻译的原理可以看作是如下这张图:



翻译机器就是其中带有问号的黑箱,它的作用就是能够将一个语言的序列(如 Economic growth has slowed down in recent years)转化成目标语言序列(如 La croissance economique sest ralentie ces dernieres annees)。其中翻译机器在正式工作之前可以利用已有的语料库(Corpora)来进行学习和训练。


所谓的神经网络机器翻译就是利用神经网络来实现上述的黑箱翻译机器。它的架构如下图所示:



其中,我们用一个神经网络替换了上图中的黑箱。在神经网络中存在着大量的链接权重,这些权重就是我们要通过数据训练、学习的参数。训练好的神经网络可以将输入的源语言转换为输出的目标语言。我们要让神经网络学习的目标就是要能准确的翻译。(来源:知乎 ID:人工智能学习笔记)


我们是如何编写代码,让计算机翻译人类的语言呢?最简单的方法,就是把句子中的每个单词,都替换成翻译后的目标语言单词。下面是西班牙语-英语互译的例子,只需要逐字替代,就能够得到一个完整的翻译句子。但是由于上下文语境的关系,翻译结果并不完美。



为了解决这个问题,机器翻译系统需要使用了不同的方法,通过分析大量文本来分配文本中的规则,以改进结果。也就是教会计算机语法规则,然后让它根据规则翻译句子。


可惜事情并不是这么简单,饱受学习外语之苦的你肯定知道,规则总是有很多例外。当我们尝试为程序描写所有这些规则及其特例以及特例的特例时,翻译的质量就无从保证。


深度神经网络可以在非常复杂的任务(语音/视觉对象识别)中取得优异结果,但尽管它们具有灵活性,却只能用于输入和目标具有固定维数的任务。


在这个过程中,训练的重要性不言而喻,训练数据的多样性、完整性,以及数量、质量、时间等各种维度都会对系统最后产生的结果产生重要影响。



微信的翻译引擎出现误翻,按照官方的回应,是因为原文中出现没有进行过训练的非正式英文词汇,也就是说引擎系统“看到”了以前从未看到过的训练数据,因此影响了翻译的准确性也就不难理解了。

翻车不止一次

实际上,腾讯在翻译上不止翻过一次车。去年博鳌论坛期间,腾讯的翻译君就曾在会上闹过乌龙,AI 前线对此做过报道:《腾讯AI同传博鳌会上闹乌龙,技术界和翻译界怎么看?》。当时,翻译错误的地方多为常见的专用术语,如“一带一路”、“道路”等词汇,翻译还出现乱码结果,现场不得不再次聘请人工翻译“接盘”。



事件后腾讯承认,面对博鳌亚洲论坛复杂的语言环境和高大上的专业内容,“腾讯同传”确实出现了错误,答错了几道题。腾讯表示,作为创新孵化和落地的 AI 产品,“腾讯同传”还在不断学习和成长当中,但是不足就是不足,不足的地方就要继续加强学习。


不止腾讯,科大讯飞也曾深陷“AI 同传造假”事件,但事后以双方都确认误会的原因是同声传译人员在工作中把“讯飞听见”的转写功能错当成“机器同传”而告终。


不得不承认,虽然 AI 技术在不断进步,相关的自然语言处理技术也在不断取得突破,但仍然改变不了 AI 的智商不及四岁小孩的现实,尤其是在应用场景要求比较高的翻译领域,目前的技术水平还十分有限,不过,我们不应否认 AI 技术在翻译领域的成果,不积跬步,无以至千里,没有不断试错,就不会有成功。



2019-03-05 08:005567
用户头像

发布了 98 篇内容, 共 64.9 次阅读, 收获喜欢 285 次。

关注

评论

发布
暂无评论
发现更多内容

毕业设计

Geek_cb2b43

低代码实现探索(二十)功能的路径

零道云-混合式低代码平台

Hoo虎符研究院 | 投资前沿——过去一周顶级投资机构动向

区块链前沿News

虎符 Hoo 虎符交易所 区块链投资

一条 Git 命令减少了一般存储空间,我的服务器在偷着笑

沉默王二

电商秒杀系统设计

天天向上

架构实战营

架构实战营-毕业设计

瓜子葫芦侠

「架构实战营」

物联网场景中灵活实施对设备的控制管理

亚马逊云科技 (Amazon Web Services)

loT

云原生训练营 毕业总结

张大彪

云原生

Go 语言快速入门指南:Go 指针

宇宙之一粟

指针 Go 语言 1月月更

架构训练营 毕业设计

吴霏

架构训练营 「架构实战营」

架构实战营 第 4 期 模块五作业

架构实战营 模块五 「架构实战营」

zip文件自动打包

你?

hw9-毕业项目设计

WWH

架构实战营

特聘专家朱嘉明:2022,数字经济迈入历史新阶段

CECBC

16 Prometheus之Exporter详解

穿过生命散发芬芳

Prometheus 1月月更

基于Mysql,ssm食材采购系统

叫练

ssm 餐厅采购

物联网场景中灵活实施对设备的控制管理

亚马逊云科技 (Amazon Web Services)

loT

【架构实战营】模块九作业

liu🍊

低代码实现探索(二十一)微流动作返回值类型

零道云-混合式低代码平台

5Why根因分析法:通过好问题引出一个好答案

石云升

1月月更 分析方法

微服务通信设计模式

俞凡

架构 微服务

架构实战营模块九作业

孙志强

架构实战营

Three.js 入门指南

devpoint

WebGL 3D渲染 three.js 1月月更

设计电商秒杀系统

Mars

架构实战营 「架构实战营」

一文带你快速了解 Java 线上问题快速诊断神器 Arthas

zuozewei

性能测试 Java性能 性能分析 Arthas 1月月更

模块五

Only

架构实战营 「架构实战营」

架构实战营-毕业设计

21°Char

ReactNative进阶(十九):React Native 按钮 Touchable 系列组件使用详解

No Silver Bullet

​React Native 1月月更 Touchable

为什么您的企业需要移动CRM系统

低代码小观

移动 CRM CRM系统 客户关系管理系统 企业管理工具

当使用Vue2+Babel时,如何实现组件重新渲染

吴脑的键客

Vue babel

手把手教程|通过部署 Apache Superset 实现 Amazon S3 的数据可视化

亚马逊云科技 (Amazon Web Services)

analytics

微信翻译闹笑话吴亦凡躺枪,AI翻译为何总“翻车”?_AI&大模型_Debra_InfoQ精选文章