产品战略专家梁宁确认出席AICon北京站,分享AI时代下的商业逻辑与产品需求 了解详情
写点什么

微软秒删堪比 GPT-4 的开源大模型!研发总部还被爆在北京?官方:我们只是忘了测试

  • 2024-04-22
    北京
  • 本文字数:2652 字

    阅读完需:约 9 分钟

大小:1.25M时长:07:15
微软秒删堪比GPT-4的开源大模型!研发总部还被爆在北京?官方:我们只是忘了测试

因发布前忘了测试,微软删除最新开源大模型

 

上周五,Meta 宣布推出了开源大模型 Llama 3,以其卓越性能引发热议。而在 Llama 3 发布之前,微软也悄悄发布了最新的开源模型 WizardLM-2。

 

颇具戏剧性的是,这款模型在发布仅几个小时后,就被微软下架了,理由是在发布之前忘了进行“毒性测试”。

 

据悉,这款大模型发布于上周一,提供三个版本:8x22B、70B 和 7B,每个版本都旨在满足不同的规模和要求。8x22B 模型是旗舰模型,拥有 1410 亿个参数,使其成为开源社区中最有效的模型之一。

 

微软这次发完模型又删除的行为让很多网友表示困惑,因此微软开发人员在 X 上发布了一份声明解释了下架模型的原因。开发人员遗憾地承认了他们在模型发布过程中由于工作疏忽忘记了进行毒性测试。为了向社区保证迅速采取行动,他们承诺在重新发布模型之前立即进行必要的测试。

 

还有外界消息称,WizardLM-2 背后的研发团队总部位于北京。他们澄清表示:“删除该模型是由于忘记测试,而不是故意试图绕过审查”。

 

我们深感抱歉。

 

距离我们发布模型已经过去一段时间😅,所以现在的我们对于新的发布流程有点生疏,不小心遗漏了模型发布过程中的重要一环——有毒内容测试。

 

目前,我们正在快速补全测试工作……

 


 大语言模型的毒性,是指其创作有害或不当内容的能力。如果在大模型中发现“有毒”内容,不单会影响技术方案的性能表现,更可能在全球各地纷纷对 AI 技术抱谨慎、甚至负面态度的背景下引发轩然大波。相关错误输出可能在互联网上疯狂自传播,甚至招来政府当局的调查。没有哪家公司愿意看到这样灾难性的经营事故。

 

因此,该模型的所有文件均被从 GitHub 和 Hugging Face 上移除,访问相关页面现在会显示 404 错误。

 

这款大模型是在 Apache 2.0 协议下发布的,在 repo 被移除之前,许多人已经下载了模型权重。但有细心的 Hacker News 用户还是将其发布地址备份保存了下来(地址如下):

 

https://huggingface.co/dreamgen/WizardLM-2-7B

https://huggingface.co/dreamgen/WizardLM-2-8x22B

 

甚至在下架之前,部分用户已经在其他基准测试中对该模型进行了评估。那么,这款大模型具有哪些功能?与其他大模型相比性能如何?

WizardLM-2“开箱”评测

WizardLM 是一套基于指令的模型,构建于 Meta 的 Llama 基础之上,属于研究人员使用生成的指令数据对 Llama 微调得到的产物。

 

值得注意的是,WizardLM-2 基于混合专家 (MoE) 架构开发,利用完全由人工智能驱动的综合训练系统,增强其处理复杂、多语言对话和执行高级推理的能力。该系统支持模型在各个领域(包括写作、编码、数学等)提供精致且与上下文相关的响应的能力。

 

该模型的第二个版本 WizardLM-2 是在 Mistral AI 的 Mixtral 8x22B 模型基础之上构建而成,并利用合成数据进行了微调。该模型家族共包含三大领先型号:WizardLM-2 8x22B、70B 与 7B。

与各领先的专有大语言模型相比,这些模型表现出极具竞争力的性能水平。

 

WizardLM-2 8x22B 是其中最先进的模型,仅略微落后于 GPT-4-1106-preview。70B 在相同体量下达到了顶级性能,而 7B 版本则速度最快,甚至拥有与参数规模 10 倍于它的领先模型相当的性能表现

 

该模型利用 AI 模型生成的合成数据训练而成。微软公司在 X 上发帖指出:

 

随着天然存在的人类数据逐步被大语言模型训练用尽,我们坚信:AI 精心创造的数据与 AI 分步监督的模型将是通往更强 AI 成果的唯一途径。因此,我们构建了一套完全由 AI 驱动的合成训练系统以增强 WizardLM-2。



WizardLM 2 的训练方式(来源:模型启动页面,现已删除)

 

在 MT-Bench 框架等基准评估中,WizardLM-2 展现出具有竞争力的性能,甚至可以与最先进的专有模型相媲美。它在现实场景中的应用较为广泛,从增强对话式人工智能到支持业务环境中的复杂决策流程。

 


将 WizardLM2 基准与 GPT-4–1106-preview、Command R Plus、Mistral Large、Qwen 1.5、Straling LM 7B 进行比较。(来源:模型启动页面,现已删除)

 

在 MT-Bench 中将 WizardLM-2 与 GPT-4-Turbo 和 Claude-3 等最先进的专有大模型相比,WizardLM-2 8x22B 仍然具备极富竞争力的性能。同时,7B 与 70B 也均成为同等参数规模之下性能最强的大语言模型。

最近几年,微软的步子迈得太大了

 

Hugging Face 及其首席执行官 Clément Delangue 对删除表示失望,并强调了 WizardLM 的开源模型对其平台的重大影响。他们正在积极寻求与 Microsoft 的解决方案,以满足社区需求。

 

随着故事的展开,人们的注意力转向了微软对负责任的 AI 实践的承诺。尽管该公司拒绝直接置评,但更新后的负责任人工智能标准一般要求的发布强调了其对道德人工智能开发的奉献精神,强调需要减少人工智能输出中的偏见和差异。

 

实际上,当前几年还没有在 AI 领域展现出强大的统治力时,微软时常因产品的发布令人失望,甚至被贴上创新停滞和顶尖人才流失的标签。

 

快进到 2024 年,微软已然成为了全世界最有价值的科技巨头之一。在首席执行官萨蒂亚·纳德拉 (Satya Nadella) 的领导下,微软股价在 10 年内飙升了 1000% 以上。一月份,该公司的市值达到 3 万亿美元,超过了法国的 GDP 总和。

 

能够让微软卷土重来的核心是人工智能。微软在 Azure 云计算平台、Office 生产力套件和 Bing 搜索引擎中嵌入了人工智能。而这一转变的关键事件是微软投资了 OpenAI,并迅速其借助先进的人工智能技术成为了生成式 AI 时代的先行者。

 

微软与 OpenAI 的合作始于 2017 年,当初这家备受瞩目的初创公司在云计算上花费了大约 790 万美元——占其职能支出的四分之一,这让两者有了初步的接触。

 

到 2019 年,微软已经成为 AI 实验室的“独家”云计算提供商。在向这家初创公司新投资 10 亿美元后,微软成为 OpenAI 商业化的首选合作伙伴。

 

微软很快将 OpenAI 大语言模型 (LLM) 集成到 Azure 云服务中。客户使用该软件实现各种应用程序功能,从聊天机器人和内容生成到翻译和个性化营销。

 

该服务增长迅速。今年第二季度,微软报告称,Azure OpenAI 的用户数量较前 12 个月增长了 50%。纳德拉表示,目前已有超过 53,000 名客户使用该服务,其中包括“一半以上”的财富 500 强企业。可以说,OpenAI 在微软的商业帝国复兴中发挥了关键作用。

 

但借助 OpenAI 这一外力重新崛起的老牌巨头想要依靠自身实力继续保持领先,并且能在激烈的竞争中始终处于有利位置,却是件很难的事情。

 

参考链接:

https://blog.stackademic.com/beyond-gpt-4-exploring-microsofts-wizardlm-2-2863e432f291

https://favtutor.com/articles/wizardlm-2-benchmarks/

https://www.teiss.co.uk/news/microsoft-pulls-wizardlm-2-ai-model-due-to-missed-toxicity-testing-13873

2024-04-22 17:384789
用户头像
李冬梅 加V:busulishang4668

发布了 946 篇内容, 共 538.3 次阅读, 收获喜欢 1105 次。

关注

评论

发布
暂无评论

从云计算到函数计算

阿里巴巴云原生

阿里云 Serverless 云原生 函数计算

安装失败怎么办

和牛

测试

浅谈运用低代码技术如何实现物流企业的降本增效

王平

全新出品!Github总榜排行第七的SpringCloud生态全栈笔记我粉了

JAVA活菩萨

Java 程序员面试 大厂技能 秋招 大厂面经

企业即时通讯软件有哪些功能?对企业有什么帮助?

WorkPlus

什么是内部客户服务?

Geek_da0866

数据库治理的探索与实践

阿里巴巴云原生

数据库 阿里云 微服务 云原生

如何模拟后台API调用场景,很细!

Liam

前后端分离 开发 Postman API 前后端协作

《机器学习的随机矩阵方法》

计算机与AI

Python 机器学习 数学

荣耀互联对外开放,赋能智能硬件合作伙伴,促进全场景生态产品融合

荣耀开发者服务平台

OpenInfra Days China 2022|SelectDB与你共享 Apache Doris 在互联网广告业务中的实践

SelectDB

MySQL 数据库 数据仓库 数据湖 Doris

【注册荣耀开发者】赢【荣耀70】手机

荣耀开发者服务平台

开发者 手机 活动 应用 荣耀

【K8s入门必看】第三篇 —— K8s必备基础概念大梳理

Albert Edison

Docker Kubernetes 容器 云原生 8月月更

《机器学习理论到应用》电子书免费下载

计算机与AI

Python 机器学习 数据科学

【web自动化测试】Playwright快速入门,5分钟上手

和牛

自动化 测试 playwright Python. 8月月更

深圳大数据培训多长时间可以找工作

小谷哥

服务器

武师叔

8月月更

目标检测的发展与现状

阿炜小菜鸡

目标检测 8月月更

硬核!阿里P7技术员身经百战总结出这份210页的Java突击面试指南

了不起的程序猿

阿里巴巴 算法 高并发 Java 面试 java程序员

开发一套高容错分布式系统

JAVA活菩萨

Java 程序员 后端 java程序员 java编程

字节二面被问到mysql事务与锁问题,我蚌埠住了

程序员小毕

Java MySQL 数据库 程序员 面试

web前端培训课程哪个比较好?

小谷哥

运力升级助力算力流转,中国数字经济的加速时刻

脑极体

基础到高级涵盖11个技术,Alibaba最新出品711页Java面试神册真香

JAVA活菩萨

Java 程序员面试 大厂技能 秋招 大厂面经

荣耀发布开发者服务平台,智慧生态合作提速

荣耀开发者服务平台

JWT主动校验Token是否过期

源字节1号

软件开发 后端开发

基于 eBPF 的 Kubernetes 可观测实践

阿里巴巴云原生

阿里云 Kubernetes 云原生 可观测

荣科科技:未来主要围绕在线互联化、生态化和智能大数据运营这三个方向发展

WorkPlus

倒数 3 天|RocketMQ 能力全景图即将发布,定义下一代消息队列未来方向

阿里巴巴云原生

阿里云 RocketMQ 云原生 消息队列

框架整合(二)- 使用Apache ShardingSphere实现数据分片

大菠萝蜜

MySQL 8月月更

WEB前端面授培训课程

小谷哥

微软秒删堪比GPT-4的开源大模型!研发总部还被爆在北京?官方:我们只是忘了测试_生成式 AI_李冬梅_InfoQ精选文章