写点什么

如何构建高质量数据集与进行公正模型评测,AICon 带你一探究竟

  • 2024-07-08
    北京
  • 本文字数:1724 字

    阅读完需:约 6 分钟

如何构建高质量数据集与进行公正模型评测,AICon 带你一探究竟

高质量的数据集对于大模型的性能至关重要。获取这样的数据集需要经过精心的数据收集、清洗、标注、增强和平衡处理。同时,数据安全和隐私保护也是不可忽视的环节。大模型的评测同样重要,它包括准确性、鲁棒性、泛化能力、效率、可解释性以及伦理和偏见的考量。


AICon 全球人工智能开发与应用大会针对这些关键议题,策划了【数据集构建以及评测】论坛。这个论坛将聚焦于数据集的构建策略、模型的评测方法,以及如何确保模型的公平性和透明度。目前已经有几个精彩的议题

精彩推荐议题一:


如果有一个分享,可以带你了解全栈式行业数据处理和模型训练的方法,那你应该听听!


近年来,闭源大语言模型(LLMs)和开源社区在通用领域取得了显著进展,甚至在某些方面超越了人类。然而,在医学、政务等专业领域,语言模型的表现仍然不足。面对决这些挑战,智源研究院通过行业合作伙伴联合实验室机制,基于行业数据集构造和示范模型训练实践,提出了数据集构建技术体系,以及包含持续预训练、监督微调(SFT)以及强化学习(RLHF)技术的完整行业模型训练范式,获得了良好的模型性能效果。


我们非常荣幸邀请到北京智源人工智能研究院大模型行业应用总监周华老师,在本次演讲中,他将首先介绍人工智能大模型在行业落地的发展趋势,并分析当前面临的主要问题。随后,他会分享智源研究院在推动大模型行业落地方面的工作思路和研究方向。接着,他将详细讲解行业数据集构建的范式,以及行业模型训练的有效方法。在演讲的实践案例部分,周华将依次分享两个案例:首先是 Aquila-Med 示范模型的数据集构建和模型训练经验,其次是 Aquila-SQL 模型的训练过程及其在实际应用中的表现。


通过他的分享,你可以了解到企业内部大模型构建的方法、行业大模型训练的技术经验以及数据处理的方法和技术体系。

精彩推荐议题二:


如过有一个演讲,能带你了解了解多模态评测相关进展,那不能错过,尤其还是北京大学二级教授张铭的分享。


现有的数据集主要集中在检验模型解决专家级别难题的能力上,难以反映模型在基础知识方面的掌握情况。由于缺乏和人类表现相关的数据,因此科学家也不可能获取到更具实际意义的模型表现参考。为了攻克这些局限性,张铭团队构建了首个多模态 STEM 数据集,并且在此基础上实现对大语言模型与多模态基础模型的评测。评测的结果发现,即使是目前最先进的人工智能模型,其 STEM 基础水平也存在较大的提升空间,尚不具备解决更有难度的现实问题的能力。


此外,张铭团队还提出了一个新的社会学科数据集 Social,包含较大规模的文本评估数据,可用来评测大语言模型的社会学科基础能力;团队还设计了一种多智能体交互的方法,能够增强大语言模型在 Social 数据集上的表现。


我们非常有幸邀请到北京大学二级教授张铭,为我们分享《全方位评测神经网络模型的基础能力》话题,通过她的分享你可以了解到多模态评测相关进展探索以及大语言模型通用智能体方法进展探索。


精彩推荐议题三:


如果有一个演讲能够带你了解掌握幻觉评估的新方法、探索出模型幻觉原因与解决方案,那错过智源的分享就太可惜了。


大型语言模型 (LLMs) 在各种任务中取得了卓越的性能, 并在现实世界中得到了广泛应用。然而,LLMs 容易出现幻觉, 生成与已知知识相冲突或不忠实于原始信息来源的内容,影响了 LLMs 在很过高厉害场景上的应用。


现有的幻觉基准主要关注句子或段落层面的幻觉检测, 忽略了对话层面的评估、幻觉定位和原因解析。为了缓解现有幻觉评估的局限性, 智源提出了 HalluDial, 第一个全面的大规模自动对话级幻觉评估基准。


利用 HalluDial, 智源对 LLMs 在信息搜索对话中的幻觉评估能力进行了全面的元评估, 并引入了一个专门的判断语言模型 HalluJudge。HalluDial 的高数据质量使 HalluJudge 在幻觉评估中取得了优异或有竞争力的性能, 有助于自动评估 LLMs 中的对话级幻觉。


我们非常也有幸邀请到智源研究院智能评测组负责人杨熙 她将分享《大语言模型的幻觉检测》话题,为你提供不一样的幻觉解决思路。



活动推荐:


InfoQ 将于 8 月 18 日至 19 日在上海举办 AICon 全球人工智能开发与应用大会,汇聚顶尖企业专家,深入端侧 AI、大模型训练、安全实践、RAG 应用、多模态创新等前沿话题。现在大会已开始正式报名,详情可联系票务经理 13269078023 咨询。



2024-07-08 19:145282

评论

发布
暂无评论

java培训SpringBoot自动装配原理

@零度

JAVA开发 springboot

48天打造你的专属 Twilio——浅谈运营商通信中台

网易云信

通信

Sitemap的重要性

源字节1号

软件开发 网站优化

进阶篇|有了这招,用文本编辑器搞前端代码都能保证格式统一

Jianmu

运维 前端 自动化 工作流 格式化

【PIMF】开源鸿蒙首款IDE低代码入门OpenHarmony应用开发

离北况归

低代码 OpenHarmony Openharmony啃论文俱乐部 OpenHarmony应用开发 可视化界面

虎符即将引入稳定币USN 并开启USN专场活动

区块链前沿News

虎符交易所 稳定币

坐实大数据资源调度框架之王,Yarn为何这么牛

华为云开发者联盟

大数据 hadoop mapreduce YARN 资源调度框架

如何使用参数化查询提高Cypher查询的性能

华为云开发者联盟

参数化 Cypher查询 华为云图引擎 GES 参数化查询

Android技术分享| Android 中部分内存泄漏示例及解决方案

anyRTC开发者

音视频 内存 内存泄漏 移动开发 Andriod

基于Flink-CDC数据同步方案

领创集团Advance Intelligence Group

算法 java

企业如何搭建一个有效的知识管理系统

小炮

企业知识管理 企业知识管理工具

踩了个DNS解析的坑,但我还是没想通

捉虫大师

DNS 问题排查 4月月更

2022南京14届-人工智能-博览会

InfoQ_caf7dbb9aa8a

云图说丨不同区块链之间如何跨链交互?

华为云开发者联盟

区块链 跨链 可信 可信跨链服务 跨链交互

用uniapp写一个内外循环的全选与反选,不会的赶紧围观

CRMEB

去中心化的 React Native 架构探索

Shopee技术团队

前端 去中心化 React Native

Docker 实战教程之从入门到提高(二)

汪子熙

Docker 容器 虚拟化 docker image 4月月更

大数据培训Hive如何控制map个数与性能调优参数

@零度

hive map 大数据开发

看板的作用是什么?任务看板如何跟进

阿里云云效

云计算 阿里云 持续交付 看板 项目协作

云智慧10年资深架构师带你了解:普通程序员向架构师成长必经之路

云智慧AIOps社区

程序人生 架构师 Meetup 晋升 成长计划

龙蜥社区成立DeepRec SIG,开源大规模稀疏模型深度学习引擎

OpenAnolis小助手

深度学习 开源 龙蜥社区 sig 稀疏模型

欧拉开发者大会即将开启,全球芯片、整机、软件厂商共建数字基础设施开源操作系统

科技热闻

解析分布式系统的缓存设计

vivo互联网技术

分布式 服务器 缓存服务

Thinkphp6实现定时任务功能详解教程

CRMEB

OpenHarmony 3.1 Beta版本关键特性解析——OpenHarmony图形框架

OpenHarmony开发者

OpenHarmony 动画效果

web前端培训nginx配置规则

@零度

nginx 前端开发

“一只股票一张表”, TDengine 在青岛金融研究院量化分析场景中的应用

TDengine

数据库 tdengine 物联网

Linux驱动开发-编写RFID-RC522射频刷卡模块驱动

DS小龙哥

4月月更

省掉80%配置时间,这款Mock神器免费又好用

Liam

前端 前端开发 Postman 前端教程 web前端开发

云效 Projex是什么?Projex企业级高效研发项目管理平台

阿里云云效

阿里云 项目管理 研发 敏捷研发 项目协作

如何优雅的记录操作日志

flyhero

Java Spring Boot 后端 造轮子 4月月更

如何构建高质量数据集与进行公正模型评测,AICon 带你一探究竟_AI&大模型_李忠良_InfoQ精选文章