写点什么

ECCV2024 | 京东零售广告创意:基于人类反馈的可信赖图像生成

  • 2024-12-05
    北京
  • 本文字数:2591 字

    阅读完需:约 9 分钟

大小:1.30M时长:07:33
ECCV2024 | 京东零售广告创意:基于人类反馈的可信赖图像生成



ECCV2024: Towards Reliable Advertising Image Generation Using Human Feedback

链接:https://arxiv.org/abs/2408.00418



摘要:在电商领域,吸引顾客注意力的广告图片至关重要。尽管生成模型可以自动生成图像,但它们往往会产生不符合广告标准的图片,可能误导顾客,并需要大量人工成本进行检查。本文探讨了如何提高可用生成图像的比例。我们首先引入了一种多模态可信赖反馈网络(RFNet),用于自动检查生成的图像。将 RFNet 整合到一个循环过程——循环生成中,可以提高可用广告图像的数量。为了进一步提升生产效率,我们通过一种创新的一致性条件正则化方法,利用 RFNet 的反馈来微调扩散模型(RFFT)。这显著提高了生成图像的可用率,减少了循环生成中的尝试次数,并提供了一种高效的生产过程,同时不牺牲视觉效果。我们还构建了一个包含超过一百万张由人工标注的生成广告图像的可信赖反馈一百万(RF1M)数据集,这有助于训练 RFNet 准确评估生成图像的可用性,并真实反映人工反馈。总的来说,我们的方法为广告图像生成提供了一个可信赖的解决方案。



一、背景及现状

吸引人的广告图片对于电子商务的成功至关重要。由于手动设计图片需要大量的人工成本,因此对自动广告图像生成的需求正在上升。最近,通过结合先进的扩散模型(Stable Diffusion)和 ControlNet,可以为产品生成和谐的背景,同时保持商品细节不变。

尽管生成模型有潜力创造出吸引人的背景,但我们观察到其经常会生成质量欠佳的广告图片,如下图所示,这些图片存在空间和尺寸不匹配、不显著以及形状幻觉等问题。





这些有缺陷的图片可能导致顾客对产品产生误解,进而带来不佳的购物体验,因此需要大量人工来检查生成的图像。这些缺陷限制了生成模型在广告图像生产中的广泛应用。因此,我们要解决的问题是如何建立一个可信赖的广告图像生成流程,以高可用率生成图像。



二、信赖反馈模型

一个自然的解决方案是利用生成过程中的随机性,反复生成图像直到获得可用的图像(循环生成)。为了替代人工检查,我们提出了一种新颖的信赖反馈网络(RFNet),充当人工检查员来评估生成的广告图像的可用性。由于仅依赖单一生成的图像,模型无法有效获得进行精确检查所需的关键知识,例如产品是什么以及产品如何出现在背景中。因此,RFNet 整合了多种辅助模态,以提供对判断不同不可用情况至关重要的信息。RFNet 的结构如下所示:





通过使用 RFNet 判别生成结果,可利用随机性提升可用率。我们将这种提升可用率的方法称之为循环生成,伪代码如下所示:





三、可信赖人类反馈

虽然循环生成大大增加了可用图像的数量,但因为生成模型本身能力有限,多次尝试会显著延长生成过程。利用人类反馈(RLHF)来增强扩散模型的能力提供了一种可行的选择,这些方法在提高生成图像的视觉质量方面已经取得显著结果。类似的,在训练完信赖反馈模型后,我们将其输出看作人类对于生成图片的评价,通过将其结果反传回生成模型来提升生成图片中可用的比例。该流程如下所示:







其中,yd 为一个 one-hot 向量,其中合格类别的概率为 1,而其他类别的概率为 0。oi 为生成图像输入给信赖反馈模型后得到的概率,N 为一次训练中样本的总数。所得到的梯度被反传至生成模型中,来使其朝着更高概率生成合格图像的方向优化。沿用 ControlNet 原有的设定,只有 ControlNet 部分参与梯度更新,而 Stable Diffusion 部分是不更新参数的。



尽管通过梯度反传微调能够提升合格样本出现的概率,然而由于图像可用率和美观度是对抗的目标,这使得提升图片的可用率会导致美观度的下降。例如,直接将商品放置于空白背景中将获得极低的 bad case 比例,然而这种方式将严重破坏图片的美感。如下图(a)所示,随着模型达到极高的图片可用率,商品的背景区域将产生美学崩塌的结果。





为了实现提升图片的可用比例并保持图片的美观,简单的方式是训练中加入 KL 损失约束,该损失可以保证模型的分布不偏离目标分布。利用该约束,可以使得模型在微调后的输出分布和微调前近似,从而达到不影响美观的结果。该过程可写作:





KL 损失约束的目的是为了保持图像不变,而 F_AC 是希望图像朝着可用率更高的方向改变,这样的对抗的目标难以产生双赢的结局。为了解决该问题,我们将重点从保持图像本身不变,迁移至输入文本条件的指导不变。由于在文生图模型中,文本内容和图像内容是高度相关的,因此我们提出了一种条件一致约束来保证文本条件不变。根据 classifier-free 的训练方法,可以推导出文本条件对图像生成过程的影响方向为:





为了保证图像可用率的梯度方向不影响文本条件的影响方向,我们提出了条件约束损失 L_CC 如下:





上图(b)显示了 L_CC 相对于 L_KL 的优势,其中 L_KL 希望逆转 F_AC 的梯度方向,而 L_CC 提供了一个双赢的策略,它保持了文本条件的梯度,同时允许模型朝着可用率更高的方向更新梯度。因此,最终微调生成模型的损失可以写作:





四、实验结果

(1)广告图像审核性能

如表 1 显示,RFNet 在所有指标上表现更优,突出了整合多模态信息和其有效结构的优势。我们进一步评估 RFNet 中各个组件的影响,结果如表 2 所示。实验表明,RFNet 中每个组件对最终 AP 有显著影响。





(2)广告图像可信赖性能

如表 3 所示,我们的 RFFT 相较其他方法获得了更高的可用率。“Ava”和“Human Ava”的相同趋势进一步证明了 RFNet 能够忠实反映人类反馈。如图 6 所示,循环生成(RG)通过多次尝试可以大幅提高可用图像的比例。由于我们模型拥有更强的生成能力,它需要更短的生产时间,这证明我们的方法提供了可靠且高效的解决方案。





如下图所示,我们对不同方法的美学质量进行了评估,所提出的方法在美学质量上可以与原始模型相媲美,这受益于所提出的条件一致约束。





(3)定性对比

下图展示了部分例子来说明我们的方法在提高可用率和生产效率方面的增强能力,同时保持视觉表现的稳定性。





(4)泛化性

为了评估我们方法的灵活性,我们考察了微调后的 ControlNet 在与各种 LoRA 和扩散模型权重整合时的通用能力。如表 4 所示,经过微调的 ControlNet 显著提高了不同 LoRA 和扩散模型权重的可用率。





Note:

欢迎大家交流与探讨,如有任何问题或建议,请随时联系:fengwei25@jd.com。

京东广告创意部门诚邀 AIGC/大模型领域人才加入,共同推动技术的进步和创新。欢迎大家踊跃投递简历,期待与您在京东相遇!


2024-12-05 11:307164

评论

发布
暂无评论
发现更多内容

光子是深度学习的未来!光子有望替代电子计算机加速神经网络计算

百度开发者中心

深度学习 最佳实践 方法论

澳鹏看点 | 厉害了,3D点云语义分割

澳鹏Appen

人工智能 自动驾驶 语义分割 数据标注 3D点云

结构化流-Structured Streaming(八-上)

Databri_AI

spark 查询引擎 结构化思维

一文读懂区块链技术如何改变非洲贸易(上)

CECBC

gitlab ee 14.1稳定版安装教程

阿呆

gitlab

声网Agora 教育 aPaaS 灵动课堂升级:UI与业务逻辑分离,界面、功能自定义更灵活

声网

在线教育 网络

想聊天?自己搭建个聊天机器人吧!

百度大脑

人工智能 聊天 飞桨

优秀!百度技术官甩出SpringBoot全栈小册,GitHub星标92.5k

Java 编程 程序员

盘点Java线程池配置的常见误区,你中了几个?

北游学Java

Java 多线程

下一代5G计算终端,正在你我的案头苏醒

脑极体

Java的内存区域是如何划分的?

卢卡多多

内存 Java内存模型 7月日更

我们都是那条流浪的小黄狗|靠谱点评

无量靠谱

河南平安,附最全自救锦囊

石云升

7月日更 郑州加油

腾讯、网易纷纷出手,火到出圈的元宇宙到底是个啥?

行者AI

游戏

【堡垒机】堡垒机到底有用不?国内哪家堡垒机好用?

行云管家

云计算 数据安全 堡垒机

Pravega Flink connector 的过去、现在和未来

阿里云大数据AI技术

现代分布式架构设计原则-互操作性

余先生

RESTful 接口 REST API

注意:线程的执行顺序与你想象的可能不一样!

冰河

Java 程序员 并发编程 多线程 异步编程

好未来 x StarRocks:全新实时数仓实践,深入释放实时数据价值

StarRocks

数据库 flink 实时数仓 好未来 StarRocks

免费分享Redis从入门到精通的优秀图书

Java入门到架构

Java 书籍

基于机器学习的语音编解码器声网Agora Silver:支持超低码率下的高音质语音互动

声网

RTE 技术详解 音频体验 AI Codec

为什么BAT的程序员能月薪 20k ,而你一个月只能拿 6K 的低保?差别就在这!

白亦杨

Java 编程 程序员

手写归并排序算法

实力程序员

程序员 C语言 排序算法 实力 编程实战

质量基础建设一站式服务平台搭建

什么是共识?(生活篇)

趣链科技

《小马哥java项目实战》训练营培训小结

夏日

有图,有代码,好理解,学习内存管理,mmap机制

奔着腾讯去

Linux 内存管理 Mmap 内存映射

为什么开发人员都不愿写 API 文档?

狐哥说技术

Postman Apifox 接口文档 接口管理

gopher成长之路(一):致三年前的我

非晓为骁

个人成长 架构师 全栈工程师 Go 语言 努力

大型企业采购云管理平台的诉求分析-行云管家

行云管家

云计算 云安全 云管平台 云资源

没有你,对我很重要|靠谱点评

无量靠谱

ECCV2024 | 京东零售广告创意:基于人类反馈的可信赖图像生成_AI&大模型_京东零售技术_InfoQ精选文章