当前位置：首页 > 资讯 > >正文

全球速看：AI自给自足！用合成数据做训练，效果比真实数据还好丨ICLR 2023

来源：量子位时间：2023-02-22 00:50:41

Brilliant 投稿量子位 | 公众号 QbitAI

(资料图)

AI生成的图像太逼真，为什么不能拿来训练AI呢？

可别说，现在还真有人这么做了。

来自香港大学、牛津大学和字节跳动的几名研究人员，决定尝试一下能否使用高质量AI合成图片，来提升图像分类模型的性能。

为了避免AI合成的图像过于单一、或是质量不稳定，他们还提出了几类提升数据多样性和可靠性的方法，帮助AI合成更好的数据集（来喂给AI的同类doge）。

结果他们发现，不仅效果不错，有的AI在训练后，效果竟然比用真实数据训练还要好！

目前这篇论文已经被ICLR 2023收录。

把AI生成的数据喂给AI

作者们分别从零样本（zero-shot）、少样本（few-shot）图像分类、模型预训练（pre-training）与迁移学习三个⽅⾯进⾏了探讨，并给出了提升数据多样性与可靠性的方法。

零样本图像分类

零样本（Zero-shot）图像分类任务，指没有任何⽬标类别的训练图⽚，只有对⽬标类别的描述。

作者们先是提出了一种名为语言增强（Language Enhancement，LE）的⽅法，用于增强合成数据多样性。

具体来说，这种方法会给标签“扩句”，如果原标签是简单的“飞机”，那么经过“扩句”后的提示词就会变成“一架盘旋在海滩和城市上空的白色飞机”。

随后，还采用了一种叫做 CLIP过滤器（CLIP Filter）的⽅法确保合成数据的可靠性，即过滤掉合成质量不行的图片，确保AI数据质量过硬。

在17个数据集上，相⽐此前效果最好的CLIP模型，相关⼤⼩模型均获得了显著提升（4.31%/2.90%），展示了合成数据的有效性。

少样本图像分类

少样本图像（Few-shot）分类任务，通常仅有极少数量（1～16张）的⽬标类别图⽚，与零样本任务的区别是增加了类别与任务特定领域信息。

因此，作者们决定将域内数据（in-domain）的知识⽤于图像⽣成，即将少量的⽬标类别图⽚⽤于噪声叠加的初始状态（Real Guidance），进⼀步发挥⽣成模型的能⼒，从而进⼀步提升性能。

预训练与迁移学习

模型预训练（pre-training）任务，即将模型在⼤量数据上进⾏训练，将训练后的模型作为“起始点”，来帮助提升下游任务的性能。

作者们利⽤合成数据，对模型进⾏了预训练，并对数据量、数据多样性程度、预训练模型结构和预训练⽅法进⾏了实验研究。

最终发现：

⽤合成数据进⾏预训练。已经可以达到甚⾄超越⽤真实数据预训练的效果。⽤更⼤的数据量和数据多样性的合成数据，可以获得更好的预训练效果。从模型结构和预训练⽅法来看，ViT-based模型（相比convolutional-based模型）、⾃监督⽅法（相比有监督⽅法）会更适合合成数据下的预训练。

论文认为，利⽤⽣成模型产⽣的合成数据来帮助图像分类任务是可行的，不过也存在⼀定的局限性。

例如，如何处理特定任务的domain gap和数据多样性之间的trade-off，以及如何更有效地利⽤潜在⽆穷量的合成图⽚⽤于预训练，都是需要进一步去解决的问题。

作者介绍

一作何睿飞，香港大学在读博士生@CVMI Lab，指导老师为齐晓娟老师，本科毕业于浙江大学竺可桢学院，研究方向是data-efficient learning, vision-language model, knowledge distillation, semi/self-supervised learning。CVMI Lab 正在招收计算机视觉与深度学习方向的博士生，感兴趣的伙伴可以直接email老师！

对于将AI合成图像用于预训练模型这件事，你还能想到更高效的方法吗？

欢迎感兴趣的小伙伴一起讨论~

论文地址： https://arxiv.org/abs/2210.07574

项目地址： https://github.com/CVMI-Lab/SyntheticData

— 完 —

量子位 QbitAI · 头条号签约

关注我们，第一时间获知前沿科技动态

X 关闭

最近更新

全球速看：AI自给自足！用合成数据做训练，效果比真实数据还好丨ICLR 2023

2023-02-22 00:50:41

资讯
【环球播资讯】新时代，我在中国｜克罗地亚教授：最重要的桥梁建在人民心中

2023-02-21 21:07:13

资讯
视焦点讯！北京大学肿瘤医院保定医院项目开建，将减少40%跨区流动患者

2023-02-21 18:50:05

资讯
刀锋洗眼

2023-02-21 17:00:58

资讯
今日热搜：ps图层蒙版怎么缩小图片_ps 将一张图添加蒙版后怎么改变大小

2023-02-21 15:39:03

资讯
环球头条：小儿氨酚黄那敏颗粒哪个牌子的好点_小儿氨酚黄那敏颗粒哪个牌子好

2023-02-21 14:03:50

资讯
环球热头条丨国家卫健委副主任李斌：普及健康知识是在赋能人民群众

2023-02-21 09:47:24

资讯
御天门

2023-02-21 07:57:22

资讯
天天讯息：LOL冰霜女巫-丽桑卓冰女怎么出装_冰霜女巫丽桑卓技能介绍

2023-02-21 03:38:58

资讯
世界速看：奶粉上火吗_吃奶粉会上火的吗

2023-02-20 23:19:03

资讯
全球聚焦：昆明这所中学拆除完毕，即将原址重建

2023-02-20 20:06:01

资讯
福特锐界胎压为多少合适天天实时

2023-02-20 18:05:51

资讯
汽车蓄电池多久更换一次_世界新动态

2023-02-20 15:48:20

资讯
暖民心促就业太原一波好工作等你来

2023-02-20 13:58:43

资讯
热文：放学后的故事_有关放学后的小故事

2023-02-20 11:41:48

资讯
中型客车多少座位？考斯特中巴车19座要什么驾照？

2023-02-01 16:21:18

聚焦
世界热头条丨2023年哈尔滨冰雪大世界春节期间开放吗？

2023-01-11 14:31:56

热点
特斯拉中国降价后三天获3万辆订单全球微动态

2023-01-11 09:21:09

热点
【时快讯】一路走好！37岁张小斐家中两位老人去世，发文称冬天令人痛心

2023-01-11 00:54:53

热点
2023北京北宫镇冰雪嘉年华坐什么公交车？交通路线一览

2023-01-10 18:44:50

热点
民航局召开春运保障视频会：最大限度降低疫情对群众出行的影响_每日观察

2023-01-10 14:51:25

热点
【天天新要闻】又到买金时？全球再现抢金潮、中国央行增持黄金！

2023-01-10 14:17:37

热点
网贷逾期96万无力偿还了怎么办

2023-01-10 14:25:39

热点
禾盛新材去年前三季度营收净利双降，实控人或将变更

2023-01-10 14:02:45

热点
焦点关注：1月9日基金净值：南方中证500ETF最新净值6.0616，涨0.45%

2023-01-10 12:42:48

热点
单方面离婚法院判决的条件有哪些_全球速讯

2023-01-10 12:08:07

热点
春运期间江西将迎5次冷空气有阶段性低温雨雪冰冻天气

2023-01-10 11:52:24

热点
平安i贷逾期37年征信会怎么样

2023-01-10 11:08:00

热点
天天快报!谁会用抖音桌面端聊天软件？

2023-01-09 21:00:49

热点
新版诊疗方案更科学、更有针对性_世界看热讯

2023-01-09 15:51:46

热点
行路难其一原文及翻译行路难其一原文和其翻译全球要闻

2023-01-09 12:24:58

热点
天天最资讯丨共70项！赣州市中心城区2023年民生实事项目计划公布

2023-01-09 09:07:07

热点
新通药物科创板IPO审核状态变更为“已问询” 公司尚未盈利且存在累计未弥补亏损

2023-01-07 00:35:36

热点
猪肉牛肉混合馅的做法?

2023-01-06 22:12:03

热点
刘强东所怒斥的，真的是PPT吗？

2023-01-06 20:05:40

热点
[担保]ST易购(002024):为子公司继续提供担保

2023-01-06 17:28:41

热点
世界即时看！为什么看了很多股票的书籍，还是做不好股票投资？问题出在哪

2023-01-06 16:01:37

热点
南京2023春运时间是什么时候？_全球百事通

2023-01-06 13:37:26

热点
全球快报:工信部：优化调整微波通信系统频率进一步满足高容量信息传输场景需求

2023-01-06 11:59:47

热点
全球快播：恶疾缠身靠贷款生活，50岁老牌歌星新年求工作，停工1年花了30万

2023-01-05 14:27:39

热点
贵州轮胎：截至2022年12月30日收盘后，公司股东户数为48,367户

2023-01-05 12:15:15

热点
特斯拉上海被曝停产一周，股票暴跌，到底发生什么了？

2023-01-04 17:38:15

热点
【环球速看料】黄金转运珠可以戴在脚上吗黄金转运珠戴脚上好不好

2023-01-04 15:19:17

热点
划重点！一图读懂南阳市《政府工作报告》|全球热议

2023-01-04 11:20:52

热点
焦点！居民熏制腊肉引发火灾消防紧急灭火

2023-01-04 08:51:22

热点
天天微头条丨知乎往返于洞穴

2023-01-04 01:23:57

热点
金溢科技(002869.SZ)：截至12月底已累计回购2.0978%股份|消息

2023-01-03 18:54:17

热点
永辉超市(601933.SH)：已累计耗资约2.63亿元回购0.94%股份_快资讯

2023-01-03 15:56:42

热点
民法典如何约定夫妻财产双方应当约定

2023-01-03 12:46:41

热点
山东济宁：让数字技术与制造业深度融合

2023-01-03 10:54:25

热点
交通运输部约谈15家交通运输新业态平台公司，包括滴滴美团货拉拉

2022-12-30 19:19:23

热点
本周盘点（12.26-12.30）：中原高速周涨1.72%，主力资金合计净流入217.61万元全球短讯

2022-12-30 16:08:42

热点
当前头条：上海九百12月30日快速上涨

2022-12-30 11:02:51

热点
文化和旅游部：丰富元旦春节期间群众精神文化生活|世界热闻

2022-12-30 07:52:23

热点
新动态：专访丨仝小林：立足“寒湿”，知常达变治新冠

2022-12-29 20:33:58

热点
华商国际海洋控股(00206.HK)：预计年度净利润可能会显著增加

2022-12-29 18:20:49

热点
今日视点：极市直播预告丨NeurIPS 2022 Oral-张博航：如何从模型层面获得对抗鲁棒性保证？

2022-12-29 16:32:38

热点
鼎信通讯：公司在南网2022年计量产品第二批框架招标中，预中标1.78亿元，目前尚处于公示阶段|快消息

2022-12-29 14:14:31

热点
邱国正拜会蓝党团　美曾问4个月训练够吗?-关注

2022-12-29 12:30:24

热点
环球实时：机器学习数据不满足同分布，怎么整？

2022-12-29 10:32:58

热点
民航局：将不再对国际客运航班实施“五个一”等调控措施

2022-12-28 18:43:00

热点
好想你12月28日快速反弹

2022-12-28 15:24:25

热点
翟晓川16分郭艾伦12分北京险胜辽宁豪取6连胜每日热讯

2022-12-28 11:37:29

热点
每日播报!突发！特斯拉又崩了：一夜暴跌3000亿！黄金瞬间飙升什么信号？

2022-12-28 08:19:18

热点
利柏特: 关于重大项目中标的公告_全球观速讯

2022-12-27 20:40:29

热点
2023长沙跨年烟花在哪放？今日聚焦

2022-12-27 16:30:03

热点
臻有钱网贷逾期还不起会上征信系统吗热讯

2022-12-27 12:08:14

热点
环球热点！汪涵儿子4岁学钢琴，为什么明星父母如此看重艺术教育？

2022-12-27 07:32:29

热点
郑州市中牟县交通违章在网上办理怎么办的

2022-12-26 18:16:27

热点
重庆首家科创板上市公司诞生今年已新增上市（过会）企业18家天天信息

2022-12-26 13:21:37

热点
克拉玛依钻井公司锚定单井创效提升钻机月速

2022-12-26 07:48:46

热点
全球快报:[快讯]中贝通信:项目中标

2022-12-25 15:40:13

热点
全球播报:突传死讯！香港知名女星父亲因病离世，12岁女儿患基因病不会说话

2022-12-24 17:49:54

热点
我阳了...

2022-12-24 00:36:43

热点
环球新消息丨英伟达 RTX 3050 显卡 GA107 GPU 版即将上市，功耗降低 15W

2022-12-23 16:31:02

热点
男孩微信网名字短男生简短气质的微信昵称

2022-12-23 10:44:23

热点
使用PyTorch 2.0 加速Hugging Face和TIMM库的模型天天速看料

2022-12-23 01:28:36

热点
记一次QQ找回经历

2022-12-22 16:25:37

热点
城建发展(600266):无锡城建发展集团有限公司2022年面向专业投资者非公开发行公司债券（第三期）（品种二）挂牌|全球消息

2022-12-22 10:37:24

热点
白月光男主合集，《随身空间：农女致富记》勇夺榜首，越追越上瘾

2022-12-21 21:47:33

热点
君亭酒店涨5.18%，民生证券一个月前给出“买入”评级

2022-12-21 15:24:21

热点
晋控电力（000767）12月20日主力资金净买入122.68万元

2022-12-21 09:20:55

热点
雷科防务: 关于2021年限制性股票激励计划预留授予部分第一个解锁期解除限售条件成就的公告

2022-12-20 20:26:00

热点
基于.NetCore开发博客项目 StarBlog - (21) 开始开发RESTFul接口全球今日讯

2022-12-20 13:27:51

热点
当前消息！友宝在线的合伙人，9个月减少了1.5万

2022-12-20 07:48:20

热点
奋达科技(002681)：董事会、监事会完成换届选举暨部分董事、监事任期届满离任_热消息

2022-12-19 18:49:53

热点
环球即时看！涨停雷达：ST板块异动 *ST方科触及涨停

2022-12-19 13:58:32

热点
亲疏有别！同一基金经理业绩大分化，收益竟能相差45%…是何原因？天天快播报

2022-12-19 08:01:02

热点
锦心似玉：徐令宜的弟弟，不就是《以家人之名》中的渣男吗？难怪如此风流

2022-12-18 21:39:57

热点
京东金条网贷逾期六个月延迟还款会不会上征信

2022-12-18 02:09:27

热点
司马懿这五句话，听懂两句都够用一生了时讯

2022-12-17 09:14:36

热点
晶华新材: 晶华新材2022年第三次临时股东大会决议公告

2022-12-16 19:23:42

热点
全球新资讯：担忧技术旁落日产推迟与雷诺达成协议

2022-12-16 13:20:12

热点
康沣生物-B(06922.HK)于12月16日-12月21日招股拟全球发售1111万股|观点

2022-12-16 07:06:14

热点
诺邦股份: 诺邦股份股票交易异常波动公告

2022-12-15 18:24:51

热点
永安药业董秘回复：1、子公司永安康健将密切关注市场动态，及时了解市场动向和客户需求，积极把握市场机会|全球热议

2022-12-15 13:09:41

热点
全球信息:丁俊晖再遭艾伦逆转！赛点机会连输3局，3-4告负无缘英格兰赛16强

2022-12-15 06:35:40

热点
新疆累计外送电量超6000亿千瓦时可供14亿人用188天全球简讯

2022-12-14 16:12:17

热点
享受24期免息分期送京东Plus会员小米13系列今天10点正式首销_今日精选

2022-12-14 11:08:44

热点
环球报道:齐鲁银行: 齐鲁银行股份有限公司关于召开2022年第二次临时股东大会的通知

2022-12-13 22:42:51

热点