当AI画的图不够好,你该怎么办-当前焦点
你有没有遇到过这种情况:让AI帮你画一张图,结果第一版总是不太对味,要么少了点东西,要么风格不搭。你提出修改意见,AI改了,但改完之后你发现,之前明明说好的地方,现在又变回去了,或者整张图的质感突然崩了。
这不是你运气不好。这是一个几乎所有AI画图工具都会踩的坑,而这篇来自UCLA和Google团队的论文,专门把这个坑挖出来给你看清楚了。
**为什么第一版永远不够好**
论文团队先做了一个很朴素的实验:找了14个真的写过论文、画过科研图的人,让他们用AI生成一张图,然后随便怎么改都行,改到满意为止。
结果所有14个人,一个不落,都要求了至少一次修改。改完之后,86%的人觉得比第一版满意多了,满意度从平均3.2分涨到4.2分(5分制)。
这个数字乍一看没什么惊喜,毕竟"修改后更满意"听起来是常识。但真正值得琢磨的是背后的原因。研究者后续访谈发现,九个参与者说,是看到了第一版草图之后,才想清楚自己到底想要什么样的图。换句话说,不是他们脑子里本来就有一张完美的图等着被画出来,而是那张不完美的初稿本身,帮他们理清了思路。
这跟写文章有点像。你不是先想好每句话再打字,而是打出第一句烂句子之后,才知道下一句该往哪个方向写。图像生成也是这样,初稿的作用不只是"结果",更是"思考的媒介"。
科研图表生成*:指用AI模型(通常是多模态生成模型)根据论文的方法描述和图注,自动画出论文里那种示意图、架构图、流程图等。
问题是,现有的AI画图系统几乎都是为"单轮生成"设计的。你说一句,它画一张,顶多再让你补充几句继续改,但没人真正研究过,如果用户要来回改五轮八轮,会发生什么。这篇论文就是奔着这个空白去的。
**改到第三轮,图为什么会越改越丑**
研究团队做了一件挺聪明的事:他们没有真的雇一堆人天天陪AI聊天改图,那太贵了,而是造了一个"虚拟用户"来模拟真实的多轮反馈过程。
具体怎么造的呢。他们先给292张人类专家画的科研图,每张图标注出大约12条"设计要求",总共标了3518条。这些要求五花八门,比如"柱状图的两种颜色必须能区分开""Q、K、V三个序列必须竖着排列"这种。这些要求一开始全部对AI保密,只在多轮对话中,由虚拟用户一条一条地"想起来"并提出来,就像真实用户看着草图逐渐意识到自己还想要什么。
用户模拟器*:一个用大语言模型驱动的程序,它会先判断当前生成的图哪些要求没被满足,再从中挑出k条,组织成一句自然语言的反馈发给AI,模拟真实用户提反馈的过程。
有了这套模拟系统,团队就能在不烧掉几十万人工成本的情况下,反复测试各种AI画图系统在"被持续挑刺"的场景下到底表现如何。测试对象包括谷歌的NanoBananaPro、OpenAI的GPT-Image-2,还有几个专门为科研图设计的智能体系统。
结果暴露了两个几乎所有系统都逃不掉的毛病。
第一个毛病,论文管它叫"质量漂移"。意思是图的质量会随着轮数增加持续下滑。用NanoBananaPro举例,图的质量分数从初始的50.3分,一路跌到19.0分,几乎腰斩再腰斩。就算是相对靠谱的PaperBanana-DirectRefine系统,分数也从50.3掉到47.1,虽然幅度小,但趋势一样。
这就像你用橡皮反复擦改一张素描,每擦一次都留下一点痕迹,改到第五次,纸面已经模糊得看不清原本的线条了。如果不做任何针对性设计,每一次"编辑"叠加上去的微小损耗会不断累积,最后图的整体质感就垮掉了。
第二个毛病叫"遗忘"。就是AI在处理你最新提出的要求时,一不小心把你之前已经确认满意的地方给改回去了或者改坏了。论文里有个很典型的例子:用户在第1轮要求把两个模块的名字加上"U-Net:"前缀,AI照做了,结果到了第4轮,因为又调整了这两个模块的配色和样式,那个"U-Net:"前缀莫名其妙又消失了。测出来的遗忘率,在所有基线系统里都落在14%到23%之间。
遗忘率*:指一个要求在被满足之后,又在后续某一轮被无意破坏的比例。
这背后的根源,其实和人类多线程处理任务时会犯的错很像。你同时兼顾五件事,专注处理第五件的时候,很容易手滑碰坏了第三件已经弄好的东西,因为你的注意力资源就那么多,顾不过来。AI在改图时同样面临类似的困境:它盯着当前这句反馈拼命优化,却没有机制去时刻检查"我是不是把之前答应好的事情弄丢了"。
**给AI装一个会自我检查的循环**
搞清楚了问题所在,研究团队提出了自己的解决方案,叫PaperBanana-Interact。核心思路不是让AI一步到位画出满意的图,而是在每一轮对话内部,悄悄跑一个"自我批评再修改"的小循环。
具体来说,这个系统里有三个角色。一个是"总结员",负责把之前所有轮次的对话和图片压缩成一段简短的文字记忆,而不是每次都把几十张历史图片全塞给AI去看。一个是"批评家",专门盯着当前这版图,从四个维度挑毛病:是否满足这一轮的新要求、是否还保留着之前所有轮次已经满足的要求、是否忠实于论文原文内容、整体呈现质量怎么样。最后一个是"修改师",根据批评家的意见去调整生成图片用的提示词,再交给画图模型重新渲染。
这个批评—修改的小循环会反复跑,最多十次,直到批评家觉得"这版可以了"才停下来交付给用户。
多目标批评家*:不是只看"这次要求满没满足"的单一批评,而是同时检查当前要求、历史所有要求、原文一致性、整体质量这四个方面,生成一份结构化的报告。
这个设计其实挺反直觉的。你可能觉得,用户提一句反馈,AI改一次不就行了,为什么要在内部空转十轮?答案藏在论文的消融实验里。研究者专门做了对比测试,把这个内部循环的迭代次数从10次逐步砍到1次,发现质量分数从61.2一路跌到43.5,几乎是断崖式下降。这说明那个"内部反复检查"的过程,不是可有可无的装饰,而是真正撑起最终质量的骨架。
这就好比你写一篇重要的邮件,不是打完就直接发,而是先自己读一遍,发现哪里语气不对再改一遍,改完再检查一遍格式有没有乱。如果你写完直接秒发,出错的概率显然更高。区别只是,人类写邮件的这个"自查"过程通常是隐性的、凭直觉的,而PaperBanana-Interact把它显性化、结构化了,变成了四个固定检查项,一项一项过一遍再决定要不要继续改。
那个"总结员"压缩历史记忆的设计也值得说一说。团队做了对比实验:如果完全不给AI提供任何历史信息(只看上一版图片),遗忘率会从12.6%涨到14.7%;但如果把所有历史图片一股脑全塞进去,遗忘率虽然略微降低,但每轮的要求满足率却从77.2掉到73.5,而且输入的token量暴涨37.1%。压缩后的文字记忆,恰好卡在了"信息够用"和"不拖后腿"的甜蜜点上。
这有点像你搬家打包东西。你不可能把过去十年积攒的所有东西原样搬到新家,那样箱子太多,新家根本放不下,你也没工夫一件件翻找。但你也不能什么都不带,把家底全扔了。聪明的做法是,把重要的东西提炼一下,写个清单记下"哪个箱子放了什么",带着清单和精简后的行李搬家,既不会丢失关键信息,也不会被杂物拖垮。
**最后交出来的成绩单**
那么这套系统实际表现如何呢。论文给出了两组实验,一组是用户每轮只提1条反馈(k=1),一组是每轮提3条(k=3)。
以PaperBanana作为初始生成器、后面接不同系统做多轮改图为例,在k=1设置下,普通的NanoBananaPro改图,质量分从初始的50.3掉到19.0;稍微聪明一点的PaperBanana-DirectRefine,掉到47.1;而PaperBanana-Interact不但没掉,反而升到了61.2,比初始版本还高出近11分。
在遗忘率上,PaperBanana-Interact也把数字压到了12.6%,比NanoBananaPro的19.0%和PaperBanana-DirectRefine的18.8%都低了不少。
论文还找了真人做了盲测,让评估者不知道图是哪个系统画的,直接排序打分。结果PaperBanana-Interact在76.7%的案例里被认为比PaperBanana-DirectRefine好,在81.3%的案例里比NanoBananaPro好。
|单轮生成器|多轮改图方式|质量分↑|要求满足率↑|遗忘率↓|
|PaperBanana|不改图(单轮)|50.3|25.2|-|
|PaperBanana|NanoBananaPro|19.0|45.2|19.0|
|PaperBanana|PaperBanana-DirectRefine|47.1|52.6|18.8|
|PaperBanana|**PaperBanana-Interact**|**61.2**|**58.0**|**12.6**|
写在后面
读完这篇论文,我最惊讶的一点其实是那个用户访谈的细节:64%的参与者说,他们的修改请求,不是因为AI画错了什么,而是看到初稿之后才冒出的新想法。这跟很多人对"多轮反馈"的直觉理解不太一样,大部分人会以为多轮对话就是"纠错循环",一步步逼近用户心里那张既定的完美图纸。但事实似乎更像是,那张图纸本身根本不存在,用户是在和AI的互动过程里,一起把它画出来的。
这让我想到一个稍微跑题但挺有意思的联系。这种"边看边想清楚自己想要什么"的模式,其实和很多创作行业里的"草稿驱动思考"很像。写小说的人常说,人物是写着写着才立起来的,不是提前设计好的。如果这个类比站得住,那"多轮反馈"这件事的价值,可能不只局限在科研插图这个场景,任何需要人和AI协作产出一个具体成品的任务,大概都值得重新想一想,是不是应该主动引入这种"先出草稿再对话式打磨"的流程,而不是追求一步到位。
论文里还留了一个没完全解决的问题:即便是表现最好的PaperBanana-Interact,遗忘率依然有10%到13%,并没有降到零。研究者自己也承认了这一点。这让我好奇,遗忘这件事到底能不能被彻底根除,还是说,只要系统在持续响应新指令,某种程度的"顾此失彼"就是不可避免的代价,就像人类团队协作时,总有人会在处理新任务时不小心碰坏别人已经完成的部分。这大概是留给后续研究的一个悬念。
Q&A
Q1:PaperBanana-Interact是什么?
A:它是一个由UCLA和Google团队提出的多智能体科研图表修改系统,内部有一个批评—修改的自我检查循环,能在多轮对话中持续提升图片质量,同时减少之前修改成果被覆盖的情况。
Q2:AI改图为什么会越改越差?
A:论文发现两个常见问题,一是质量漂移,图片质量随修改轮数增加持续下滑;二是遗忘,后面的修改会不小心覆盖掉之前已经改好、用户满意的内容。
Q3:MTPaperBananaBench是用来做什么的?
A:它是论文提出的多轮图表生成测试基准,包含292张图片和3518条标注要求,通过一个模拟用户反馈的程序,可以低成本、可复现地测试AI系统在多轮对话改图场景下的真实表现。
相关阅读
-
当AI画的图不够好,你该怎么办-当前焦点
当AI画的图不够好,你该怎么办,论文,改图,实验,生成器,显式标识 -
奈雪的茶(02150.HK)9月22日斥资81.55万...
奈雪的茶(02150 HK)发布公告,该公司于2026年9月22日斥资81 55万港元回 -
中来股份(300393.SZ):子公司拟签订8631...
,格隆汇 -
和远气体:拟收购子公司股权 快播
和远气体:拟收购子公司股权每经AI快讯,和远气体(SZ002971,收盘价: -
要闻速递:维冈勇士瞄准2026三冠王,总...
维冈勇士瞄准2026三冠王,总决赛之路轻车熟路,维冈,勇士,三冠王,赛季揭 -
张家文任中银集团投资有限公司执行总裁...
【张家文任中银集团投资有限公司执行总裁】近日,中银集团投资有限公司
- 当AI画的图不够好,你该怎么办-当前焦点2026-09-22
- 内蒙古博物院几乎每一件文物,都在讲同一个2026-09-22
- 2026抖音电商作者峰会举行,搭好生意「主舞2026-09-22
- 【速看料】太美医疗科技:9月22日斥资9.522026-09-22
- 观速讯丨“别人已经把你看光了”,女班助喧2026-09-22
- 南京同曦官方:球队更名“南京同曦宙光”出2026-09-22
- 鲁尼:JJ-加布里埃尔天赋异禀,曼联失去他2026-09-22
- 9月22日生意社金属硅市场基差为985元/吨2026-09-22
- 奈雪的茶(02150.HK)9月22日斥资81.55万港元2026-09-22
- 和讯信息陈爱国:节前持股还是持币?2026-09-22
- 焦点热讯:33岁绝世少帅!英超全员通杀BIG62026-09-22
- 精选!899元:联想异能者X11A平板开售,10.2026-09-22
- Xbox将裁员数百人,整合多家游戏工作室2026-09-22
- 快消息!铁路+光伏 以场景适配破解交通能2026-09-22
- 国家金融监督管理总局贵州监管局关于邱润生2026-09-22
- 中来股份(300393.SZ):子公司拟签订8631.32026-09-22
- 阅文集团(00772.HK)9月22日耗资397.55万港2026-09-22
- 每日头条!宝利化再获发明专利,破解麦角碱2026-09-22
- 国内首个!八层楼高的“空中大气球”来了 2026-09-22
- 每日报道:生意社:9月22日华鲁恒升硫酸铵2026-09-22
- 守护舌尖上的安全 新一批食品安全国标看点2026-09-22
- 9月22日延华智能涨停:智慧政务,国产软件2026-09-22
- 和远气体:拟收购子公司股权 快播2026-09-22
- 焦点滚动:云煤能源(600792)龙虎榜数据(09-22)2026-09-22
- 【聚看点】GameStop董事长Ryan Cohen斥资22026-09-22
- 生意社:9月22日上海期货交易所期锡库存4502026-09-22
- 药明巨诺-B(02126.HK)盘中涨超20% 今日热搜2026-09-22
- 格力电器公开空调AI模组OTA升级方法、装置2026-09-22
- “黑丝、吊带、洗澡”,国民品牌翻车2026-09-22
- 媒体观察:全链竞争时代下,杰瑞的差异化发2026-09-22








