这项由香港科技大学、加拿大滑铁卢大学、阿里巴巴通义千问应用团队及帝国理工学院联合开展的研究,于2026年7月以预印本形式发布,编号为arXiv:2607.05382。感兴趣的读者可通过该编号在arXiv平台检索到完整论文。
你有没有试过让AI画图工具画出某个你喜欢的冷门游戏角色,结果它信心满满地交出一张"创意改编版"——跟原版差了十万八千里?或者让它画一张关于最近某届奥运会的纪念海报,它却把奖牌数据画得一塌糊涂?这种情况并不是AI偷懒,而是它根本就不知道那些信息。就像一个画师在深山里闭关修炼了好几年,出关后你让他画"最新流行的网红款汉服",他掌握的技艺再精湛,也画不出他从未见过的东西。
这正是这群研究者要解决的核心难题:**AI画图工具的"知识盲区"问题**。他们把这个问题叫做"世界知识瓶颈",并为此构建了一个庞大的测试体系,还提出了一套让AI学会"什么时候去查资料"的训练方法。
一、一万个用户的真实需求,暴露了AI画图的致命软肋
研究团队并没有凭空设想AI会在哪里犯错,而是实实在在地爬梳了来自生产级别AI画图平台的两万多条真实用户请求。这相当于他们坐在一个巨大的"用户需求数据库"里,逐条翻阅用户到底想让AI画什么。
翻完之后,他们总结出了十二类让AI画图工具频繁"翻车"的请求类型。这十二类可以用一个统一的逻辑来理解:用户想要的,恰恰是AI在训练时没见过、或者见过但记不住的东西。
第一类是"时效性强的近期事件",比如"画出2025年大阪世博会的官方吉祥物摆出官方造型"。世博会吉祥物是在AI训练结束之后才发布的,AI不可能知道它长什么样。第二类是"当下实时信息",比如"把当前世界杯小组赛积分榜做成一张记分板图形"。AI不联网,根本不知道今天的比赛结果。第三类是"特定角色与IP",比如"画《崩坏:星穹铁道》里的镜流挥舞冰剑"——这个角色有极其精确的视觉设定,稍有偏差就会被玩家一眼看穿。第四类是"概念与符号",比如"不丹国旗上的龙纹设计要画准确"——国旗图案有严格的规范,AI画出来的版本往往似是而非。
除了这四类,还有历史与事实类(比如"画出温泉关战役中斯巴达人使用的历史真实青铜盔甲")、文化特异性类(比如"画出瓦哈卡传统彩绘龙纹怪兽玩具")、视觉界面类(比如"画出iOS 17天气应用显示雷暴动画时的截图")、数据可视化类(比如"做一张中国朝代年表,包含准确的年份和开国皇帝")、文字与字体类(比如"做一张新艺术运动风格的音乐会海报,字体要符合那个时代")、复合类(比如"用阿兹特克风格信息图解释DNA复制过程,要有准确的步骤标注")、模糊抽象类(比如"画出在日本小城镇雨天下午的怀旧感")以及隐式推理类(比如"画一个宫崎骏电影风格的温馨山间小屋内景")。
研究团队还做了一项统计,结果相当震撼:在他们整理出的三万一千多个独特视觉实体中,有93.1%只在整个数据集里出现过一次。换句话说,绝大多数用户想画的东西,都是极度"长尾"的稀有需求。没有任何AI训练集能穷尽这些需求,搜索工具从根本上就是不可或缺的。
此外,每个提示词平均包含5.2个"知识缺口"——也就是说,AI平均需要在5个以上的地方"补充外部知识"才能画准。90.5%的提示词同时包含三个以上的知识缺口。这意味着用户的需求往往是多层次的复合需求,而非单一的简单要求。
二、一场专门揭穿AI短板的考试
为了系统地衡量这个问题有多严重,研究团队专门构建了一套名为SEARCHGEN-20K的数据集和配套的SEARCHGEN-BENCH基准测试。这套数据集包含两万多个提示词,横跨二十二个领域,覆盖上述十二类失败模式,并且是双语的——58%为英文(平均266个字符,偏向详细描述),42%为中文(平均89个字符,偏向简洁隐含),真实反映了跨语言用户的不同提问习惯,而非简单翻译。
每个提示词都配备了3到10个"核查清单"——也就是一组具体的是非题,比如"角色的脸部特征是否与目标人物相符"、"服装是否与1970年代农村场景匹配"。这些清单让评分可以完全自动化,不再依赖人工逐张检查。
评分体系分为两大类。第一类是"知识敏感型"指标,专门衡量AI有没有画出正确的知识内容,包括核查清单得分、类别专属评分维度、提示词忠实度、视觉参考相似度以及文字知识准确度。第二类是"渲染质量型"指标,衡量图片本身画得好不好,包括画面清晰度、文字渲染、AI痕迹自然度、构图美感以及物理合理性。这种分法的用意很明确:把"不知道该画什么"和"不会画"这两种不同的失败原因彻底区分开来。
测试结果令人咋舌。在不需要外部知识的"参数型提示词"上,无论是开源模型还是商业系统,得分都集中在63到75分之间(满分100),大家旗鼓相当。但一旦切换到需要外部世界知识的提示词,开源画图模型的得分全部崩塌到21到28分的区间,而像GPT-Image-2这样背后集成了实时搜索的商业系统几乎没有下滑。这个落差高达40分,而且这种差距在现有的任何其他基准测试中几乎都是看不见的——因为其他测试根本就不测这类内容。
最关键的发现在于:知识敏感型指标(如核查清单得分)在开源模型上急剧下滑,而渲染质量型指标(如物理合理性、画面清晰度)却依然保持在相对较高的水平。这直接证明了:模型不是不会画,而是不知道该画什么。
三、搜索看起来是解药,但直接用会适得其反
既然问题出在"不知道",那最直觉的解决方案就是:给AI配一个搜索工具,让它在画图前先查一查。研究团队把这种方式叫做"主动式视觉生成"——AI不再是孤立地根据提示词作画,而是像一个会查资料的助手,先搜集信息和参考图片,再动笔。
然而,研究团队的实验结果揭示了一个让人哭笑不得的现象:不加区别地搜索,反而会把事情搞砸。
他们测试了两种策略。第一种叫"盲目搜索"——对每一个提示词,不管AI知不知道,都去搜索一番,把搜到的内容塞给AI参考。第二种叫"有选择的搜索"——让一个强大的视觉语言模型判断哪些提示词真正需要搜索,再决定是否搜索。
结果显示,在那些AI本来就能处理得很好的提示词上,盲目搜索让Qwen-Image-2的得分从70.7分跌到60.4分,相对损失超过14%。搜索非但没有帮忙,反而把AI原本正确的"内部知识"给覆盖掉了。
研究团队把这种现象归纳为两种结构性失败。第一种叫"概念污染":搜索触发了一个AI本来就能正确处理的提示词,返回的参考图片反而覆盖掉了AI正确的内部知识,导致最终生成的图片反而画错了。第二种叫"复制效应":参考图片里的信息太多,AI不加辨别地全部照单全收,最终输出的图片看起来像是对参考图的直接复制,而不是一幅真正根据需求创作的新画。
这两种失败模式说明一个道理:搜索本身不是问题,问题在于**什么时候搜**和**怎么用搜到的东西**。这就像厨师做菜——菜谱上有的食材,你不需要去市场临时采购,强行采购反而打乱了既有流程;而对于菜谱上没有的稀缺食材,不去采购就根本没法做出这道菜。更关键的是,买回来的食材也需要经过筛选和加工,不能直接整个丢进锅里。
四、知识边界:AI"已知"与"必须查"的分水岭
为了从理论上厘清这个问题,研究团队引入了一个核心概念——"知识边界"。这个概念是整篇论文最精髓的洞见,理解了它,就理解了整套方法的逻辑。
知识边界的意思是:对于任何一个特定的AI画图模型,世界上所有的知识都可以被分成两类。第一类是"可内化知识"——这些知识通过训练可以被AI吸收进参数里,下次不需要搜索就能直接用。比如,某个角色的标志性外观,一旦AI在足够多的数据和专项训练之后,就能记住并复现,搜索就变得多余了。第二类是"必须依赖外部上下文的知识"——这些知识无论怎么训练都不可能完全内化,因为它们要么是AI训练截止日期之后才发生的新事件,要么极其罕见根本没有足够的训练数据,要么是需要实时更新的动态信息。对于这类知识,搜索是结构性必需的,没有替代品。
这条分界线有两个重要特性。第一,它是**模型专属的**——不同的AI模型,知识边界的位置不一样。对一个弱模型来说需要搜索的内容,对一个强模型来说可能已经内化了,不再需要搜索,甚至搜索反而有害。第二,它是**动态变化的**——随着AI模型被训练得越来越好,知识边界会向外扩张,越来越多的知识从"必须查"变成"已经知道"。
这意味着,一个为弱版AI模型设计的搜索策略,直接用到强版AI身上可能反而会变差。这就是为什么"让AI自己学会什么时候该搜、什么时候不该搜"比"设计一个固定的搜索触发规则"要重要得多。
五、三道关卡:让搜索变得智能而非添乱
基于对知识边界的理解,研究团队设计了一套叫做"噪声抵抗型主动推理器"的机制,本质上是一个在AI画图之前运行的三阶段决策流程,就像一位经验丰富的研究助手,在把资料递给画师之前,先经过三轮严格筛选。
第一道关卡叫"门控"。推理器接到用户提示词后,首先判断这个提示词里有哪些AI可能不知道的知识缺口,并为每个缺口评定严重程度(关键、重要、一般、轻微)。只有被评为"关键"或"重要"的知识缺口,才会触发搜索;其余的直接跳过。同时,推理器还会判断每个缺口需要的是图片搜索还是网页文字搜索,因为有些知识缺口需要看图(比如角色外观),有些需要看文字(比如历史年表数据)。如果没有任何缺口达到触发门槛,整个搜索流程直接跳过,发出"无需搜索"的指令。
第二道关卡叫"过滤"。搜索执行完毕后,返回的结果往往是一堆图片或网页,质量参差不齐。这一阶段的任务是从中挑选出最直接填补知识缺口、同时带有最少无关内容的那一份。研究团队发现,这一步对于减少"复制效应"至关重要——通过筛掉那些内容过于丰富、容易让AI照单全收的参考资料,只保留真正有针对性的内容。
第三道关卡叫"整合"。即便经过筛选的参考图片,也不能直接原封不动地丢给AI——因为AI会把图片里所有的视觉信息都当成指令来执行,包括背景颜色、灯光方向、构图方式这些跟用户需求毫无关系的细节。整合阶段的做法是:推理器用自然语言把参考图片里"有用的部分"明确说出来,比如"参照图1中角色的青金色长袍款式,但不要复制图1的背景和光线"。这样,AI得到的不是一张"原始参考图",而是一段精确指令,告诉它从参考资料里借鉴哪些、忽略哪些。这条路径把视觉知识转换成了语言知识,从根本上切断了"复制效应"的来源。
六、先教会它,再告诉它去查什么
光有这三道关卡还不够。研究团队提出的更深层解法是一套"协同训练"框架,用一句话概括就是:**先让画图AI学会它能学会的,再让搜索推理器学会只查AI学不会的**。
训练过程分为三个阶段,依次递进。
第零阶段是"有监督的热身"。研究团队首先收集了约一万条专家标注的"推理轨迹"——每条轨迹记录了推理器在面对某个提示词时,三道关卡分别应该怎么处理。用这些数据对Qwen3-VL-8B(一个八十亿参数的视觉语言模型)进行微调,让它学会按照正确格式执行三阶段流程。但此时的推理器是"模型无关"的——它不知道具体跟哪个画图模型配合,只知道一般性原则。
第一阶段是"教会画图AI能内化的知识"。热身好的推理器开始为训练集中的提示词执行搜索,生成包含参考图片和文字知识的"增强版提示词",然后喂给画图AI(比如Flux.2-Klein-4B,一个四十亿参数的流程匹配模型)。画图AI针对每个提示词生成多张候选图片,由Gemini-3-Flash评分,然后用"直接偏好优化"(DPO)方法,用评分最高和最低的那对图片来训练画图AI,让它朝着更好的方向进步。
经过这一阶段,画图AI扩展了自己的知识边界——那些之前需要搜索才能画对的概念,现在已经被吸收进参数里,不再需要搜索了。研究团队用一个累积分布图直观证明了这一点:经过DPO训练的画图AI,在不借助任何搜索的情况下,得分分布整体向右移动,意味着更多的提示词被模型自身处理得很好。这个"向右移动的区域",就是被内化的新知识。
第二阶段是"重新校准推理器:只查AI还不会的"。画图AI的知识边界已经扩张了,但推理器还不知道这件事,它还在按照之前的老策略触发搜索,包括那些画图AI现在已经会了、不需要搜索的提示词。这时需要对推理器重新校准。方法是"拒绝采样微调"(RFT):让推理器对大量提示词分别执行和不执行搜索,把两种结果都送给升级后的画图AI生成图片,评分比较,只保留那些"搜索确实带来了改善"的推理轨迹来训练推理器。这样,推理器就从数据里自动学到了"对于这个已经变强的画图AI,哪些提示词还需要搜索,哪些已经不需要了"。
整套训练流程的计算成本并不高。推理器训练阶段只需要8块英伟达H20显卡运行约4小时,画图AI的DPO阶段则是8块H20运行24小时,总计约256个GPU小时。对于学术研究团队来说,这个门槛是可以接受的。
七、实验结果:一步步向上爬的成绩单
研究团队用SEARCHGEN-BENCH对整套框架进行了全面测试,并对两个结构差异明显的开源画图模型——Flux.2-Klein-4B(一个流程匹配模型)和Bagel-7B(一个统一视觉语言模型)——分别做了实验,以排除结果只对特定模型架构有效的可能性。
测试结果验证了三个关键预测。
第一,得分单调递增——训练的每一步都在进步,没有任何退步。对于Klein-4B来说,第零阶段(盲目搜索)得分为26.4分,第一阶段(画图AI经过DPO升级)提升到29.2分,第二阶段(推理器重新校准)进一步提升到31.8分。更值得注意的是,31.8分已经略微超过了用Gemini-3-Flash这个万亿级参数商业模型作为推理器时的31.2分上限。这意味着,一个针对特定画图模型精心校准的8B推理器,可以超越一个通用的超大规模推理器。Bagel-7B也呈现出相同的递进趋势。
第二,改善是有选择性的——推理器学会了在不需要搜索的提示词上主动克制。在那100个"本来就不需要搜索"的提示词上,第二阶段的Klein-4B-DPO搭配重新校准的推理器得分为56.9分,比不搜索的基准线49.9分高出了整整7分。这说明推理器不仅学会了什么时候要搜,也学会了什么时候不要搜,并且在判断"不搜索"的提示词上,有时候善用搜索工具仍然能带来额外增益,而不是盲目搜索造成损害。
第三,搜索策略是画图模型专属的——把针对Klein-4B-DPO校准的推理器,拿去配Klein-4B(未升级版本),得分从31.8分跌回26.8分。这直接证明了知识边界是"模型与推理器共同决定的属性",而不是提示词的固有属性。推理器必须知道它在跟哪个版本的画图AI合作,才能做出正确的搜索决策。
除了这套方法本身,研究团队还做了一件对整个领域有实际价值的事:他们把整套数据集、训练轨迹和搜索结果全部打包成离线可回放的"研究工具箱"对外发布。其中包括两万条提示词、9万多条推理轨迹、近28万张生成图片,以及14万多条已经缓存完毕的搜索会话。研究者可以在完全不依赖付费搜索API的情况下,重现所有实验,极大降低了后续研究的门槛。
说到底,这项研究揭示的核心是:AI画图工具的失败,往往不是因为不会画,而是因为不知道该画什么。世界是不断变化的,新角色、新事件、新符号每天都在涌现,任何固定的训练集都永远追不上这个速度。通过让AI学会"主动知道自己不知道什么",并在恰当的时候去查,再通过协同训练让搜索边界随着模型能力的提升而动态调整,这套框架提供了一条让AI画图工具变得更"知情"的可行路径。对普通用户来说,这意味着未来那个"信心满满画错冷门角色"的场景,有望越来越少出现——前提是这套机制能被更广泛地集成到实际产品中。有兴趣深入探索的读者,可以通过arXiv编号2607.05382查阅完整论文。
Q&A
Q1:SEARCHGEN-BENCH和现有的AI画图评测标准有什么区别?
A:现有的AI画图基准测试(如GenAI-Bench)主要测试AI在"已知概念范围内"的构图和理解能力,不测试AI对于训练集之外知识的掌握程度。SEARCHGEN-BENCH专门针对那些需要外部世界知识才能正确画出的提示词,比如最新发布的吉祥物、冷门游戏角色、历史精确细节等,因此能暴露出现有基准完全看不到的40分左右的性能差距。
Q2:协同训练中的"知识边界"会随着AI模型升级自动更新吗?
A:不会自动更新,需要重新做第二阶段的推理器校准训练(RFT)。研究的核心发现之一就是:当画图AI通过DPO训练扩展了知识边界之后,原来配套的搜索推理器会变得"过度搜索",因为它还不知道画图AI已经学会了哪些新内容。每次画图AI升级后,需要重新收集搜索与不搜索的对比数据,筛选出有效轨迹,再对推理器进行一轮微调,整个校准过程大约需要32个GPU小时。
Q3:为什么盲目给AI提供搜索结果反而会让生成质量变差?
A:研究团队发现了两种主要的失败机制。一是"概念污染":当AI本来就知道怎么画某个概念时,搜索返回的参考图片会覆盖AI正确的内部知识,导致画出错误的版本。二是"复制效应":参考图片携带了太多无关信息(比如背景、光线、构图),AI会不加辨别地全部照搬,输出的图片变成了对参考图的滤镜版复制,而不是真正的创作。这两种问题都需要通过"门控—过滤—整合"三阶段流程来解决。