研究到创作 · 生图少漏要求

鸟画对了,意大利面却没出现:AI 生图怎样少漏要求

一张官方对照图,把画面好看与要求落实分开。看 Diffusion Controller 怎样在生成过程中调整方向,以及这项研究与日常生图工具的距离。

Google Research 9 月 29 日介绍了这项研究;原论文 3 月 7 日已公开。这里读原图和方法,不把它当作新上线的生图功能。

本文目录3 个章节

有了鸟和面,也要再看它有没有在吃

原图中,基础模型画出了蓝松鸦,却没有意大利面;另两种结果补上了面。再仔细看,‘面出现在旁边’与‘鸟正在吃面’仍不是同一个判断。我们的读图结论是:画面完整感、物件是否齐全、动作关系是否成立,应分开核对。单张演示也不能代表所有提示词。

Google 原图对比基础模型、LoRA 和研究方法生成的黑猫、蓝松鸦与戴墨镜的蜥蜴。
Google Research 原图。Pretrained=基础模型,LoRA=一种微调方式,Ours=论文方法。中间一组要求蓝松鸦吃意大利面;基础模型只有鸟。点击放大查看。 · 打开大图
来源与延伸阅读

它调整生成过程,使用仍有前提

Diffusion Controller 的一种做法是在保持基础模型不变时,训练一个小网络,逐步纠正生成方向。论文使用 Stable Diffusion 1.4 做实验;受限访问版本仍需要模型暴露中间去噪输出,不是只要能输入提示词、拿到图片就能接上。这里不能推出 Nano Banana 或 GPT Image 已支持,也不能把实验胜率读成日常出图成功率。

来源与延伸阅读

做自己的图,可以先拆清三件事

假设你要一张‘小狗戴红围巾、坐在窗边看雨’的配图,可以先检查小狗和围巾有没有,再看围巾是否为红色,最后看它的位置、视线与窗外天气。风格满意不代表这三项都通过;漏一项时,指出具体缺失,比笼统要求‘更好看’更容易判断下一张是否有进步。这是本站从示例整理的使用建议,不是我们对研究工具的复现。

一张图要把物件与动作对上,多镜头视频还要把这些关系延续下去。之前钢琴手切镜后变成小提琴手的案例,正好把同一个问题往前推进了一步。