研究到创作 · 生图少漏要求
鸟画对了,意大利面却没出现:AI 生图怎样少漏要求
一张官方对照图,把画面好看与要求落实分开。看 Diffusion Controller 怎样在生成过程中调整方向,以及这项研究与日常生图工具的距离。
Google Research 9 月 29 日介绍了这项研究;原论文 3 月 7 日已公开。这里读原图和方法,不把它当作新上线的生图功能。
有了鸟和面,也要再看它有没有在吃
原图中,基础模型画出了蓝松鸦,却没有意大利面;另两种结果补上了面。再仔细看,‘面出现在旁边’与‘鸟正在吃面’仍不是同一个判断。我们的读图结论是:画面完整感、物件是否齐全、动作关系是否成立,应分开核对。单张演示也不能代表所有提示词。

来源与延伸阅读
- Google Research:Diffusion Controller官方研究介绍 · 9 月 29 日原始对照图、方法介绍与实验范围。
它调整生成过程,使用仍有前提
Diffusion Controller 的一种做法是在保持基础模型不变时,训练一个小网络,逐步纠正生成方向。论文使用 Stable Diffusion 1.4 做实验;受限访问版本仍需要模型暴露中间去噪输出,不是只要能输入提示词、拿到图片就能接上。这里不能推出 Nano Banana 或 GPT Image 已支持,也不能把实验胜率读成日常出图成功率。
来源与延伸阅读
- 原论文:框架、算法与参数化研究论文 · 3 月 7 日核对模型中间过程的访问条件与 Stable Diffusion 实验。
做自己的图,可以先拆清三件事
假设你要一张‘小狗戴红围巾、坐在窗边看雨’的配图,可以先检查小狗和围巾有没有,再看围巾是否为红色,最后看它的位置、视线与窗外天气。风格满意不代表这三项都通过;漏一项时,指出具体缺失,比笼统要求‘更好看’更容易判断下一张是否有进步。这是本站从示例整理的使用建议,不是我们对研究工具的复现。
一张图要把物件与动作对上,多镜头视频还要把这些关系延续下去。之前钢琴手切镜后变成小提琴手的案例,正好把同一个问题往前推进了一步。