跳到主要内容

图像提示的标准做法 — 每个词都在扰动模型

这一章讲三件事: 图像提示的解剖——格式、风格、质量词、负提示、权重各自管什么; 图像本身怎么当输入(底图、局部重绘、外扩、一致角色); 以及两条元技巧:让 LLM 替你改写提示、把名家风格拆成可重混的部件。 对应原书第 8 章全章(以 Midjourney 演示,手法通用于各家)。

1. 这一章讲什么

第 11 章给了地图(潜空间)和格局(三家);这一章给导航手法。全书反复出现的一个观察可以当本章的座右铭:提示里加的每个词都在扰动模型——词不是装饰,是推力1

主走查:画一幅「时代广场,达利风格」。 三步:先直呼其名(在提示里写 Dali);发现太像复制品后,让 GPT-4 把达利的风格解绑成一组特征(风格的组成要素)词;再拿这组部件重混出一幅既 surreal 又不抄袭的图。这条路线会先后用到艺术家名、提示改写、解绑三件工具。

2. 顶层全景:一条提示的解剖

oil painting of a business meeting, trending on artstation --no frame, wall
└┬────────┘ └──────────┬──────────┘ └───────┬────────┘ └──┬──┘
格式(往哪类图上靠) 主体(放最前,权重最大) 质量词(往高质量区拽) 负提示(排除项)

更精细的控制:Van Gogh::0.8 Dali::0.2 —— ::配重,逐段调比例

图说:一条图像提示 = 主体 + 若干推力。每个推力都有大小(权重),
都可以反向(负权重)。拆得开这些成分,才谈得上「调」提示。

3. 核心原理

3.1 格式修饰符:格式会连内容一起改

最基本的手法是指名格式:stock photo(素材图)、油画、古埃及壁画……模型都能出2。但书里的警告比手法本身更值钱:格式会带动内容——画「商务会议」的油画里不会出现电脑,因为油画这种格式在训练数据里就没有电脑;同一主题的埃及壁画版,与会者自动戴上了古埃及头饰3

所以格式不是滤镜,是整幅图的世界观。选错格式,内容细节会跟着跑偏。反过来用也成立:想要某种内容氛围,可以先选承载它的格式。

3.2 艺术家名:潜空间的捷径与其灰区

主走查第一步。要达利风格,最省事的写法就是直呼其名:「painting of Times Square in the style of Salvador Dali」。这之所以有效,是因为训练数据里他的名字和他的画风绑在一起——名字就是第 11 章那张地图上的一个知名坐标,一报名字,整片风格区域被激活4。书里的常见例子:梵高=后印象派、达利=超现实、毕加索=立体派;当代艺术家里,波兰幻想画家 Greg Rutkowski 的名字被引用得多到他自己成了现象4

灰区必须照实写:模仿在世艺术家的风格是否构成合理使用,是未决的法律问题;Rutkowski 等艺术家已公开反对。书里给的经验法则(作者明确说这不是法律意见):只用去世一年以上的艺术家,商用前咨询律师4

还有一个质量问题:直呼其名得到的东西「像,但是廉价的像」——它在复刻,不在创作。这正是主走查第三步(§3.7 解绑)要解决的。

3.3 质量词:模型不追求好图,你得开口要

有一组词叫质量词(quality boosters),比如 4kvery beautifultrending on artstation——加上去,图就明显更「好」5。机理在第 02 章就埋下了:模型不主动追求高质量,它只是模仿训练集;而训练数据里,ArtStation 这类作品网站上的图带着「trending」标签的,平均美学水平就是更高。加质量词等于告诉模型:往那片区域洗6

代价同样来自训练集:ArtStation 上飞船多,于是「a space whale, trending on artstation」(太空鲸)画出来的鲸有点像飞船——质量词会把它的来源网站的题材偏好一起带进来6

3.4 负提示:把纠缠的概念拆开

正向说「要什么」有时候不够,因为概念在训练数据里是纠缠的:油画的训练图常常带画框、挂在墙上,于是你要油画,它连框带墙一起画。负提示(negative prompt)就是排除项:Midjourney 里加 --no frame, wall,逗号分隔的词会被从图里拿走7

负提示的三个真实用例,书里各给了一张图8:

  • 修顽疾:早期模型画手畸形,就往负提示里塞 nsfw, too many digits(常不管用,但值得试);
  • 拆名人:Karen Gillan(红发女星)当负提示,可以降低主体出现红发的概率;
  • 做实验:Homer Simpson --no cartoon(辛普森,但不要卡通)——把两个几乎不可分的概念硬拆开,看模型交出什么(答:某种写实化的诡异辛普森)。

书里如实标注:负提示不是完全可靠——纠缠太深的概念拆不动8

3.5 加权:词不再平等

默认每个词的权重都是 1,但位置靠前的词影响更大——所以主体习惯放句首9。Midjourney 的配重语法(写法规则)是双冒号:painting of the Golden Gate Bridge::1 in the style of Van Gogh::0.8, in the style of Dali::0.2——一座以梵高为主、带一撮达利的金门大桥9

配比怎么找?别一格一格手试,用网格搜索(grid search:把权重按固定步进——书里用 0.2——两两组合,全部生成,摊成网格挑最好的)10。这正是第 07 章「排列组合提示 + 网格」评测法在提示内部的用法。

权重可以大于 1(强调),也可以是负的——--no X 其实只是 X::-0.5 的简写;负权重配强正向能做出极端重混:Van Gogh::-1 Dali::5 把梵高成分从达利里彻底剥掉11

3.6 图像当输入:底图、重绘、外扩、一致角色

文字不是唯一输入。把一张图传进 Discord 拿链接、塞进提示,就是图生图(img2img,第 01 章提过);/blend 把多张图融成一张;--iw 参数控制底图相对文字的权重12。视频生成也常用这招:先用图把风格调对,再生成视频12

两个精细操作:inpainting(局部重绘:抹掉图的一块,只重画那块)和 outpainting(外扩:往画框外接着画,等于拉远变焦)13。书里的演示:一张 1920 年代风格的女子像,抹掉裙子,提示「Van Gogh style dress, inspired by Starry Night」——裙子变成《星月夜》的漩涡14。一条与官方建议相反的经验:常见说法是「提示要描述整幅图」,而作者的经验是提示只写被抹掉的那一块,效果更好14

还有一个被低估的组合用法:一致角色。生成一张 --ar 2:1 的并排双图(同一个角色的两张肖像),放大,抹掉其中半边,换新场景的提示重绘那半边——因为另半边始终在画面里,模型会保住角色的长相;重复几轮、裁切,就攒出同一角色的多个角度。攒到 20 张,就够去训一个专属模型了(DreamBooth,第 13 章)15

3.7 提示改写与 meme 解绑:主走查的后两步

用户常常写不对提示。书里的补救是提示改写:把用户的提示喂给 ChatGPT,让它改写得更专业16。例:用户写「a dachshund dog in the style of Banksy」(班克西风格的腊肠狗),出来的是「狗站在一幅街头涂鸦旁边」而不是「狗是涂鸦的一部分」——因为没写 Banksy 的媒介。让 ChatGPT 先问一句「Banksy 主要用什么媒介?」(答:街头艺术),改写成 street art of a dachshund dog in the style of Banksy,构图就对了16。垃圾进垃圾出,改写器治的是「进」的那端。

主走查最后一步:解绑(unbundling,Bakz T. Future 造的词)。「时代广场,达利风格」直呼其名已经像样,但太像复制品。解法分四步17:

1. 让 GPT-4 描述《记忆的永恒》的风格特征——提示里明令不许提画家和画名
(要的是「讲给没见过这幅画的人听」的干净描述);
2. 把描述缩写成一个图像提示;
3. 加上主体:时代广场;
4. 生成——得到一幅 surreal 的、熔化的、梦境感的时代广场:
像达利,但不再是任何一幅具体达利的副本。

更深的一层:描述里的每个特征(「surrealist landscape」「melting objects」「dreamlike atmosphere」)都是一个 meme(模因:在人际间被反复复制的文化信息单元,不只是搞笑图)——解绑就是把一个风格拆成一把可独立取用的模因零件,再和别的艺术家的零件重混出你的新风格18。书里的边界:这招只对「著名到训练数据里有充分描述」的作品有效18

3.8 提示分析:/shorten 与删词的力量

提示越写越长是通病。书里的解药是 Midjourney 的 /shorten 命令:它给出每个词元(token 的另一种叫法,即第 01 章的标记)实际拿到的权重,把废话暴露出来1。实例:「portrait of Homer Simpson as a Soviet factory worker, gritty, dirty, beautiful, very detailed, hyperrealistic…」的实测权重——homer simpson1.00,portrait 0.08,而 beautifulverymedium shot 全是 0.00:这些词模型根本不看19

结论就是本章开头那句座右铭的完整版:每个词都在扰动模型,而删掉没用的词和加新词一样有效——提示工程在图像侧常常是减法1

4. 作者的判断与证据

  • 所有手法都配了真实提示与出图(文本层可见的是提示与权重数字,图本身在书里);
  • 「质量词因 ArtStation 关联而有效」用了 reportedly(据报训练数据含这些站点)——是合理推断,标注照录6;
  • 「upscale 当训练信号」「NSFW 过滤伤性能」均为社区推测,第 11 章已标明;
  • 「提示只写抹掉的区域更好」是作者经验,与官方建议相反,书里明说14;
  • 「去世一年以上」是作者的经验法则,书里自己声明不是法律意见4

判断(我们的,不是书里的): 这一章的所有手法共享同一个心智模型——提示词不是描述,是施力。格式往某类图拽,质量词往高质量区拽,负提示往外推,权重调每股的力的大小,/shorten 则是测力计。文本提示工程里「模型是续写引擎」,图像侧的对应物是「模型是被一群词拉扯的噪声」——两个心智模型都能在各自的侧解释几乎全部手法。 如果错,会错在: 这个「施力」模型是启发式(凭经验有效、没有严格证明)的,不是对扩散过程的严格描述;如果某代模型读懂文字的方式变了,「词序靠前权重大」「零权重词」这类具体现象可能消失,但「测过再信」(/shorten、网格搜索)的原则不变。

5. 边界与局限

  • 本章语法(::--no--iw--ar)是 Midjourney 方言;Stable Diffusion 有自己的一套(第 13 章),理念通、拼写不通;
  • 负提示「不可靠」是书里原话:纠缠深的概念拆不开,别把它当精确手术刀;
  • 解绑只对名作有效;冷门艺术家在训练数据里没有足够描述,拆不出零件;
  • 一致角色流程是手工活(生成、抹、重绘、裁切),书里攒 20 张训 DreamBooth 是半自动的下一步;
  • 版权与伦理:模仿在世艺术家、用他人照片当底图,都在灰区;书里给的是谨慎原则,不是结论。

6. 可带走的

  1. 图像提示 = 主体 + 若干推力;先想清楚要哪几股力,再动笔;
  2. 格式会连内容一起改——油画里没有电脑;选格式就是选世界观;
  3. 报名字是合法捷径,但得到的是复制品;要原创,走解绑;
  4. 模型不追求好图——质量词(4k / trending on artstation)是刚需,不是锦上添花;
  5. 质量词会带进来源站的题材偏好(太空鲸变飞船)——看到跑偏,先查质量词;
  6. 排除用负提示,配比用 :: 权重;--no X 就是 X::-0.5;
  7. 配比别手试,网格搜索一次出全组合;
  8. 风格调不动时,让图像当输入:底图、/blend、局部重绘、外扩;
  9. 用户提示先过改写器:垃圾进,垃圾出;
  10. 定期 /shorten:权重为 0 的词全删掉——删词和加词一样有效。

7. 原文地图

主题原书章原文位置
格式会改内容Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:9(搜「stock photo」) · text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:54(搜「aren't any computers」)
impasto 与艺术家清单Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:33(搜「impasto」)
艺术家名与灰区Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:58(搜「Greg Rutkowski」)
/describe 反推提示Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:77(搜「reverse engineer」) · text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:79(搜「CLIP Interrogator」)
质量词Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:85(搜「quality boosters」)
太空鲸像飞船Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:99(搜「space whale」)
负提示与 frame, wallCh.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:105(搜「negative prompts」)
Karen Gillan 与 HomerCh.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:119(搜「Karen Gillan」) · text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:133(搜「--no cartoon」)
加权 :: 语法Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:147(搜「equal weighting of 1」) · text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:152(搜「Gogh::0.8」)
网格搜索配比Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:158(搜「grid search」)
--no 是 ::-0.5 简写Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:168(搜「::-0.5」)
底图、/blend、--iwCh.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:201(搜「/blend」)
局部重绘:梵高裙Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:211(搜「Vary Region」) · text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:228(搜「Starry Night」)
只提示抹掉的区域Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:224(搜「narrowing down the prompt」)
外扩与 Zoom OutCh.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:248(搜「Zoom Out」)
一致角色流程Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:269(搜「consistent characters」) · text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:295(搜「one-half of the image」)
提示改写:BanksyCh.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:315(搜「street painting」) · text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:330(搜「street art of a dachshund」)
解绑与 Bakz T. FutureCh.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:357(搜「Bakz T. Future」)
不许提画家和画名Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:385(搜「not mentioning the artist」)
模因重混Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:431(搜「melting objects」)
meme mapping 与 LexicaCh.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:451(搜「Lexica.art」)
/shorten 与词权重Ch.8 图像标准做法text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:474(搜「/shorten」) · text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:485(搜「1.00」)

Footnotes

  1. 出处:「Ch.8 图像标准做法」第 474 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:474,搜「Every word added perturbs the model」)。 2 3

  2. 出处:「Ch.8 图像标准做法」第 9 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:9,搜「stock photo」)。

  3. 出处:「Ch.8 图像标准做法」第 54 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:54,搜「aren't any computers」)。

  4. 出处:「Ch.8 图像标准做法」第 58 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:58,搜「Greg Rutkowski」)。「去世一年以上」的经验法则与「非法律意见」声明都在这段。 2 3 4

  5. 出处:「Ch.8 图像标准做法」第 85 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:85,搜「quality boosters」)。

  6. 出处:「Ch.8 图像标准做法」第 99 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:99,搜「space whale」)。 2 3

  7. 出处:「Ch.8 图像标准做法」第 105 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:105,搜「negative prompts」)与第 109 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:109,搜「--no frame, wall」)。

  8. 出处:「Ch.8 图像标准做法」第 119 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:119,搜「Karen Gillan」)、第 133 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:133,搜「--no cartoon」)与第 139 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:139,搜「too many digits」)。「not fully reliable」在第 119 段。 2

  9. 出处:「Ch.8 图像标准做法」第 147 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:147,搜「equal weighting of 1」)与第 152 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:152,搜「Gogh::0.8」)。 2

  10. 出处:「Ch.8 图像标准做法」第 158 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:158,搜「grid search」)。

  11. 出处:「Ch.8 图像标准做法」第 168 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:168,搜「::-0.5」)与第 173 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:173,搜「Gogh::-1」)。

  12. 出处:「Ch.8 图像标准做法」第 201 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:201,搜「/blend」)。 2

  13. 出处:「Ch.8 图像标准做法」第 211 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:211,搜「Vary Region」)与第 248 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:248,搜「Zoom Out」)。outpainting 在 OpenAI labs 已下线、ChatGPT 未上,Midjourney 叫 Zoom Out。

  14. 出处:「Ch.8 图像标准做法」第 224 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:224,搜「narrowing down the prompt」)与第 228 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:228,搜「Starry Night」)。 2 3

  15. 出处:「Ch.8 图像标准做法」第 269 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:269,搜「consistent characters」)与第 295 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:295,搜「one-half of the image」)。

  16. 出处:「Ch.8 图像标准做法」第 315 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:315,搜「street painting」)、第 319 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:319,搜「medium」)与第 330 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:330,搜「street art of a dachshund」)。 2

  17. 出处:「Ch.8 图像标准做法」第 357 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:357,搜「Bakz T. Future」)、第 361 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:361,搜「artistic style」)与第 399 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:399,搜「shortened prompt」)。

  18. 出处:「Ch.8 图像标准做法」第 346 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:346,搜「meme」)、第 431 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:431,搜「melting objects」)与第 447 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:447,搜「famous enough」)。 2

  19. 出处:「Ch.8 图像标准做法」第 485-489 段(text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:485,搜「1.00」;text/62-ch08-chapter-8-standard-practices-for-image-generatio.txt:487,搜「0.00」)。