DALL·E 2提示词工程实战:从踩坑到可控生成的底层逻辑
1. 这不是一篇“教程”,而是一份花了15美元买来的实战手记
你点开这篇文章,大概率不是为了查维基百科式的定义,而是想搞清楚一件事: 如果我现在真掏钱去用DALL·E 2,到底值不值?能干成什么?又会在哪一步被卡住、被气笑、被自己写的提示词反复打脸? 我花了15美元——准确说是115个信用点,换来了超过100次生成、300多张图、近两周的密集试错,最后才抠出一张勉强能发在博客首页的“ llama dunking a basketball”。这不是AI画图的炫技秀,这是我在真实付费账户里,一笔一笔扣掉信用点后,写下的操作日志、踩坑实录和可复用的底层逻辑。
关键词 DALL·E 2 在今天早已不是新鲜词,但绝大多数人看到的,是社交媒体上被精心筛选过的“神图”:一只穿着西装的柴犬在华尔街敲钟,或是梵高风格的太空站悬浮在麦田上空。那些图很美,但它们像橱窗里的高定礼服——你知道它存在,却不知道拉链在哪、衬里怎么缝、走线会不会崩。而我要讲的,是亲手拆开这件礼服,摸清每根线头、每处暗扣、每块衬布的材质和走向。比如,为什么加了“realistic photo of”反而让画面更假?为什么“dunking a basketball”这个动作,AI永远理解成“把球往地上砸”,而不是“单手抓球、屈膝跃起、手腕下压”?为什么你认真写了“low angle, Dutch angle, 35° tilt”,生成结果里那只羊驼的脚还在画面外,而球框却歪得像地震后的篮球架?这些不是玄学,是模型训练数据分布、文本-图像对齐机制、以及提示词与隐空间映射关系共同作用下的必然结果。我不会堆砌术语吓唬你,但也不会跳过原理直接给你“万能模板”——因为根本不存在万能模板。DALL·E 2 不是一个按钮,而是一台需要你同时当导演、美术指导、灯光师和场记的复合型机器。你给它的每一个词,都在悄悄重写它的“视觉记忆”。接下来的内容,就是我把这台机器的说明书、维修手册和我的手写批注,一起摊开给你看。
2. 从“llama playing basketball”到“Michael Jordan in alpaca form”:一场关于提示词工程的系统性解构
2.1 初始试探:为什么最直白的描述反而最失败?
我们先回到起点。当我第一次在DALL·E 2界面里敲下“llama playing basketball”,按下生成键,三秒后弹出四张图。没有欢呼,只有一阵沉默。四张图里,三张是扁平卡通风,一只简笔画式的羊驼站在一个歪斜的篮筐下,手里举着一个明显比它脑袋还大的篮球;另一张试图写实,但羊驼的毛发像静电吸附的棉花糖,篮球表面泛着塑料玩具般的反光,而背景……干脆是一片模糊的灰白色,仿佛摄影师忘了开景深。这不是技术不行,而是模型在“诚实作答”。DALL·E 2 的训练数据里,几乎没有“羊驼打篮球”的真实照片或高质量插画。它见过海量的“llama”(多是南美牧场、动物园宣传照、毛绒玩具广告),也见过海量的“basketball”(NBA赛事、街头球场、体育用品电商图),但它没见过这两者的交集。于是,它只能从两个独立的知识库中各自提取最“典型”的特征:羊驼=长脖子+蓬松毛+呆萌脸;篮球=橙色+颗粒纹+圆形。然后,它用一种最安全、最不费力的方式把它们拼在一起——卡通化。因为卡通风格对细节一致性要求最低,容错率最高。这就像你让一个只读过《本草纲目》和《天工开物》的古人,凭文字描述画一台iPhone:他能画出“矩形”、“玻璃面”、“金属边”,但绝画不出iOS图标那种微妙的阴影渐变和像素级的圆角精度。 直白的提示词,暴露的是训练数据的盲区;而模型的“安全选择”,恰恰是它最没价值的输出。 所以,第一步不是优化词,而是承认这个事实:DALL·E 2 不是“所想即所得”,而是“所训即所得”。你要做的,是绕过它的知识盲区,把它已有的、扎实的视觉语料库,精准地调取出来。
2.2 第一次升级:“realistic photo of”为何成了双刃剑?
意识到问题后,我的第二轮尝试加了前缀:“realistic photo of llama playing basketball”。效果立竿见影:羊驼的毛发有了质感,篮球的纹理清晰了,背景甚至出现了一小块木地板的反光。但新问题立刻浮现——整张图像被一股强烈的“PS合成感”笼罩。羊驼的身体比例还算协调,可它的脚踝与地板的接触点毫无重量感,仿佛是被胶水粘在上面的;篮球悬在半空,下方没有一丝运动轨迹的残影,也没有因高速下落而产生的空气扰动模糊;最致命的是,羊驼的面部表情,是一种凝固的、空洞的“微笑”,眼神焦点涣散,完全不像一个正在完成高难度动作的生物。为什么会这样?因为“realistic photo”这个指令,只是告诉模型“请模仿一张真实照片的质感”,但它并没有赋予模型“真实物理世界”的规则。一张真实的扣篮照片,背后是牛顿力学(重力、加速度、肌肉发力)、光学物理(动态模糊、焦外虚化、光影投射)和人类行为学(运动员的肢体语言、表情管理)。DALL·E 2 只学到了“照片看起来什么样”,没学到“照片为什么看起来是这样”。它把“真实感”等同于“高分辨率+锐利边缘+丰富纹理”,却忽略了构成真实感的底层逻辑。这就像一个只会临摹油画的学生,能把伦勃朗的光影画得惟妙惟肖,但让他画一盏台灯在墙上的投影,他只会画一个和灯罩形状一模一样的黑色剪影,而不会计算光源角度、物体距离和墙面材质对投影形态的影响。 所以,“realistic photo of”不是万能钥匙,它是一把只打开表层质感的钥匙,而锁芯深处,还藏着物理规则、空间逻辑和叙事意图三把更关键的锁。 你必须一把一把去试。
2.3 真正的突破口:从“描述对象”转向“定义场景”
真正的转机,来自一次偶然的阅读——DALL·E 2 Prompt Book 里的一句话:“不要告诉模型‘画什么’,要告诉它‘在什么情境下,由谁,用什么方式,呈现什么’。” 我立刻重写了提示词,不再聚焦于“llama”和“basketball”这两个孤立名词,而是构建一个完整的电影分镜:
“Film still of a llama dunking a basketball, low angle, extreme long shot, indoors, dramatic backlighting.”
这一次,变化是质的。生成的图里,羊驼不再是画面中心的静态模特,而是被置于一个有纵深感的室内篮球馆中;低角度镜头让它显得高大威猛;逆光勾勒出它跃起时肌肉的轮廓和毛发的金边;远景则让整个场馆的穹顶和观众席的模糊色块成为有力的背景支撑。这张图依然不完美——羊驼的手臂动作僵硬,篮球的位置还是有点飘——但它已经具备了“可信的瞬间感”。为什么?因为“Film still”(电影剧照)这个词,瞬间激活了模型对影视工业庞大语料库的记忆:它知道电影剧照意味着特定的构图法则(三分法、引导线)、特定的光影范式(三点布光、伦勃朗光)、特定的叙事节奏(决定性瞬间)。而“low angle”、“extreme long shot”、“indoor”、“dramatic backlighting”这一连串摄影术语,则像一套精确的坐标系,将模型的想象牢牢锚定在某个具体的视觉传统里。它不再需要凭空发明“扣篮”,它只需要从已有的、海量的NBA比赛、体育纪录片、电影《空中大灌篮》的剧照中,提取并重组那些最符合坐标的视觉元素。 提示词工程的本质,不是向AI提问,而是为AI提供一套它能高效检索和组合的“视觉词典索引”。 你提供的索引越专业、越具体、越指向某个成熟的视觉流派,它调取的结果就越稳定、越有质感。这解释了为什么“vaporwave”、“Miyazaki anime”这类风格词如此有效——它们本身就是高度结构化、特征鲜明的视觉语法体系,模型在训练中早已将它们编码为一组紧密关联的权重向量。
2.4 细节的炼金术:如何让AI“看见”你脑中的微表情与织物质感
当宏观场景搭建完毕,真正的挑战才开始:填充血肉。我注意到,所有生成的羊驼,面部都像戴了一副微笑面具,缺乏扣篮瞬间应有的专注、爆发力甚至一丝痛苦。我尝试加入“expressive face”、“intense focus”,结果要么是五官扭曲,要么是直接生成了一张人类运动员的脸。后来我才明白,DALL·E 2 对“表情”的理解,严重依赖于它所见过的、与该表情强关联的主体。它见过太多人类运动员在关键时刻的特写,所以“intense focus”会优先调取人类眼部肌肉收缩、额头青筋暴起的模式,再强行套在羊驼脸上,自然诡异。解决方案,是放弃抽象形容词,改用具象的、可视觉化的动作指令:
“llama in mid-air, tongue slightly out, eyes wide open and locked on the rim, mouth open in a silent shout”
这一次,效果惊人。生成的羊驼,舌头真的微微伸出,眼睛瞪得溜圆,瞳孔收缩,嘴巴张开的角度恰到好处,传递出一种原始的、生理性的专注。这不是AI“理解”了情绪,而是它把“tongue out”、“eyes wide open”、“mouth open”这三个在动物行为学中高度相关的视觉信号,从训练数据里精准地匹配并组合了出来。同样道理适用于材质。“wearing a jersey”最初生成的球衣,像一块印着队徽的硬纸板。直到我加上“cotton jersey, slightly wrinkled from movement, sweat stains under arms”,球衣才真正有了垂坠感、褶皱的随机性和运动带来的微妙变形。 DALL·E 2 的“细节能力”,不在于它能无中生有,而在于它能将你提供的、彼此间存在强统计关联的视觉碎片,进行高保真的缝合。 你的任务,就是成为那个最了解这些碎片之间关联性的“缝纫师”。
3. 超越提示词:DALL·E 2 的硬性边界与不可逾越的物理法则
3.1 构图与空间逻辑:为什么AI永远算不准“球该往哪飞”?
即使提示词写得再完美,你也一定会撞上那堵名为“空间推理”的墙。我曾用长达12个词的提示,精确描述:“llama’s right hand gripping basketball at peak of jump, ball positioned directly above rim, rim visible below ball, net taut and stretched downward”。生成结果里,球确实在羊驼手上,篮筐也出现了,但球的位置,要么在羊驼头顶正上方一米处,要么就紧贴着篮筐的铁圈,而篮网……常常是向上绷紧的,仿佛球刚被从下方托起。这绝非偶然失误,而是模型架构的根本限制。DALL·E 2 是一个扩散模型,它的核心工作,是在一个巨大的、多维的“隐空间”里,根据文本提示,逐步“去噪”,最终生成像素。这个过程,本质上是概率采样,而非几何计算。它没有内置的3D引擎,没有坐标系,没有重力模拟器。它所“知道”的,只是在海量图片中,“手”、“球”、“篮筐”、“网”这些元素,在什么样的相对位置下,共现的概率最高。而在真实世界的数据里,“手握球在篮筐上方”的共现,远少于“手握球在胸前”或“球在篮筐内”。因此,它倾向于选择那些统计上更“安全”的位置组合。 要突破这个限制,唯一的办法,是用提示词强行覆盖统计惯性。 比如,我不再描述“球在篮筐上方”,而是直接命令:“ball passing through hoop, net fully extended downward, perfect swish”。这一次,“passing through hoop”是一个在体育摄影中高频出现的、具有明确空间指向的动作短语,它比静态的“above”更能激活模型对“球-筐-网”三者动态关系的记忆。这就像教一个只认识单词的孩子造句,你不能说“苹果在桌子上面”,而要说“苹果从桌子上滚下来”,后者自带了方向和因果。
3.2 文字与符号:当AI开始“造字”,你就该警惕了
DALL·E 2 无法拼写,这是一个广为人知的缺陷。但它的“造字”行为,其实揭示了一个更深层的真相:它对符号系统的理解,是彻底的视觉化、而非语义化。当我输入“logo on jersey with text ‘TEAM LLAMA’”,生成的球衣上,确实出现了一块方形区域,里面有类似字母的、扭曲的、充满装饰性的图形。它不是在“拼错”,而是在“创造一种看起来像文字的视觉图案”。因为它从未学习过“字母A代表什么音”,它只学习过“A”这个形状,在哪些字体、哪些背景下,与哪些品牌、哪些运动场景相关联。所以,当你看到一张图里出现了“可读的文字”,那几乎可以肯定,这张图的原始训练数据里,就包含这张带字的图。DALL·E 2 做的,只是把这个局部,原封不动地“复制粘贴”到了新场景里。这意味着, 任何对文字、数字、精确符号有要求的商业用途,都必须视为高风险。 你不能指望它生成一个带正确Slogan的海报,也不能指望它生成一个带准确日期的日历。它的强项,是生成“看起来像有文字”的氛围,而不是承载文字信息本身。如果你真需要文字,唯一可靠的方法,是生成一张高质量的、留有空白区域的图,然后用Photoshop等工具后期添加。这听起来倒退,但却是目前最务实的工作流。
3.3 面部与身份:一场关于“安全护栏”的静默博弈
最让我后背发凉的,是羊驼的面部。无论我如何调整提示词,只要生成的羊驼脸部占据画面较大比例,就会出现一种难以言喻的“非人感”:瞳孔大小不一,左右眼睑的开合度不同,鼻孔的朝向违背解剖学,甚至有时会生成三只眼睛。这并非技术缺陷,而极可能是OpenAI主动植入的“安全护栏”。公开资料表明,DALL·E 2 在训练后期,对涉及人脸的生成进行了大量对抗性微调,目的就是防止其被用于生成逼真的虚假人物形象(deepfakes)。有趣的是,这个护栏并未区分“人类”与“动物”。当模型识别到“llama face”这个概念时,它内部的“人脸检测器”也被触发了,于是,它开始有意识地引入“失真”——降低面部特征的精确度、增加不对称性、模糊关键细节。这是一种非常聪明的防御策略:与其费力区分“人”和“羊驼”,不如对一切“高精度面部生成”都施加统一的模糊化处理。 所以,当你发现AI生成的动物脸“怪怪的”,别急着骂模型差,它可能正在忠实地执行一项你并不知情的安全协议。 这提醒我们,DALL·E 2 的每一次“失败”,背后都可能站着一个明确的设计意图。理解这些意图,比单纯抱怨“它做不到”更有价值。
4. 实操全流程:从零到一张可用图的完整作战地图
4.1 准备阶段:信用点就是你的弹药,规划就是你的战术地图
在DALL·E 2里,15美元=115个信用点,每个生成消耗1点,产出4张图。这意味着,你只有115次“开火”的机会。把这当成一场资源有限的军事行动。我的做法是,严格划分三个弹药库:
- 侦察弹药(30点): 专门用于测试基础概念。目标不是出图,而是快速验证:这个主题(llama + basketball)在哪个风格下最容易出效果?“film still”、“digital art”、“vaporwave”哪个的初始成功率最高?这个阶段,我只用最简短的提示词(<5个词),批量生成,快速扫雷。
- 攻坚弹药(60点): 锁定1-2个最有希望的风格后,进入精细打磨。这时,我会建立一个Excel表格,记录每一次尝试的提示词、生成时间、哪一张图(A/B/C/D)最接近目标、具体好在哪(比如“B图的光影最好,但C图的构图最准”)。然后,基于这张“最优图”,进行迭代:保留它好的部分(比如“dramatic backlighting”),替换掉差的部分(比如把“playing basketball”换成“dunking a basketball like Michael Jordan”)。每一次迭代,都是对上一次结果的“微调”,而非推倒重来。这能极大提升信用点的利用效率。
- 收尾弹药(25点): 当你已经有一张90%满意的图时,剩下的点数,全部用来做“变异”(Variation)。DALL·E 2 的变异功能,不是随机重画,而是以原图为基础,在隐空间里进行小幅度扰动。这就像一位经验丰富的调色师,不是重新配色,而是在现有色调上,微调饱和度、明度和色相。我通常会对同一张“优胜图”做3-4次变异,然后从中挑选一张在细节上(比如毛发的光泽、篮网的纹理、背景的虚化程度)最完美的作为终稿。
提示:DALL·E 2 的历史记录只保存最近50次生成。务必养成习惯:每次生成后,立刻右键保存你认为有价值的图,并在本地文件夹里按“日期_关键词_版本号”命名(例如:20220910_llama_dunk_v3.jpg)。否则,当你在第51次生成后,想回头找第48次的某张神图时,它已经永远消失了。
4.2 核心生成阶段:一份可直接抄作业的提示词模板
经过上百次试错,我提炼出一个高度可靠的、可复用的提示词骨架。它不是魔法咒语,而是一个经过验证的“思维框架”,你可以根据任何主题填空:
“[Art Style] of a [Subject], [Key Action/State], [Critical Detail 1], [Critical Detail 2], [Camera & Lighting], [Composition & Framing], [Atmosphere/Mood]”
让我们用它来生成一张“咖啡馆里的猫”的图:
- [Art Style] :
Watercolor painting(水彩画,规避写实面部问题) - [Subject] :
a ginger cat(姜黄色猫,比“cat”更具体) - [Key Action/State] :
sitting on a wooden windowsill(坐在木窗台上,定义位置和姿态) - [Critical Detail 1] :
paws neatly tucked, tail curled around front paws(爪子收好,尾巴卷在身前,定义细节姿态) - [Critical Detail 2] :
sunlight streaming through the window, illuminating dust motes in the air(阳光穿过窗户,照亮空气中的浮尘,定义光影和氛围) - [Camera & Lighting] :
soft focus, shallow depth of field(柔焦,浅景深,突出主体) - [Composition & Framing] :
medium close-up, centered composition(中景特写,居中构图,确保主体完整) - [Atmosphere/Mood] :
peaceful, quiet, cozy(宁静、安静、舒适)
组合起来就是:
“Watercolor painting of a ginger cat sitting on a wooden windowsill, paws neatly tucked, tail curled around front paws, sunlight streaming through the window, illuminating dust motes in the air, soft focus, shallow depth of field, medium close-up, centered composition, peaceful, quiet, cozy”
这个模板的力量,在于它强制你思考每一个维度。你不能只想着“我要一只猫”,你必须回答:它是什么风格的?它在做什么?它的身体细节是怎样的?光线如何塑造它?镜头如何捕捉它?画面如何组织它?它想传递什么感觉? 当你的大脑被迫完成这八重思考,你写出的提示词,就已经超越了90%的用户。 DALL·E 2 不是猜谜游戏,它是你思维的放大器。你输入的混乱,它会加倍返还;你输入的清晰,它会十倍兑现。
4.3 后期精修:DALL·E 2 不是终点,而是起点
很多人以为,生成一张图就结束了。大错特错。DALL·E 2 生成的,永远是一张“原材料”。我的最终成品,是经过三轮后期的产物:
- AI内精修: 利用DALL·E 2 自带的“Edit”功能。这个功能允许你用画笔涂抹掉图中你不满意的部分(比如一个奇怪的影子、一个穿帮的背景元素),然后输入新的提示词,让AI只重绘被涂抹的区域。这比全图重生成高效得多。例如,我发现某张图里羊驼的球鞋颜色太艳,我就用画笔涂掉鞋子,然后输入“white leather sneakers, clean and minimal”,AI会只生成一双符合要求的新鞋,无缝融合在原图中。
- 专业软件精修: 将图导入Photoshop。这里不做大改,只做三件事:一是用“内容识别填充”(Content-Aware Fill)修复AI留下的细微瑕疵(比如毛发边缘的锯齿、背景中不自然的色块);二是用“曲线”(Curves)工具,精细调整全局的对比度和色彩平衡,让光影更有电影感;三是用“锐化”(Unsharp Mask)工具,有选择性地增强关键区域(如羊驼的眼睛、篮球的纹理)的清晰度,让细节“跳”出来。
- 人工点睛: 这是最关键的一步。在最终图上,用画笔工具,手工添加1-2个微小的、AI绝对无法生成的“生命感”细节。比如,在羊驼跃起时,给它额头上加几滴细小的、反光的汗珠;在篮球表面,用橡皮擦轻轻擦出一道因高速旋转而产生的、极其细微的模糊拖影。这些细节,单看微不足道,但它们共同构成了“这是一个人类创作者亲手打磨过的作品”的终极证据。它让AI的“完美”变得有温度,也让这张图,真正属于你。
5. 血泪教训与避坑指南:那些没人告诉你的“潜规则”
5.1 关于“免费额度”的残酷真相
官方说“首月50个免费信用点”,听起来很多。但请记住,这50点,是你探索DALL·E 2 的“学费”。我用这50点,完成了全部的侦察和初步攻坚。结果呢?50点花光,我只得到了一堆“还不错但不够用”的图,离一张能商用的终稿,还有至少30点的距离。 这50点,不是让你“做出成果”的,是让你“认清现实”的。 它的设计目的,就是让你在尝到甜头后,心甘情愿地掏出15美元。所以,我的建议是:把这50点,当作一次高强度的“压力测试”。不要省着用,要大胆、密集、系统地用。测试所有你好奇的风格、所有你怀疑的关键词、所有你听说过的技巧。把这50点,榨干到最后一滴价值,让它为你后面的付费决策,提供最坚实的数据支持。
5.2 “Fluffy”是毒药,“Jersey”是钥匙:词汇的权重陷阱
在无数次失败中,我发现某些词,拥有远超其字面意义的“权重”。比如“fluffy”(毛茸茸的)。它本意是描述羊驼毛发的状态,但在我所有的测试中,只要这个词一出现,生成质量就会断崖式下跌。原因很简单:在训练数据里,“fluffy”与“可爱”、“萌系”、“儿童插画”强绑定,它会瞬间把模型的风格倾向,从“写实体育摄影”拽回“卡通绘本”。相反,“jersey”(球衣)这个词,却像一把万能钥匙。它不仅定义了服装,还自动关联了“运动”、“团队”、“竞技”、“现代感”等一系列视觉语境。所以, 选词不是看它“准不准”,而是看它“带不带你去你想去的地方”。 一个看似精准的描述词,可能把你带进死胡同;一个看似宽泛的风格词,反而能打开一扇门。永远优先选择那些,在你的目标视觉领域里,高频出现、且语义指向明确的“锚点词”。
5.3 版权限制:别被“full usage rights”这句话骗了
OpenAI官网明确写着:“users get full usage rights to commercialize the images they create”。这句话很诱人,但请务必看清小字。这里的“commercialize”,指的是你有权出售、印刷、制作周边,但前提是, 你生成的图,不能侵犯第三方的知识产权。 这意味着,如果你用“portrait of Elon Musk”生成了一张图,哪怕它长得不像,你也无权商用,因为“Elon Musk”是受法律保护的个人形象。同理,“Mickey Mouse in a jersey dunking a basketball”?不行,迪士尼的版权壁垒坚不可摧。更隐蔽的风险是“风格侵权”。虽然法律上很难界定“模仿宫崎骏风格”是否侵权,但如果你生成的图,与某位在世艺术家的标志性作品过于相似,对方发起诉讼,你依然可能败诉。 所以,最安全的商用路径,永远是“原创主题+原创风格”。 像“llama dunking a basketball”,就是一个完美的选择:它没有现实原型,不指向任何具体人物或IP,你拥有的,是100%的、无可争议的版权。把这句话刻在脑子里:DALL·E 2 给你的是“画笔”,不是“免罪金牌”。用它创作,你依然是那个要为作品负责的作者。
5.4 一个被严重低估的生产力工具:DALL·E 2 的“灵感加速器”模式
最后,分享一个颠覆我认知的用法。我曾经以为,DALL·E 2 最大的价值,是“出图”。后来才发现,它最不可替代的价值,是“破局”。当你面对一个创意瓶颈,比如“我想为新博客设计一个封面,但完全没想法”,不要苦思冥想。直接打开DALL·E 2,输入一个极度宽泛、甚至有点荒谬的提示,比如:“abstract visual representation of ‘clarity after confusion’, vibrant colors, chaotic lines transforming into clean geometry”。生成四张图,哪怕没有一张能直接用,它们也会像四把钥匙,瞬间撬开你大脑里被堵塞的创意通道。你会突然想到:“啊,原来‘清晰’可以用‘几何’来表达!”、“‘混乱到清晰’的过渡,可以用‘线条’的形态变化来隐喻!”——然后,你就可以带着这个全新的、被AI点燃的思路,关掉DALL·E 2,拿起笔,开始真正属于你的、独一无二的创作。 DALL·E 2 不是取代你的创意,而是帮你绕过创意启动时最艰难的“0到1”阶段。 它是一位永不疲倦、永不评判、永远能给出新视角的创意伙伴。这才是15美元,买到的最昂贵、也最值得的投资。
我个人在实际使用中发现,最有效的状态,不是把它当成一个“画图工具”,而是当成一个“视觉思维的外接硬盘”。当你脑中有一个模糊的意象,把它喂给DALL·E 2,它会立刻给你四个不同的、可视化的“翻译版本”。你不需要全盘接受,只需要从中挑出一个最触动你的“火花”,然后,用你自己的手和脑,把它锻造成真正的作品。这个过程,不是人机协作,而是人机对话——而对话的质量,永远取决于你提问的深度。
更多推荐


所有评论(0)