深度阅读 · DEEP READING

为什么你的 AI 只会做「设计泔水」,
而他的 AI 能做出 世界级设计

精读 Lenny's Newsletter 长文:一位前苹果 12 年 AI 产品研发负责人,把管理人类设计师团队的方法论搬到了 AI Agent 上——用三阶段流程,把「平均脸」式的 AI 输出,调教成有灵魂的设计。

原文 How to turn your AI into a world-class designer 作者 Anshu Chimala(前 Apple,12 年)· 刊发于 Lenny Rachitsky 专栏 发布 2026-09-01 本页 Keybo 深度阅读 · 含扩展检索与分析
只看到 AI
1% 创造力
的人必读

三十秒版本:全文在讲什么

作者 Anshu Chimala 曾在苹果领导了 12 年面向未来 AI 产品的研究与原型团队。他发现大多数人抱怨「AI 不懂设计」,其实是用错了方式:LLM 天生是「取悦所有人的委员会」,而好设计恰恰是反共识、反平均的。

他的解法不是换模型,而是换流程——把设计界经典的双钻模型(Double Diamond)改造成给 AI Agent 团队用的三阶段流水线:

DISCOVER
发现

从模型外部注入随机性与品味,跳出「平均脸」,探索大胆的方向。

DEFINE
定义

用独立的「设计批评家」Agent 闭环迭代,再接入图像/视频生成,赋予作品个性。

DELIVER
交付

靠人的判断做减法:删掉 AI 堆砌的冗余,收敛到克制、高级的成品。

「大多数人只看到了 AI 创造力的 1%。我要展示的是怎么解锁剩下的 99%。」—— Anshu Chimala

病因诊断:AI 设计为什么天然「泔水」

作者给出的解释值得每个用 AI 做东西的人记住:LLM 是逐 token 预测的机器。每做一个设计决策——选什么颜色、怎么排版——它都在挑「最可能让所有人满意」的那个 token。再加上人类反馈强化学习(RLHF)的调教,模型被训练成做「一致的、安全的选择」。

结果就是「终极版委员会设计」:每个局部都不出错,合起来毫无个性。

默认输出:紫色渐变落地页
实验:给 Claude 一句最普通的「帮我做个生产力 App 的落地页」——几乎每次都得到紫色渐变、左文右图、一模一样的结构。「看起来像所有 AI 设计的网站。」

更反直觉的是:你让模型「随机一点」也没用。作者让它「每个设计决策完全随机」,输出看着不同,细看还是同一套配色、同一套结构、甚至同样蹩脚的陶艺隐喻——因为模型只能预测「听起来像随机的 token」,它骨子里不会真的随机。

要求随机后的输出仍然雷同
失败的尝试:prompt 里写了「完全随机」,结果依旧雷同。模型预测的是「听起来随机」的 token,而不是真随机。
好设计始于感受、旨在激起情绪,它打破规则、用出人意料的选择取悦用户——这恰恰是 LLM 天性的反面。—— 这一段是全文的理论基石:不是模型没有创造力,是训练把创造力压成了「均值」。

延伸解读 · 这是「分布坍缩」问题

  • 技术上这叫 mode collapse / 分布收敛:RLHF 与「讨好多数评分员」的目标函数,会把输出概率质量压向分布的峰值区域,牺牲长尾的多样性。
  • 所以作者全部技巧的共同本质只有一句话:多样性必须从模型外部注入——无论是外部随机种子、外部批评者,还是人类的品味。模型内部不存在真正的熵源。
  • 这也解释了「调 temperature」为何不够:采样温度只影响抖动幅度,不改变模型「想去哪儿」;它仍然在同一个均值盆地附近打转。

Discover:从外部注入「熵」与「品味」

技巧 1 · 随机种子思维(String Seed of Thought)

这是全文含金量最高的一个技巧,来源是日本 Sakana AI 发表的论文 SSoT。做法分两步:先让 AI 用 shell 脚本生成一串真随机字符串,再让它把这串字符串「解读」成设计灵感(找子模式、特殊数字、任何能联想到的东西),最后据此做设计。

帮我做一个生产力 App 的落地页。遵循以下流程: 1. 用 shell 脚本生成一串长的随机字母数字字符串。 2. 基于这串字符串定义创意方向(配色、布局、字体……)。 挖掘表面之下的子模式、特殊数字——任何能激发你的东西。 3. 用你的判断把这个方向做出来,做得漂亮。 不要在设计里暴露这串字符串,它只是你的灵感来源。
SSoT 后的多样输出
效果:配色、字体、创意方向立刻多样起来。之前的设计任何 Claude 用户都能得到;这些设计是独一无二的——每次运行结果都不同。

扩展检索 · SSoT 的论文背景

  • Sakana AI 的原始研究问题是:「LLM 能在脑子里抛硬币吗?」——让前沿模型抛 1000 次硬币,正反面计数严重偏离 500:500,存在系统性偏差。
  • 结论:直接让 LLM 执行概率性指令时,它们无法忠实地从目标分布采样;而「先生成随机字符串、再基于它推理」这一纯 prompt 技巧(无需训练、无需外部工具)能显著提升概率忠实度与输出多样性。
  • 设计领域的应用正是把这个结论推到底:既然模型内部没有随机性,就用 shell 命令把真随机喂给它。这是「工具调用补全模型能力缺口」的一个教科书案例。

技巧 2 · 狂野而具体的 prompt(注入你的品味)

第二条路是反过来——不靠随机,靠极度具体。给模型一个清晰的视觉世界观,让它有据可依,而不是临场发挥。作者的三个示范方向:

而当你自己也没想法时,作者给出一个「找想法」的三步工作流:

步骤做法为什么有效
① 广撒网让 AI 列出尽可能多的设计语言方向,「要广,不要深」AI 擅长穷举平庸选项,把它当菜单而不是答案
② 用你的品味锐化挑一个方向,写下你的具体好恶:「我想要触感、咔哒作响的按钮;灰色渐变太无聊;避免卡通化的拟物,那很俗」这一步是护城河——AI 想法人人可得,你的品味人人不同
③ 转成执行 prompt让 AI 把锐化后的方向写成给 coding agent 的简洁 POC prompt把「品味」固化成可复现的指令

作者的心法

  • 「如果你觉得一个想法听起来肯定行不通——那你就找对方向了。」Agent 经常给你惊喜,你多半低估了它。
  • 失败的 prompt 不要删:存起来,等新模型发布再跑一遍——这是检验「你是否吃透了最新模型能力」的现成测试集。

Define:设立一个不吃「沉没成本」的设计总监

即使探索阶段做得再好,初稿仍然是「有潜力的平庸」。迭代是必须的,但让写代码的 Agent 自己审自己没用——它不客观:它看着自己的代码、自己过去的决策和理由长大,无法跳出来「think different」。

作者的解法是组织设计级别的:引入第二个 Agent——「设计批评家」(design critic)。它只看截图,不看代码、不看实现、不看历史,只回答一个问题:这达到顶级设计工作室的水准了吗?打 1~10 分。执行 Agent 必须迭代到批评家独立打出 9 分以上为止——而这个标准不写进批评家的 prompt 里,保证评分不被污染。

批评家闭环后的设计
批评家闭环之后:不再是千篇一律的模板布局,每个设计都长出了自己的身份——同时保留了最初的高层美学方向。

批评家 prompt 的四个关键设计(全文最值得抄的部分)

  • 每次迭代都用全新上下文调用批评家,只给截图——不给代码、不给实现细节、不给之前的版本和评语。
  • 批评家的思维框架:先判断设计想走什么美学路线 → 想象顶级设计工作室会如何执行这个美学 → 指出当前与那个标准之间的最大差距。
  • 明确惩罚「AI 味」:过度、堆砌、一眼 AI 生成的模式要扣分;反馈要狠、要具体,不要含糊的散文。
  • 成本结构的惊喜:整个流程中昂贵的大模型批评家只消耗 不到 10% 的输出 token——让 Fable 直接重画页面的成本是它的两倍还慢得多。判断贵、执行便宜,把钱花在刀刃上。

评价标准怎么写:从糟糕到优秀

等级写法问题/优点
糟糕「判断设计是否漂亮、是否不像 AI 生成的。」太主观,每次运行结果 wildly 不同
尚可「审视我们的目标美学,想象顶级工作室如何执行,据此打分。」仍然模糊,但提供了稳定框架与质量基线
优秀「这里有 5 张图:4 张专业范例 + 1 张我们的产品截图。按精致度与品味排序。」具体、客观,且提供了视觉基准

另有两条工程提醒:给批评家提供参考图(竞品截图、概念图皆可),但要声明是「基线/情绪板」而非「抄袭目标」;谨慎设置停止条件——否则批评家永远觉得不够好,执行 Agent 会在死循环里烧光 token,先跑一两轮看是否收敛。

给设计「上强度」:把图像与视频模型接进 Agent

coding agent 爱写代码,所以默认只用代码能表达的东西——渐变、形状、基础图案——而这正是「AI 生成」的最大破绽。解法:把图像生成、视频生成接到 agent 的工具链里。

Deliver:最后的 10%,全靠做减法

到了交付阶段,主角从 AI 换回人。作者的判断一针见血:「AI 热爱添加,但几乎从不删减。」过度解释、塞满无实际用途的元素,是 AI 设计最典型的指纹;而克制的设计,一眼就显得昂贵。

他的热量追踪 App 案例:明明要求了「干净、极简」,Claude 的初稿仍然塞满了粉色发光背景、随机高亮文字、多余的标签与空位、比 iOS 原生组件更丑的自绘控件。作者的修改指令几乎全是删除句:

把布局简化成以图片为主的的网格。 去掉渐变、发光和不必要的容器。 追求真正极简的美学,要有 Apple 原生的感觉。
减法前
Before:发光、渐变、自绘组件、多余标签——「要求了极简,却一点都不极简」。
减法后
After:图片网格 + 原生 iOS 组件,文字更小更紧——「让视觉自己说话」。
今天的模型永远不会主动做出这些选择——精简设计、删除代码是「有风险」的操作,而模型厌恶风险。它需要你推一把。—— 屏幕上放得更少,往往传达得更多。

深度分析:这篇文章真正在说什么

1 · 这是「管理学」文章,不是「提示词」文章

作者的身份是理解全文的钥匙:他在苹果管了 12 年人类研发团队,文中明说这套方法源自当年打破团队「界面惯性」的流程改造。他做的事本质上是把组织设计(角色分工、评审制度、质量门禁、成本控制)平移到 Agent 编排上:执行者=初级设计师,批评家=设计总监,人类=创意总监兼最终拍板。提示词技巧会过时,这套「AI 团队管理术」不会。

2 · 一个统一的理论:给确定性系统外挂熵源

全文所有技巧可以归到一张表里——LLM 缺什么,就从外部补什么:

模型缺的外部补法对应技巧
真随机性shell 生成的随机字符串SSoT 种子思维
客观眼光全新上下文的第二模型设计批评家闭环
视觉表达力图像/视频生成 APIfal.ai / 生图接入
品味与克制人类的审美判断Deliver 阶段做减法

这张表就是可迁移的方法论内核:下次遇到「AI 输出太平均」的任何任务(写文案、起名、做方案),先问——这里缺的熵,该从哪里注入?

3 · 经济学视角:判断与执行解耦

「批评家只花不到 10% token」是一个被很多人忽略的重点。它对应一个通用架构原则:把昂贵的智能用在低频、高杠杆的决策点上,把廉价的算力用在高频的执行循环里。这与现实中「总监只管关键评审、工程师负责落地」的成本结构完全同构,也是当下多 Agent 系统编排的主流范式之一。

4 · 批判性思考:这套方法的边界

5 · 实操清单(可直接照抄)

CHECKLIST

  • ☑ 探索阶段:prompt 里加「先生成随机字符串作灵感」,或直接注入一个狂野的视觉世界观。
  • ☑ 让 AI 出 20 个方向 → 用你的好恶锐化 1 个 → 转成执行 prompt。
  • ☑ 迭代阶段:独立批评家、全新上下文、只给截图、打 1~10 分、≥9 分停止。
  • ☑ 批评标准要客观:最好给 4+1 张图做「排序题」,并给情绪板作基线。
  • ☑ 大模型当批评家、快模型当执行者;给生图/视频 key 设消费上限。
  • ☑ 交付阶段通读一遍只问一个问题:「这里有什么可以删?」
  • ☑ 失败的 prompt 存档,新模型发布时重跑。

来源与延伸阅读

  1. 原文:Lenny's Newsletter — How to turn your AI into a world-class designer(2026-09-01,作者 Anshu Chimala)
  2. 扩展检索:Sakana AI — String Seed of Thought: Prompting LLMs for Distribution-Faithful and Diverse Generation(「LLM 能在脑中抛硬币吗」实验与 SSoT 方法)
  3. 方法论原型:Double Diamond 双钻设计模型(英国设计委员会 2005 年提出:Discover / Define / Develop / Deliver;本文将 Develop 并入 Define,压缩为三阶段)
  4. 作者阵地:Anshu Chimala 的 X / Substack / LinkedIn(持续发布 AI 设计教程与 demo)
  5. 工具:视频模型聚合平台 fal.ai(一把 key 调度多家视频/抠像模型)

AI 设计Prompt 工程多 Agent 编排生成-批评闭环SSoT双钻模型品味即护城河