AI 生图方法论第二章:Prompt 是「视觉规格」,不是一句漂亮话
第一章讲了 Midjourney 的底层原理——生图是在「视觉概率空间」里采样。这一章回答下一个问题:既然 Prompt 的本质是收缩这个空间,那具体该在哪几个维度上收缩?答案是 Google 的「视觉变量公式」——Subject、Action、Scene、Style、Composition 五维,进阶再扩成十层模型。
Long-form essays on engineering, AI, and craft.
第一章讲了 Midjourney 的底层原理——生图是在「视觉概率空间」里采样。这一章回答下一个问题:既然 Prompt 的本质是收缩这个空间,那具体该在哪几个维度上收缩?答案是 Google 的「视觉变量公式」——Subject、Action、Scene、Style、Composition 五维,进阶再扩成十层模型。
我把自己给门店搭的 CRM 体系打包成成果记录下来:用飞书多维表格当后台、飞书 CLI 当数据接口、Hermes AI 助理当前端,让销售像聊天一样录客资、记跟进、查转化——不用逐格开表。这篇拆解这套「自然语言 → 结构化 CRM」怎么设计,以及为什么它比传统 ERP 更适合小团队。
我把自己做 AI 视频的整套方法沉淀成了一个可复用的 skill:六步流水线(选题→脚本→分镜→画面画布+主体人物→关键帧 prompt JSON→整段视频 prompt),双轨设计(ChatGPT 6-shot 快速预览 + 正式生产),外加豆包免费模式、台词时长质检、双人 IP 锁比例这些把翻车提前挡掉的机制。这篇就是它的完整说明文档。
我给拍摄剪辑的同事做了一个『一句话生成抖音封面』的 AI Skill:草稿图 + 提示词 → 图生图 → 回传飞书。这中间最值的不是生成,而是两个设计——如何在高并发多个需求时不搞混各自的草稿图,以及如何用『执行电路』而不是一堆『禁止』来让流程自然走对。
我把「内容生产」从手工写、一条条发,改造成了一条可复用的自动化流水线:100问选题库当原料、GEOFlow 批量产母版、五个平台写手 agent 改写、飞书归档闭环。一周产了 700+ 篇高质量母版。这篇拆解这条线怎么搭,以及为什么「证据纪律」才是整条线的保命符。
给飞书机器人搭实时流式卡片,我踩了一整天雷才跑通:从『卡片出了但表格秒消失』这种看似玄学的问题,挖到其实是『AI 输出完又去清理临时脚本触发了归档机制』这个根因。这篇把整套 HFC 流式卡片的排坑链路、机制认知和最终方案写成可复用的记录。
我把小红书图文的整套做法也做成了 skill:从 GEOFlow 母版整理成固定 5 张图的结构化提示词(封面→原理→对比→决策+商业→FAQ 避坑),贴给 ChatGPT 一次出图,再配封面和标题/Tag。核心是三条我踩出来的规则:固定 5 张、商业只在图4、FAQ 是图文长尾搜索的核心资产。这篇是它的完整说明文档。
「AI 能做私人辅导」这句话大家都听腻了。真正值钱的是背后三个设计原则:在理解边缘教学、把挣扎留给内容本身而不是后勤、让 AI 画依赖图逼它认真推理。读完你就能拿这套思路改造自己的学习方式。
网站做出来 Google 搜不到?不是网站坏了,是 SEO 链路没走通。这篇把从 Googlebot 发现页面到用户体验的整个过程拆成五步可执行框架,并告诉你哪些步骤可以放心交给 AI、哪些必须自己判断。
在 Hermes Agent 中接入图片中转站后,飞书生图不再是一个"每次让模型临场发挥"的不可靠动作。本文记录了我们将生图流程固化为"消息入口 → 固定 Skill → 中转站 → 校验落盘 → 单一 MEDIA 出口"的完整架构方案,包含模块划分、状态机设计和交付规则。