--- name: space-xhs-image description: 根据用户提供的文章、教程、SOP、清单或主题,使用 Codex 内置 image_gen 生图模型生成 3:4 小红书信息图与组图。固定采用轻盈 AI 产品信息图风:白色或浅薰衣草背景、黑色大标题、紫蓝与青柠绿强调、圆角卡片、线性科技图标、流程/对比/清单模块;支持单图和 6–9 张系列图,不需要 API Key 或外部生图后端。用户说“做小红书图片”“按内容生成组图”“做科技感信息图”“做类似这种图”“用 Codex 生图”“做封面和内页图”等请求时触发。 --- # SPACE XHS Image 把用户内容变成可直接发布的小红书 3:4 信息图。默认使用 Codex 内置 `image_gen`,不探测外部后端,不索要 API Key,不调用第三方生图脚本。 视觉目标不是复刻某张参考图,而是稳定复用一套独立的“轻盈 AI 产品信息图”系统:强标题、卡片化结构、线性科技图标、紫蓝与青柠绿强调、白色呼吸感。 ## 先读 执行前必须读取: - `references/visual-system.md`:固定视觉语言、颜色、字体层级、组件与提示词锁。 - `references/page-patterns.md`:封面、流程、对比、清单、拆解、总结等页面结构。 ## 适用范围 适合: - AI、效率、产品、财务、职场、教程、SOP、方法论内容。 - 一张封面、单张知识图,或 6–9 张连续组图。 - 用户提供参考图,希望借鉴其信息层级、色彩关系和组件语言。 - 用户希望直接得到位图,不需要 HTML。 不适合: - 要求文字 100% 可编辑、逐像素改版:改用 `xhs-html`。 - 需要 SVG、HTML、PPT 等原生可编辑格式。 - 只写正文、标题或选题。 - 自动发布、批量矩阵号生产。 ## 默认交付 - 比例:竖版 3:4,最终保存为 1080×1440 PNG。 - 数量: - 用户明确“单图/封面”时做 1 张。 - 用户明确数量时按其数量。 - 用户说“组图/图文”但没说数量时,给 6、7、8、9 张选项,并推荐一档。 - 用户说“直接做/你定”时:短清单 6 张,完整方法 7 张,实操教程 8 张,完整 SOP 9 张。 - 品牌名或账号名默认只放首页;内页不重复。 - 一张图只承担一个中心任务,不把整篇文章塞进一张图。 - 每张图单独调用一次内置生图工具,不用一次调用生成多张不同内容。 ## 工作流 ### 1. 读取内容 先读完整内容,再拆页。不要边读边生成。 提取: 1. 目标读者:这组图写给谁。 2. 核心承诺:看完能完成什么动作。 3. 最小完整链路:准备 → 操作 → 结果 → 验收。 4. 可直接拿走的材料:步骤、提示词、字段、模板、检查表、例子。 5. 可删除内容:重复铺垫、空泛鼓励、同义反复、爹味教训。 6. 原文中的具体信息:对象、字段、规则、步骤、数字、阈值、输出名称和人工边界。 拆页前建立“原文依据 → 页面文案”映射。页面里的具体描述必须能回到用户原文;为了排版可以压缩句子,但不能把原文改造成新的口号或泛化观点。 ### 2. 建立页序 输出简短页面规划: ```markdown ## 组图规划 风格:轻盈 AI 产品信息图 数量:8 张 账号名:只在第 1 张出现 | 页码 | 页面任务 | 主标题 | 原文依据 | 结构 | 读者拿走什么 | |---|---|---|---|---|---| | 01 | 点击 | 财务人怎么用 Codex | 原文总主题 | 封面 | 明确主题 | | 02 | 留人 | 完整处理链路 | 原文步骤段 | 总览 | 知道后续路径 | | 03 | 准备 | 准备 3 份输入 | 原文准备段 | 清单 | 可照着准备 | ... ``` 如果用户只要求一张图,不输出组图规划,直接提炼该图的主标题、重点和结构。 ### 3. 控制文字 生图模型能生成文字,但信息越密,错字和错行概率越高。封面和内页使用不同信息密度: **封面** - 主标题:8–18 个汉字,最多 2–3 行,可以占据较大面积。 - 副标题:0–28 个汉字。 - 只保留主题、结果和一个主视觉,不承担完整教学。 **内页** - 主标题:6–16 个汉字,最多 2 行;视觉字号约为封面标题的 55%–68%。 - 标题区高度控制在页面的 8%–14%,把主要空间留给正文。 - 正文:4–6 个模块;每个模块必须有“短标题 + 12–28 字的完整说明”,不能只放名词标签。 - 每页建议 120–180 个汉字;操作模板页可以到 220 字,但必须拆成清楚的层级。 - 优先保留用户原文中的对象、字段、动作、判断条件、输出和复核要求。 - 所有文字逐字写入提示词的 `Text (verbatim)`,不可让模型自行改写。 正文过多时先拆页;正文不足时回到原文补充具体说明,不用装饰图标占满空间。 ### 4. 文案句式 内页以直接说明为主: - 写“扫描件提取后,需要核对金额、日期和模糊字段”。 - 写“文档生成前提供固定模板、必填字段和指标口径”。 - 写“表格处理会输出标准表、汇总表和差异表”。 限制以下口号式句型: - “不是 A,而是 B” - “能 A,不等于 B” - “不要 A,要 B” - “别急着 A,先 B” 除非它是用户原文中的关键表达,一组图最多使用一次。能直接陈述事实时,直接写事实。 ### 5. 选择版式 根据内容从 `references/page-patterns.md` 选择,不连续三页使用同一种结构。 优先关系: - 一个结论 → Hero / 单观点 - 3–5 个步骤 → 横向或纵向流程 - A 与 B → 左右对比 - 3–6 条并列信息 → 清单 / 卡片矩阵 - 表层与本质 → 双层拆解 - 做前与做后 → Before / After - 一套完整方法 → 总览 + 分步 + 验收 ### 6. 生成图片 默认调用 Codex 内置 `image_gen`。 新图: - 不传 `num_last_images_to_include`。 - 没有参考图时不传 `referenced_image_paths`。 - 用户提供参考图并要求借鉴时,可将最有代表性的 1–3 张作为 `referenced_image_paths`;在提示词中明确它们只是“视觉语言参考”,不得复制账号名、Logo、水印、原文、插图或具体版式。 系列图: - 每张图调用一次 `image_gen`,按页序逐张生成。 - 每一页都逐字复用 `references/visual-system.md` 的 Style Lock。 - 只改变本页的标题、内容模块、图标和版式。 - 不用 `n` 代替多次调用;不同页面必须是不同提示词。 提示词使用以下结构: ```text Use case: infographic-diagram Asset type: 3:4 Xiaohongshu vertical infographic, page {页码}/{总页数} Primary request: 根据本页内容生成一张信息图,不增删、不改写给定文字 Input images: {如有,逐张说明“仅作视觉语言参考”} Scene/backdrop: 白色到极浅薰衣草背景,大面积留白 Style/medium: {粘贴完整 Style Lock} Composition/framing: {选中的页面结构 + 模块数量 + 位置} Color palette: {固定色板} Source grounding: - 原文依据:“{对应原句或要点}” - 允许压缩,不允许新增结论 Text (verbatim): - 顶部标签:“{标签}” - 主标题:“{主标题}” - 副标题:“{副标题}” - 模块 1:“{文字}” - 模块 2:“{文字}” Constraints: 3:4;文字逐字准确;简体中文;外边距充足;信息层级清晰 Avoid: 水印、Logo、AI_walker、账号仿冒、乱码、伪文字、照片感、复杂 3D、拥挤小字、厚重阴影、过度装饰 ``` 具体视觉约束以 `references/visual-system.md` 为准。 ### 7. 逐图复核 每张生成后检查: 1. 是否为 3:4,主体没有贴边或被裁。 2. 主标题是否一眼读完,紫/绿强调是否只落在关键词。 3. 中文是否逐字正确,数字和英文是否准确。 4. 卡片、线性图标、流程关系是否与本页内容一致。 5. 是否出现参考图的账号名、Logo、水印或近似复制。 6. 是否和前页保持同一色板、圆角、线宽、阴影和留白节奏。 7. 缩小到信息流尺寸后,主标题和主结构是否仍清楚。 8. 内页标题是否明显小于封面,正文是否占据页面主要空间。 9. 每个正文模块是否有完整说明,且能在用户原文中找到依据。 10. 是否滥用了“不是…而是…”“能…不等于…”等反转句式。 可运行: ```bash python3 scripts/check_image.py <图片路径> ``` 它检查比例、尺寸、浅色背景、文件大小,并输出 260px 缩略图。机器检查通过后仍需肉眼检查文字。 ### 8. 修正 一次只修一个问题: - 错字:要求“仅把 X 改成 Y,其余构图、颜色、图标和文字完全不变”。 - 太挤:先缩小内页标题区;正文仍拥挤时拆页,不把模块说明压成小字。 - 太空:从原文补回字段、步骤、输出或验收要求,不增加空泛口号和装饰。 - 文案跑偏:回到“原文依据 → 页面文案”映射,替换为贴近原文的说明。 - 风格跑偏:重贴完整 Style Lock,指定以前一张已通过图片为视觉一致性参考。 - 比例不对:重新生成优先;若画面安全,可居中裁成 3:4 后缩放到 1080×1440。 编辑最近生成的图片时,仅包含完成本次编辑所需的最近图片;不要把整组图全部作为输入。 同一张图连续两次仍有中文错误时: 1. 先把文字压短再生成一次。 2. 若用户要求 100% 精确,说明限制并建议用 `xhs-html` 做文字确定版。 3. 不把有明显错字的图片当成完成稿交付。 ### 9. 保存与交付 预览讨论可保留在 Codex 默认生成目录。用户要发布、继续编辑或用于项目时,必须把最终图片保存到工作区。 默认目录: ```text 09 frames/xhs-image/{主题-slug}/ ├── 01-cover.png ├── 02-overview.png ├── 03-step-1.png ├── ... ├── 08-checklist.png └── prompts.md ``` 不要覆盖既有文件;使用 `-v2`、`-v3` 版本名。交付时列出: - 每张最终图片路径。 - 实际采用的页数和视觉系统。 - 最终提示词或 `prompts.md` 路径。 - 使用“Codex 内置 image_gen”,不写成外部 API。 ## 固定视觉原则 - 白色或极浅薰衣草底,外边距宽,页面能呼吸。 - 封面以黑色粗标题为第一视觉;内页标题缩小,正文信息成为第一阅读主体。 - 中部用大圆角白卡承载信息;卡片内使用短标题、完整说明句、编号和线性图标。 - 图标以浏览器窗口、代码、流程、清单、目标、盾牌、机器人、文档为主。 - 装饰只用于平衡画面,不抢正文。 - 可以信息丰富,但不可像截图堆满;先保证层级,再保证数量。 - 第一页可以有账号名;内页默认没有账号名和重复口号。 ## 原创与安全 - 参考图只提供视觉方向,不复制其标题、文案、账号名、Logo、水印、独特插图或逐像素布局。 - 不冒充其他创作者,不保留 `AI_walker` 或任何来源账号标识。 - 不生成虚假数据、收益承诺、排名、疗效或未经提供的事实。 - 不用“某位在世设计师/艺术家的风格”描述;只使用客观视觉特征。 - 未经用户要求,不生成真人肖像或品牌商标。 ## 文件结构 ```text space-xhs-image/ ├── SKILL.md ├── agents/openai.yaml ├── evals/evals.json ├── references/ │ ├── visual-system.md │ └── page-patterns.md └── scripts/check_image.py ```