ZHIGUANG.CO
Keep 课程 App 图标

课程封面
AI 智能生成系统-MVP


为 Keep 课程生产搭建一套配置驱动、可接入自动化调度的封面生成系统。
封面动作必须匹配课程真实训练动作,生成结果需通过动作准确、内容匹配和入库可用三类校验。

70%

姿态准确性

60+%

MVP 封面合格率

Vibe CodingPrompt EngineeringAgent SkillsWorkflowDify

01 / 项目背景

项目概览与业务价值

把课程封面从单次设计交付,改造成可调度的图像生产能力。业务规模化要求封面生产从“设计师一张一张做”转变成“系统批量出”。问题定义、核心痛点与系统目标构成项目起点。

关键约束:封面动作必须与课程真实训练动作一致。项目验收标准聚焦动作准确、内容匹配、课程系统可稳定调用。

01

策略迭代受设计产能约束

策略迭代速度被设计产能卡住,无法快速试错。

02

设计周期是验证瓶颈

设计耗时显著影响课程上线周期长,数据反馈滞后,迭代效率低

03

深度依赖成熟设计师

人力成本高,关键能力集中在个人,无法规模化。

提升课程供给与分发效率

供给价值

补齐课程从内容生成到入库展示的视觉资产形态,使课程具备可检索、可匹配、可分发的基础入口。

产能价值

支撑 10 万级规模化课程封面生产,将人工单次交付升级为可批量调用的图像生产能力,降低人工依赖与边际生产成本。

分发价值

支持课程营销节点、课程卖点生成多版本图像,提高课程资产的复用效率与分发响应速度。

02 / 核心难点

难点集中在质量、规模与工程可控性三层

项目验收口径明确:动作准确、内容匹配、批量稳定、可接入生产链路。难点集中在质量、规模和工程三层,分别对应封面合格、动作覆盖和系统持续运行。

两名女性在户外草地上做弓步健身动作
标准姿态肌肉发力器械交互

质量难点:专业动作必须被正确呈现

健身动作对姿态标准、发力感、动态感和器械交互握持方式有明确专业要求

决定封面是否可用

工程难点:链路可控、可调度、可扩展

封面生成接入课程自动化生产链路,并承载风格、角色、模板、分发策略、审核回流和入库规则。模块化拆解后,问题可定位、策略可配置、节点可替换、链路可扩展。

决定系统是否可持续运行

规模难点:海量动作需要被结构化描述

动作名称接近一万,人工逐条编写提示词不可持续。系统从动作名称、动作类型、训练部位、器械和参考图中提取稳定描述逻辑,将「动作名」转化为模型可理解的画面结构。

海量决定动作是否可覆盖

03 / 解法判断

不是选技术路线,是在每个环节划清模型、规则和人的分工边界

课程封面面向核心营收场景,约束比普通图像生成更硬。
视觉质量只是表层要求,真正的难点来自专业准确性、动作规模、策略自动化和工程稳定性四个维度的同时叠加。

模型能力与工程补位的边界

参考资产+工程补位补偿模型边界

模型:基础画面(视觉主体、空间、光影、基础风格);参考资产(姿态帧、角色档案)稳输入;工程补位(MoveNet 关键点检测、部位裁剪、标注叠加)兜底;质检做准出

设计经验变成系统可消费的分流逻辑

把人的隐性判断转译为系统规则

把设计师脑子里“减脂课用对比图+↓30%”这类隐性判断,拆成“基础形态→放大策略→实现路径”的显性分流规则,让系统自动执行,人只做审核

选确定性而非灵活性

高约束场景下,确定性比灵活性重要

采用线性管道+模块化拆解,明确不用自主决策形式——不确定性不符合高约束场景的验收要求。模块化保证新风格/新策略可快速插入已调好的流程

课程封面AI 智能生成系统

04 / 方案设计

从业务问题到可运行链路,按四个阶段推进

先定义封面类型与生成路径,再准备姿态、角色和模板输入;并行验证 Dify-workflow、图像模型与能力原型,最终接入营销拼合、视觉审核与入库复用链路。

001

资源准备

沉淀动作参考、角色一致性资产和模板资源,为生成链路提供稳定的可配置输入

姿态库:Keep 多年视频课程截取关键帧,真实健身教练拍摄 → 动作专业性保障。
角色库:固定角色 + 第三方 KOL/IP 角色 → 角色准确 + 系列感。
模板库:对比图拼合方式、文本位置/字号、箭头线条标识 → 营销表达预设。

姿态库角色库模板库
002

业务拆解

盘历史封面图,反推设计策略和业务规则,形成系统规则输入

判断现有封面的呈现方式、生成方式与实现方式,明确单图直出、局部裁剪、对比拼合等路径,形成系统规则输入。

现状归类封面类型生成路径
003

核心能力验证

Dify、模型选型与能力原型并行推进

Dify、模型选型与能力原型并行推进。
能力原型快速验证图像预处理、后处理、姿态定位、裁切和模板拼合,并输出方案提案、验证结论和工程拆解依据。

Dify-workflow模型选型vibe coding 原型验证
004

生产闭环

验证通过的能力进入正式链路

验证通过的生成能力进入正式链路,生成结果按营销策略拼合,经审核后随课程入库,形成可检索、可复用的课程视觉资产。

模板拼合视觉审核入库复用

05 / 资源准备

从业务资产中提取三类可控资产:姿态、角色、模板

资源准备是生成系统的输入控制层,负责降低动作、角色和版式三类不确定性。姿态库提供动作参考,角色档案控制人物一致性,模板库承接营销表达与批量拼合。

男性教练俯身绳索夹胸动作的视频截图 男性教练侧弓步拉伸的白棚动作关键帧 男性教练站姿提膝转体的白棚动作关键帧 女性教练低弓步转体的白棚动作关键帧 女性教练四点跪姿屈腿的白棚动作关键帧 男性教练俯身哑铃划船的白棚动作关键帧 男性教练仰卧自行车卷腹的白棚动作关键帧 女性教练鸽子式拉伸的白棚动作关键帧

01 / 姿态库

标准姿态库

姿态库来自课程视频关键帧。每个视频片段截取一张代表帧,并与动作名称、训练部位、是否带器械等信息绑定,进入生成链路后提供动作参考。

来源

真实课程视频片段截取白棚动作帧。

链路作用

降低姿态漂移、动作错误和穿模风险。

视频截帧动作名称徒手 / 器械

02 / 角色档案

人物一致性输入

角色档案把人物一致性从口头描述转成可输入的视觉参考。进入生成链路时提供参考图输入,不训练独立模型。

R3 固定 IP

KOL / 达人角色,优先控制面部、体型、服装和气质。

档案要素

面部、三视图、表情、色彩、服装细节。

入驻KOL角色典型教练角色随机角色
白色训练服女性健身教练多视图角色档案 灰色训练服男性健身教练多视图角色档案 蓝色训练服女性健身教练多视图角色档案
课程封面模板规则示例:深蹲局部放大与 Before/After 对比

03 / 模板库

营销表达与拼合规则

模板库承接版式复用、营销表达、多图拼合和信息层呈现,让生成结果进入稳定的批量生产格式。

控制对象

版式结构、信息层、营销重点和视觉节奏。

链路作用

降低单张设计成本,保证批量封面风格稳定。

通用模板营销模板对比模板

06 / 业务梳理

把封面问题解构成系统规则

业务拆解的核心工作,是盘 Keep 几年积累的历史封面,反推设计师做图的逻辑策略和业务规则,从分散的内容规则中归纳出系统可消费的分流逻辑。最终产出是一套三步决策树。

001 如何构成

基础形态

回答画面结构问题:

  • 单图呈现(一张训练图表达课程内容)
  • 多图呈现(训练前后对比、正误对照、底图叠子图)

002 如何表达

放大策略

覆盖在基础形态上的表达策略:

  • 色调强化 / 光源强化 / 场景强化 / 文本强调 / 数值变化 / 描线聚焦 / 箭头趋势 / 对比组合 / 特征放大

003 如何实现

实现路径

控制层

给图像模型的输入项:

  • prompt(Dify 生成,含文本提示词 + 指引后处理的关键词)
  • + 角色参考图(角色库:固定角色 / KOL-IP / 自建角色)
  • + 运动姿态参考图(姿态库:视频关键帧)
  • → 三者一起输入给闭源图像模型

后处理层

把模型输出加工成可用素材:

  • 角色
  • 背景层分离
  • 人像抠图
  • 健身部位定位裁剪

渲染层

把素材变成成品封面:

  • 直出(模型图叠加策略后直接可用)
  • 模板拼合(嵌套模板:标注 + 详情窗口 + 文本位置等)
生成路径与放大策略示意

07 / Dify workflow

模型做基础画面,策略编排和工程补位解决模型做不到的部分

核心能力验证聚焦 Dify 策略编排层:怎么把业务规则变成可执行的工作流,怎么让新增风格不牵动主干链路,以及怎么在上线前把质量兜住。通过国产 / 国外图像模型横向评测,确定模型生成与工程补位边界:模型做基础画面,工程补位补出可用封面。

ASSET 01

模块化编排

每个节点只处理一个问题域:主体、服装、场景、动作、组装或合规。问题可定位到具体模块,不需要重调整条 Prompt。

ASSET 02

单点调试

动作、服装、场景或风格出现问题时,只调整对应模块,不牵动整条生成链路。

ASSET 03

可插拔可扩展

新增、下线或替换风格时,在模块层处理配置和组装规则,保留原有链路稳定性。

Dify 多模块工作流编排界面

工作流架构:多模块并行解耦

工作流拆为 4 个并行预处理模块 + 1 个组装模块 + 1 个合规模块。每个模块对应一个 Dify 节点,独立负责一个专业领域,
降低长 Prompt 的耦合风险;新增风格、下线规则和局部替换均在模块层完成。

Dify workflow 编排图

图像模型选型验证动作生成底线。

模型选型是调试期投入最高的环节。通过国产与国外模型横向评测,确认图像生成的下限、上限和生产取舍。

动作准确性

专业动作姿态是否标准、标志性是否清晰、发力表现是否可信。

运动瞬间表现

能否呈现运动中的张力与最紧绷瞬间,而非僵硬摆拍。

人 - 器械空间

与器械的交互关系是否正确,是否出现穿模、错位。

泛化能力

能否覆盖大量运动品类与多种场景。

稳定性

同一输入产出的一致性与可预期性。

耗时与成本

满足线上服务的响应与成本约束。

09 / Vibe coding 功能验证

Vibe coding验证能力原型&生成链路

图像模型只能产出基础画面,课程封面还依赖裁切、定位、标注、对比、拼合和模板渲染等工程补位。集中验证关键路径可行性,输出提案展示、可行性结论和前后端工程拆解依据。对于不确定的环节,优先以原型验证替代沟通对齐,确保方案推进节奏可控。

原型定位
- 用 TensorFlow.js、MoveNet、BodyPix 和 Canvas 在浏览器端验证“生成前处理参考图”和“生成后加工成封面”两条路径。
- 正式落地时,能力拆到不同节点:参考图裁切进入预处理,部位裁剪、标注、对比拼合、课程贴片进入后处理与模板渲染。

Vibe coding 课程封面能力验证原型界面

识别定位

验证人体、关节点和训练部位能否被稳定识别,为姿态判断和部位定位提供输入

图像加工

验证参考图裁切、局部裁切、局部放大和轮廓提取,把原始图像处理成可用于封面的结构化素材

表达叠加

验证箭头、虚线、角度、框选、连接线和放大窗口等信息层,把训练重点、正误差异和结果变化显性表达

模板拼合

验证训练前后对比、正误对照、课程分段贴片和多图组合,确认多图模板封面的渲染路径

工程拆解

将能力拆分为前处理、后处理和模板渲染节点,为前后端接入正式链路提供工程依据

10 / 流程地图

全流程地图:从触发到入库的完整工程链路

资源、规则、模型、原型各自就绪后,生产闭环把它们串成一条从触发到入库的完整工程链路。每一步内部有具体的分支逻辑,对应业务拆解中定义的生成模式和拼合模式。

全流程地图

真实工作样例:参数 → 源图 → 成品

每张样例展示完整转换链路:课程参数(动作名称/场景/部位/难度/性别/风格/年龄)→ 生成素材 → 后处理拼合 → 成品封面。标签(单图/多图 × 直出/特征放大)对应 06 业务拆解的决策树。

徒手深蹲 · 全身

健身房·K2·S1

徒手深蹲课程封面成品 输出
单图

拼合

后处理·场景强化

素材

徒手深蹲生成素材

生成素材x1

输入

女性健身教练角色三视图
  • 徒手深蹲
  • 健身房
  • 下肢
  • K2
  • S1
  • 30岁

动感单车 · 全身

健身房·K3·S1

动感单车课程封面成品 输出
单图

拼合

后处理·场景强化

素材

动感单车生成素材

生成素材x1

输入

女性健身教练角色三视图
  • 动感单车
  • 健身房
  • 全身
  • K3
  • S1
  • 30岁

俯身哑铃屈伸 · 全身

健身房·K3·S1

俯身哑铃屈伸课程封面成品 输出
单图特征放大

拼合

后处理·特征放大裁切

素材

俯身哑铃屈伸生成素材

生成素材x1

输入

女性健身教练角色三视图
  • 俯身哑铃屈伸
  • 健身房
  • 手臂
  • K3
  • S1
  • 30岁

交替伐木提膝 · 核心

办公场景·K2·S1

交替伐木提膝课程封面成品 输出
单图特征放大

拼合

后处理·特征放大裁切

素材

交替伐木提膝生成素材

生成素材x1

输入

女性健身教练角色三视图
  • 交替伐木提膝
  • 办公场景
  • 核心
  • K2
  • S1
  • 30岁

臀腿·塑型课程 · 核心

办公场景·K2·S1

臀腿塑型课程封面成品 输出
单图特征放大

拼合

后处理·特征放大裁切&模板1

素材

臀腿塑型课程生成素材

生成素材x1

输入

女性健身教练角色三视图
  • 前后分腿上举伸展
  • 臀部
  • 办公场景
  • K2
  • S1
  • 30岁

减脂课程 · 核心

办公场景·K2·S1

减脂课程封面成品 输出
单图特征放大

拼合

后处理·特征放大裁切&模板1

素材

减脂课程生成素材

生成素材x1

输入

女性健身教练角色三视图
  • 正面站姿
  • 客厅
  • 核心
  • K2
  • S1
  • 30岁

减脂 · 核心

办公场景·K2·S1

减脂对比课程封面成品 输出
多图特征放大

拼合

后处理·特征放大裁切&对比

素材

标准体型站姿生成素材偏胖体型站姿生成素材

生成素材x1

输入

女性健身教练角色三视图
  • 正面站姿
  • 正面站姿-胖
  • 客厅
  • 上身
  • K2
  • S1
  • 30岁

腿部矫正 · 核心

办公场景·K2·S1

腿部矫正课程封面成品 输出
多图特征放大

拼合

后处理·特征放大裁切&对比&t线条强化

素材

腿部矫正前生成素材腿部矫正后生成素材

生成素材x1

输入

女性健身教练角色三视图
  • 正面站姿
  • 正面站姿-病
  • 客厅
  • 下肢
  • K2
  • S1
  • 30岁

局部放大 · 核心

办公场景·K2·S1

徒手深蹲局部放大课程封面成品 输出
多图特征放大

拼合

后处理·特征放大裁切&模板2

素材

徒手深蹲生成素材后侧错步站姿生成素材

生成素材x1

输入

女性健身教练角色三视图
  • 徒手深蹲
  • 核心
  • 健身房
  • K2
  • S1
  • 后侧错步站姿
  • 全身
  • 30岁

11 / 资产沉淀

将隐性经验转成 AI 可读、可调用的规则资产

大部分公司做 AI 智能化时面对同一个问题:让 AI 读取和执行的规则,散落在汇报文档、业务文档或关键人员的经验里——不是 AI 可以直接调用的。资产沉淀做的,是把这些隐性经验整理成 AI 可读的结构化资产,让新场景接入时不用从零开始。

01 配置驱动的生成范式

分层范式:配置层 + 决策规则层 + 生成层 + 后处理层 + 审核层。

解耦机制:映射表 × 提示词库,规则与文案分离。

能复用到

封装为Skill、可复用于其它图像自动化能力中

02 多节点解耦工作流

工作流范式:并行预处理 + 模板引擎组装 + 统一合规。

混合模式:查表 + 动态推理。

扩展方法:让新增风格实现「拆 / 换 / 加」乐高式扩展

能复用到

需要持续扩展风格或品类的图像生产场景

03 规则资产化(隐性 → AI 可读)

规则体系:围绕人物 / 服装 / 动作 / 场景模块,梳理成要素拆解 → 属性层级 → 标准化描述模板 → 边界约束规则体系

专业判断:含器械分级防穿模、动作命名反推等。

能复用到

需要持续扩展风格或品类的图像生产场景

04 AI 原生解法范式

工程范式:先摸清图像模型的能力边界 → 让模型只做它擅长的基础画面 → 用工程补齐出图前后的不稳定环节。

能复用到

可迁移到其他「模型做不稳」的生成场景

05 双形式沉淀(Skills + 数字资产库)

形式一:封装为可移植的 Agent Skill(意图网关 → 主体/服装/场景/动作 → 组装 → 合规 → 一键出图,内置「新增风格」)。

形式二:数字资产库存入规则、映射表、参考资产。可被直接调取或重新串联。

能复用到

团队复用:个人经验转为团队可复用的数字资产

数字资产库中的 Sport Cover Generator Skill 文件结构