供给价值
补齐课程从内容生成到入库展示的视觉资产形态,使课程具备可检索、可匹配、可分发的基础入口。
为 Keep 课程生产搭建一套配置驱动、可接入自动化调度的封面生成系统。
封面动作必须匹配课程真实训练动作,生成结果需通过动作准确、内容匹配和入库可用三类校验。
70%
›姿态准确性
60+%
›MVP 封面合格率
01 / 项目背景
把课程封面从单次设计交付,改造成可调度的图像生产能力。业务规模化要求封面生产从“设计师一张一张做”转变成“系统批量出”。问题定义、核心痛点与系统目标构成项目起点。
关键约束:封面动作必须与课程真实训练动作一致。项目验收标准聚焦动作准确、内容匹配、课程系统可稳定调用。
策略迭代速度被设计产能卡住,无法快速试错。
设计耗时显著影响课程上线周期长,数据反馈滞后,迭代效率低
人力成本高,关键能力集中在个人,无法规模化。
补齐课程从内容生成到入库展示的视觉资产形态,使课程具备可检索、可匹配、可分发的基础入口。
支撑 10 万级规模化课程封面生产,将人工单次交付升级为可批量调用的图像生产能力,降低人工依赖与边际生产成本。
支持课程营销节点、课程卖点生成多版本图像,提高课程资产的复用效率与分发响应速度。
02 / 核心难点
项目验收口径明确:动作准确、内容匹配、批量稳定、可接入生产链路。难点集中在质量、规模和工程三层,分别对应封面合格、动作覆盖和系统持续运行。
健身动作对姿态标准、发力感、动态感和器械交互握持方式有明确专业要求
决定封面是否可用封面生成接入课程自动化生产链路,并承载风格、角色、模板、分发策略、审核回流和入库规则。模块化拆解后,问题可定位、策略可配置、节点可替换、链路可扩展。
决定系统是否可持续运行动作名称接近一万,人工逐条编写提示词不可持续。系统从动作名称、动作类型、训练部位、器械和参考图中提取稳定描述逻辑,将「动作名」转化为模型可理解的画面结构。
海量决定动作是否可覆盖03 / 解法判断
课程封面面向核心营收场景,约束比普通图像生成更硬。
视觉质量只是表层要求,真正的难点来自专业准确性、动作规模、策略自动化和工程稳定性四个维度的同时叠加。
参考资产+工程补位补偿模型边界
模型:基础画面(视觉主体、空间、光影、基础风格);参考资产(姿态帧、角色档案)稳输入;工程补位(MoveNet 关键点检测、部位裁剪、标注叠加)兜底;质检做准出
把人的隐性判断转译为系统规则
把设计师脑子里“减脂课用对比图+↓30%”这类隐性判断,拆成“基础形态→放大策略→实现路径”的显性分流规则,让系统自动执行,人只做审核
高约束场景下,确定性比灵活性重要
采用线性管道+模块化拆解,明确不用自主决策形式——不确定性不符合高约束场景的验收要求。模块化保证新风格/新策略可快速插入已调好的流程
04 / 方案设计
先定义封面类型与生成路径,再准备姿态、角色和模板输入;并行验证 Dify-workflow、图像模型与能力原型,最终接入营销拼合、视觉审核与入库复用链路。
沉淀动作参考、角色一致性资产和模板资源,为生成链路提供稳定的可配置输入
姿态库:Keep 多年视频课程截取关键帧,真实健身教练拍摄 → 动作专业性保障。
角色库:固定角色 + 第三方 KOL/IP 角色 → 角色准确 + 系列感。
模板库:对比图拼合方式、文本位置/字号、箭头线条标识 → 营销表达预设。
盘历史封面图,反推设计策略和业务规则,形成系统规则输入
判断现有封面的呈现方式、生成方式与实现方式,明确单图直出、局部裁剪、对比拼合等路径,形成系统规则输入。
Dify、模型选型与能力原型并行推进
Dify、模型选型与能力原型并行推进。
能力原型快速验证图像预处理、后处理、姿态定位、裁切和模板拼合,并输出方案提案、验证结论和工程拆解依据。
验证通过的能力进入正式链路
验证通过的生成能力进入正式链路,生成结果按营销策略拼合,经审核后随课程入库,形成可检索、可复用的课程视觉资产。
05 / 资源准备
资源准备是生成系统的输入控制层,负责降低动作、角色和版式三类不确定性。姿态库提供动作参考,角色档案控制人物一致性,模板库承接营销表达与批量拼合。
01 / 姿态库
姿态库来自课程视频关键帧。每个视频片段截取一张代表帧,并与动作名称、训练部位、是否带器械等信息绑定,进入生成链路后提供动作参考。
真实课程视频片段截取白棚动作帧。
降低姿态漂移、动作错误和穿模风险。
02 / 角色档案
角色档案把人物一致性从口头描述转成可输入的视觉参考。进入生成链路时提供参考图输入,不训练独立模型。
KOL / 达人角色,优先控制面部、体型、服装和气质。
面部、三视图、表情、色彩、服装细节。
03 / 模板库
模板库承接版式复用、营销表达、多图拼合和信息层呈现,让生成结果进入稳定的批量生产格式。
版式结构、信息层、营销重点和视觉节奏。
降低单张设计成本,保证批量封面风格稳定。
06 / 业务梳理
业务拆解的核心工作,是盘 Keep 几年积累的历史封面,反推设计师做图的逻辑策略和业务规则,从分散的内容规则中归纳出系统可消费的分流逻辑。最终产出是一套三步决策树。
基础形态
回答画面结构问题:
放大策略
覆盖在基础形态上的表达策略:
实现路径
给图像模型的输入项:
把模型输出加工成可用素材:
把素材变成成品封面:

07 / Dify workflow
核心能力验证聚焦 Dify 策略编排层:怎么把业务规则变成可执行的工作流,怎么让新增风格不牵动主干链路,以及怎么在上线前把质量兜住。通过国产 / 国外图像模型横向评测,确定模型生成与工程补位边界:模型做基础画面,工程补位补出可用封面。
ASSET 01
每个节点只处理一个问题域:主体、服装、场景、动作、组装或合规。问题可定位到具体模块,不需要重调整条 Prompt。
ASSET 02
动作、服装、场景或风格出现问题时,只调整对应模块,不牵动整条生成链路。
ASSET 03
新增、下线或替换风格时,在模块层处理配置和组装规则,保留原有链路稳定性。
工作流拆为 4 个并行预处理模块 + 1 个组装模块 + 1 个合规模块。每个模块对应一个 Dify 节点,独立负责一个专业领域,
降低长 Prompt 的耦合风险;新增风格、下线规则和局部替换均在模块层完成。

模型选型是调试期投入最高的环节。通过国产与国外模型横向评测,确认图像生成的下限、上限和生产取舍。
专业动作姿态是否标准、标志性是否清晰、发力表现是否可信。
能否呈现运动中的张力与最紧绷瞬间,而非僵硬摆拍。
与器械的交互关系是否正确,是否出现穿模、错位。
能否覆盖大量运动品类与多种场景。
同一输入产出的一致性与可预期性。
满足线上服务的响应与成本约束。
09 / Vibe coding 功能验证
图像模型只能产出基础画面,课程封面还依赖裁切、定位、标注、对比、拼合和模板渲染等工程补位。集中验证关键路径可行性,输出提案展示、可行性结论和前后端工程拆解依据。对于不确定的环节,优先以原型验证替代沟通对齐,确保方案推进节奏可控。
原型定位
- 用 TensorFlow.js、MoveNet、BodyPix 和 Canvas 在浏览器端验证“生成前处理参考图”和“生成后加工成封面”两条路径。
- 正式落地时,能力拆到不同节点:参考图裁切进入预处理,部位裁剪、标注、对比拼合、课程贴片进入后处理与模板渲染。
验证人体、关节点和训练部位能否被稳定识别,为姿态判断和部位定位提供输入
验证参考图裁切、局部裁切、局部放大和轮廓提取,把原始图像处理成可用于封面的结构化素材
验证箭头、虚线、角度、框选、连接线和放大窗口等信息层,把训练重点、正误差异和结果变化显性表达
验证训练前后对比、正误对照、课程分段贴片和多图组合,确认多图模板封面的渲染路径
将能力拆分为前处理、后处理和模板渲染节点,为前后端接入正式链路提供工程依据
10 / 流程地图
资源、规则、模型、原型各自就绪后,生产闭环把它们串成一条从触发到入库的完整工程链路。每一步内部有具体的分支逻辑,对应业务拆解中定义的生成模式和拼合模式。

每张样例展示完整转换链路:课程参数(动作名称/场景/部位/难度/性别/风格/年龄)→ 生成素材 → 后处理拼合 → 成品封面。标签(单图/多图 × 直出/特征放大)对应 06 业务拆解的决策树。
健身房·K2·S1
输出
拼合
后处理·场景强化
素材

生成素材x1
输入
健身房·K3·S1
输出
拼合
后处理·场景强化
素材

生成素材x1
输入
健身房·K3·S1
输出
拼合
后处理·特征放大裁切
素材

生成素材x1
输入
办公场景·K2·S1
输出
拼合
后处理·特征放大裁切
素材

生成素材x1
输入
办公场景·K2·S1
输出
拼合
后处理·特征放大裁切&模板1
素材

生成素材x1
输入
办公场景·K2·S1
输出
拼合
后处理·特征放大裁切&模板1
素材

生成素材x1
输入
办公场景·K2·S1
输出
拼合
后处理·特征放大裁切&对比
素材


生成素材x1
输入
办公场景·K2·S1
输出
拼合
后处理·特征放大裁切&对比&t线条强化
素材


生成素材x1
输入
办公场景·K2·S1
输出
拼合
后处理·特征放大裁切&模板2
素材


生成素材x1
输入
11 / 资产沉淀
大部分公司做 AI 智能化时面对同一个问题:让 AI 读取和执行的规则,散落在汇报文档、业务文档或关键人员的经验里——不是 AI 可以直接调用的。资产沉淀做的,是把这些隐性经验整理成 AI 可读的结构化资产,让新场景接入时不用从零开始。
分层范式:配置层 + 决策规则层 + 生成层 + 后处理层 + 审核层。
解耦机制:映射表 × 提示词库,规则与文案分离。
能复用到
封装为Skill、可复用于其它图像自动化能力中
工作流范式:并行预处理 + 模板引擎组装 + 统一合规。
混合模式:查表 + 动态推理。
扩展方法:让新增风格实现「拆 / 换 / 加」乐高式扩展
能复用到
需要持续扩展风格或品类的图像生产场景
规则体系:围绕人物 / 服装 / 动作 / 场景模块,梳理成要素拆解 → 属性层级 → 标准化描述模板 → 边界约束规则体系
专业判断:含器械分级防穿模、动作命名反推等。
能复用到
需要持续扩展风格或品类的图像生产场景
工程范式:先摸清图像模型的能力边界 → 让模型只做它擅长的基础画面 → 用工程补齐出图前后的不稳定环节。
能复用到
可迁移到其他「模型做不稳」的生成场景
形式一:封装为可移植的 Agent Skill(意图网关 → 主体/服装/场景/动作 → 组装 → 合规 → 一键出图,内置「新增风格」)。
形式二:数字资产库存入规则、映射表、参考资产。可被直接调取或重新串联。
能复用到
团队复用:个人经验转为团队可复用的数字资产