视频教程
重量级应用演示(哔哩哔哩内嵌播放)。更多单功能说明见下方图文介绍。
详情页批量复刻生成
单功能图文介绍
图片灵脉与视频灵脉各能力的输入 / 输出说明、流程示意;视频灵脉共 15 项(图生视频类 8 项 + 视频参考类 7 项),与软件左侧菜单一致,部分 Tab 含 B 站演示视频。
图片灵脉 · 造型与风格
输入:输入男性或女性全身照,尽量高清,最好正面或轻微侧脸(平视角度)
输出:输出一张多角度高清图片。
tips:不能输入动物、装备等。原图太小或不够清晰时,脸部相似度会降低。
输入:输入原始图片,可以人物,物品等图片,提示词中写入风格类描述。
输出:输出一张对应风格图片。
tips:选「高级效果」时,风格还原通常更好。
输入:原图尽量清晰,或者高清人脸图。提示词中输入对现有人像的修改,比如脸变的圆润一点,微胖,其他部位不变。
输出:生成16张各个角度的人脸图。
tips:适合批量准备同一人脸的多角度素材,建议输出设为高清方形。
输入:3张不同角度的脸图(正面,两个侧面),或足够清晰的图片。
输出:生成16张各个角度的人脸图,人脸一致性非常的ok。
tips:适合批量准备同一人脸的多角度素材;输出不够清晰时,可用扩图或高清放大再处理。
图片灵脉 · 替换类
输入:输入一张模特图,穿着目标服装类型的衣服。输入一张高清服装图。服装类型需要选择正确,提示词可以自定义,不写则使用默认描述。
tips:替换内衣、内裤时审核较严、费用偏高,请在界面选好对应服装类型。部分生成方式不支持内衣类;纯色、常规款式效果更好,花纹复杂时效果会差一些。内衣类偶有可能生成失败;未出图不会扣费。
输入:上传模特图、服装图及若干张细节图(软件内最多 9 张参考图,按槽位顺序上传;空槽位会用默认图补齐)。
输出:替换服装后的模特图。
tips:请在界面选好服装类型,可按需填写提示词。细节图越多,花纹与版型还原通常越好;内衣类规则与「服装替换」相同。
输入:原始图片中被替换的物品需要和替换物品同一个种类。
输出:原始图片中的物品被替换,并保存展示方式。
tips:两张图都尽量清晰、尺寸够大。
输入:原图尽量清晰,人脸参考图可以只需要人脸,或足够清晰的图片。
输出:将人脸参考图迁移到原始图片的人脸中。
tips:两张图都尽量清晰;生成比例最好与原图一致。
输入:模特图和场景图都需要展示相似的部位,模特图最好是全身图,清晰大图。
输出:按照场景图中模特的姿势,将模特迁移到场景图中。
tips:两张图都尽量清晰、尺寸够大。
输入:原始图片可以是衣物等物品,也可以是人物。背景图片最好是纯背景图片,尽量清晰。
输出:替换背景后的合成图片。
tips:选「高级效果」时,提示词建议自己写,把物品与背景的衔接写进描述里。
输入:原始图片可以是衣物等物品,也可以是人物。背景通过提示词来描述,越详细越好。
输出:替换背景后的合成图片。
tips:选「高级效果」时提示词越详细越好;选「标准效果」时简单描述即可。
图片灵脉 · 提取与精修
输入:人物或者商品的图片。
输出:提取出提示词相符合的白底图。
tips:部分提取方式一次可得到多个结果,并按顺序展示。
输入:输入一张待调整的图片,功能可以选择扩图和切割,都是居中计算。
输出:根据输入的宽和高,居中扩图和切割后的图片。
tips:当前是居中切割和扩图,如果需要在方向上调整,可以联系工作人员,提需求。
输入:输入不够清晰的小图。
输出:指定宽度、等比例的高清图片。
tips:细节保留,质感不变。
输入:商品图片,可以有背景,可以有遮挡,可以有水印。
输出:商品的白底图。
tips:不是简简单单的白底图程序。
输入:输入一张高清图片。
输出:人脸白底图。
tips:适合批量提取人脸白底图,便于后续统一整理使用。
图片灵脉 · 生成与创意
输入:输入最多9张图,建议不要太多。
输出:根据描述,提取并组合画面元素,生成新图。
tips:16宫格图需要在提示词中明显的指出生成16宫格图,程序会自动切分为16张图。
输入:输入一张模特图的人脸图和一张服装图片,都需要高清图。
输出:穿着服装的这个人脸的模特图。
tips:部分生成方式可出内衣、内裤类模特图,纯色款式效果较好;花纹复杂时效果一般。部分高级方式不支持内衣类模特图。
输入:输入一张高清图片。
输出:一定数量的各种姿势的图。
tips:不同生成方式的整体效果接近。
输入:输入最多9张图,建议不要太多。
输出:根据描述,提取并组合画面元素,生成新图。
tips:16宫格图需要在提示词中明显的指出生成16宫格图,程序会自动切分为16张图。
输入:主要输入文字描述:选「高级效果」时越详细越好;选「标准效果」时简单几句即可,程序会自动扩展描述。
输出:根据提示词,生成图片。
tips:9宫格图需要明确指出生成9宫格图(如:请根据下面的提示词描述,生成一张9宫格图片,格式为一行3列,一列3行的3乘以3的9宫格格式。)生成后,程序会自动切分为9张图。
输入:会把图片先分析成文字描述,再生成新图。
输出:一定数量的图片。
tips:分「固定人像风格」和「通用」两种:固定人像风格主要用于生成指定模特,目前内置 4 种人脸风格可选。
输入:输入一张或者多张图片,提示词输入商品的优点。
输出:16 张风格相同的商品详情页图。
tips:当前输出采用 9:16 格式,如需要其他格式,请发需求,后续增加。
视频灵脉 · 图生视频类(8 项)
输入:上传一张主图,搭配「参考音频」「视频描述」。生成方式二选一:音色参考+文字内容(须填「语音文字」)或 音频参考(以整段参考音频为主)。
输出:单镜头视频(不对口型,画面配合背景声)。
tips:未上传主图时会使用默认示意图;未上传参考音频时会尝试使用默认音频。可按需设置时长、清晰度与「跳过开始时间」。
输入:上传一张主图,搭配「参考音频」「视频描述」。生成方式:音色参考+文字内容 或 音频参考。
输出:单镜头对口型视频,嘴型与配音同步。
tips:首帧建议中景、人脸清晰。已有整段口播或演唱时选「音频参考」;用 5–10 秒音色样本 + 文案现配音时选「音色参考+文字内容」并填写「语音文字」。
输入:上传一张主图,搭配「参考音频」「视频描述」。生成方式同「单图生视频」,但支持多镜头切换。
输出:一条视频内可呈现多个镜头或动作切换的成片(不对口型)。
tips:视频描述宜一句对应一个镜头,可连续写多条短句。含「音色参考+文字内容」须填「语音文字」。
输入:上传首帧、中间过渡帧、尾帧三图(同一场景、同一光线),搭配「参考音频」「视频描述」。生成方式同「单图生视频」。
输出:三帧引导下的单镜头视频(不对口型)。
tips:中间帧用来引导动作走向;描述宜简单、单一动作。含「音色参考+文字内容」须填「语音文字」。
输入:上传首帧、中间过渡帧、尾帧三图(同一场景、同一光线),搭配「参考音频」「视频描述」。生成方式同「单图生视频对口型」。
输出:三帧引导下的单镜头对口型视频。
tips:三图背景须一致;人脸宜清晰。含「音色参考+文字内容」须填「语音文字」。其余设置同「单图生视频对口型」。
输入:上传首帧图与尾帧图,搭配「参考音频」「视频描述」。生成方式同「单图生视频」。
输出:首尾帧约束下的单镜头视频(不对口型)。
tips:首末帧构图与光照宜自然衔接;描述宜单一动作、单镜头。
输入:上传首帧图与尾帧图,搭配「参考音频」「视频描述」。生成方式同「单图生视频对口型」。
输出:首尾帧约束下的单镜头对口型视频。
tips:首末帧宜自然衔接;含「音色参考+文字内容」须填「语音文字」。
输入:以文字描述为主,每个输入框对应一条任务;可选上传一条「参考音频」。生成方式含 W模型、Z模型、L模型,每类各有「音色参考+文字内容」与「音频参考」两种。
输出:按每条描述分别生成的视频。
tips:选「音色参考+文字内容」须填「语音文字」。W模型、Z模型适合较详细的描述;L模型自带语音与背景声,宜写整体氛围。多行任务时,每行音频设置各自独立。
视频灵脉 · 视频参考类(7 项)
输入:上传静态图片与参考视频(建议正面高清全身照、单一镜头)。生成方式可选「ST(单人)」「SC(单人)」「SC(多人)」。不对口型,仅参考动作。
输出:让人物按参考视频动作动起来的视频。
tips:主要适用于人物。「SC(多人)」适合多人舞蹈等场景。图片与视频可批量组合提交。
输入:上传人物图片与参考视频(建议正面高清全身照、单一镜头)。生成方式可选「姿势参考」「姿势参考+背景参考」「全能图片G+姿势参考+背景参考」等。
输出:按参考视频中的动作(及所选方式决定是否带背景)生成的新视频。
tips:主要适用于人物。图片与视频可批量组合,一次提交多个任务。
输入:上传人物图片、参考视频(建议正面高清全身照、单一镜头)与参考音频。生成方式为「对口型+动作参考」。
输出:动作与口型同步的视频,比单纯口播对口型更生动。
tips:主要适用于人物。图片、视频、音频可组合批量生成。
输入:上传参考语音与语调的音频;输入一段或多段文字。生成方式可选「语音语调参考」或「口音方言模拟」(后者需分别提供两个人物的参考音频)。
输出:按文本生成对应语音的音频文件;多段文字将同时生成多条任务。
tips:部分多音字读音可能不够准确,后续版本会继续优化。
输入:上传一段人物视频(人物未开口说话、动作流畅),搭配「参考音频」。
音频来源:选「音频内容」时上传整段口播或演唱;选「音色参考+文字内容」时上传短音色样本并填写口播文字。
输出:原视频画面配合对口型的成片。
tips:人物宜占画面中景或上半身,视频尽量清晰。视频与音频可批量组合生成多个任务。
输入:上传静态人物图片与参考音频(整段口播或演唱)。生成方式为「对口型+单动作+音频参考」。
输出:按音频同步口型的视频。
tips:图片宜正面半身、动作变化小;口播内容由参考音频决定,无法在界面自定义文字。
输入:上传一段或多段带字幕或水印的视频。生成方式为「L方式去字幕水印」。
输出:去除字幕与水印后的视频;每个视频对应一个子任务。
tips:适合批量处理多条素材。可按需设置时长、跳过开始时间与帧率。
需要帮助?
扫码关注
官方服务号
请关注「灵脉AI」微信服务号
教程更新、新功能说明与使用技巧持续推送;如需提需求或联系工作人员,也可通过服务号留言。
软件内问题请前往「设置 → 技术支持」