All models

kling-v2-6

KuaishouVideo
2.1–14 Credits
Get your API key
kling-v2-6

兼顾首尾帧控制与同步伴音的短视频模型

kling-v2-6 是快手可灵 V2.6 视频模型,适合把文字构想或静态图片制作成短视频。它的选择价值在于 pro 模式同时提供首尾帧控制与同步伴音,可用于产品展示、氛围片段和故事镜头;还可在会说话的照片工作流中,结合人物照片与已有音频制作对口型视频。

Kuaishou模型品牌
视频模型类型
视频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

创作方式
文生视频、图生视频;另有照片加音频的对口型工作流
视频时长
平台入口支持 5 秒或 10 秒
生成模式
std、pro
画幅
16:9、9:16、1:1
首尾帧控制
pro 图生视频支持首帧加尾帧;尾帧不能单独使用
同步伴音
pro 支持 generate_audio;默认关闭
结果交付
视频链接、视频 ID、任务 ID 与状态;支持异步及回调

以上为本平台的 V2.6 调用规格,照片对口型是独立工作流,不等同于视频生成时的同步伴音。

核心能力

了解 kling-v2-6 能为你的工作带来什么。

让声音与画面一起生成

V2.6 的 pro 模式支持在生成视频时开启伴音,适合希望同时获得画面和声音的短片创作。提示词可围绕主体、动作与场景组织,再通过 generate_audio 开启音频;只需要视觉素材时则保持关闭,便于后续自行配音和剪辑。

用起点和终点组织镜头

图生视频可从指定首帧出发,pro 模式还能加入尾帧,为片段设置明确的起始与结束画面。它适合已有产品图、人物图或分镜稿的项目,让创作围绕选定构图展开;首尾帧用于约束画面边界,并不是对中间每一帧的逐帧编辑。

把人物照片做成口播片段

会说话的照片工作流接受人物图片和已有音频,先将照片动画化,再完成音频对口型,一次提交即可取得最终视频。可用 prompt 描述动画阶段的动作与表情,并显式选择 kling-v2-6;这条工作流适合已有录音的任务,而非从文字直接合成语音。

适用场景

从具体任务出发,找到模型发挥作用的位置。

产品展示与社交短片

输入商品主图和展示动作描述,制作适合横屏、竖屏或方形发布的短片。若已设计好收尾画面,可用 pro 加入尾帧,让产品展示落到预定构图;交付的视频链接可进入剪辑流程,再补充品牌文字、字幕与完整的营销编排。

有声氛围与故事镜头

从场景、人物动作和事件描述出发,使用文生视频制作短镜头,并在 pro 模式开启同步伴音。适合先验证一个故事片段或有声氛围创意,再决定是否进入正式剪辑;把任务组织成清楚的单个片段,比把完整长篇脚本塞进一次生成更便于检查。

已有录音的人物口播

准备清晰的单人正脸照片,以及与目标视频时长相配的录音,提交到会说话的照片入口。输出包括最终对口型视频,也可取得照片动画阶段的视频链接,便于分别检查人物动作与口型效果,适合角色介绍、简短讲解和口播样片。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

在 V2.5 Turbo 与 V2.6 之间选择

若需要首尾帧,两者的 pro 模式都可纳入选择;若希望生成时同时获得伴音,V2.6 的 pro 更符合任务要求,V2.5 Turbo 不提供这一功能。对无需声音、也不需要尾帧的片段,可从 V2.6 std 开始;需要声音或明确收尾画面时再选择 pro,而不是仅凭版本名称判断。

何时转向 V3 或 Omni

V2.6 适合固定短时长、文字或首帧驱动,以及 pro 下的伴音创作。若任务要求 3–15 秒整数时长、原生 4K 模式或专用运镜控制,应考虑对应能力的 V3;若要组合多张参考图、参考视频或直接编辑已有视频,应选择 O1 或 V3 Omni,不要把这些能力套用到 V2.6。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • std 不支持同步伴音和尾帧,使用这两项功能应选择 pro。图生视频需要首帧图片,尾帧只能与首帧共同使用;提交前应把期望的动作过程写清楚,避免将起止画面的约束误当成对整段运动轨迹的精确控制。
  • V2.6 不支持 mode=4k,也不支持 camera_control 专用运镜参数。可以在提示词中表达镜头意图,但这与参数化运镜控制不同;多图参考、参考视频及视频编辑属于其他型号的工作方式,不是本型号的通用输入能力。
  • 照片对口型需要可访问的图片和音频链接,建议使用清晰单人正脸。音频支持 mp3、wav、m4a、aac,文件不超过 5MB,时长建议不超过目标视频;这条工作流依赖已有音频,不替代语音创作或长篇口播制作。

常见问题

解答使用 kling-v2-6 时的常见疑问。

V2.6 的 std 和 pro 应该怎么选?

只制作不带同步声音、无需指定尾帧的片段,可以选择 std。需要同步伴音或首尾帧控制时,应使用 pro。两种模式都支持 5 秒或 10 秒视频;pro 的这些功能需要主动设置,并不会因为选择该模式就自动全部开启。

怎样开启 V2.6 的同步音频?

在 /kling/videos 请求中显式设置 model 为 kling-v2-6、mode 为 pro,并将 generate_audio 设为 true。该开关默认关闭。同步伴音与提交现成音频进行照片对口型是两种不同方式,应根据是否已有录音来选择。

可以只给一张尾帧图生成视频吗?

不能将尾帧单独作为这条图生视频流程的输入。应使用 action=image2video,提供 start_image_url,并在 pro 模式下按需加入 end_image_url。若只有一张图片,可以把它作为首帧,再用提示词描述希望发生的动作。

怎样用 V2.6 让照片按录音说话?

向 /kling/talking-photo 提交 image_url 和 audio_url,并显式指定 model=kling-v2-6,选择 5 秒或 10 秒。prompt 可描述照片动画阶段的动作表情。最终 video_url 是对口型成片,source_video_url 则是中间的照片动画视频。

怎样接收生成结果,避免一直等待连接?

可设置 async=true,先保存返回的 task_id,再通过任务查询获取状态与结果;也可配置 callback_url 接收完成通知。取得 video_url 后再下载或进入剪辑流程。两个生成入口都建议显式指定 kling-v2-6,避免使用其他默认型号。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 kling-v2-6 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。