🌐
经济型:买域名、轻量云服务器、用途:游戏 网站等 《腾讯云》特点:特价机便宜 适合初学者用
点我优惠购买
🚀
拓展型:买域名、轻量云服务器、用途:游戏 网站等 《阿里云》特点:中档服务器便宜 域名备案事多
点我优惠购买
🛡️
稳定型:买域名、轻量云服务器、用途:游戏 网站等 《西部数码》 特点:比上两家略贵但是稳定性超好事也少
点我优惠购买
从云端 API 生成数字人说起
这篇文章想分享一件我刚刚跑通的事。把几家云端服务的 API 接进豆包以后,给它一条短视频链接、一份自己的音色和一个训练好的数字人形象,豆包就能继续生成文案、音频和数字人视频,最后把成片保存到指定文件夹。 今天我会从豆包的角度,把这套做法完整写下来。智凌 API 用来提取文案,MiniMax 负责克隆声音和生成音频,蝉镜负责让数字人开口。豆包负责调用这些接口、整理中间文件,并检查每一步有没有真的完成。 四个平台在整套流程里的分工如下。|
平台
|
在这套流程里负责什么
|
|---|---|
|
智凌 API
|
把短视频分享链接变成文字
|
|
MiniMax
|
把文字变成自己的克隆声音
|
|
蝉镜
|
让数字人按照这段声音开口
|
|
豆包
|
调用前三个平台,并把文案、音频和视频接起来
|
平台准备 → 凭证准备 → 素材准备 → 三项单测 → 完整成片 → 人工验收这次最终跑出了一条 10.24 秒、1080×1920 的竖屏数字人视频。整条任务都由豆包执行,真实 API key 没有出现在提示词、文章、Skill 文件和结果目录里。后文用到的耗时、文件大小和报错,也都来自这次实测。
教程导读
01|认识整条流程 先看智凌、MiniMax、蝉镜和豆包分别负责什么,需要提前准备哪些素材、账号与凭证。 02|完成平台准备 依次注册三个云端平台,找到接口说明,创建 API 凭证,再准备自己的克隆音色和数字人形象。 03|配置豆包项目 在独立项目中建立三个 Skill,把六项信息填入安全配置,并通过不计费的只读预检确认环境可用。 04|从单测走到成片 分别测试链接转文案、文字转声音和音频驱动数字人。三项通过后,再让豆包读取正式口播稿并生成完整视频。 05|验收与排错 打开结果文件夹检查文案、音频和视频,按失败环节单独重试,最后再决定是否进入批量制作。一、先看懂整条数字人流水线
1. 三个平台分别负责什么
把数字人想成一个真人主播,会更容易理解这三套服务的分工。 智凌负责“找稿子”。你把公开短视频的分享链接交给它,它返回标题、字幕或口播文字。这里拿到的只是原始材料,不等于可以直接发布的新文案。 MiniMax 负责“说话”。你先创建一个克隆音色,再把确认后的口播稿提交给 TTS 接口,它会生成 MP3 音频。 蝉镜负责“出镜”。你先创建并训练自己的数字人形象,再把 MP3 上传给它,平台会让数字人的嘴型、表情和动作跟随音频,最后返回 MP4。 豆包负责把三家平台接起来。它读取链接、调用 Skill、保存中间文件,碰到异步任务就继续等待,任务完成后再下载成片。每一步是否成功,按提示词里的验收条件判断。2. 开始前需要准备什么
正式操作前,先把这些材料准备齐。 1、一个可公开访问的短视频分享链接; 2、一段用于克隆声音的干净录音; 3、一段用于训练数字人的真人视频; 4、智凌 API Key; 5、MiniMax API Key 和 VoiCe ID; 6、蝉镜 APP ID、Secret Key 和数字人 ID; 7、一个专门保存本次产物的文件夹; 8、豆包客户端和一个独立的“豆包数字人”项目。 录音和训练视频尽量一次准备好。录音要减少背景音乐、回声和他人说话;训练视频要保持正脸、光线稳定、画面连续。素材质量不好,后面再好的模型也只能放大问题。3. 平台网址速查
实际用到的网站都在下面。先分别注册并登录,再回来继续操作。|
平台
|
官方入口
|
本教程中的用途
|
|---|---|---|
|
豆包
|
创建 Skill、执行测试并串联完整流程
|
|
|
智凌 API
|
开通短视频文案提取、创建 API Key
|
|
|
MiniMax 开放平台
|
克隆音色、获取 Voice ID 和 API Key
|
|
|
蝉镜开放平台
|
创建数字人、获取 API 凭证并生成视频
|
4. 安全和授权边界
API Key 相当于第三方平台的付费通行证。不要把它贴进普通对话或共享项目,也不要写进 Skill 的 SKILL.md、脚本、文章或 Git 仓库。 本教程只记录配置项名称,不记录真实值。ZHILING_API_KEY
MINIMAX_API_KEY
MINIMAX_VOICE_ID
CHANJING_APP_ID
CHANJING_SECRET_KEY
CHANJING_PERSON_ID
本教程的主流程从三个平台分别取得凭证,再把真实值填入豆包项目的安全配置。
保存后只让豆包检查配置是否存在、格式是否合理,不要让它打印完整内容。普通对话里只写变量名,真实值只出现在安全配置区域。
三项测试会调用真实接口,数字人生成通常还会产生少量费用。第一次保持“按需确认”,看到调用外部 API、上传音频或开始视频合成时,先确认范围再继续。
二、准备智凌,先拿到短视频文案
1. 注册并进入控制台
打开智凌 API 用户控制台,按照页面提供的方式注册并登录。进入控制台后,先找到“产品列表”,确认账号下已经出现短视频解析、文案提取或语音转文字相关产品。 界面名称以后可能调整,判断方法很简单。这个接口要能接收短视频分享链接,并返回可读的文字结果。
2. 找到文案提取接口
点进文案提取产品,先看接口说明,不要马上复制示例代码。文档里先找四件事。请求地址是什么; 请求方法是 GET 还是 POST; 分享链接放在哪个参数中; 任务是同步返回还是提交后继续轮询。短视频文案提取经常走异步流程。第一次请求只返回任务编号,几秒后还要查询任务状态。豆包 Skill 会负责轮询,你不用手动刷新。接口显示“提交成功”时,文案通常还没有生成。
3. 获取并安全保存 API Key
回到控制台,打开“密钥管理”。如果账号还没有密钥,点击创建;如果已经有可用密钥,不要重复创建。 复制以后立刻放进安全配置,并记录变量名为 ZHILING_API_KEY。文章、截图和豆包回复里都不应该出现完整值。部分平台只在创建时展示一次完整密钥,关闭弹窗前先确认已经安全保存。
4. 记下接口规则,暂时不要调用
准备一条公开的短视频分享链接,第一次不要选十几分钟的长视频。此时只确认产品已经开通、接口可以接收分享链接,并记下任务查询方式。 真正的接口测试放在第六章。等豆包里的 Skill、凭证和输出目录全部准备好,再执行一次最小测试。这样遇到错误时,能够判断问题来自平台接口还是豆包配置。三、准备 MiniMax,克隆并调用自己的声音
1. 注册时先确认站点和账号
进入 MiniMax 开放平台,按页面方式注册。国内账号尽量使用国内开放平台,不要把不同站点创建的 Key、音色和账户余额混在一起。 登录后先检查控制台里是否能看到“语音”“声音克隆”“我的音色”和“API 密钥”。声音克隆需要完成个人或企业实名认证。如果某个入口没有显示,先检查认证状态、账号权限和产品是否已开通。2. 准备录音并创建克隆音色
进入“声音克隆”,上传或直接录制一段干净的人声。按照 MiniMax 音色快速复刻文档 当前的接口要求,克隆音频应为 MP3、M4A 或 WAV,时长保持在 10 秒至 5 分钟之间,文件不要超过 20MB。录音时再注意下面这些事。只留一个人说话。 不放背景音乐。 避免明显喷麦、回声和电流声。 使用正常语速和自然情绪。 内容尽量连续,少用碎片拼接。提交前给音色起一个一眼能认出的名字,例如“我的日常口播”。平台完成处理后,先在网页里试听,确认没有明显机械音、吞字或音量突变。
3. 找到并记录 Voice ID
打开“我的音色”,找到刚才创建并试听通过的音色。音色名称方便人确认,API 调用认的是 Voice ID。 把 Voice ID 保存到 MINIMAX_VOICE_ID,不要直接写入 Skill 正文。后续如果有多个音色,豆包应按名称或你明确指定的顺序选择,不能每次随机取一个。
4. 创建并保存 API Key
进入“API 密钥”,点击创建新密钥,填写一个能识别用途的名称,例如“doubao-digital-human”。创建后复制到安全配置中的 MINIMAX_API_KEY。 Key 和 Voice ID 的作用不同。Key 负责鉴权,Voice ID 负责指定声音。出现 401、无权限或找不到音色时,先检查账号和站点,再确认这两个字段是否属于同一个 MiniMax 账户。
四、准备蝉镜,创建自己的数字人形象
1. 注册并进入 API 接入页面
打开蝉镜 API 接入页并登录,进入“API 接入”或开放平台页面。豆包要从这个入口调用蝉镜,普通网页成片编辑器接不到这次任务。 先检查账户是否已开通 API、是否还有可用额度,再确认能看到 App ID、Secret Key、数字人列表和任务查询等入口。平台套餐、计费和可用模型会变化,实际费用以生成前的页面提示为准。
2. 创建 API 凭证并确认鉴权方式
在 API 接入页面找到密钥区域。这里会用到两项凭证。|
配置名
|
用途
|
|---|---|
|
CHANJING_APP_ID
|
应用或账号标识
|
|
CHANJING_SECRET_KEY
|
用于签名或鉴权的 API Key
|
3. 创建自己的数字人
进入“数字人”或“我的数字人”,点击创建。平台提供“视频生数字人”和“文生数字人”等方式;想让成片使用自己的真人形象,就选择“视频生数字人”,上传自己有权使用的真人素材。
训练视频尽量满足下面这些条件:
1、竖屏成片就用竖屏素材,主体不要太小; 2、人脸完整、无遮挡,视线尽量看向镜头; 3、光线和背景保持稳定; 4、不要频繁切镜头、转身或突然离开画面; 5、嘴部要清晰可见,避免手、口罩或杯子遮挡; 6、只上传自己拥有授权的人像和声音。 提交后等待平台训练完成。状态还是处理中时,不要继续调用视频接口。4. 找到数字人 ID
训练完成后打开数字人详情,确认预览图、名称和造型都正确,再记录它的数字人 ID,并保存为 CHANJING_PERSON_ID。 这里也要分清名称和 ID。名称方便人确认,API 通常依赖 ID。为了避免泄露或误用,本教程截图和结果只展示名称,不展示完整 ID。
5. 记下音频驱动要求,稍后统一测试
蝉镜的云端接口不能直接读取电脑上的本地路径。第六章开始测试时,Skill 要先把 MiniMax 生成的 MP3 上传到蝉镜文件管理,等待文件可用,再把返回的文件 ID 交给数字人视频接口。 按照蝉镜合成数字人视频文档,如果希望视频带字幕,上传音频可以使用 8000Hz 或 16000Hz 的单声道文件。本教程统一使用 16000Hz、单声道 MP3。测试时先选基础模型,画面使用 1080×1920、1080p,音频只做三到五秒。数字人视频是异步任务,提交成功以后还要继续查询任务状态并下载结果。 五、在豆包中建立数字人项目 1. 新建独立项目和结果目录 打开豆包,在左侧新建一个“豆包数字人”项目,再为第一次练习准备单独的输出文件夹。原始录音、训练视频、测试文件和正式成片不要混在桌面或下载目录根部。 建议给每个中间结果编号:01-zhiling-copy.txt
02-minimax-voice.mp3
03-chanjing-test.mp4
04-final-script.txt
05-final-voice.mp3
06-final-digital-human.mp4
顺序编号方便排错。看一眼最后生成的文件名,就知道任务停在哪一步。
2. 让豆包准备三个独立 Skill
这里不用提前下载压缩包,也不用自己编写复杂代码。让豆包先读取三个平台的接口说明,再把三个 API 分别做成只管一件事的 Skill。接口地址和参数以平台文档为准,遇到没有写清的字段就停下来,不让豆包凭经验猜。|
Skill
|
输出
|
需要读取的配置
|
|
|---|---|---|---|
|
智凌文案提取
|
公开视频分享链接
|
TXT 文案
|
ZHILING_API_KEY
|
|
MiniMax 文字转语音
|
文字、模型、语速
|
MP3 音频
|
MINIMAX_API_KEY
、
MINIMAX_VOICE_ID
|
|
蝉镜数字人
|
MP3 音频、画面规格
|
MP4 视频
|
CHANJING_APP_ID
、
CHANJING_SECRET_KEY
、
CHANJING_PERSON_ID
|
请在当前“豆包数字人”项目中创建三个彼此独立的本地 Skill:
1. 智凌文案提取:接收公开视频分享链接,调用智凌接口,输出纯文本 TXT。
2. MiniMax 文字转语音:接收文字、模型和语速,调用指定克隆音色,输出 MP3。
3. 蝉镜数字人:接收本地 MP3 和视频规格,用指定数字人生成并下载 MP4。
共同要求:
- 先读取三个平台当前的接口文档,再编写调用逻辑;接口地址、请求参数或签名规则不明确时停止并说明,不得猜测。
- 凭证只能从安全配置读取,变量名分别为 ZHILING_API_KEY、MINIMAX_API_KEY、MINIMAX_VOICE_ID、CHANJING_APP_ID、CHANJING_SECRET_KEY、CHANJING_PERSON_ID。
- 不得把任何凭证或完整 ID 写入 Skill、脚本、日志和回复。
- 每个 Skill 只负责一种能力,并写清输入参数、输出路径、接口失败信息和验收方法。
- 异步任务必须保存任务编号并轮询同一个任务,禁止重复提交。
- MiniMax 输出 MP3 时允许指定采样率和声道,本教程默认使用 16000Hz、单声道。
- 蝉镜 Skill 先用 App ID 和 Secret Key 获取 AccessToken。Token 过期或返回 104.0 时只刷新一次,刷新后继续原任务,不把 Token 长期写入配置。
- 蝉镜 Skill 接收本地 MP3 时,先上传文件并等待文件状态可用,再提交数字人视频任务。使用蝉镜主站创建的数字人时设置 source=1。
- 输出文件已存在时不要直接覆盖,先说明情况;API 调用失败时停止,不要自动改用其他平台。
创建完成后只做静态检查,不调用任何付费 API。最后用表格报告三个 Skill 的名称、输入、输出、所需配置和检查结果。
3. 把三个平台的 API 凭证提供给豆包
完成前面三个平台的注册和配置后,你手里应该已经有六项信息。智凌提供 API Key,MiniMax 提供 API Key 和 Voice ID,蝉镜提供 App ID、Secret Key 和数字人 ID。它们都要从你自己的平台账号中复制,不能使用文章示例或别人的凭证。|
平台
|
需要提供给豆包的配置
|
|---|---|
|
智凌 API
|
ZHILING_API_KEY
|
|
MiniMax
|
MINIMAX_API_KEY
、
MINIMAX_VOICE_ID
|
|
蝉镜
|
CHANJING_APP_ID
、
CHANJING_SECRET_KEY
、
CHANJING_PERSON_ID
|
请只检查当前“豆包数字人”项目中的安全配置,本轮不要调用任何外部或付费 API。
依次检查 ZHILING_API_KEY、MINIMAX_API_KEY、MINIMAX_VOICE_ID、CHANJING_APP_ID、CHANJING_SECRET_KEY、CHANJING_PERSON_ID 是否存在且非空。
不得读取、展示、复述或截断展示任何真实值。不要修改配置,也不要自动创建或替换凭证。发现缺项或格式明显异常时,只报告变量名和问题。
完成后用表格报告六项配置是否就绪,以及是否满足后续单项测试条件。
配置完成后,关闭仍然显示完整密钥的页面,不要把填写过程截图发到公开平台。后面的单项测试只引用变量名,不再重复粘贴真实值。
4. 先让豆包检查环境
正式调用前,让豆包完成一次不计费的预检。下面这段可以直接复制使用。请对当前“豆包数字人”项目执行一次只读预检,本轮禁止调用任何外部或付费 API。
依次检查:
1. 三个 Skill 是否存在并可以加载;
2. 六项安全配置是否存在,但不要读取或展示真实值;
3. 所需运行依赖是否可用;
4. output 目录是否存在且可写;
5. output/01-zhiling-copy.txt、output/02-minimax-voice.mp3 和 output/03-chanjing-test.mp4 是否已有同名文件,避免误覆盖。
请用表格输出“检查项、结果、待处理问题”。如果有任意一项不通过,明确指出问题并停止;全部通过时只回复“可以开始三项单测”。
只有三项 Skill、配置和输出目录都显示正常,才进入下一步。
六、逐项测试三个能力
第一次不要把链接、改写、TTS、数字人一次全交出去。完整任务出了错,你很难判断是链接无效、音色失效、密钥错误,还是蝉镜仍在排队。一次只测一个输入和一个输出,排查起来最快。测试一,链接能不能变成干净文案
输入是一条公开分享链接,输出是 output/01-zhiling-copy.txt。复制下面的提示词,只替换分享链接。请执行一次“智凌文案提取”单项测试。
输入:
- 公开视频分享链接:【把分享链接粘贴到这里】
- 输出文件:output/01-zhiling-copy.txt
执行要求:
1. 使用安全配置中的 ZHILING_API_KEY 调用智凌文案提取接口。
2. 只保留视频中的原始口播或字幕正文,不改写、不总结,也不要保存整段接口 JSON。
3. 如果接口返回任务编号,请持续查询同一个任务,直到成功或明确失败。
4. 如果遇到临时网络错误,间隔数秒后最多自动重试一次。再次失败时停止,不要继续创建任务。
5. 不得在回复、日志或输出文件中显示 API Key。
完成后检查输出文件存在且非空,只报告:执行结果、正文字符数、耗时和文件路径。
验收时检查文件非空、内容可读,也没有把接口返回的 JSON 当成正文。我第一次和第二次独立测试都遇到 Connection reset by peer。排除本机代理影响后,我手动发起了第三次测试,5.4 秒后成功拿到 363 个字符,文件大小 955 字节。这里的第三次是人工排查后的新测试,不属于提示词允许的一次自动重试。
如果出现临时网络重置,先确认服务可达,再只处理智凌这一项,不要跟着重跑 MiniMax 和蝉镜。
测试二,文案能不能变成可用声音
输入是一句固定短文案,输出是 output/02-minimax-voice.mp3。下面这段可以直接复制。请执行一次“MiniMax 文字转语音”单项测试。
输入:
- 测试文案:你好,这是我的第一条数字人语音测试。
- 输出文件:output/02-minimax-voice.mp3
执行要求:
1. 从安全配置读取 MINIMAX_API_KEY 和 MINIMAX_VOICE_ID,使用指定的克隆音色。
2. 模型使用 speech-2.8-turbo,语速设为 1.0,输出 16000Hz、单声道 MP3。
3. 原样朗读测试文案,不扩写、不添加开场白,只调用一次语音接口。
4. 不得在回复、日志或输出文件中显示 API Key 和完整 Voice ID。
完成后确认 MP3 可以播放、时长大于 2 秒且没有明显截断,只报告:执行结果、音频时长、文件大小、耗时和文件路径。
验收时亲自播放,确认音色正确、声音完整、没有读错关键字。本次实测音频 4.05 秒、67,956 字节,约 1.4 秒生成完成。
短句通过以后再测试长文案。因为长音频更贵,也更容易暴露断句、英文缩写和多音字问题。
测试三,音频能不能驱动数字人
输入是第二项已经听过的 MP3,输出是 output/03-chanjing-test.mp4。下面的提示词适用于在蝉镜主站创建的个人数字人。请执行一次“蝉镜音频驱动数字人”单项测试。
输入:
- 驱动音频:output/02-minimax-voice.mp3
- 输出文件:output/03-chanjing-test.mp4
执行要求:
1. 从安全配置读取 CHANJING_APP_ID、CHANJING_SECRET_KEY 和 CHANJING_PERSON_ID。
2. 先用 App ID 和 Secret Key 获取 AccessToken,不展示或长期保存 Token。返回 10400 时只刷新一次。
3. 把本地 MP3 上传到蝉镜文件管理,等待文件状态可用,再使用返回的文件 ID 创建视频。
4. 使用 CHANJING_PERSON_ID 指定的数字人。该数字人来自蝉镜主站,因此 source 设为 1。
5. 选择基础模型,生成 1080×1920、1080p 的竖屏视频,保留默认字幕处理。
6. 任务提交后持续查询同一个任务编号,完成后立即下载 MP4。等待期间不要重复提交任务。
7. 不得在回复、日志或输出文件中显示 App ID、Secret Key、AccessToken 和完整数字人 ID。
完成后确认视频可以打开,画面为 1080×1920,同时包含视频流和音频流,视频时长与输入音频基本一致。只报告:执行结果、视频时长、文件大小、耗时和文件路径。
文件扩展名只能说明它叫 MP4,验收时还要逐项检查下面这些内容。
能不能正常打开; 画面是不是 1080×1920; 有没有声音; 时长是否接近输入音频; 人脸、嘴部和字幕是否正常。我这次生成的测试片长 4.04 秒,文件大小 3,055,955 字节,前后等了约 42.6 秒。豆包等到任务完成后才下载文件,没有把“提交成功”当成最终结果。 我这次跑出的数据放在下面。
|
项目
|
结果
|
耗时
|
输出
|
|---|---|---|---|
|
智凌文案提取
|
成功
|
5.4 秒
|
955 B / 363 字符
|
|
MiniMax 语音
|
成功
|
1.4 秒
|
4.05 秒 / 67,956 B
|
|
蝉镜数字人
|
成功
|
42.6 秒
|
4.04 秒 / 3,055,955 B
|
三个结果文件都能打开,并且分别通过验收,素材准备才算完成。
七、用豆包生成第一条完整数字人视频
1. 把智凌结果整理成正式口播稿
三项测试通过以后,先把 output/01-zhiling-copy.txt 整理成自己的正式口播。智凌提取到的是原始材料,豆包可以帮你压缩和改写,最终版本仍然要由人确认。 第一条完整成片控制在十秒左右,口播保留 45 至 65 个汉字即可。复制下面的提示词,先让豆包给出候选稿,不调用语音和数字人接口。请读取 output/01-zhiling-copy.txt,把它整理成一段适合约 10 秒数字人口播的候选稿。
改写要求:
1. 只使用原文中能够确认的信息,不补写未经核实的数据、经历和效果。
2. 保留一个主要信息,控制在 45 至 65 个汉字,使用自然口语和完整句子。
3. 不连续照搬原文中的长句,重新组织表达,删除账号名、引流话术和无关开场。
4. 本轮只在回复中给出一版候选稿,不保存文件,也不调用智凌、MiniMax 或蝉镜 API。
最后报告候选稿字数,并等待我确认。
读一遍候选稿,确认事实、语气和长度都合适以后,再复制下面这句。
确认使用上一版候选稿。请原样保存为 output/04-final-script.txt,不再改写,不调用任何外部 API。保存后只报告字符数和文件路径。
为了单独验证接口衔接,我这次使用了一段 58 字的自写测试稿,同样保存为 output/04-final-script.txt。
我现在会用 AI 工具整理文案、生成声音,再驱动数字人完成一条完整视频,整个流程简单又高效,就算第一次操作也能很快上手。output/04-final-script.txt 一旦确认,后续重试只处理失败的音频或视频步骤,不再顺手改稿。
2. 把完整任务一次写清
确认三个单项测试都通过后,复制下面的提示词即可开始。它会使用安全配置中的音色和数字人,不用再填写真实 Key 或 ID。执行后会产生实际 API 调用和少量费用。请使用当前项目中已经通过单项测试的 MiniMax 和蝉镜 Skill,生成一条约 10 秒的正式数字人成片。
固定参数:
- 输出目录:output
- 口播文案:读取 output/04-final-script.txt 中已经人工确认的完整内容
- MiniMax 模型:speech-2.8-turbo
- 语速:1.0
- 音频规格:16000Hz、单声道 MP3
- 音色:使用 MINIMAX_VOICE_ID 指定且已通过单测的克隆音色
- 数字人:使用 CHANJING_PERSON_ID 指定且已通过单测的数字人
- 视频规格:基础模型、竖屏 1080×1920、1080p
执行顺序:
1. 先确认 output/04-final-script.txt 存在且非空,不修改文件内容。
2. 检查 output/05-final-voice.mp3 和 output/06-final-digital-human.mp4 是否已存在;任一文件存在时停止并报告,不要覆盖。
3. 调用 MiniMax 一次,生成 output/05-final-voice.mp3;生成后确认文件可播放且内容完整。
4. 只有音频验收通过后,才调用蝉镜一次,生成 output/06-final-digital-human.mp4。
5. 蝉镜 Skill 先上传 MP3,再使用有效 AccessToken 提交视频任务。保存任务编号并持续查询同一个任务,禁止因等待而重复提交。
安全与失败处理:
- 凭证只从安全配置读取,不修改配置,不显示 API Key、Voice ID、App ID 或数字人 ID。
- 任一步失败时立即停止,保留已经成功的文件,并说明失败步骤和原始错误摘要。
- 只允许对发生临时网络错误的失败步骤自动重试一次;不得重跑已成功步骤。
最终验收:
- 确认三个正式文件都存在;
- 报告口播字符数、音频时长、视频时长、文件大小和总耗时;
- 确认视频为 1080×1920,并同时包含 H.264 视频流和 AAC 音频流;
- 最后只输出结果表和三个文件路径,不再生成其他版本。
3. 为什么一定要写“失败时只重试失败环节”
一条流水线里,文案几乎不花钱,语音费用较低,数字人视频通常更慢、消耗也更明显。 如果只在最后下载文件时失败,却把前面的步骤全部重跑一遍,就会多出重复音频、重复视频和额外费用。提示词要让豆包先找到失败步骤,只重跑这一段。4. 打开结果文件夹验收
本次豆包最终生成六个按顺序编号的文件,测试产物和正式产物都保留在同一个独立文件夹中。
最终验收结果放在下面。
|
项目
|
实测结果
|
|---|---|
|
正式口播
|
58 字(含标点)
|
|
正式音频
|
10.27 秒,167,604 B
|
|
正式视频
|
10.24 秒,8,250,407 B
|
|
画面
|
H.264,1080×1920
|
|
声音
|
AAC 音频流
|
|
总耗时
|
64.7 秒
|
八、常见问题与排查顺序
1. 智凌返回连接重置或超时 先检查公开链接能否在浏览器打开,再检查智凌服务是否可达。服务可达、凭证也存在时,只做一次带间隔的重试。不要因为智凌失败就重新生成声音和视频。 2. MiniMax 提示 401、无权限或找不到音色 先看 API Key 是否来自当前站点,再确认 Voice ID 属于同一个账号。接着检查音色是否仍然可用,账户有没有调用权限。不要把完整 Key 放进报错截图。 3. 声音生成了,但不是自己的音色 说明豆包选到了系统音色或另一个克隆音色。回到“我的音色”确认名称,在安全配置中指定正确 Voice ID,再只重跑 MiniMax 这一项。 4. 蝉镜一直显示处理中 数字人视频是异步任务,短片也可能需要几十秒。让豆包继续查询同一个任务,不要反复提交新任务。超过平台正常等待时间后,再检查任务状态和额度。 5. 蝉镜返回 10400 或 AccessToken 验证失败 先确认 App ID 和 Secret Key 来自同一个应用。让蝉镜 Skill 重新获取一次 AccessToken,再继续查询或提交当前步骤。刷新 Token 后不要继续使用旧值,也不要让多个任务同时重复获取 Token。 6. MP4 能打开,但没有声音 文件存在不代表成片完整。让豆包检查媒体流,至少应该同时看到视频流和音频流。本次实测是 H.264 + AAC。只有视频流时,回到上传音频或合成参数这一步排查。 7. 字幕位置过高、遮脸或被裁切 这类问题出在模板和画面布局上,API Key 不用动。先确认分辨率和方向,再调整字幕安全区、字号和数字人位置。 8. 豆包反复分析,却迟迟不执行 把任务拆短,并使用确定句式。MiniMax 这一步迟迟没有执行时,直接复制下面这段。请停止继续规划,当前只执行 MiniMax 语音生成这一步。
输入文案读取 output/04-final-script.txt,使用已经通过单测的克隆音色、speech-2.8-turbo 和 1.0 语速,输出到 output/05-final-voice.mp3。不要改写文案,不调用蝉镜,也不要创建其他文件。
如果输出文件已存在,停止并报告;如果调用失败,保留错误摘要并停止,不要自动更换模型、音色或平台。命令开始运行后再报告进度,完成后只报告文件路径、时长和大小。
豆包写出计划以后,任务还没完成。文件落盘、能打开并通过验收,这一步才算结束。
九、小白最适合的升级路线
第一条视频跑通后,也不要马上批量生成。按下面五级升级,哪里出问题都容易定位: 1、固定短句,反复测试同一个音色; 2、固定音频,比较不同数字人或基础、高质模型; 3、加入文案改写,但每次先由人确认最终稿; 4、把链接提取、改写、TTS、数字人串成单条稳定任务; 5、单条任务稳定后,再做批量选题、批量口播和定时执行。 每升一级都保留三个习惯。中间文件按顺序编号; 失败时只重试失败环节; 豆包报告完成后,人再打开最终文件验收。第一条十秒短片跑通以后,先把这六个编号文件留好。下一次换文案或人物时,哪一步出错就回到对应文件继续,不用整条任务从头再来。
文章版权声明:除非注明,否则均为AI虎哥的工具库原创文章,转载或复制请以超链接形式并注明出处。



还没有评论,来说两句吧...