最后更新:2026-09-04 00:01
实验6 声音克隆+语音识别¶
难度:★☆☆ | 预估时长:__ 分钟
6.1 实验目的¶
- 知识目标:了解语音识别、AI 音色克隆、文生音乐、AI 配音的基本原理,认识 TMSpeech、豆包、剪映、海绵音乐、讯飞智作、noiz.ai 等工具的功能定位与适用场景。
- 技能目标:能独立使用 TMSpeech / 豆包 APP 完成视频语音转文字;能用剪映替换 AI 音色(熊二)完成视频配音;能在海绵音乐平台 AI 写词并生成音乐;能用讯飞智作完成 AI 文案配音;能提取网络视频音频并在 noiz.ai 完成声音复刻;能按模板规范撰写 AI 音乐克隆项目报告。
- 素养目标:养成规范下载与解压素材、核对在线平台可用性(如 noiz.ai 解析失败重试)的工程习惯,提升融媒体 AIGC 音视频创作与文档总结能力。
6.2 实验环境¶
- 操作系统:Windows 10 或 Windows 11
- 软件工具:TMSpeech 语音转文字软件、剪映 6.0.1 免激活版、解压工具
- 移动设备:手机(安装豆包 APP)
- 在线平台:海绵音乐 haimian.com、讯飞配音 peiyin.xunfei.cn、noiz.ai、snapany.com 音频下载网站
- 浏览器:Chrome 浏览器
- 辅助工具:豆包大模型(文案创作、灵感词获取)
6.3 实验重难点¶
- 重点:电脑与手机端语音转文字操作;剪映 AI 音色切换配音;海绵音乐文生音乐创作;讯飞 AI 文案配音流程;noiz.ai 平台声音复刻完整步骤。
- 难点:抖音 / B 站视频音频素材提取下载;声音克隆片段选取与文字生成调试;noiz.ai 网页解析异常问题排查;按照规范格式完成 AI 音乐克隆项目报告撰写与问题分析。
6.4 实验内容¶
6.4.0 实验流程总览¶
graph LR
A[TMSpeech<br>录音转文字] --> B[豆包APP<br>会议纪要]
B --> C[剪映<br>AI音色配音]
C --> D[海绵音乐<br>文生音乐]
D --> E[讯飞智作<br>AI文案配音]
E --> F[声音复刻<br>noiz.ai]
F --> G[项目报告<br>撰写提交]
6.4.1 任务1:电脑端 TMSpeech 录音转文字¶
1. 任务描述
使用电脑端语音转文字软件,将指定视频文件实时转换为文字。
2. 实验步骤
- 步骤 1:双击打开课程资料文件夹,在 TMSpeech 语音转文字软件(请解压后运行).7z 文件上右键,选择解压;
- 步骤 2:进入解压后的文件夹,双击运行 TMSpeech.exe;
- 步骤 3:找到课堂播放的素材视频(参考演示),双击打开播放;
- 步骤 4:等待软件实时识别视频语音,自动完成录音转文字。
TMSpeech 是什么?
TMSpeech 就像一个"速记员":你播放一段视频,它把里面说的话实时听写下来,自动变成可以复制、编辑的文字稿。
常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)
- 若双击打不开:先确认已把 .7z 压缩包解压,再运行里面的 TMSpeech.exe,不要直接打开压缩包本身;
- 若识别不出声音:检查电脑默认录音/播放设备是否正常,确认视频本身带有声音轨。
6.4.2 任务2:手机端豆包语音转文字会议纪要¶
1. 任务描述
利用手机豆包 APP 录音纪要功能,识别课堂素材视频语音,生成中文会议记录。
2. 实验步骤
- 步骤 1:打开手机豆包 APP;
- 步骤 2:在 APP 内找到录音纪要功能入口;
- 步骤 3:导入课堂播放的素材视频;
- 步骤 4:选择中文识别模式,自动将视频发言转为文字纪要。
录音纪要是什么?
豆包的"录音纪要"就像一个"会议秘书":你给它一段录音或视频,它帮你把说的话整理成一段通顺的文字记录,省去自己边听边敲。
常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)
- 若识别不准:在 APP 内确认选择了"中文"识别模式,视频音量过低会导致识别不全;
- 若导入失败:确认视频格式受支持,或先转存为常见格式再导入。
6.4.3 任务3:剪映配音¶
1. 任务描述
解压安装剪映软件,导入视频素材,将视频原声替换为熊二 AI 音色。
2. 实验步骤
- 步骤 1:右键 剪映 6.0.1 版本免激活.rar,选择解压到当前文件夹;
- 步骤 2:打开解压后的「剪映 6.0.1 版本免激活」文件夹,双击启动软件;
- 步骤 3:点击开始创作,跳过新手教程;
- 步骤 4:将「素材视频.mp4」文件拖拽导入,点击右下角 + 号添加至下方轨道;
- 步骤 5:找到音频设置中的音色功能,在音色列表选择熊二;
- 步骤 6:应用音色效果,预览视频配音效果(电脑没有音响则听不到声音,属正常现象)。
AI 音色是什么?
AI 音色就像给视频"换嗓子":把原来的声音替换成熊二的声音,视频里说话的腔调就变了,但画面和字幕不变。
常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)
- 若找不到"音色"按钮:先在轨道选中视频片段,右侧才会显示音频设置与音色选项;
- 若听不到配音:教室电脑常无音响,属正常,不影响作业截图。
6.4.4 任务4:海绵音乐网站文生音乐创作¶
1. 任务描述
浏览器访问海绵音乐平台,注册登录后输入灵感词,借助 AI 写词并生成专属音乐。
2. 实验步骤
- 步骤 1:打开浏览器,地址栏输入 haimian.com 进入海绵音乐官网;
- 步骤 2:新用户完成账号注册并登录平台;
- 步骤 3:点击左侧创作功能,输入音乐灵感词语(可咨询豆包获取灵感);
- 步骤 4:单击AI 写词,下滑页面选择喜欢的歌词版本;
- 步骤 5:设置音乐风格,点击生成音乐,查看右上角生成进度圈;
- 步骤 6:生成完成后可在线试听,支持下载音频 / 视频、扫码分享、复制链接。
AI 写词是什么?
AI 写词就像一个"填词助手":你只给几个灵感词(比如"青春、海边、离别"),它帮你铺成一段完整押韵的歌词。
常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)
- 若生成失败:检查网络与登录状态,刷新页面重试;
- 若风格不满意:音乐风格设置会影响听感,可多试几版再下载,不要急着导出。
6.4.5 任务5:讯飞智作 AI 文案配音¶
1. 任务描述
访问讯飞配音官网,借助豆包创作解说文案,选择主播音色完成 AI 配音制作。
2. 实验步骤
- 步骤 1:浏览器输入 peiyin.xunfei.cn,进入讯飞智作配音官网;
- 步骤 2:选择AI 配音功能,进入制作页面;
- 步骤 3:打开豆包大模型,输入需求生成文案(如姆巴佩世界杯进球解说词);
参考(姆巴佩世界杯解说词示例): 球进啦!!姆巴佩!!风一样的速度撕裂防线,冷静推射破门!他张开双臂狂奔,全场山呼海啸!这就是超级巨星,这就是基利安・姆巴佩!伯纳乌为之沸腾,法兰西为之骄傲! 电光火石之间,姆巴佩如猎豹出鞘。单骑闯关,一剑封喉。皮球应声入网,少年意气风发。 短快燃句版(适合短视频):姆巴佩!破门!全场炸裂!/风驰电掣,一击制胜!姆巴佩,无解!/进球!欢呼!这就是姆巴佩时刻!
- 步骤 4:将生成的文案复制粘贴到讯飞配音文本框;
- 步骤 5:在主播列表自选适配音色,调整语速、情感等参数;
- 步骤 6:预览配音效果,确认无误后导出保存音频文件。
AI 配音是什么?
AI 配音就像请一位"播音员"念稿子:你把文案贴进去,它用选定的音色把文字读出来,比自己录音更标准、更省事。
常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)
- 若音色不合适:在主播列表多试几个,注意语速/情感参数;
- 若朗读异常:文案含特殊符号或多音字可能读错,先清理文本再生成。
6.4.6 任务6:在线平台声音复刻(芬达音色)¶
1. 任务描述
通过音频下载网站提取网络视频人声,使用 noiz.ai 平台完成声音克隆,生成芬达音色音频。
2. 实验步骤
6.4.6.1 素材获取¶
- 步骤 1:浏览器打开 snapany.com/zh/;
- 步骤 2:复制抖音、B站等平台的视频链接,粘贴至网站输入框;
- 步骤 3:点击提取素材,下载视频;
- 步骤 4:利用剪映软件,把视频导入后导出音频文件。
6.4.6.2 noiz.ai 平台声音复刻¶
注意:该平台存在网页解析失败、无法访问的情况,若出现报错可更换浏览器、刷新页面或切换网络重试。
- 步骤 1:浏览器打开 https://noiz.ai/tts/creation,使用任意邮箱注册账号(可自定义邮箱,密码统一设置为 12345678)并完成登录;
- 步骤 2:登录成功后,点击页面右上角免费开始,选择新建克隆声音功能;
- 步骤 3:上传刚刚剪映导出的 mp3 格式音频文件,点击下一步;
- 步骤 4:在文本输入框中输入测试文案(示例:你好我是芬达),确认参数无误后生成克隆音频;
- 步骤 5:在线试听生成的芬达音色音频,效果达标后下载保存至本地文件夹。
参考界面如下:
声音复刻是什么?
声音复刻就像一个"声音模仿秀":你给 AI 一段你的音频,它学会用你的声音说话,之后输入任意文字都能用这个声音读出来。
常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)
- 若 noiz.ai 打不开/解析失败:换浏览器、刷新或切换网络重试;
- 若上传报错:确认音频为 mp3 格式,时长适中、无过多杂音;
- 若登录异常:确认邮箱密码为统一设置的 12345678。
6.4.7 任务7:AI 音乐克隆项目报告撰写¶
1. 任务描述
按照固定模板规范填写项目报告,完整记录工具使用、操作步骤、成果截图、问题解决与实验总结,文件命名为班级_姓名.docx。
2. 实验步骤
- 步骤 1:打开课程下发的项目报告模板;
- 步骤 2:按模板逐项填写工具清单、操作步骤、成果截图、问题分析与实验总结;
- 步骤 3:将文件命名为「班级_姓名.docx」并保存。
项目报告是什么?
项目报告就像一次实验的"说明书":把用过的工具、做过的步骤、踩过的坑都记下来,方便自己复盘,也方便老师批改给分。
常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)
- 若忘记命名格式:文件必须命名为 班级_姓名.docx,否则作业无法对应到本人;
- 若漏填截图:每个工具至少附 1 张成果截图,避免报告内容空洞。
6.5 实验总结¶
本次实验掌握了以下要点:
- 一是认识了语音识别、音色克隆、文生音乐、AI 配音的原理,以及 TMSpeech、豆包、剪映、海绵音乐、讯飞智作、noiz.ai 等工具的功能定位(对应知识目标);
- 二是能独立完成视频语音转文字、剪映熊二音色配音、海绵音乐文生音乐、讯飞 AI 配音、noiz.ai 声音复刻,并按模板撰写项目报告(对应技能目标);
- 三是养成规范下载解压素材、核对平台可用性、独立排查问题的工程素养,提升了融媒体 AIGC 音视频创作与总结能力(对应素养目标)。
6.6 作业提交¶
- 提交地点:吾爱作业网
-
提交资料:
-
作业 1:海绵音乐生成截图 至少 1 张;
- 作业 2:按模板完整填写的AI 音乐克隆项目报告(命名格式:班级_姓名.docx)。
6.7 知识检测¶
- [ ] (填空)把电脑端视频语音实时转成文字的软件是 TMSpeech;手机端用豆包 APP 的录音纪要功能。
- [ ] (填空)在剪映中把视频原声替换成"熊二"声音,使用的是音频设置里的音色功能。
- [ ] (选择)在 noiz.ai 平台进行声音复刻时,上传的音频推荐使用哪种格式?
- A. mp4 B. mp3 C. docx D. png
查看解析
正确答案:B。noiz.ai 声音复刻一般要求上传 mp3 格式音频,时长适中、清晰无杂音效果更好。
- [ ] (填空)AI 音乐克隆项目报告的文件命名格式为 班级_姓名.docx。
本课相关资源¶
| 序号 | 资源名称 | 类型 | 说明 |
|---|---|---|---|
| 1 | 实验6 AIGC音频与视频创作实操.docx | Word | 实验原始文档 |
| 2 | ai音乐克隆报告模板.docx | Word | 文档素材 |
| 3 | TMSpeech 语音转文字软件(请解压后运行).7z | 7Z | 学习素材/数据集 |
| 4 | 剪映6.0.1版本免激活.rar | RAR | 学习素材/数据集 |
| 5 | 实验6 声音克隆+语音识别.zip | ZIP | 学习素材/数据集 |
| 6 | 成品效果一览 .mp3 | 音频 | 音频素材 |
| 7 | 素材视频.mp4 | 视频 | 操作演示 |
| 8 | 芬达原音.mp3 | 音频 | 音频素材 |
实验素材下载
点击下方链接获取本节课全部资源(含课件、任务清单、安装包等): 🔗 夸克网盘







