跳转至

最后更新:2026-09-04 00:01

实验6 声音克隆+语音识别

难度:★☆☆ | 预估时长:__ 分钟

6.1 实验目的

  • 知识目标:了解语音识别、AI 音色克隆、文生音乐、AI 配音的基本原理,认识 TMSpeech、豆包、剪映、海绵音乐、讯飞智作、noiz.ai 等工具的功能定位与适用场景。
  • 技能目标:能独立使用 TMSpeech / 豆包 APP 完成视频语音转文字;能用剪映替换 AI 音色(熊二)完成视频配音;能在海绵音乐平台 AI 写词并生成音乐;能用讯飞智作完成 AI 文案配音;能提取网络视频音频并在 noiz.ai 完成声音复刻;能按模板规范撰写 AI 音乐克隆项目报告。
  • 素养目标:养成规范下载与解压素材、核对在线平台可用性(如 noiz.ai 解析失败重试)的工程习惯,提升融媒体 AIGC 音视频创作与文档总结能力。

6.2 实验环境

  1. 操作系统:Windows 10 或 Windows 11
  2. 软件工具:TMSpeech 语音转文字软件、剪映 6.0.1 免激活版、解压工具
  3. 移动设备:手机(安装豆包 APP)
  4. 在线平台:海绵音乐 haimian.com、讯飞配音 peiyin.xunfei.cn、noiz.ai、snapany.com 音频下载网站
  5. 浏览器:Chrome 浏览器
  6. 辅助工具:豆包大模型(文案创作、灵感词获取)

6.3 实验重难点

  • 重点:电脑与手机端语音转文字操作;剪映 AI 音色切换配音;海绵音乐文生音乐创作;讯飞 AI 文案配音流程;noiz.ai 平台声音复刻完整步骤。
  • 难点:抖音 / B 站视频音频素材提取下载;声音克隆片段选取与文字生成调试;noiz.ai 网页解析异常问题排查;按照规范格式完成 AI 音乐克隆项目报告撰写与问题分析。

6.4 实验内容

6.4.0 实验流程总览

graph LR
    A[TMSpeech<br>录音转文字] --> B[豆包APP<br>会议纪要]
    B --> C[剪映<br>AI音色配音]
    C --> D[海绵音乐<br>文生音乐]
    D --> E[讯飞智作<br>AI文案配音]
    E --> F[声音复刻<br>noiz.ai]
    F --> G[项目报告<br>撰写提交]

6.4.1 任务1:电脑端 TMSpeech 录音转文字

1. 任务描述

使用电脑端语音转文字软件,将指定视频文件实时转换为文字。

2. 实验步骤

TMSpeech解压运行

图 6-1:TMSpeech 解压后双击运行
  • 步骤 3:找到课堂播放的素材视频(参考演示),双击打开播放;
  • 步骤 4:等待软件实时识别视频语音,自动完成录音转文字。

TMSpeech 是什么?

TMSpeech 就像一个"速记员":你播放一段视频,它把里面说的话实时听写下来,自动变成可以复制、编辑的文字稿。

常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)

  • 若双击打不开:先确认已把 .7z 压缩包解压,再运行里面的 TMSpeech.exe,不要直接打开压缩包本身;
  • 若识别不出声音:检查电脑默认录音/播放设备是否正常,确认视频本身带有声音轨。

6.4.2 任务2:手机端豆包语音转文字会议纪要

1. 任务描述

利用手机豆包 APP 录音纪要功能,识别课堂素材视频语音,生成中文会议记录。

2. 实验步骤

  • 步骤 1:打开手机豆包 APP;
  • 步骤 2:在 APP 内找到录音纪要功能入口;
  • 步骤 3:导入课堂播放的素材视频;
  • 步骤 4:选择中文识别模式,自动将视频发言转为文字纪要。

录音纪要是什么?

豆包的"录音纪要"就像一个"会议秘书":你给它一段录音或视频,它帮你把说的话整理成一段通顺的文字记录,省去自己边听边敲。

常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)

  • 若识别不准:在 APP 内确认选择了"中文"识别模式,视频音量过低会导致识别不全;
  • 若导入失败:确认视频格式受支持,或先转存为常见格式再导入。

6.4.3 任务3:剪映配音

1. 任务描述

解压安装剪映软件,导入视频素材,将视频原声替换为熊二 AI 音色。

2. 实验步骤

  • 步骤 1:右键 剪映 6.0.1 版本免激活.rar,选择解压到当前文件夹;
  • 步骤 2:打开解压后的「剪映 6.0.1 版本免激活」文件夹,双击启动软件;

剪映解压后文件夹

图 6-2:剪映解压后的文件夹
  • 步骤 3:点击开始创作,跳过新手教程;
  • 步骤 4:将「素材视频.mp4」文件拖拽导入,点击右下角 + 号添加至下方轨道;
  • 步骤 5:找到音频设置中的音色功能,在音色列表选择熊二

选择熊二音色

图 6-3:在音色列表选择「熊二」
  • 步骤 6:应用音色效果,预览视频配音效果(电脑没有音响则听不到声音,属正常现象)。

AI 音色是什么?

AI 音色就像给视频"换嗓子":把原来的声音替换成熊二的声音,视频里说话的腔调就变了,但画面和字幕不变。

常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)

  • 若找不到"音色"按钮:先在轨道选中视频片段,右侧才会显示音频设置与音色选项;
  • 若听不到配音:教室电脑常无音响,属正常,不影响作业截图。

6.4.4 任务4:海绵音乐网站文生音乐创作

1. 任务描述

浏览器访问海绵音乐平台,注册登录后输入灵感词,借助 AI 写词并生成专属音乐。

2. 实验步骤

  • 步骤 1:打开浏览器,地址栏输入 haimian.com 进入海绵音乐官网;
  • 步骤 2:新用户完成账号注册并登录平台;
  • 步骤 3:点击左侧创作功能,输入音乐灵感词语(可咨询豆包获取灵感);
  • 步骤 4:单击AI 写词,下滑页面选择喜欢的歌词版本;
  • 步骤 5:设置音乐风格,点击生成音乐,查看右上角生成进度圈;

生成进度圈

图 6-4:查看生成进度圈
  • 步骤 6:生成完成后可在线试听,支持下载音频 / 视频、扫码分享、复制链接。

AI 写词是什么?

AI 写词就像一个"填词助手":你只给几个灵感词(比如"青春、海边、离别"),它帮你铺成一段完整押韵的歌词。

常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)

  • 若生成失败:检查网络与登录状态,刷新页面重试;
  • 若风格不满意:音乐风格设置会影响听感,可多试几版再下载,不要急着导出。

6.4.5 任务5:讯飞智作 AI 文案配音

1. 任务描述

访问讯飞配音官网,借助豆包创作解说文案,选择主播音色完成 AI 配音制作。

2. 实验步骤

  • 步骤 1:浏览器输入 peiyin.xunfei.cn,进入讯飞智作配音官网;
  • 步骤 2:选择AI 配音功能,进入制作页面;

讯飞AI配音制作页

图 6-5:讯飞智作 AI 配音制作页面
  • 步骤 3:打开豆包大模型,输入需求生成文案(如姆巴佩世界杯进球解说词);

参考(姆巴佩世界杯解说词示例): 球进啦!!姆巴佩!!风一样的速度撕裂防线,冷静推射破门!他张开双臂狂奔,全场山呼海啸!这就是超级巨星,这就是基利安・姆巴佩!伯纳乌为之沸腾,法兰西为之骄傲! 电光火石之间,姆巴佩如猎豹出鞘。单骑闯关,一剑封喉。皮球应声入网,少年意气风发。 短快燃句版(适合短视频):姆巴佩!破门!全场炸裂!/风驰电掣,一击制胜!姆巴佩,无解!/进球!欢呼!这就是姆巴佩时刻!

  • 步骤 4:将生成的文案复制粘贴到讯飞配音文本框;
  • 步骤 5:在主播列表自选适配音色,调整语速、情感等参数;
  • 步骤 6:预览配音效果,确认无误后导出保存音频文件。

AI 配音是什么?

AI 配音就像请一位"播音员"念稿子:你把文案贴进去,它用选定的音色把文字读出来,比自己录音更标准、更省事。

常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)

  • 若音色不合适:在主播列表多试几个,注意语速/情感参数;
  • 若朗读异常:文案含特殊符号或多音字可能读错,先清理文本再生成。

6.4.6 任务6:在线平台声音复刻(芬达音色)

1. 任务描述

通过音频下载网站提取网络视频人声,使用 noiz.ai 平台完成声音克隆,生成芬达音色音频。

2. 实验步骤

6.4.6.1 素材获取

  • 步骤 1:浏览器打开 snapany.com/zh/;

snapany下载站

图 6-6:snapany 音频下载网站
  • 步骤 2:复制抖音、B站等平台的视频链接,粘贴至网站输入框;
  • 步骤 3:点击提取素材,下载视频;

提取素材下载

图 6-7:提取并下载视频素材
  • 步骤 4:利用剪映软件,把视频导入后导出音频文件。

6.4.6.2 noiz.ai 平台声音复刻

注意:该平台存在网页解析失败、无法访问的情况,若出现报错可更换浏览器、刷新页面或切换网络重试。

  • 步骤 1:浏览器打开 https://noiz.ai/tts/creation,使用任意邮箱注册账号(可自定义邮箱,密码统一设置为 12345678)并完成登录;
  • 步骤 2:登录成功后,点击页面右上角免费开始,选择新建克隆声音功能;
  • 步骤 3:上传刚刚剪映导出的 mp3 格式音频文件,点击下一步;
  • 步骤 4:在文本输入框中输入测试文案(示例:你好我是芬达),确认参数无误后生成克隆音频;
  • 步骤 5:在线试听生成的芬达音色音频,效果达标后下载保存至本地文件夹。

参考界面如下:

noiz.ai操作界面

图 6-8:noiz.ai 声音复刻操作界面

声音复刻是什么?

声音复刻就像一个"声音模仿秀":你给 AI 一段你的音频,它学会用你的声音说话,之后输入任意文字都能用这个声音读出来。

常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)

  • 若 noiz.ai 打不开/解析失败:换浏览器、刷新或切换网络重试;
  • 若上传报错:确认音频为 mp3 格式,时长适中、无过多杂音;
  • 若登录异常:确认邮箱密码为统一设置的 12345678。

6.4.7 任务7:AI 音乐克隆项目报告撰写

1. 任务描述

按照固定模板规范填写项目报告,完整记录工具使用、操作步骤、成果截图、问题解决与实验总结,文件命名为班级_姓名.docx

2. 实验步骤

  • 步骤 1:打开课程下发的项目报告模板;
  • 步骤 2:按模板逐项填写工具清单、操作步骤、成果截图、问题分析与实验总结;
  • 步骤 3:将文件命名为「班级_姓名.docx」并保存。

项目报告是什么?

项目报告就像一次实验的"说明书":把用过的工具、做过的步骤、踩过的坑都记下来,方便自己复盘,也方便老师批改给分。

常见错误与排错(必填项;无坑则填 本任务常规操作即可,如无报错可跳过)

  • 若忘记命名格式:文件必须命名为 班级_姓名.docx,否则作业无法对应到本人;
  • 若漏填截图:每个工具至少附 1 张成果截图,避免报告内容空洞。

6.5 实验总结

本次实验掌握了以下要点:

  1. 一是认识了语音识别、音色克隆、文生音乐、AI 配音的原理,以及 TMSpeech、豆包、剪映、海绵音乐、讯飞智作、noiz.ai 等工具的功能定位(对应知识目标);
  2. 二是能独立完成视频语音转文字、剪映熊二音色配音、海绵音乐文生音乐、讯飞 AI 配音、noiz.ai 声音复刻,并按模板撰写项目报告(对应技能目标);
  3. 三是养成规范下载解压素材、核对平台可用性、独立排查问题的工程素养,提升了融媒体 AIGC 音视频创作与总结能力(对应素养目标)。

6.6 作业提交

  1. 提交地点:吾爱作业网
  2. 提交资料:

  3. 作业 1:海绵音乐生成截图 至少 1 张;

  4. 作业 2:按模板完整填写的AI 音乐克隆项目报告(命名格式:班级_姓名.docx)。

6.7 知识检测

  • [ ] (填空)把电脑端视频语音实时转成文字的软件是 TMSpeech;手机端用豆包 APP 的录音纪要功能。
  • [ ] (填空)在剪映中把视频原声替换成"熊二"声音,使用的是音频设置里的音色功能。
  • [ ] (选择)在 noiz.ai 平台进行声音复刻时,上传的音频推荐使用哪种格式?
    • A. mp4 B. mp3 C. docx D. png
查看解析

正确答案:B。noiz.ai 声音复刻一般要求上传 mp3 格式音频,时长适中、清晰无杂音效果更好。

  • [ ] (填空)AI 音乐克隆项目报告的文件命名格式为 班级_姓名.docx

本课相关资源

序号 资源名称 类型 说明
1 实验6 AIGC音频与视频创作实操.docx Word 实验原始文档
2 ai音乐克隆报告模板.docx Word 文档素材
3 TMSpeech 语音转文字软件(请解压后运行).7z 7Z 学习素材/数据集
4 剪映6.0.1版本免激活.rar RAR 学习素材/数据集
5 实验6 声音克隆+语音识别.zip ZIP 学习素材/数据集
6 成品效果一览 .mp3 音频 音频素材
7 素材视频.mp4 视频 操作演示
8 芬达原音.mp3 音频 音频素材

实验素材下载

点击下方链接获取本节课全部资源(含课件、任务清单、安装包等): 🔗 夸克网盘

本站总访问 次 | 访客 人 | 本页阅读