五步制作抖音热门“聊天记录唱歌”视频
如何制作抖音热门的“聊天记录唱歌”视频?AI工具完整教程

使用大模型整理聊天文本并生成对话歌曲:从文本清洗到视频剪辑
前言
本文记录一种 AI 内容生成实践:先将聊天文本整理为适合演唱的对话歌词,再通过音乐生成工具完成歌曲,最后在视频编辑器中同步聊天气泡、字幕和音频。
整个过程主要包括四个环节:
- 获取并筛选聊天文本;
- 使用大语言模型清洗和格式化文本;
- 使用 AI 音乐工具生成对话歌曲;
- 在视频编辑器中完成音画同步。
本文以 ChatGPT、妙响和剪映作为操作示例,也可以使用具有相同功能的其他工具完成。
一、整理原始聊天文本
首先从聊天软件中复制需要处理的对话。为了方便后续生成歌曲,原始文本最好具备以下特点:
- 对话双方的身份清楚;
- 每句话长度适中;
- 对话顺序完整;
- 内容包含明确的情绪变化;
- 没有与主题无关的系统提示。
处理真实聊天内容时,应先删除姓名、头像、电话号码、地址、订单号等个人信息。涉及其他人的对话,公开使用前还应取得相应授权。
二、使用大语言模型清洗文本
聊天记录中通常包含日期、时间、昵称和系统提示。这些内容如果直接作为歌词输入,可能影响歌曲生成结果,因此需要进行清洗。
可以将聊天文本发送给 ChatGPT,并使用下面的提示词:
请整理下面的聊天记录,使其适合作为一首男女对话歌曲的歌词。
处理要求:
1. 删除日期、时间、姓名、昵称和系统提示;
2. 保留原始对话顺序和原意;
3. 不要增加原文中不存在的内容;
4. 保留自然的口语表达;
5. 将双方分别标记为[女声]和[男声];
6. 每句话单独一行;
7. 对过长的句子进行自然断句;
8. 最后只输出整理后的完整歌词。
原始聊天记录:
【在这里粘贴聊天记录】
整理后的文本可以采用下面的结构:
[女声]
你有没有看到我刚才发的消息?
[男声]
看到了,我刚才正在整理文件。
[女声]
那你为什么一直没有回复?
[男声]
我本来想忙完以后认真回答。
使用 [女声] 和 [男声] 标签,可以帮助音乐生成模型理解角色切换。如果工具不能识别中文标签,也可以尝试使用 [Female] 和 [Male]。
三、检查和压缩歌词
大语言模型整理完成后,不建议立即生成音乐,还需要人工检查一次。
主要检查以下内容:
- 是否仍然包含姓名或其他个人信息;
- 对话顺序是否正确;
- 是否出现模型自行补充的句子;
- 单句是否过长;
- 两个角色的标签是否一致;
- 是否存在重复但没有实际作用的对话。
对于较长的聊天记录,可以删除重复句子,只保留推动对话发展的内容。这样可以减少演唱节奏混乱,也能让歌曲结构更加紧凑。
四、生成对话歌曲
打开 AI 音乐创作工具,进入支持完整歌词和风格描述的创作模式。本文示例使用妙响的专业创作功能。
在歌词区域粘贴清洗后的完整对话,在音乐风格区域输入希望采用的曲风、节奏、乐器和演唱方式。
本次使用的音乐风格提示词如下:
Black Gospel Funk, bouncy mid-tempo groove, thick slapping funk bass, punchy brass stabs, warm vintage gospel organ, crisp tight funk drum breaks, clean rhythm funk guitar, male & female call-and-response duet vocals, soulful gospel ad-libs and vocal runs, light backing choir harmonies, comedic conversational storytelling mood, playful contrast between upset female lead and sales-obsessed male lead, retro 70s black funk gospel production, dynamic vocal delivery for dialogue sections
这段提示词主要定义了以下音乐特征:
- 中速、具有弹性的放克节奏;
- Slap Bass、铜管、风琴、鼓组和节奏吉他;
- 男女声交替演唱;
- 福音风格的转音与背景和声;
- 对话式叙事和较明显的情绪反差;
- 复古的 20 世纪 70 年代放克制作质感。
音乐生成具有一定随机性,可以生成多个版本并进行比较。选择时重点检查:
- 对话内容是否能够听清;
- 两个角色是否正确切换;
- 句子之间是否存在明显断裂;
- 音乐节奏是否与对话情绪一致;
- 歌曲长度是否符合后续剪辑需要。
五、在视频编辑器中进行音画同步
歌曲生成完成后,将音频导入剪映或其他视频编辑器,再根据演唱时间添加聊天画面。
1. 创建项目
根据最终使用场景设置画面比例,然后将音频添加到时间轴。建议先完成音频剪切,再处理聊天气泡,避免后续频繁调整画面位置。
2. 制作聊天气泡
可以使用经过匿名处理的截图,也可以在编辑器中重新制作聊天界面。重新制作的方式更容易控制字体、颜色、位置和出现时间。
一种简单的布局方式是:
- 女声对话显示在左侧;
- 男声对话显示在右侧;
- 当前演唱的句子使用高亮颜色;
- 已经唱完的句子降低亮度;
- 每次只突出一条主要信息。
3. 对齐音频
播放音频,在每句话开始的位置添加标记,再让对应的聊天气泡出现在标记位置。
如果某句话语速较快,可以将整句话拆成两行显示。如果存在较长的转音,可以适当延长聊天气泡的停留时间。
4. 添加字幕
可以先使用自动字幕功能识别音频,再逐句检查。对话歌曲中可能存在转音、合唱和角色交替,自动识别结果通常还需要人工修正。
六、常见问题
1. 模型把角色唱反了
检查每一段之前是否都有统一的角色标签。也可以缩短连续对话,并避免在同一段中频繁切换角色。
2. 部分文字没有被唱出来
可能是单句过长或歌词总量过大。可以缩短句子、删除重复内容,或者把较长文本分成两次生成。
3. 演唱内容不清楚
减少背景合唱和复杂转音,并在风格提示词中增加 clear vocal articulation 或 clear dialogue vocals。
4. 音乐与对话情绪不一致
在风格提示词中明确说明速度、情绪和角色关系。例如使用 calm、tense、playful 或 dramatic 等情绪描述。
七、流程总结
复制聊天文本
↓
删除时间、姓名和系统提示
↓
使用大语言模型整理角色与句子
↓
人工检查并压缩歌词
↓
输入歌词和音乐风格提示词
↓
生成并选择合适的歌曲
↓
导入视频编辑器
↓
同步聊天气泡、字幕和音频
↓
检查隐私信息并导出成片
总结
将聊天文本制作成对话歌曲,本质上是一个由文本预处理、音乐生成和视频剪辑组成的工作流。大语言模型主要负责清洗和格式化文本,音乐模型负责生成旋律与人声,视频编辑器则负责最终的视觉呈现。
为了获得稳定的结果,重点应放在三个方面:保持歌词结构清晰、明确区分演唱角色,以及让聊天画面与音频准确同步。同时,处理真实聊天记录时应始终注意个人隐私和内容授权。
更多推荐

所有评论(0)