如何制作抖音热门的“聊天记录唱歌”视频?AI工具完整教程

聊天记录唱歌视频制作示意图

使用大模型整理聊天文本并生成对话歌曲:从文本清洗到视频剪辑

前言

本文记录一种 AI 内容生成实践:先将聊天文本整理为适合演唱的对话歌词,再通过音乐生成工具完成歌曲,最后在视频编辑器中同步聊天气泡、字幕和音频。

整个过程主要包括四个环节:

  1. 获取并筛选聊天文本;
  2. 使用大语言模型清洗和格式化文本;
  3. 使用 AI 音乐工具生成对话歌曲;
  4. 在视频编辑器中完成音画同步。

本文以 ChatGPT、妙响和剪映作为操作示例,也可以使用具有相同功能的其他工具完成。

一、整理原始聊天文本

首先从聊天软件中复制需要处理的对话。为了方便后续生成歌曲,原始文本最好具备以下特点:

  • 对话双方的身份清楚;
  • 每句话长度适中;
  • 对话顺序完整;
  • 内容包含明确的情绪变化;
  • 没有与主题无关的系统提示。

处理真实聊天内容时,应先删除姓名、头像、电话号码、地址、订单号等个人信息。涉及其他人的对话,公开使用前还应取得相应授权。

二、使用大语言模型清洗文本

聊天记录中通常包含日期、时间、昵称和系统提示。这些内容如果直接作为歌词输入,可能影响歌曲生成结果,因此需要进行清洗。

可以将聊天文本发送给 ChatGPT,并使用下面的提示词:

请整理下面的聊天记录,使其适合作为一首男女对话歌曲的歌词。

处理要求:
1. 删除日期、时间、姓名、昵称和系统提示;
2. 保留原始对话顺序和原意;
3. 不要增加原文中不存在的内容;
4. 保留自然的口语表达;
5. 将双方分别标记为[女声]和[男声];
6. 每句话单独一行;
7. 对过长的句子进行自然断句;
8. 最后只输出整理后的完整歌词。

原始聊天记录:

【在这里粘贴聊天记录】

整理后的文本可以采用下面的结构:

[女声]
你有没有看到我刚才发的消息?

[男声]
看到了,我刚才正在整理文件。

[女声]
那你为什么一直没有回复?

[男声]
我本来想忙完以后认真回答。

使用 [女声][男声] 标签,可以帮助音乐生成模型理解角色切换。如果工具不能识别中文标签,也可以尝试使用 [Female][Male]

三、检查和压缩歌词

大语言模型整理完成后,不建议立即生成音乐,还需要人工检查一次。

主要检查以下内容:

  • 是否仍然包含姓名或其他个人信息;
  • 对话顺序是否正确;
  • 是否出现模型自行补充的句子;
  • 单句是否过长;
  • 两个角色的标签是否一致;
  • 是否存在重复但没有实际作用的对话。

对于较长的聊天记录,可以删除重复句子,只保留推动对话发展的内容。这样可以减少演唱节奏混乱,也能让歌曲结构更加紧凑。

四、生成对话歌曲

打开 AI 音乐创作工具,进入支持完整歌词和风格描述的创作模式。本文示例使用妙响的专业创作功能。

在歌词区域粘贴清洗后的完整对话,在音乐风格区域输入希望采用的曲风、节奏、乐器和演唱方式。

本次使用的音乐风格提示词如下:

Black Gospel Funk, bouncy mid-tempo groove, thick slapping funk bass, punchy brass stabs, warm vintage gospel organ, crisp tight funk drum breaks, clean rhythm funk guitar, male & female call-and-response duet vocals, soulful gospel ad-libs and vocal runs, light backing choir harmonies, comedic conversational storytelling mood, playful contrast between upset female lead and sales-obsessed male lead, retro 70s black funk gospel production, dynamic vocal delivery for dialogue sections

这段提示词主要定义了以下音乐特征:

  • 中速、具有弹性的放克节奏;
  • Slap Bass、铜管、风琴、鼓组和节奏吉他;
  • 男女声交替演唱;
  • 福音风格的转音与背景和声;
  • 对话式叙事和较明显的情绪反差;
  • 复古的 20 世纪 70 年代放克制作质感。

音乐生成具有一定随机性,可以生成多个版本并进行比较。选择时重点检查:

  1. 对话内容是否能够听清;
  2. 两个角色是否正确切换;
  3. 句子之间是否存在明显断裂;
  4. 音乐节奏是否与对话情绪一致;
  5. 歌曲长度是否符合后续剪辑需要。

五、在视频编辑器中进行音画同步

歌曲生成完成后,将音频导入剪映或其他视频编辑器,再根据演唱时间添加聊天画面。

1. 创建项目

根据最终使用场景设置画面比例,然后将音频添加到时间轴。建议先完成音频剪切,再处理聊天气泡,避免后续频繁调整画面位置。

2. 制作聊天气泡

可以使用经过匿名处理的截图,也可以在编辑器中重新制作聊天界面。重新制作的方式更容易控制字体、颜色、位置和出现时间。

一种简单的布局方式是:

  • 女声对话显示在左侧;
  • 男声对话显示在右侧;
  • 当前演唱的句子使用高亮颜色;
  • 已经唱完的句子降低亮度;
  • 每次只突出一条主要信息。

3. 对齐音频

播放音频,在每句话开始的位置添加标记,再让对应的聊天气泡出现在标记位置。

如果某句话语速较快,可以将整句话拆成两行显示。如果存在较长的转音,可以适当延长聊天气泡的停留时间。

4. 添加字幕

可以先使用自动字幕功能识别音频,再逐句检查。对话歌曲中可能存在转音、合唱和角色交替,自动识别结果通常还需要人工修正。

六、常见问题

1. 模型把角色唱反了

检查每一段之前是否都有统一的角色标签。也可以缩短连续对话,并避免在同一段中频繁切换角色。

2. 部分文字没有被唱出来

可能是单句过长或歌词总量过大。可以缩短句子、删除重复内容,或者把较长文本分成两次生成。

3. 演唱内容不清楚

减少背景合唱和复杂转音,并在风格提示词中增加 clear vocal articulationclear dialogue vocals

4. 音乐与对话情绪不一致

在风格提示词中明确说明速度、情绪和角色关系。例如使用 calmtenseplayfuldramatic 等情绪描述。

七、流程总结

复制聊天文本
      ↓
删除时间、姓名和系统提示
      ↓
使用大语言模型整理角色与句子
      ↓
人工检查并压缩歌词
      ↓
输入歌词和音乐风格提示词
      ↓
生成并选择合适的歌曲
      ↓
导入视频编辑器
      ↓
同步聊天气泡、字幕和音频
      ↓
检查隐私信息并导出成片

总结

将聊天文本制作成对话歌曲,本质上是一个由文本预处理、音乐生成和视频剪辑组成的工作流。大语言模型主要负责清洗和格式化文本,音乐模型负责生成旋律与人声,视频编辑器则负责最终的视觉呈现。

为了获得稳定的结果,重点应放在三个方面:保持歌词结构清晰、明确区分演唱角色,以及让聊天画面与音频准确同步。同时,处理真实聊天记录时应始终注意个人隐私和内容授权。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐