概述
AI Music Video Query 生成系统 (简称 aimv) 是一个将歌曲音频转换为结构化视觉检索 Query 的智能系统。用户只需上传一首歌曲,系统会自动完成从歌词识别、歌词库匹配、视觉规划到多候选 Query 生成的全流程。
解决的问题
- ASR 识别错误 - 自动语音识别容易出错,影响画面理解
- 歌词抽象难视觉化 - 思念、遗憾等抽象歌词难以转成具体画面
- 视觉风格不统一 - 同一首歌每句歌词风格割裂,缺乏整体感
- 重复歌词处理 - 副歌重复时使用相同画面,显得单调
- 伴奏段缺失 - 前奏、间奏、尾奏不知道用什么画面
- 效率低下 - 手动为每句歌词想检索词耗时巨大
核心能力
1. 智能歌词匹配
系统首先进行 ASR 歌词识别,然后通过 RAG 技术在歌词库中检索完整标准歌词。当相似度超过阈值(默认 0.85)时,自动用标准歌词替换 ASR 结果。
2. 全局视觉规划
在生成逐句 Query 前,系统先分析整首歌的视觉统一方案,包括主题、情绪曲线、视觉风格、色调、场景池等。
3. 多候选 Query 生成
为每句歌词生成 3 个不同角度的候选 Query:字面叙事、情绪氛围、具象隐喻。
4. 重复歌词差异化
同一句歌词多次出现时,系统自动生成不同视觉角度:第1次建立人物和场景,第2次强化动作和情绪,第3次转向特写,最后1次远景/背影/空镜收束。
5. 伴奏段 Query
前奏、间奏、尾奏等无歌词段也能生成独立 Query,基于全局视觉风格和上下文生成过渡画面。
技术栈
- Python 3.10+ - 主语言
- FastAPI - Web 框架
- Pydantic - 数据验证
- DashScope API - 通义千问 AI 能力
- 阿里云 OSS - 文件存储
产品背景
在音乐视频、歌词视频、MV 混剪、AI 视频生成等场景中,创作者面临一个核心痛点:如何高效地将歌曲的情感和内容转化为具体的视觉画面?
传统方式需要人工逐句分析歌词、搜索素材、规划分镜,耗时巨大且风格难以统一。随着 AIGC 技术的发展,AI 生成视频正在成为内容创作的主流方式,但如何让 AI 准确理解歌曲意图并生成匹配的视觉内容,成为关键瓶颈。
产品价值
解决问题 → 方案 → 价值
通过 AI 自动化歌词分析和视觉 Query 生成,让创作者专注于创意本身,而非机械性的素材检索工作。
- ASR 识别错误 → 歌词库 RAG 匹配 → 歌词准确率提升至 92%+
- 歌词抽象难视觉化 → 全局视觉规划 + 多路径 Query 生成 → 每句歌词 3 个候选检索词
- 视觉风格不统一 → 全局视觉规划约束 → 整首歌风格一致性
- 重复歌词处理 → 差异化策略 → 副歌每次出现都有新视觉角度
- 伴奏段缺失 → 独立 Query 生成 → 前奏/间奏/尾奏全覆盖
- 效率低下 → 全流程自动化 → 5 分钟歌曲处理 < 2 分钟
目标用户
核心用户画像
短视频创作者(30%)、MV 剪辑师(25%)、AIGC 视频平台(20%)、素材库运营(15%)、内容审核编辑(10%)
用户场景
- 短视频创作者:需要快速生成歌词卡点素材检索词,提升内容产出效率
- MV 剪辑师:需要歌词分镜和素材方向参考,缩短策划周期
- AIGC 视频平台:需要将音乐自动转成视觉脚本,对接 AI 生成 API
- 素材库运营:需要根据歌曲内容推荐库内素材,提升素材利用率
核心功能
1. 智能歌词识别与匹配
ASR 识别 + 歌词库 RAG 双重保障。当相似度 ≥ 0.85 时自动替换为标准歌词,确保歌词准确。匹配成功后不混用 ASR 和标准歌词,保证歌词来源一致性。
2. 全局视觉规划
在生成逐句 Query 前,先分析整首歌的视觉统一方案。包括:主题、核心情绪、情绪曲线、视觉风格、色调、场景池、人物策略、镜头语言、剪辑节奏。
3. 多候选 Query 生成
为每句歌词生成 3 个不同角度的候选 Query:字面叙事(直接画面命中)、情绪氛围(具象隐喻)、特写空镜(道具/环境)。Query 必须符合句式结构:【主体】在【场景】【做什么】,【视觉细节】,【氛围修饰】。
4. 重复歌词差异化
同一句歌词多次出现时,采用递进策略:第 1 次建立人物和场景,第 2 次强化动作和情绪,第 3 次转向特写,最后 1 次远景/背影/空镜收束。
5. 伴奏段 Query
前奏/间奏/尾奏等无歌词段,基于全局视觉风格和上下文生成过渡画面。生成方向:前奏建立场景,副歌后间奏情绪释放,尾奏留白收束。
6. 镜头建议与情绪标签
每个歌词段/伴奏段输出:镜头类型(特写/近景/中景/远景)、运镜方式(固定/推近/横移/跟拍)、构图方式、灯光氛围、素材类型、情绪标签和强度(1-5分)。
产品路线图
P0 - MVP(M1)
- 音频上传与 ASR 识别
- 歌词库 RAG 匹配与标准歌词替换
- 时间轴对齐
- 歌词 Query 生成与 JSON 输出
P1 - 完整视觉能力(M2)
- 全局视觉规划
- 伴奏段 Query 生成
- 重复歌词差异化
- 镜头建议与情绪标签
P2 - 素材库适配(M3)
- 接入素材库摘要,生成更容易命中的 Query
- 支持用户指定视觉偏好
- Query 质量自动校验和修复
P3 - 自动化与多模态(M4)
- 自动选择最终素材
- 自动生成完整分镜视频
- 支持多语言歌词
技术架构
核心流程
音频上传 → ASR 识别 → 歌词清洗 → 歌词库匹配 → 标准歌词替换 → 时间轴对齐 → 歌曲结构识别 → 全局视觉规划 → 逐句 Query 生成 → 重复歌词差异化 → 视觉校验 → Query 格式校验 → 输出 JSON
核心模块
- ASR Service - 调用 ASR API 识别音频歌词
- ASR Postprocess - 清洗 ASR 结果,修正明显错误
- Lyrics RAG Service - 歌词库检索,返回完整标准歌词
- Match Decision - 判断相似度是否超过阈值
- Timestamp Alignment - 将标准歌词对齐到时间轴
- Query Generation - 生成多候选视觉 Query
技术选型
- FastAPI + Uvicorn - 高性能异步 Web 框架,支持 async/await
- Pydantic - 强类型数据验证,保证 API 输入输出安全
- DashScope API - 通义千问 LLM 能力,支持歌词理解和 Query 生成
- Mutagen + FFmpeg - 音频元数据处理和格式转换
API 设计
RESTful 接口
- POST /api/tasks - 创建新任务,上传音频
- GET /api/tasks - 列出所有任务
- GET /api/tasks/{task_id} - 获取任务状态
- GET /api/results/{task_id} - 获取任务结果
- GET /api/results/{task_id}/export - 导出 JSON
- PUT /api/results/{task_id}/segments/{segment_id} - 更新 segment
输出协议
输出严格 JSON,包含:schema_version、task_id、status、audio_info、lyrics_match(歌词来源和匹配分数)、global_visual_plan(全局视觉规划)、segments(歌词段/伴奏段列表,含 Query 候选、镜头建议、情绪标签)、quality_report(质量报告)。
关键产品决策
歌词来源一致性
匹配成功后,不混用 ASR 和标准歌词。这一决策保证了歌词来源的可追溯性,避免时间轴对齐时出现混乱。
Query 必须视觉化
抽象情绪词不能直接作为 Query,必须转化为可被视频素材库检索的画面描述。这是产品化的关键——Query 的目的是检索素材,而非表达情感。
伴奏段独立处理
前奏、间奏、尾奏等无歌词段,虽然没有歌词内容,但音乐情绪依然需要视觉承接。独立生成 Query 保证视频节奏连贯。
质量保障
- Query 格式校验 - 中文、句式、数量、长度、多样性检查
- 视觉统一性校验 - 确保全片风格一致
- 时间轴合法性校验 - start_time < end_time
- 质量报告 - asr_confidence_avg、alignment_confidence_avg、warnings
未来规划
- 接入本地素材库摘要,生成更容易命中的 Query
- 支持用户指定视觉偏好
- Query 质量自动校验和修复
- 人工编辑后的偏好沉淀
- 自动选择最终素材和生成完整分镜视频
- 多语言歌词支持和副歌高潮增强节奏