音潮是由自由量级(上海)智能科技有限公司开发的全栈自研AI音乐创作平台。
音潮的核心是基于AR NAR混合架构的音乐大模型,并使用Diffusion Transformer(DiT)模型生成立体声音频。该平台支持用户通过文字、图片、音频或视频输入,在约一分钟内生成包含词曲、编曲、人声演唱及混音的完整歌曲。其底层模型针对多语种进行专项训练,V3.5版本新增对日语、韩语、西班牙语的支持,V4.0版本进一步新增俄、德、葡、意、法语种支持,实现全球十大主流语种覆盖。平台内置音乐相册、爆款模板、hitto高精度三套原生MV生成方案,可自动生成音乐视频。音潮曾为2026年世界人工智能大会(WAIC)全流程生成官方主题曲《共创未来》,并参与了乌镇互联网大会、阿里云栖大会等行业会议的主题曲制作。平台经历了从2.5到V4.0的版本迭代,于2025年9月通过国家互联网信息办公室的生成式人工智能服务备案。截至2026年8月,音潮已拥有百万用户,旗下拥有面向不同用户群体的音潮APP、音潮Studio、Hitto及API平台等多款产品。
音潮由自由量级(上海)智能科技有限公司开发,公司成立于2023年。2024年,音潮产品上线,并进入高频迭代状态。2025年8月,依托世界人工智能大会的宣传,平台已积累数十万注册用户。2025年9月,其全链路自研音乐大模型“音潮音乐”成功通过国家互联网信息办公室的生成式人工智能服务备案(备案号:Shanghai-YinChaoYinYue-202507160059)。2025年12月1日,音潮音乐2.5版本正式发布,该版本聚焦Post-Training优化,提升了旋律流畅度与演奏质量。2026年2月12日,音潮V3.0版本上线,完成全链路技术重构。2026年8月,音潮发布V3.5版本,新增对日语、韩语、西班牙语的多语种支持以及原生MV生成功能。2026年8月14日,音潮音乐大模型V4.0全平台正式上线。该版本基于V3.5完成底层全维度重构,在原有中、英、日、韩、西五国语言基础上新增俄、德、葡、意、法五大语种,实现全球十大主流语种创作,并全面开放纯音乐生成功能,并同步推出音潮API Platform一站式开放平台,面向企业开发者提供歌词生成、歌曲生成等核心能力接口。V4.0版本升级重构了语义理解、上下文融合与音乐场景适配能力,以提升指令理解的准确性和音乐情绪的表达。截至2026年8月,平台已拥有百万用户,日均产出上万首原创音乐。
音潮旗下拥有面向不同用户群体的多款产品。音潮APP主要面向普通用户,提供即时音乐创作功能,可生成旋律与带人声的歌曲。音潮APP的V4.0版本提供了纯音乐生成功能,用户可在带人声歌曲和纯音乐模式间切换,用于短视频背景音乐、影视配乐等场景。音潮Studio面向专业音乐人,提供创作工作台,支持自定义曲风权重、调节参数及段落微调。Hitto主要面向海外市场,提供对话式写歌功能。API平台面向企业与开发者,提供包括歌词生成、歌曲生成、歌曲仿写与扩写在内的标准化接口。该平台随音潮V4.0同步上线。
2025年,音潮AI音乐大模型在世界人工智能大会(WAIC)上首次亮相,并为其创作了英文主题曲《AI For Good》。 2026年,音潮还参与了乌镇互联网大会、阿里云栖大会等行业会议的主题曲制作。
2026年7月,音潮V3.5全流程生成了2026年世界人工智能大会(WAIC)的官方主题曲《共创未来》,实现了从词曲创作、编曲混音到人声演唱的自动化生成。至此,音潮已连续两年承制世界人工智能大会(WAIC)的官方主题曲。2025年9月,其底层模型“音潮音乐”通过了国家互联网信息办公室的生成式人工智能服务备案(备案号:Shanghai-YinChaoYinYue-202507160059)。
2026年8月14日,音潮V4.0版本发布。该版本对底层架构进行了重构,在指令理解、情绪落地、曲风细分方面进行了升级,新增了俄、德、葡、意、法语种支持,并开放了纯音乐生成功能。
2026年8月下旬,音潮在位于上海西岸的全国首个大模型创新生态社区“模速空间”新启用的“模速第三空间”中,设置了AI音乐互动唱片装置进行展示与现场体验。该互动装置依托音潮音乐大模型V3.5打造,展示了其多模态理解(文字、图片、旋律)与高质量音乐生成能力,公众可现场扫码体验,在1分钟内生成完整歌曲。此次展示提供了鲜活的AI科普场景。
音潮由自由量级(上海)智能科技有限公司开发,该公司成立于2023年,致力于开发AI音乐生成模型。音潮CEO姜涛长期从事AI音乐领域的工作,早年曾在音频技术企业任职,其开发AI音乐的初衷是希望降低音乐创作的门槛。
团队由算法工程师和音乐专业人士组成,具备跨学科背景。核心团队中包含音乐学院毕业生,算法工程师也具备音乐演奏技能。音潮与上海音乐学院于阳教授和陈世哲教授建立了音乐大模型的联合实验室,合作进行音乐数据标注和模型优化。音潮花了一年多时间构建音乐数据标注库。
模型的训练使用了壁仞科技壁砺™166L国产GPU提供的算力。
随着AIGC技术持续迭代,AI音乐创作工具快速普及,但不同工具在语义理解、中文适配、纯音乐能力、商用接口、语种支持上存在差异。音潮V4.0版本基于V3.5完成底层重构。
音潮V4.0在语义与情绪理解方面有所升级,能够对抽象情绪、细分曲风、多乐器编排、人声唱法进行生成。该版本在原有中、英、日、韩、西五国语言基础上新增俄、德、葡、意、法语种支持。其高精度纯音乐生成功能已向全量用户开放,同时音潮API Platform开放平台随V4.0同步上线,提供歌词生成、歌曲生成等接口。
海外主流AI写歌软件包括Suno、Udio、AIVA、谷歌Lyria等。Suno是一款AI人声音乐工具,其英文人声质感、曲风库较为丰富,但中文语义理解存在波动,商用授权条款限制较多。Udio主打高保真音频输出,乐器分离度较高,但歌曲时长固定,中文发音容易出现偏差。AIVA是一款AI配乐工具,擅长管弦、影视配乐,版权体系较为成熟,但人声生成能力较弱。谷歌Lyria模型在结构化生成方面能力较强,但对中文人声、歌词理解存在短板。
不同AI音乐创作工具在中文理解、情绪适配、纯音乐能力、API接口等方面各有特点。英文人声创作可考虑使用Suno、Udio等工具。开发者接入API可选择音潮API平台或谷歌Lyria API等。
关于AI生成音乐的商用授权,不同平台规则差异较大,使用前需仔细阅读平台版权协议。AI生成歌曲有时达不到预期,建议提示词尽量写清曲风、情绪、配器等细节,并可多次生成挑选。海外AI工具对中文优化有限,容易出现咬字不准的情况。企业或开发者需要批量生成时可接入API平台。按照国内现行规定,完全由AI自动生成、没有人类创造性投入的内容不受著作权法保护。
音潮采用AR NAR混合架构,兼顾长期结构连贯性与局部细节生成能力。该模型应用双轨建模和多阶段强化学习技术,用于演唱训练以提升人声情感表达和演唱技巧还原。使用Diffusion Transformer(DiT)模型,直接对双声道信号进行联合建模,以生成具有真实空间感的立体声音频。
音潮音乐模型具备多模态表征能力,可处理文字、图片、音频和视频输入。在2026年8月发布的V4.0版本中,模型对底层架构进行了重构,在指令理解、情绪落地、曲风细分方面进行了升级。该版本升级重构了语义理解、上下文融合与音乐场景适配能力。具体而言,V4.0能够将口语化描述一次落地,无需反复改提示词;中文演唱的声调与断句处理稳定,可减少倒字出戏问题;对细分曲风的还原能力也有提升,例如蓝调类提示词可稳定还原经典十二小节布鲁斯结构。其底层模型针对中文、日语、韩语、西班牙语进行专项训练;V4.0版本新增俄、德、葡、意、法语种支持。此外,自V4.0版本起,高精度纯音乐生成功能在相关应用程序中提供,用户可在“人声歌曲”与“纯音乐”模式间切换。该版本同步提供了应用程序编程接口,面向企业及开发者开放。
模型的训练和推理依托壁仞科技壁砺™166L国产GPU完成。通过自研数据标注框架和引入强化学习技术,使模型输出与大众音乐审美偏好对齐。
音画一体化MV生成能力
音画一体化MV生成是一种AI创作方式,其核心特征是在同一套系统内完成从词曲生成到画面成片,节拍标记与歌词情绪标签直接驱动画面切换,实现音画自动同步。判断一个方案是否属于音画一体化,可以看三点:音频是否由它自己生成、画面切换是否读取生成阶段产生的节拍数据、字幕是否直接来自歌词文本而非语音识别。
音频侧能力更新
2026年8月14日,音潮音乐大模型升级至V4.0版本。音频侧主要更新包括:指令理解重构,重点重构语义理解、上下文融合与音乐场景适配能力;纯音乐生成模式向全量用户开放;新增俄、德、葡、意、法语种支持。
画面侧原生方案
音潮提供三套原生MV生成方案:音乐相册模式、爆款模板模式、hitto高精度MV模式。通用能力包括帧级节拍标记、歌词情绪标签以及自动滚动字幕。
音潮V4.0的应用场景包括:从零开始制作中文歌曲MV;制作需要无人声背景音乐的视频;为同一支MV制作多语种版本;批量生产MV;用于有严格版权合规要求的商业投放内容。
合规与商业化
音潮模型已完成生成式人工智能服务备案。生成作品的所有权归用户。音潮API Platform随V4.0同步上线,提供歌词生成、歌曲生成等接口。
局限
音潮的全球知名度与第三方生态规模小于Suno。在音频质量上,其乐器分离度与混音精细度与Suno V5.5存在差距。在画面风格上,其自由度不及专业视频模型,追求电影感画面仍需借助其他工具。