Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
钛媒体 · 2026/7/21 10:51:57

没有AI味的AI音乐来了,Mureka V9.5交出满分音乐答卷

AI 中文解读
AI音乐终于不再“AI味”十足了!昆仑万维天工新发布的Mureka V9.5,做出了更克制、更真实、更有人情味的音乐。以前AI写歌总爱把所有乐器堆满,旋律从头挤到尾,人声像被伴奏淹了,情绪转折生硬得像拼盘。现在V9.5学会了“留白”——该停的停,该撤的撤,给主旋律和人声腾出空间,让情绪有呼吸。更厉害的是O3反思式推理系统,不是一次性生成就完事,而是像人类创作者一样,写一段回头审视,不对就自己修改,确保整首歌逻辑连贯、不跑偏。对普通人来说,这意味着以后听到的AI生成歌曲不再是“差点意思”的合成品,而是可以直接商用、发到音乐平台的真实作品。无论是想给视频配乐还是自己玩创作,门槛都大大降低,普通人也能轻松产出有质感的音乐了。
AI音乐这两年火得很快,打开任何一个音乐平台,AI生成的歌单已经多到刷不完。听得多了你会发现一个问题,这些歌听起来都挺像那么回事,却又总觉得差点意思。旋律从头到尾挤得满满当当,没有一个小节舍得停下来喘口气。人声像被伴奏活活埋掉的配角,怎么都冒不出来。段落之间一个力度撑到底,前一段还在深情款款,后一段突然不知道拐到哪儿去了。情绪断层、结构割裂,像是把几首不同歌的片段硬拼在了一起。这倒不是哪家产品的问题,整个行业的路子多少都有点偏。很长时间里,行业里把堆满编配当成了完成度,多层乐器一叠,第一耳确实热闹,但经不起细听。热闹底下空落落的,什么都没说出来。这种AI味儿太重的歌,很难直接拿去做商用发行。7月19日,昆仑万维天工AI在2026世界人工智能大会上发布了新一代音乐生成底座Mureka V9.5,同时推出了基于这个底座的O3反思式音乐推理方案,以及一个全新的创作Agent体验。V9.5的方向很明确,做更克制、更真实、更贴合创作意图的音乐,说白了就是更有人味儿、更少AI味儿。O3的思路是用test-time scaling让音乐思考从一次性规划变成持续推演,写一段回头看一段,不对就改。创作Agent则是把定稿改成了版本化管理,创作不再是一锤子买卖。Mureka V9.5发布现场Mureka V9.5官方视频一、不是堆编配,是给音乐留出呼吸空间Mureka的技术路线叫MusiCoT,核心思路是让模型在生成音频之前先形成一套音乐思维,从全曲结构到局部细节,粗到细地组织创作,而不是逐帧瞎蒙。V9.5在这个基础上往前推了一步,它开始思考一首真实的歌到底是怎么成立的。编配不用时刻拉满,声部得学会呼吸,情绪推进得有留白,所有声音上的选择都该为创作意图服务。它不再追求第一耳让你觉得好厉害,而是在一个更真实的音乐框架里,把Prompt控制、人声表现、音质和情绪表达做扎实。(AI 自动分析画面的场景、动作和情绪,创作更贴合内容的配乐)我们回头扫了一遍样本,一致的感觉是,它听起来更克制、更真实,也更不像AI写的。歌曲《夜色缓缓》定位:中文流行,对标国内流行市场,情绪捕捉准确提示词:以柔和钢琴、中文流行,氛围合成器和渐进式弦乐构建电影感情绪,男声贴近演唱,细腻、克制,从低声诉说逐渐走向情感释放。整体像雨夜里未说出口的告别,忧伤但温柔,不煽情却充满力量。Featuring soft piano, Chinese pop influences, atmospheric synth layers, and gradual strings to create a cinematic emotional atmosphere. Intimate male vocals with delicate, restrained delivery, building from quiet storytelling to emotional release. Like an unspoken goodbye on a rainy night, melancholic yet tender, powerful without being dramatic.歌曲《Melted Chrome 2》分版定位:一首标准的西海岸G-Funk,风格极佳,对小众曲风的捕捉,风格极致表达,对合成器和地域文化理解,理解曲风的风格表达,音效选取的有特点,编曲层层递进提示词:迷幻西海岸 G-Funk 街头说唱。深沉滑动的合成器低音、Moog 哨音、Talkbox 氛围、温暖 Rhodes、哇音吉他与复古磁带质感,配合松弛靠后的鼓点和沙哑男声,营造低底盘夜间巡游般的迷幻街头氛围。Psychedelic West Coast G-Funk street rap, featuring deep sliding synth bass, a melted Moog whistle lead, talkbox haze, warm Rhodes, muted wah guitar, warped cassette textures, and a lazy behind-the-beat groove. Raw raspy male vocals deliver relaxed, human street storytelling over a smoky lowrider night-cruise atmosphere, with no trap hi-hats, drill patterns, or EDM drops.传统AI音乐的习惯做法是默认叠多层乐器、持续填充旋律,觉得这样才有完成感。V9.5把配器逻辑整个翻了过来,声部怎么进怎么出、乐器什么时候上什么时候撤、强弱动态怎么走,全部看提示词的情绪和曲风来定。无效声部主动砍掉,给主旋律和人声腾位置,给情绪转折留白。它在学真人编曲那种轻重交替、张弛有度的习惯。(仅需上传一张照片与一小段清晰人声,即可快速生成专属 Character)数据上显示,同一轮100首样本的盲测里,V9.5在旋律、人声、音质和编配上都有提升,指令精准度从6.92提到了7.62。具体到四个评测维度:第一,编配上它更克制,不把配器密度等同于音乐质量,为主旋律、人声和情绪变化留出了呼吸空间。第二,音乐框架上它更真实,声部进入、段落推进与动态关系更接近真实创作,减少了模板化和复杂堆叠感。第三,人声表现良品率达到61.0%,情绪、唱腔和伴奏之间的关系更自然,听起来更可信。第四,意图优先于炫技这一点尤其明显,97.0%的控制良品率和95.7%的曲风完全体现比例,说明复杂度更多被用于服务Prompt,而不是掩盖音乐判断。一句话总结,V9.5的任务是把歌做得更自然。二、不是生成得更多,是想得更深如果说V9.5解决的是听起来像不像人做的,O3解决的就是想得够不够深。O3跑在V9.5之上,用test-time scaling把MusiCoT的推理过程拉长了。从能看到的层面来说,它不是简单地把生成拉长或者算更久,而是让模型在生成过程中持续问自己:当前这段旋律还在为整首歌服务吗?编配是不是又把主唱淹了?情绪是不是透支了?结构有没有跑偏?多出来的算力,被用来回头看和自己改,让音乐思维一步步收敛,而不是一次决定后一条道走到黑。具体来说,这种反思式推理覆盖四个能力。首先,全曲目标不丢,MusiCoT先定好结构、情绪和表达方向,后面每一步判断都回到这个全局目标,不是走一步看一步。其次,生成中持续审视,模型不光判断局部好不好听,还检查当前选择有没有破坏整首歌的一致性。再次,发现偏差后自己改,旋律、编配、人声或情绪跑偏了,后续决策会重新校准,有点像创作者写完一段回头听,觉得不对,删了重来。最后是成本,更高的推理成本换的不是算力炫耀,而是审视、修正和收敛的空间。这套机制能有效,前提是底座先有了真实感。V9.5提供了一个更克制、更自然的基底,O3不需要从一个充满AI堆叠感的结果开始补救,而是在一个已经不错的底子上打磨。歌曲《误差》定位:更拟真的音色,编曲可以理解提示词的感觉提示词:Minimal Electronic / Cosmic Pop。晶莹合成器脉冲、低频氛围无人声与极简电子纹理,描绘一座漂浮在沉睡星球轨道上的空间站,冰冷、空旷、遥远。整体像隔着舷窗凝望深空,缓慢、克制、沉思,充满失重感与未知感。 Minimal Electronic / Cosmic Pop,Featuring crystal-like synth pulses, soft sub drones, minimal electronic textures, and vast spatial reverb. A cold and distant soundscape inspired by a drifting orbital station, creating a feeling of weightlessness, isolation, and quiet contemplation.歌曲《Still in the Room》定位:更稳定的编曲,完整的编曲,模型可以完整的捕捉曲风。提示词:Dream Pop。混响吉他、漂浮感男声与柔和氛围合成器营造朦胧梦境质感,温暖贝斯和松弛鼓组支撑空间感,整体像私人房间里的夜晚独处,迷离、内省、温柔而有距离感。Prompt:Dream Pop, featuring reverb-rich guitars, floating male vocals, soft atmospheric pads, warm bass, and restrained drums. A hazy and intimate soundscape with a private studio feeling, blending dreamy textures, emotional distance, and gentle melodic hooks.方向性数据也支持这个判断。此前一轮100首实验中,推理扩展把听感良品率从35%提到了43%,综合可用率从35%提到39%。这说明更充分的音乐CoT加test-time scaling这条路有继续提升质量的潜力。(评测范围:100 首歌曲样本。数字来自同一轮候选对照;“更有人味、更少 AI 味”来自评审对样本的回扫归因,是对音乐形态、编配克制和真实感的综合判断,不是由单一数值直接定义。)当然,这个结果是基于前期底座的,只是用来验证技术方向,不代表新版V9.5下的最终O3指标。V9.5负责把
分享
阅读原文