MiniMax 发布音乐生成模型 MiniMax Music 3
MiniMax 发布音乐生成模型 MiniMax Music 3,支持基于歌词和音乐描述生成最长五分钟的完整歌曲,采用 8B 全局 LLM 与 0.6B 局部 LLM 的混合架构,结合 Flow Matching 和 Flow-VAE 进行连续隐状态合成,输出 32 kHz 16-bit 立体声 WAV 音频。
推荐理由:原文详细说明了模型架构、控制方式和部署方法,读者可据此判断其在音乐创作中的实际可用性。
公司与模型
MiniMax 的模型与产品动态:M 系列大模型、语音与多模态能力、开源与商业化进展。
4 条精选近 30 天 0 条共收录 9 条
MiniMax 发布音乐生成模型 MiniMax Music 3,支持基于歌词和音乐描述生成最长五分钟的完整歌曲,采用 8B 全局 LLM 与 0.6B 局部 LLM 的混合架构,结合 Flow Matching 和 Flow-VAE 进行连续隐状态合成,输出 32 kHz 16-bit 立体声 WAV 音频。
推荐理由:原文详细说明了模型架构、控制方式和部署方法,读者可据此判断其在音乐创作中的实际可用性。
MiniMax 发布开源多模态视频生成模型 H3,支持文本、图像、视频、音频的统一理解与生成,可输出最高 2K 分辨率、15 秒时长的视频并带有立体声。模型包含 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块,支持多种输入模式如文本到视频(T2VA)、首尾帧到视频(FL2VA)和参考多模态到视频(Ref2VA)。
推荐理由:原文提供了模型架构、输入输出规范和部署方式,读者可以据此判断其在多模态视频生成中的实际应用潜力。
Together AI 作为 MiniMax M3 的优选云合作伙伴,分享了其针对该模型新特性的推理优化方案。M3 具备 100 万 token 上下文、原生多模态和稀疏注意力架构,Together AI 通过 KV 块主序稀疏注意力、与分页注意力的集成、解码索引评分优化以及网关预处理多模态输入等方法,在代理式流量下将推理性能提升了 81% 至 125%。
推荐理由:Together AI 分享了其针对 MiniMax M3 模型稀疏注意力等新特性的推理优化细节,包括 KV 块重排、分页注意力集成和网关预处理。
MiniMax 发布新模型 MiniMax-M2.7,支持模型自进化、复杂技能构建与多智能体协作,具备强工程能力,在 SWE-Pro、VIBE-Pro、GDPval-AA 等多个基准上表现优异,开源权重可于 HuggingFace 获取,推荐使用 SGLang、vLLM 或 Transformers 部署。
推荐理由:模型支持自进化机制和多智能体协作,读者可依据其在多个工程与多模态基准上的表现评估其在复杂任务中的实际能力。