MiniMax-H3 移植到 MLX,在 Apple Silicon 上运行
MiniMax 发布通用多模态生成系统 MiniMax-H3,社区将其移植到 MLX 以在 Apple Silicon 上运行,可生成带音频的 15 秒视频。
2026年8月4日 - 链接博客PipeNetwork/minimax-h3-mlx。
MiniMax 两天前发布了 MiniMax-H3,他们将其描述为“一个通用、全模态的生成系统”,实际上这意味着它接受文本、图像、音频和视频,并可以用它们生成最长 15 秒、包含音频的视频片段。
这个 Python 包将其移植到 MLX,以便在 Apple Silicon 上运行。我在我的 M5 Max MacBook Pro 上运行了它。我克隆了仓库,并按如下方式运行模型:
# 首先下载模型uvx --from huggingface_hub hf download MiniMaxAI/MiniMax-H3 \--include 'FL2VA/*' --exclude 'FL2VA/transformer/*'uvx --from huggi
ngface_hub hf download pipenetwork/MiniMax-H3-MLX-8bit# 现在运行提示词uv run --with mlx-vlm \--with-requirements requirements.txt python script
s/generate.py \"a rainbow colored skunk leaps over a mossy log in a supermarket" \-o skunk.mp4 \-c ~/.cache/huggingface/hub/models--Mini
MaxAI--MiniMax-H3/snapshots/fa9c8ab1eaa21c8ae25e7e40b83b2e6002f340af/FL2VA \-t ~/.cache/huggingface/hub/models--pipenetwork--MiniMax-H3-
MLX-8bit/snapshots/3ac52081470b0488921c3ec3ba84a39097bf2361以下是我根据提示词得到的视频:超市里一只彩虹色的臭鼬跳过一根长满苔藓的原木它下载了约 115 GB 的模型文件,视频生成耗时不到 45 分钟。
视频令人印象深刻,但音频是奇怪的类似语音的噪音,因为我没有提供任何关于音频应该是什么的提示指导。
提示指南(我在这次实验之前没有阅读)包含大量关于如何使其正常工作的信息。