从144G到64G的极致压缩:K100_AI单卡部署MiniMax-H3全模态模型的实战(含详细部署步骤)
本文介绍在海光K100_AI单卡上部署MiniMax-H3全模态生成模型的完整方案。针对官方SGLang方案对144GB显存的硬性要求,本文采用ComfyUI推理框架配合INT8量化模型,通过按层offload技术,成功在64GB显存下稳定运行15秒音视频生成任务。文章详细记录了从Docker环境配置、模型下载到工作流导入的每一步操作,并分享了6个典型踩坑问题的避坑经验,实测文生视频10秒耗时约4小时。本文为显存受限环境下的国产大模型部署提供了可复现方案,验证了“量化+动态卸载”策略在单卡推理中的有效性。
pla888888882026-08-12 22:30:16