Serving MiniMax-M3 for efficient inference: Unlocking 1M-Token Context and Multimodality Without Regrets
Together AI 作为 MiniMax M3 的首选云合作伙伴,介绍了为该模型提供生产级推理服务的工程方案。M3 采用 MiniMax Sparse Attention 块稀疏注意力,使 prefilling 提速超 9x、decoding 提速超 15x,支持 1M token 上下文与原生多模态。