Fast LoRA inference for Flux with Diffusers and PEFT
Hugging Face 发布针对 Flux.1-Dev 的 LoRA 快速推理优化教程,结合 Flash Attention 3、torch.compile 和 FP8 量化,在 H100 上实现约 2.23x 提速。
Hugging Face 发布针对 Flux.1-Dev 的 LoRA 快速推理优化教程,结合 Flash Attention 3、torch.compile 和 FP8 量化,在 H100 上实现约 2.23x 提速。