My News ← 戻る

Nunchaku 4-bit拡散推論をDiffusersに統合——メモリ50%削減・推論速度30〜80%向上

Nunchaku 4-bit拡散推論をDiffusersに統合——メモリ50%削減・推論速度30〜80%向上

項目 内容
ジャンル AI
日付 2026-07-24
元記事 Hugging Face Blog

要約

従来の拡散変換器モデル(Diffusion Transformer)をBF16精度で動かすには20〜30GBのVRAMが必要で、一般的なGPUでは動作が難しかった。Hugging FaceはSVDQuant技術(4-bit重みと活性化の同時量子化、W4A4)を実装したNunchakuをDiffusersライブラリに統合する「Nunchaku Lite」統合パスを公開した。これにより通常のDiffusersモデルと同様にfrom_pretrained()でNunchakuチェックポイントを読み込めるようになった。Blackwell GPU向けのNVFP4と従来GPU向けのINT4の2カーネルを提供し、ユーザー自身がモデルを量子化・公開するための「diffuse-compressor」ツールも用意されている。結果としてメモリ使用量が約50%削減、推論速度が30〜80%向上し、消費者向けGPUでも高品質な画像生成が実現した。


元記事を読む →