PTQ は、浮動小数点精度を使用して既に訓練されているモデルに量子化を適用します。このアプローチにより単純化できますが、特に小さなモデルや高精度なタスクでは、精度を犠牲にする可能性があります。
主な特性:
- プロセス:モデルを通常学習 → 量子化パラメータを較正 → 量子化形式に変換
- キャリブレーション:代表的なデータセットを使用して倍率を決定します。
- 開発期間:開発サイクルの短縮 (再トレーニング不要)
- 精度への影響:通常、QAT よりも精度損失が大きくなります。
利点:
- 既存のトレーニング済みモデルによるさらにシンプルなワークフロー。
- トレーニング手順の変更が不要。
- 迅速な導入パス。
- 開発の計算要件の低減。
制約:
- 精度の大幅な低下を招く可能性があります。
- 量子化効果に対する制御が限定的です。
- 正弦関数のような回帰タスクでは特に困難です。
- 量子化アーチファクトを補償する機能が制限されています。