6.4. 高阶指南

量化指以低于浮点精度比特宽度执行计算存储张量技术。量化模型使用整数不是浮点张量执行部分全部操作。与典型的 FP32 模型相比,horizon_plugin_pytorch 支持 INT8 量化,从而使模型大小减少 4 倍,内存带宽需求减少 4 倍。对 INT8 计算硬件支持通常比 FP32 计算快 2 到 4 倍。量化主要一种加速推理技术,量化运算支持前向计算。

horizon_plugin_pytorch 提供适配 BPU 的量化操作,支持量化感知训练,该训练使用量化模块对前计算反向传播量化误差进行建模。请注意,量化训练整个计算过程使用浮点运算执行的。在量化感知训练结束时,horizon_plugin_pytorch 提供转换函数,将训练模型转换定点模型,在 BPU 上使用紧凑模型表示高性能矢量化操作。

本章内容详细介绍地瓜基于 PyTorch 开发的 horizon_plugin_pytorch 的量化训练工具。