刘聪 NLP:K2-Thinking 背后的原生 INT4 量化的思考
K2-Thinking 采用 fake-quantization+STE 的 W4A16 QAT 方案,post-training 阶段近乎无损;INT4 精度下完整 RL iteration 耗时减少约 10%-20%。
K2-Thinking 采用 fake-quantization+STE 的 W4A16 QAT 方案,post-training 阶段近乎无损;INT4 精度下完整 RL iteration 耗时减少约 10%-20%。