학습 중 일부 연산을 32비트(float32) 대신 16비트(float16/bfloat16)로 계산해서 속도를 높이고 메모리를 줄이는 기법 GPU는 16비트 행렬곱을 텐서 코어를 활용해 32비트보다 훨씬 빠르게 처리할 수 있음메모리도 절반만 차지해서 같은 배치를 더 적은 메모리로 돌릴 수 있음 loss 계산이나 그래디언트 누적처럼 정밀도가 중요한 부분은 32비트로 유지하고, 행렬곱 등 덜 민감한 연산만 16비트로 전환합니다. 또 그래디언트가 너무 작아서 16비트에서 0이 되는 걸 막기 위해 손실값을 일시적으로 키우는 "Loss scaling"을 자동으로 진행 아주 드물게 16비트 변환 때문에 학습이 약간 다르게 수렴할 수 있음 (보통은 무시할 수준임)원래 베이스라인과 완벽히 동일한 조건은 아니라서, 나중..