A scaling knob applied before softmax that flattens a probability distribution, making smaller probabilities easier to learn from.
Continue to AI University →