Stored key/value vectors from prior tokens, reused each decode step so attention doesn't recompute the whole sequence.
Continue to AI University →