A decoding or classification layer maps hidden states to one logit per candidate. Temperature, masks, penalties, or calibration may modify logits before softmax or another decision rule.
A logit is an unnormalized score a model produces for a possible class or next token before probabilities are computed.
A decoding or classification layer maps hidden states to one logit per candidate. Temperature, masks, penalties, or calibration may modify logits before softmax or another decision rule.