Methods inspect inputs, activations, features, gradients, examples, and behavioral patterns at different levels. An explanation may be useful without being a complete or faithful account, so claims require validation.
Interpretability is the effort to understand why an AI system produces particular representations, decisions, or outputs.
Methods inspect inputs, activations, features, gradients, examples, and behavioral patterns at different levels. An explanation may be useful without being a complete or faithful account, so claims require validation.