Each task supplies a small set of input-output grids that demonstrate an unknown transformation. A system must infer that transformation and produce the exact output grid for new inputs. Exact-match scoring makes partial visual similarity insufficient.