Pixel diffusion models spend as much compute on blank sky as on faces. Every patch is a token in every layer.
Our fine-tuned MiniT2I runs on region tokens instead. Half as many tokens, same quality, twice as fast, trained at different budgets for elastic inference.