Of 232 runs where a frontier judge disagreed with the benchmark, only 71 survived a blind label audit (3+ model families, a human ruling on every split vote).
About a quarter were the benchmark's error: hidden criteria, broken checkers, unstated rules.