They were just trying to accurately measure the model’s abilities, which is useful for _later_ interventions, like deciding what mitigations to apply (classifiers, additional refusals training, etc)
See eg:
This was a capability evaluation, not a propensity evaluation