(1/n) Introduce LLM-as-a-Coach for non-verifiable tasks. Scalar rewards discard rich feedback. LLM-as-a-Coach guides policy with context, leveraging high bandwidth to provide rich experiential knowledge that preserves fine-grained preference on non-verifiable tasks.