Agent Distillation can be surprisingly data-efficient.
We distilled Inkling-Small into Nemotron-3-Nano on incident-diagnosis problems using trajectories from only 19 problems!
Very encouraging for post-training task-specific models in data-poor regimes.