Something to share: we built a benchmark for evaluating agentic reverse engineering.
- instead of grading intermediate outputs, e.g., recovered types/names
- we evaluate agents e2e on deterministic goals, e.g., JTAG a firmware to enable its debug mode.