As we mentioned, success rates stayed close, but speed and token efficiency split between harnesses:
- Success rate: 22/28 for Kimi Code, 21/28 for Hermes, 20/28 for Claude Code
- Median time per task: 179s in Hermes, 297s in Kimi Code, 348s in Claude Code
So the fastest harness (Hermes) and the most token-efficient one (Kimi Code) were different.