GLM-5.2 is now just 0.005 away from Fable-5 in visual spec-to-app development.
On VISTA’s latest C4 leaderboard:
🥇 Claude Code + Fable-5 — 0.274
🥈 Claude Code + GLM-5.2 — 0.269
🥉 Claude Code + Opus 4.8 — 0.263
Claude Code + Sonnet 4.6 — 0.248
Cursor + Composer 2.5 — 0.212
Codex + GPT-5.5 — 0.205
The story is no longer just “which model writes better code.”
For real app-building agents, performance is increasingly shaped by the full stack:
🧠 model
🛠️ harness
🔁 tool loop
👁️ visual understanding
⚙️ reasoning setup
The harness is becoming part of the model.
🔗