If you write code

These compare things you reach through an API key or a developer account, and the tasks behind them are programming tasks. Same protocol as everything else on the site: identical prompts through one harness, three judges from three labs, position-swapped, every raw output downloadable. Looking for a chatbot instead? →

Model and API changes

  1. GLM 5.2 output price down 59%output price 1.9316 → 0.792 over 29 changes8 Aug 2026
  2. GLM 5.2 input price down 59%input price 0.6146 → 0.252 over 29 changes8 Aug 2026
  3. Claude Opus 4.6 slipped to 5 on the leaderboard, from 4LMArena leaderboard (CC-BY-4.0)7 Aug 2026
  4. Qwen3.7 Max slipped to 16 on the leaderboard, from 14LMArena leaderboard (CC-BY-4.0)7 Aug 2026
  5. Gemini 3.5 Flash slipped to 10 on the leaderboard, from 9LMArena leaderboard (CC-BY-4.0)4 Aug 2026
  6. Gemini 3.1 Pro Preview slipped to 12 on the leaderboard, from 11LMArena leaderboard (CC-BY-4.0)7 Aug 2026
  7. Grok 4.5 leaderboard place up 9%leaderboard place 34 → 37 over 2 changes7 Aug 2026
  8. Claude Opus 4.8 leaderboard place up 6%leaderboard place 33 → 35 over 2 changes7 Aug 2026
  9. DeepSeek V4 Pro leaderboard place up 5%leaderboard place 37 → 39 over 2 changes7 Aug 2026
  10. GPT-5.5 leaderboard place up 4%leaderboard place 23 → 24 over 2 changes7 Aug 2026