LMArena · Agent
LMArena · Agent is run by LMArena. It has ranked 46 models, of which the catalogue holds 27, scoring from 1.26 to 60 on Net Improvement (%).
measured by LMArena · the board itself
| Place | Model | Metric | Score |
|---|---|---|---|
| 2ndof 46 | Gemini 3.5 Flash | Net Improvement (%) | 15.35 |
| 4thof 46 | Claude Fable 5.1 | Net Improvement (%) | 13.71 |
| 5thof 46 | GPT 6 Astra | Net Improvement (%) | 11.54 |
| 7thof 46 | Claude Opus 5 | Net Improvement (%) | 10.25 |
| 11thof 46 | Claude Fable 5 | Net Improvement (%) | 8.81 |
| 12thof 46 | Claude Opus 4.8 | Net Improvement (%) | 8.19 |
| 13thof 46 | GPT-5.6 Sol | Net Improvement (%) | 7.1 |
| 16thof 46 | Claude Sonnet 5 | Net Improvement (%) | 5.97 |
| 17thof 46 | Gemini 3.6 Flash | Net Improvement (%) | 5.94 |
| 18thof 46 | Gemini 3.1 Pro Preview | Net Improvement (%) | 5.81 |
| 20thof 46 | MiMo-V2.5 | Net Improvement (%) | 5.73 |
| 22ndof 46 | GPT-5.5 | Net Improvement (%) | 5.03 |
| 24thof 46 | DeepSeek V4.1 Flash | Net Improvement (%) | 4.88 |
| 25thof 46 | Gemini 3.8 Flash | Net Improvement (%) | 4.71 |
| 27thof 46 | Muse Spark 1.3 | Net Improvement (%) | 4.2 |
| 28thof 46 | DeepSeek V4 Pro | Net Improvement (%) (high) | 4.14 |
| 30thof 46 | qwen3.8 | Net Improvement (%) | 3.3 |
| 31stof 46 | GLM-5.3 | Net Improvement (%) | 3.05 |
| 32ndof 46 | Muse Spark 1.2 | Net Improvement (%) | 2.98 |
| 34thof 46 | openai-gpt | Net Improvement (%) | 2.67 |
| 35thof 46 | Grok 4.6 | Net Improvement (%) | 2.01 |
| 36thof 46 | DeepSeek V4 Flash | Net Improvement (%) (high) | 1.8 |
| 39thof 46 | GPT-5.6 Terra | Net Improvement (%) | 1.44 |
| 40thof 46 | GPT-5.4 | Net Improvement (%) | 1.26 |
| 44thof 46 | Gemini 3.7 Flash | Net Improvement (%) | 60 |
| 45thof 46 | GPT-5.6 Luna | Net Improvement (%) | 44 |
| 46thof 46 | Qwen3.8 Flash | Net Improvement (%) | 7 |
Read from the board on 2026-09-16