Find models by task.
Compare the relevant evaluation, tested settings, and source behind each score.
1–10 of 138 results · EQ-Bench Creative Writing v3
| # | Model / configuration | Elo rating | Relative percentile | Evidence | Details |
|---|---|---|---|---|---|
| 1 | OpenAI: GPT-6 Astra gpt-6-astra · publisher default settings | 2173.1 | 100.0 | llm judged | |
| 2 | Anthropic: Claude Fable 5.1 claude-fable-5-1 · publisher default settings | 2161.8 | 99.3 | llm judged | |
| 3 | Anthropic: Claude Opus 5 claude-opus-5 · publisher default settings | 2132.3 | 98.5 | llm judged | |
| 4 | OpenAI: GPT-6 Sol gpt-6-sol · publisher default settings | 2124.5 | 97.8 | llm judged | |
| 5 | MoonshotAI: Kimi K3 kimi-k3 · publisher default settings | 2082.0 | 97.1 | llm judged | |
| 6 | Z.ai: GLM 5.3 GLM-5.3 · publisher default settings | 2074.8 | 96.4 | llm judged | |
| 7 | Anthropic: Claude Opus 5.5 claude-opus-5-5 · publisher default settings | 2050.0 | 95.6 | llm judged | |
| 8 | SpaceXAI: Grok 4.7 grok-4.7 · publisher default settings | 2007.4 | 94.9 | llm judged | |
| 9 | OpenAI: GPT-5.6 Sol gpt-5.6-sol · publisher default settings | 1971.1 | 94.2 | llm judged | |
| 10 | ox-alpha ox-alpha · publisher default settings | 1970.7 | 93.4 | llm judged |
How these results are ranked
EQ-Bench Creative Writing v3 · Creative Writing v3LLM-judged creative writing, not human preference or general editing accuracy. Fit uses a relative percentile within this full published pool; it is not an accuracy percentage.
Evaluated: Not published per result. Scan date records when we retrieved the source, not when these systems were tested.
138 tested configurations · 77 catalogue matches · scanned 2026-09-24. Original results ↗
138 results · ordered by Elo rating. Fit uses the percentile within the full published pool.