Find models by task.

Compare the relevant evaluation, tested settings, and source behind each score.

1–10 of 138 results · EQ-Bench Creative Writing v3

#Model / configurationElo ratingRelative percentileEvidenceDetails
1OpenAI: GPT-6 Astra

gpt-6-astra · publisher default settings

2173.1100.0llm judged
Metrics & source

rubric: 16.80

Publisher results ↗
2Anthropic: Claude Fable 5.1

claude-fable-5-1 · publisher default settings

2161.899.3llm judged
Metrics & source

rubric: 16.95

Publisher results ↗
3Anthropic: Claude Opus 5

claude-opus-5 · publisher default settings

2132.398.5llm judged
Metrics & source

rubric: 17.07

Publisher results ↗
4OpenAI: GPT-6 Sol

gpt-6-sol · publisher default settings

2124.597.8llm judged
Metrics & source

rubric: 16.51

Publisher results ↗
5MoonshotAI: Kimi K3

kimi-k3 · publisher default settings

2082.097.1llm judged
Metrics & source

rubric: 16.85

Publisher results ↗
6Z.ai: GLM 5.3

GLM-5.3 · publisher default settings

2074.896.4llm judged
Metrics & source

rubric: 17.04

Publisher results ↗
7Anthropic: Claude Opus 5.5

claude-opus-5-5 · publisher default settings

2050.095.6llm judged
Metrics & source

rubric: 16.79

Publisher results ↗
8SpaceXAI: Grok 4.7

grok-4.7 · publisher default settings

2007.494.9llm judged
Metrics & source

rubric: 17.16

Publisher results ↗
9OpenAI: GPT-5.6 Sol

gpt-5.6-sol · publisher default settings

1971.194.2llm judged
Metrics & source

rubric: 16.78

Publisher results ↗
10ox-alpha

ox-alpha · publisher default settings

1970.793.4llm judged
Metrics & source

rubric: 16.89

Publisher results ↗

How these results are ranked

EQ-Bench Creative Writing v3 · Creative Writing v3

LLM-judged creative writing, not human preference or general editing accuracy. Fit uses a relative percentile within this full published pool; it is not an accuracy percentage.

Evaluated: Not published per result. Scan date records when we retrieved the source, not when these systems were tested.

138 tested configurations · 77 catalogue matches · scanned 2026-09-24. Original results ↗

138 results · ordered by Elo rating. Fit uses the percentile within the full published pool.