CookingBench

Leaderboard / categories

Flavour Pairing

Pairing logic, cuisine coherence and balancing dishes.

Ranking

  1. 1Mistral Large 3
    97.2
  2. 2GPT-5.4 Mini
    97.1
  3. 3Grok 4.3
    94.9
  4. 4Claude Sonnet 4.6
    93.7
  5. 5Kimi K2.6
    93.6
  6. 6DeepSeek V4 Pro
    92.4
  7. 7GPT-5.5
    92.0
  8. 8Gemini 3.1 Pro Preview
    90.4
  9. 9Qwen 3.5 Plus
    90.2
  10. 10Claude Opus 4.8
    90.0
  11. 11Gemini 3.5 Flash
    89.2
  12. 12Claude Fable 5
    88.1
  13. 13Llama 4 Maverick
    85.3

Question heatmap (public questions only)

Model001002003004005006007008009010011012013014015016
Mistral Large 3
GPT-5.4 Mini
Grok 4.3
Claude Sonnet 4.6
Kimi K2.6
DeepSeek V4 Pro
GPT-5.5
Gemini 3.1 Pro Preview
Qwen 3.5 Plus
Claude Opus 4.8
Gemini 3.5 Flash
Claude Fable 5
Llama 4 Maverick

Each cell is one question; deeper colour = higher score. Hover for exact values.