CookingBench

Leaderboard / categories

Recipe Generation

Generating complete recipes under constraints: servings, allergens, time, equipment.

Ranking

  1. 1Gemini 3.1 Pro Preview
    95.0
  2. 2Gemini 3.5 Flash
    94.0
  3. 3GPT-5.4 Mini
    89.8
  4. 4Grok 4.3
    89.6
  5. 5GPT-5.5
    89.1
  6. 6Claude Fable 5
    88.5
  7. 7Claude Opus 4.8
    86.0
  8. 8Qwen 3.5 Plus
    85.0
  9. 9Mistral Large 3
    82.6
  10. 10Kimi K2.6
    82.4
  11. 11DeepSeek V4 Pro
    82.2
  12. 12Claude Sonnet 4.6
    79.3
  13. 13Llama 4 Maverick
    74.8

Question heatmap (public questions only)

Model001002003004005006007008009010011012013014015016017018019020
Gemini 3.1 Pro Preview
Gemini 3.5 Flash
GPT-5.4 Mini
Grok 4.3
GPT-5.5
Claude Fable 5
Claude Opus 4.8
Qwen 3.5 Plus
Mistral Large 3
Kimi K2.6
DeepSeek V4 Pro
Claude Sonnet 4.6
Llama 4 Maverick

Each cell is one question; deeper colour = higher score. Hover for exact values.