Leaderboard / categories
Flavour Pairing
Pairing logic, cuisine coherence and balancing dishes.
Ranking
- 1Mistral Large 397.2
- 2GPT-5.4 Mini97.1
- 3Grok 4.394.9
- 4Claude Sonnet 4.693.7
- 5Kimi K2.693.6
- 6DeepSeek V4 Pro92.4
- 7GPT-5.592.0
- 8Gemini 3.1 Pro Preview90.4
- 9Qwen 3.5 Plus90.2
- 10Claude Opus 4.890.0
- 11Gemini 3.5 Flash89.2
- 12Claude Fable 588.1
- 13Llama 4 Maverick85.3
Question heatmap (public questions only)
| Model | 001 | 002 | 003 | 004 | 005 | 006 | 007 | 008 | 009 | 010 | 011 | 012 | 013 | 014 | 015 | 016 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 3 | ||||||||||||||||
| GPT-5.4 Mini | ||||||||||||||||
| Grok 4.3 | ||||||||||||||||
| Claude Sonnet 4.6 | ||||||||||||||||
| Kimi K2.6 | ||||||||||||||||
| DeepSeek V4 Pro | ||||||||||||||||
| GPT-5.5 | ||||||||||||||||
| Gemini 3.1 Pro Preview | ||||||||||||||||
| Qwen 3.5 Plus | ||||||||||||||||
| Claude Opus 4.8 | ||||||||||||||||
| Gemini 3.5 Flash | ||||||||||||||||
| Claude Fable 5 | ||||||||||||||||
| Llama 4 Maverick |
Each cell is one question; deeper colour = higher score. Hover for exact values.