ETH Zurich / INSAIT · 2025
Evaluates models only on competitions held after their release date to rule out contamination, covering 162 problems from seven competitions plus human-graded IMO proof writing.
No sample rows available for this dataset.