
Chinese LLM evaluation suite...
C-Eval's 52-discipline Chinese focus fills Chinese LLM evaluation gap. Four difficulty levels, C-Eval Hard for deep reasoning. Only GPT exceeded average. Open on Hugging Face. Best for Chinese LLM developers, researchers.
C-Eval is a Chinese LLM evaluation suite (2023) by Shanghai Jiao Tong, Tsinghua, etc. First major Chinese benchmark: 52 disciplines, MC questions, 4 difficulty levels. Includes C-Eval Hard subset.
Difficulty: Intermediate
52-Discipline Chinese Evaluation
Tests Chinese knowledge and reasoning across 52 disciplines
Four Difficulty Levels
Middle school to professional levels, C-Eval Hard for advanced
Open Source
Dataset and code on Hugging Face and GitHub
Chinese Model Evaluation
Developers evaluate Chinese scenario capabilities
Academic Research
Papers cite C-Eval for Chinese capability metrics
C-Eval targets Chinese, 52 subjects; MMLU English 57. Complementary.
Hard subset requiring stronger reasoning to differentiate top models.
Real reviews and feedback from users