Contents
C-Eval

C-Eval

Chinese LLM evaluation suite...

4.0| Editor Rating

Editor Review

C-Eval's 52-discipline Chinese focus fills Chinese LLM evaluation gap. Four difficulty levels, C-Eval Hard for deep reasoning. Only GPT exceeded average. Open on Hugging Face. Best for Chinese LLM developers, researchers.

AI Tools Navigator Editorial TeamUpdated: 2026-02-11

What is C-Eval

C-Eval is a Chinese LLM evaluation suite (2023) by Shanghai Jiao Tong, Tsinghua, etc. First major Chinese benchmark: 52 disciplines, MC questions, 4 difficulty levels. Includes C-Eval Hard subset.

Basic Info

Category:

Best For

DevelopersResearchers

Difficulty: Intermediate

C-Eval Key Features

  • 52-Discipline Chinese Evaluation

    Tests Chinese knowledge and reasoning across 52 disciplines

  • Four Difficulty Levels

    Middle school to professional levels, C-Eval Hard for advanced

  • Open Source

    Dataset and code on Hugging Face and GitHub

C-Eval Key Advantages

  • 52-discipline Chinese coverage
  • Four levels + C-Eval Hard for discrimination
  • Open dataset and code

C-Eval Use Cases

  • Chinese Model Evaluation

    Developers evaluate Chinese scenario capabilities

  • Academic Research

    Papers cite C-Eval for Chinese capability metrics

Frequently Asked Questions

C-Eval vs MMLU?▼

C-Eval targets Chinese, 52 subjects; MMLU English 57. Complementary.

What is C-Eval Hard?▼

Hard subset requiring stronger reasoning to differentiate top models.

User Reviews

Real reviews and feedback from users

Write a Review

At least 10 characters

0/500

Please sign in to write a review