M3Exam
by DAMO-NLP-SG
Pythonpushed over 3 years ago
Data and code for paper "M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models"
AI summary
LM Benchmark
A benchmark for evaluating large language models in multiple languages and formats
- stars
- 93
- forks
- 12
- watching
- 9