LLMeBench

LLM benchmarker

A benchmarking framework for large language models

Benchmarking Large Language Models

GitHub

81 stars
13 watching
18 forks
Language: Python
last commit: almost 2 years ago
Linked from 1 awesome list

benchmarkinglarge-language-modelsllmmultilingual

Backlinks from these awesome lists:

Related projects:

RepositoryDescriptionStars
ray-project/llmperfA tool for evaluating the performance of large language model APIs678
damo-nlp-sg/m3examA benchmark for evaluating large language models in multiple languages and formats93
bilibili/index-1.9bA lightweight, multilingual language model with a long context length920
multimodal-art-projection/omnibenchEvaluates and benchmarks multimodal language models' ability to process visual, acoustic, and textual inputs simultaneously.15
aifeg/benchlmmAn open-source benchmarking framework for evaluating cross-style visual capability of large multimodal models84
felixgithub2017/mmcuMeasures the understanding of massive multitask Chinese datasets using large language models87
nanbeige/nanbeigeDevelops large language models for text understanding and generation tasks.85
ailab-cvc/seed-benchA benchmark for evaluating large language models' ability to process multimodal input322
xverse-ai/xverse-7bA multilingual large language model developed by XVERSE Technology Inc.50
bytedance/lynx-llmA framework for training GPT4-style language models with multimodal inputs using large datasets and pre-trained models231
tianyi-lab/hallusionbenchAn image-context reasoning benchmark designed to challenge large vision-language models and help improve their accuracy259
pleisto/yuren-baichuan-7bA multi-modal large language model that integrates natural language and visual capabilities with fine-tuning for various tasks73
gmftbygmftby/science-llmA large-scale language model for scientific domain training on redpajama arXiv split125
openbmb/bmlistA curated list of large machine learning models tracked over time341
aiplanethub/beyondllmAn open-source toolkit for building and evaluating large language models267