CharXiv

Chart eval

An evaluation suite for assessing chart understanding in multimodal large language models.

[NeurIPS 2024] CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs

GitHub

85 stars
3 watching
9 forks
Language: Python
last commit: almost 2 years ago
benchmarkchart-understandingmachine-learningmultimodalvision-language-model

Related projects:

RepositoryDescriptionStars
hkust-nlp/cevalAn evaluation suite providing multiple-choice questions for foundation models in various disciplines, with tools for assessing model performance.1,650
ruixiangcui/agievalEvaluates foundation models on human-centric tasks with diverse exams and question types714
pkunlp-icler/pca-evalAn open-source benchmark and evaluation tool for assessing multimodal large language models' performance in embodied decision-making tasks99
cloud-cv/evalaiA platform for comparing and evaluating AI and machine learning algorithms at scale1,779
maluuba/nlg-evalA toolset for evaluating and comparing natural language generation models1,350
mshukor/evalign-iclEvaluating and improving large multimodal models through in-context learning21
ailab-cvc/seed-benchA benchmark for evaluating large language models' ability to process multimodal input322
chartmimic/chartmimicAn open-source benchmarking project that evaluates large multimodal models' code generation capabilities via visually-grounded chart-to-code conversion95
obss/juryA comprehensive toolkit for evaluating NLP experiments offering automated metrics and efficient computation.187
fuxiaoliu/mmcDevelops a large-scale dataset and benchmark for training multimodal chart understanding models using large language models.87
x-plug/cvaluesEvaluates and aligns the values of Chinese large language models with safety and responsibility standards481
open-compass/vlmevalkitAn evaluation toolkit for large vision-language models1,514
open-compass/lawbenchEvaluates the legal knowledge of large language models using a custom benchmarking framework.273
krrishdholakia/betterpromptAn API for evaluating the quality of text prompts used in Large Language Models (LLMs) based on perplexity estimation43
openai/simple-evalsEvaluates language models using standardized benchmarks and prompting techniques.2,059