MiniCPM-V

Multimodal LLM

A multimodal language model designed to understand images, videos, and text inputs and generate high-quality text outputs.

MiniCPM-V 2.6: A GPT-4V Level MLLM for Single Image, Multi Image and Video on Your Phone

GitHub

13k stars
108 watching
902 forks
Language: Python
last commit: almost 2 years ago
Linked from 2 awesome lists

minicpmminicpm-vmulti-modal

Backlinks from these awesome lists:

Related projects:

RepositoryDescriptionStars
opengvlab/internvlDevelops large language models capable of processing multiple data types and modalities6,394
open-mmlab/mmcvProvides a foundational library for computer vision research and training deep learning models with high-quality implementation of common CPU and CUDA ops.5,948
openbmb/viscpmA family of large multimodal models supporting multimodal conversational capabilities and text-to-image generation in multiple languages1,098
vision-cair/minigpt-4Enabling vision-language understanding by fine-tuning large language models on visual data.25,490
dvlab-research/mgmAn open-source framework for training large language models with vision capabilities.3,229
qwenlm/qwen-vlA large vision language model with improved image reasoning and text recognition capabilities, suitable for various multimodal tasks5,179
opengvlab/llama-adapterAn implementation of a method for fine-tuning language models to follow instructions with high efficiency and accuracy5,775
open-mmlab/mmaction2A comprehensive video understanding toolbox and benchmark with modular design, supporting various tasks such as action recognition, localization, and retrieval.4,360
openmv/openmvA platform for machine vision development with programmable cameras and extensive image processing capabilities2,446
internlm/internlm-xcomposerA comprehensive multimodal system for long-term streaming video and audio interactions with capabilities including text-image comprehension and composition2,616
openbmb/toolbenchA platform for training, serving, and evaluating large language models to enable tool use capability4,888
thudm/cogvlmDevelops a state-of-the-art visual language model with applications in image understanding and dialogue systems.6,182
pleisto/yuren-baichuan-7bA multi-modal large language model that integrates natural language and visual capabilities with fine-tuning for various tasks73
luodian/otterA multi-modal AI model developed for improved instruction-following and in-context learning, utilizing large-scale architectures and various training datasets.3,570
cambrian-mllm/cambrianAn open-source multimodal LLM project with a vision-centric design1,799