πŸ† #671 overall#201 of 601 in Language Models

YangLing0818 /RPG-DiffusionMaster

[ICML 2024] Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs (RPG)

$ git clone https://github.com/YangLing0818/RPG-DiffusionMaster.git
GitHub social preview for YangLing0818/RPG-DiffusionMaster
Stars
1.8K
1,845
Forks
100
100
Language
Jupyter Notebook
License
MIT
Created
Jan 22, 2024
2.7 years old
Last push
Feb 1, 2025

Categories

GitHub topics

More in Language Models

Language Models

ictnlp/LLaMA-Omni

LLaMA-Omni is a low-latency and high-quality end-to-end speech interaction model built upon Llama-3.1-8B-Instruct, aiming to achieve speech capabilities at the GPT-4o level.

PythonApache-2.0updated May 19, 2025
GitHub β†—β˜… 3.1Kβ‘‚ 225
Language Models

cambrian-mllm/cambrian

Cambrian-1 is a family of multimodal LLMs with a vision-centric design.

PythonApache-2.0updated Nov 7, 2025
GitHub β†—β˜… 2Kβ‘‚ 140
Language Models

EvolvingLMMs-Lab/NEO

NEO Series: Native Vision-Language Models from First Principles

PythonApache-2.0updated Jul 27, 2026
GitHub β†—β˜… 893β‘‚ 33
Language Models

MME-Benchmarks/Video-MME

✨✨[CVPR 2025] Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Otherno licenseupdated Dec 8, 2025
GitHub β†—β˜… 796β‘‚ 30
Language Models

FoundationVision/UniTok

[NeurIPS 2025 Spotlight] A Unified Tokenizer for Visual Generation and Understanding

βœ‚οΈ Tokenization & Preprocessing
PythonMITupdated Nov 14, 2025
GitHub β†—β˜… 533β‘‚ 14
Language Models

VITA-MLLM/Freeze-Omni

✨✨Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM

πŸŽ™οΈ Speech Recognition
PythonOtherupdated May 27, 2025
GitHub β†—β˜… 398β‘‚ 31

Data from GitHub Β· snapshot Sep 24, 2026