ChatGPT n’est pas un modèle unique mais une interface qui fait tourner plusieurs LLM développés par OpenAI. Poser la question de la taille de ChatGPT revient à interroger les dimensions de chacun de ces modèles, de GPT-3.5 jusqu’aux récents GPT-5.x. Le problème : OpenAI ne publie plus le nombre exact de paramètres de ses modèles depuis GPT-4.
Paramètres des modèles GPT : ce qu’OpenAI a publié et ce qui reste estimé
Les premières générations ont fait l’objet de publications scientifiques détaillées. GPT-2, sorti en 2019, comptait 1,5 milliard de paramètres. GPT-3, lancé l’année suivante, a marqué un saut considérable avec 175 milliards de paramètres, un chiffre documenté dans l’article de recherche d’OpenAI.
À partir de GPT-4, la transparence s’est arrêtée. OpenAI n’a communiqué ni le nombre de paramètres ni l’architecture précise du modèle. Les estimations qui circulent situent GPT-4 dans une fourchette de plusieurs centaines de milliards à plus de mille milliards de paramètres, mais aucune de ces valeurs n’a été confirmée officiellement.
Pour les modèles plus récents (GPT-5.4, GPT-5.5, GPT-5.6), la situation est identique. Les données disponibles ne permettent pas de conclure sur un chiffre précis. OpenAI semble considérer que le nombre brut de paramètres n’est plus un indicateur pertinent à communiquer.

Fenêtre de contexte : la nouvelle mesure de taille d’un LLM ChatGPT
Les articles concurrents abordent la taille des LLM presque exclusivement sous l’angle du nombre de paramètres. Cette approche est devenue incomplète. En 2025-2026, la fenêtre de contexte définit autant la « taille » fonctionnelle d’un modèle que ses paramètres.
ChatGPT s’appuie désormais sur GPT-5.4 avec une fenêtre de 1 million de tokens en entrée. Les variantes GPT-5.5 et GPT-5.6 (Sol, Terra, Luna) poussent cette limite à environ 1,05 million de tokens en entrée et jusqu’à 128 000 tokens en sortie.
Un token ne correspond pas exactement à un mot. En français, un token représente en moyenne trois quarts d’un mot. Un million de tokens équivaut donc à plusieurs centaines de milliers de mots traités en une seule conversation, soit l’équivalent de plusieurs romans.
Pourquoi la fenêtre de contexte change la donne
Un modèle avec une fenêtre de contexte limitée oublie le début de la conversation à mesure qu’elle s’allonge. Avec un million de tokens, ChatGPT peut traiter des documents entiers, analyser des bases de code volumineuses ou maintenir une cohérence sur des échanges très longs.
Cette évolution a des implications concrètes sur la mémoire vive nécessaire pour faire tourner le modèle. Plus la fenêtre de contexte est grande, plus la quantité de données maintenues en mémoire pendant l’inférence augmente. C’est l’une des raisons pour lesquelles ces modèles restent hors de portée d’un usage local sur du matériel grand public.
Poids en gigaoctets et mémoire GPU : la taille physique des modèles GPT
Le nombre de paramètres se traduit en un poids concret sur disque et en mémoire. Chaque paramètre occupe entre 2 et 4 octets selon la précision numérique utilisée (FP16, FP32). Un modèle d’un milliard de paramètres en précision FP16 pèse environ 2 Go. Un modèle de plusieurs centaines de milliards de paramètres dépasse donc facilement le téraoctet en mémoire.
C’est là qu’intervient la quantification. Cette technique réduit la précision de chaque paramètre (par exemple de 16 bits à 4 bits) pour diminuer l’empreinte mémoire sans trop dégrader les performances. Les versions quantifiées de modèles open source comme LLaMA permettent de faire tourner des LLM de plusieurs milliards de paramètres sur un ordinateur personnel.
Faire tourner un LLM localement : quelles limites par rapport à ChatGPT
Les modèles accessibles en local via des outils comme LM Studio sont des versions bien plus petites que celles derrière ChatGPT. Voici les ordres de grandeur :
- Un modèle de 7 milliards de paramètres quantifié en 4 bits nécessite environ 4 à 6 Go de RAM GPU, ce qui reste accessible sur une carte graphique récente de milieu de gamme
- Un modèle de 70 milliards de paramètres quantifié demande plusieurs dizaines de Go de VRAM, réservé aux configurations professionnelles ou multi-GPU
- Les modèles derrière ChatGPT, estimés à plusieurs centaines de milliards de paramètres, tournent sur des clusters de milliers de GPU dans les datacenters d’OpenAI, un usage local à cette échelle reste inenvisageable
La taille de ChatGPT dépasse de très loin ce qu’un particulier peut exécuter sur sa propre machine, même avec du matériel haut de gamme.

Pourquoi OpenAI ne communique plus la taille exacte de ses modèles
Le silence d’OpenAI sur les paramètres de GPT-4 et de ses successeurs n’est pas anodin. Plusieurs facteurs expliquent ce choix.
La concurrence directe avec Google, Meta et Anthropic a poussé OpenAI à protéger ses avantages techniques. Publier l’architecture exacte d’un modèle facilite sa reproduction par des équipes concurrentes disposant des ressources de calcul nécessaires.
Par ailleurs, le nombre de paramètres seul ne prédit pas la qualité des réponses. Un modèle plus petit mais mieux entraîné, avec des données de meilleure qualité et un fine-tuning plus rigoureux, peut surpasser un modèle plus volumineux. OpenAI préfère orienter la communication sur les capacités (raisonnement, code, analyse d’images) plutôt que sur une métrique brute.
Les modèles récents utilisent aussi des architectures mixtes. GPT-4 reposerait sur un système de type « mixture of experts » (MoE), où seule une fraction des paramètres est activée pour chaque requête. Dans ce cas, annoncer un nombre total de paramètres serait trompeur puisque le modèle n’utilise pas la totalité de sa capacité pour chaque token généré.
Taille de ChatGPT LLM : ce que les chiffres connus permettent de situer
En résumé, les seuls chiffres publiés par OpenAI concernent les générations anciennes : 175 milliards de paramètres pour GPT-3. Pour GPT-4 et au-delà, on travaille avec des estimations non confirmées qui pointent vers plusieurs centaines de milliards, potentiellement plus d’un trillion avec une architecture MoE.
La vraie mesure de la taille de ChatGPT en 2026, c’est aussi sa fenêtre de contexte d’un million de tokens et l’infrastructure de calcul distribuée qui le fait tourner. Le nombre de paramètres reste un indicateur parmi d’autres, et probablement plus le plus révélateur de la puissance réelle du modèle.