Join Médicis

Fondamentaux IA

Fenêtre de contexte

context window

La fenêtre de contexte est la quantité maximale de tokens qu'un modèle IA traite en une fois. Définition, fonctionnement, limites et conseils pratiques.

Qu'est-ce qu'une fenêtre de contexte ?

La fenêtre de contexte est la quantité maximale d'informations, mesurée en tokens, qu'un modèle d'IA peut traiter en une seule fois. Elle englobe l'ensemble des données fournies au modèle pour générer une réponse : votre message, l'historique de la conversation, les documents joints, les instructions système et la réponse elle-même.

Aussi connu sous : longueur de contexte, context window.

Pourquoi la taille de la fenêtre de contexte compte pour vous

Une fenêtre plus large permet de fournir davantage de documents ou de conserver une conversation plus longue sans que le modèle « oublie » le début de l'échange. Mais chaque token supplémentaire dans cette fenêtre a un coût de calcul, et donc un coût financier. Les besoins de calcul augmentent de façon quadratique avec la longueur de la séquence : doubler le nombre de tokens en entrée peut multiplier par quatre la puissance de traitement nécessaire. Choisir la taille de contexte adaptée à votre usage, plutôt que la plus grande disponible par défaut, reste un vrai levier de maîtrise des coûts.

Comment fonctionne une fenêtre de contexte

Les modèles de langage actuels reposent sur une architecture Transformer, qui utilise un mécanisme d'auto-attention pour calculer les relations entre tous les tokens d'une séquence. La taille de la fenêtre de contexte détermine combien de tokens le modèle peut mettre en relation à la fois. Le texte que vous tapez n'occupe généralement qu'une partie de cet espace : le prompt système, l'historique de conversation, les documents récupérés par une architecture RAG et le formatage consomment aussi des tokens dans la même fenêtre.

Ce même principe s'applique au-delà du texte. Les modèles multimodaux appliquent une logique équivalente aux pixels d'une image ou aux fragments d'un fichier audio : une image en très haute résolution peut, elle aussi, dépasser la fenêtre de contexte disponible.

Une fenêtre plus grande n'est pas toujours meilleure

L'augmentation continue de la taille des fenêtres de contexte s'accompagne d'un débat récurrent dans la recherche : les modèles exploitent-ils vraiment tout cet espace efficacement ? Une étude de 2023 menée par des chercheurs de Stanford et de UC Berkeley a montré que les modèles étaient nettement plus performants lorsque l'information pertinente se situait au début ou à la fin du contexte fourni, et que leurs performances se dégradaient quand cette information se trouvait au milieu d'un long passage, un phénomène surnommé lost in the middle. D'autres travaux ont observé une baisse de performance significative au-delà de quelques dizaines de milliers de tokens sur des tâches de classification fine, quel que soit le modèle testé.

Dans l'industrie, certains praticiens vont plus loin et considèrent qu'une très grande fenêtre de contexte relève parfois davantage de l'argument commercial que du besoin réel : peu d'usages professionnels nécessitent réellement d'interroger l'équivalent d'un livre entier en une seule requête. Pour objectiver ce débat, plusieurs benchmarks ont été conçus spécifiquement pour évaluer la capacité réelle d'un modèle à retrouver une information précise noyée dans un contexte long, comme Needle-in-a-Haystack, RULER ou LongBench. Ces tests servent de référence pour comparer les modèles entre eux sur ce critère précis, plutôt que de se fier au seul nombre de tokens annoncé.

Fenêtre de contexte ou RAG : lequel choisir

Deux approches permettent à un modèle de travailler avec de grandes quantités d'informations. Fournir directement tous les documents dans la fenêtre de contexte, ou passer par une architecture RAG (génération augmentée de récupération), qui ne sélectionne et n'injecte que les passages pertinents pour la question posée.

Une fenêtre de contexte large convient bien à l'analyse ponctuelle d'un document unique et volumineux (contrat, transcription, base de code). Le RAG reste préférable pour une base de connaissances stable et réutilisée à grande échelle, où il réduit le coût par requête et permet une mise à jour continue des données sans réentraîner ni recharger l'ensemble du corpus à chaque appel.

Questions fréquentes sur la fenêtre de contexte

Que se passe-t-il si je dépasse la fenêtre de contexte d'un modèle ? La requête échoue ou le contenu le plus ancien est tronqué, selon le système utilisé. Il n'existe pas de dégradation progressive comme avec la mémoire humaine, la limite est stricte.

Une fenêtre de contexte plus grande coûte-t-elle plus cher ? Oui, en général. Le coût d'un appel dépend directement du nombre de tokens traités, entrée et sortie comprises, quel que soit le modèle utilisé (Claude, ChatGPT, Gemini, Mistral ou DeepSeek).

Le prompt caching réduit-il vraiment les coûts ? Oui. Réutiliser une partie de contexte déjà traitée lors d'un appel précédent (un document, un historique) est généralement facturé à un tarif réduit par rapport à un traitement complet.

Comment gérer concrètement votre fenêtre de contexte

  • Résumez ou condensez les documents volumineux avant de les injecter plutôt que de fournir un contenu brut intégral.
  • Découpez les conversations longues plutôt que de laisser l'historique s'accumuler indéfiniment.
  • Placez les informations les plus importantes en début ou en fin de contexte, là où les modèles restent les plus fiables.

Ces réflexes limitent à la fois le coût et le risque de dégradation de la qualité des réponses, quel que soit le modèle choisi.

Dernière mise à jour : 30 septembre 2026

La bibliothèque IA gratuite et open-source pour les marketeurs

Retrouvez facilement des ressources gratuites tels que des Skills, des MCP, des workflows et des agents IA. Fait pour les marketers par des marketers !

  • Skills, MCP, workflows et agents IA prêts à l'emploi
  • 100 % gratuit, sans paywall ni conditions cachées
  • Open-source : code MIT, contenu CC BY 4.0
Contribuer