Comprendre

L'IA et les modèles

Un modèle de langage ne « sait » rien : il prédit du texte. Comprendre ce détail change tout dans la façon de lui parler — et de le surveiller.

Un modèle de langage ne réfléchit pas comme vous

Il ne consulte pas une base de connaissances : il prédit, un token après l'autre, la suite la plus probable du texte qu'on lui donne. C'est pour cela qu'il peut écrire du code qui a l'air parfait… et qui ne compile pas.

Trois conséquences pratiques, à garder en tête en permanence :

  • Sans mémoire. Un modèle ne se souvient de rien entre deux appels : l'agent lui renvoie le contexte (fichiers, historique) à chaque tour. Un fichier qu'on ne lui envoie pas, il ne le voit pas.
  • Plausible n'est pas vrai. Une réponse confiante peut être fausse. Seul un test — le serveur qui démarre, la page qui s'affiche — prouve quelque chose.
  • Le contexte est un budget. Chaque tour relit tout l'historique et les fichiers. C'est ce qui coûte, et c'est ce qui finit par noyer l'essentiel.
La formule à retenir

Vous ne payez pas « une réponse » : vous payez tout ce que le modèle doit lire avant de répondre.

Les tokens : la monnaie du modèle

Un token est un morceau de mot : environ 3 à 4 caractères en français. Le modèle compte en tokens, facture en tokens, et sa fenêtre de contexte se mesure en tokens.

Un token

≈ 3 à 4 caractères

Le modèle ne voit pas des mots mais des morceaux de mots. « Bonjour » peut compter pour un seul token, « informatique » pour deux ou trois.

Une page de texte

≈ 800 tokens

Un paragraphe dense de 20 lignes en français tourne autour de 150 à 250 tokens.

Un fichier de code

≈ 12 tokens par ligne

Le code est plus dense que la prose : un fichier de 100 lignes pèse environ 1 200 tokens. Un projet de 20 fichiers se lit donc pour ~25 000 tokens.

Une session d'agent

≈ 30 000 à 200 000 tokens

Le coût ne vient pas de votre question (courte) mais du contexte relu à chaque tour : fichiers, historique, réponses précédentes.

La fenêtre de contexte : la table de travail

La fenêtre de contexte, c'est la quantité maximale de texte que le modèle peut « garder sous les yeux » en une fois : votre question, l'historique, les fichiers lus par l'agent. Les modèles actuels de DeepSeek ouvrent une fenêtre de 1 million de tokens — de quoi lire un gros projet… et de quoi payer cher si on la remplit sans réfléchir.

deepseek-flash

DeepSeek V4.1 Flash

Le modèle à utiliser par défaut : rapide, très bon marché, mode « réflexion » intégré.

  • Contexte de 1 million de tokens, sortie jusqu'à 384 000 tokens
  • Réfléchit ou répond directement (mode thinking par défaut)
  • Accepte les images, les appels d'outils et le format JSON
  • Rapport qualité-prix imbattable pour un projet d'élève
deepseek-v4-pro

DeepSeek V4 Pro

Le grand frère : à réserver aux tâches vraiment difficiles.

  • Même contexte de 1 million de tokens
  • Environ 4 à 5 fois plus cher que Flash
  • Pas d'analyse d'images
  • Utile quand Flash tourne en rond sur un problème de logique
Pourquoi l'agent « oublie »

Quand la conversation devient longue, l'agent doit résumer ou abandonner une partie du contexte : c'est le rôle du /compact d'OpenCode (voir la section OpenCode). Une session neuve, avec un contexte propre, est parfois plus efficace qu'une session de trois heures.

Effort et qualité : où placer le curseur

Les modèles actuels ont un mode réflexion (« thinking ») : avant de répondre, ils rédigent un raisonnement interne, token par token. C'est très efficace sur les problèmes tordus… et inutile pour renommer un fichier. Ces tokens de réflexion sont facturés en sortie, la ligne la plus chère.

TâcheRéglage conseilléPourquoi
Ajouter une section, corriger une faute, renommerRéponse directeLa solution est évidente : réfléchir ne fait qu'ajouter des tokens.
Comprendre une erreur inconnueRéflexionLe modèle doit explorer des hypothèses avant de choisir.
Concevoir la structure d'un projetRéflexion + mode planUne erreur de conception coûte beaucoup plus cher que quelques tokens.
Refaire ce qui vient d'échouerNouveau prompt, pas plus d'effortSi c'est raté, le problème est dans la demande — pas dans la puissance.
Le vrai levier de qualité, c'est vous

Passer de Flash à Pro change peu sur une page web. Un objectif clair, un contexte propre et un test après chaque modification changent tout. La qualité vient du pilotage, pas de la taille du modèle.

Combien ça coûte, concrètement

DeepSeek facture au token, avec deux tarifs selon l'heure (les heures pleines sont le double des heures creuses) et un tarif très réduit quand le début du contexte est déjà en cache. Voici les prix officiels du moment, en dollars par million de tokens :

Prix (par million de tokens)deepseek-flashdeepseek-v4-pro
Entrée — cache manqué0,15 $ creux · 0,30 $ pleines0,66 $ creux · 1,32 $ pleines
Entrée — cache touché0,0030 $ creux · 0,0060 $ pleines0,0220 $ creux · 0,0440 $ pleines
Sortie0,60 $ creux · 1,20 $ pleines1,98 $ creux · 3,96 $ pleines

Un projet d'élève — quelques dizaines de requêtes, un projet de taille modeste — coûte en général moins d'un dollar. Ce qui fait exploser la note, ce n'est pas le nombre de questions : c'est le contexte qu'on laisse grossir.

Calculez votre propre scénario

Tarif appliqué

Comparaison du coût en heures creuses et en heures pleines
TarifEntréeSortieTotal
Heures creuses
Heures pleines

Prix publics DeepSeek vérifiés le 29/09/2026 (dollars US, par million de tokens). Le cache est automatique : la part « déjà en cache » reste une estimation. Les heures pleines sont 01 h–04 h et 06 h–10 h UTC, du lundi au vendredi ; tout le reste, week-ends compris, est en heures creuses.

Deux détails qui changent tout
  • Le cache est automatique. Le préfixe de contexte déjà envoyé est facturé environ 50 fois moins cher (0,003 $ contre 0,15 $ par million, sur Flash). C'est pour cela qu'une longue session n'est pas forcément ruineuse — mais seulement si elle réutilise ce qu'elle a déjà lu.
  • Les heures creuses tombent bien. Les heures pleines sont 01 h–04 h et 06 h–10 h UTC, du lundi au vendredi : en France, cela correspond surtout à la matinée et au milieu de la nuit. Le week-end entier est en tarif réduit, et le créneau 12 h–3 h du matin aussi.

Cinq leviers pour payer moins

Travailler en heures creuses

Le tarif est divisé par deux : tout le week-end, les jours fériés chinois et, en semaine, en dehors de 01 h–04 h et 06 h–10 h UTC (soit 03 h–06 h et 08 h–12 h à l'heure de Paris en été).

Laisser le cache travailler

Le début du contexte déjà envoyé est facturé ~50 fois moins cher (cache touché). C'est automatique : moins vous recommencez de zéro, plus vous payez peu.

Nettoyer le contexte

Une session qui traîne relit sans arrêt les mêmes fichiers et les mêmes erreurs. Compacter (voir OpenCode) ou repartir d'une session neuve coûte souvent moins cher que continuer.

Réserver la « réflexion » aux cas difficiles

Le mode thinking produit des milliers de tokens de raisonnement, facturés en sortie. Pour renommer un fichier ou corriger une faute, il ne sert à rien.

Demander petit

Une demande précise = une réponse courte = moins de tokens. « Ajoute un titre » coûte moins que « refais toute la page », et se corrige mieux.

Quatre croyances à vérifier

« Il se souvient de notre conversation d'hier. »

Non : un modèle est sans mémoire. L'agent lui renvoie le contexte à chaque tour. S'il n'envoie pas un fichier, le modèle ne le voit pas.

« Il a dit que c'était corrigé, donc c'est corrigé. »

Il dit ce qui est plausible. Seul un test dans le navigateur prouve quelque chose. Le ton assuré n'est pas une preuve.

« Avec 1 million de tokens de contexte, il sait tout. »

Une grande fenêtre n'est pas une grande attention : noyé dans trop de texte, le modèle rate l'essentiel. Un contexte propre vaut mieux qu'un contexte énorme.

« Plus cher = meilleur. »

La différence entre Flash et Pro se voit sur les problèmes difficiles. Sur une page web classique, vous payez surtout des tokens de sortie : mieux vaut un bon prompt qu'un gros modèle.

Pour aller plus loin