Aller au contenu
English
English
medium

Gemini CLI : modèles, quotas et coûts

15 min de lecture

Gemini CLI ne facture rien en soi : ce qui compte, c'est le modèle appelé et le quota de votre accès. Ce guide explique quel modèle l'agent utilise (Flash ou Pro), comment le choisir, quels sont les quotas de la clé API en 2026, et comment suivre puis maîtriser votre consommation de tokens. Il s'adresse à qui veut travailler sans exploser son quota ni sa facture, débutant comme intermédiaire.

  • Comment l'agent est authentifié en 2026 et ce que ça change
  • La différence entre Gemini Flash et Gemini Pro, et lequel choisir
  • Forcer un modèle par la ligne de commande, le REPL ou settings.json
  • Suivre votre consommation de tokens avec /stats
  • Réduire vos coûts sans dégrader la qualité

Ce qui a disparu le 18 juin 2026, c'est la voie GRATUITE par compte Google, pas le compte Google lui-même. La documentation officielle le formule sans détour : « Gemini CLI was replaced by Antigravity CLI on June 18th, 2026 », pour les utilisateurs du palier gratuit et de Google One. Les paliers payants, eux, continuent de fonctionner avec Gemini CLI.

Quatre voies restent ouvertes, et leur quota diffère d'un facteur six :

MéthodePalierRequêtes par jourModèles accessibles
Compte GoogleGemini Code Assist1 000toute la famille Gemini, choisie par la CLI
Compte GoogleGoogle AI Pro1 500idem
Compte WorkspaceCode Assist Standard1 500idem
Clé API Geminigratuit250Flash uniquement
Vertex AIExpressvariableselon le projet

Deux lignes méritent qu'on s'y arrête. La clé API gratuite plafonne à 250 requêtes par jour et ne sert que du Flash : c'est quatre fois moins qu'un compte Code Assist, et sans accès aux modèles de raisonnement. Et une requête « par jour » n'est pas une requête « que vous tapez », la suite de cette page le mesure.

La méthode active se lit dans votre configuration, et pas ailleurs :

Fenêtre de terminal
python3 -c "import json,pathlib;print(json.loads((pathlib.Path.home()/'.gemini'/'settings.json').read_text())['security']['auth']['selectedType'])"
# gemini-api-key

Gemini CLI s'appuie sur la famille Gemini 3. Deux profils de modèles couvrent l'essentiel des usages, et ils n'ont ni le même coût ni la même vocation :

ModèlePour quoiAccès
Gemini Flash (gemini-3.5-flash)Vitesse et volume : édition, questions, itérations rapidesÉligible au free tier
Gemini Pro (gemini-3.1-pro-preview)Raisonnement complexe, gros refactors, analyse profondePayant

Le réflexe économique est simple : rester sur Flash par défaut, et ne basculer sur Pro que pour les tâches qui le justifient vraiment.

Écrivez le nom exact, la CLI ne vous rattrapera pas

Section intitulée « Écrivez le nom exact, la CLI ne vous rattrapera pas »

Un nom de modèle inexistant produit un message qui ne nomme ni le modèle ni l'erreur. Relevé le 20 septembre 2026 avec Gemini CLI 0.47.0 :

Fenêtre de terminal
gemini -m gemini-3-pro -p "OK"
# An unexpected critical error occurred:[object Object]

Derrière ce message se cache un 404 de l'API, avec is not found. Le nom gemini-3-pro n'existe pas : la famille Pro s'appelle gemini-3.1-pro-preview. La liste réelle se demande à l'API, pas à la documentation :

Fenêtre de terminal
curl -s -H "x-goog-api-key: $GEMINI_API_KEY" \
https://generativelanguage.googleapis.com/v1beta/models \
| jq -r '.models[] | select(.supportedGenerationMethods[]? == "generateContent")
| .name | sub("^models/";"")' | grep '^gemini-3'

Relevé ce jour-là, 50 modèles servis par la clé, dont ces familles :

FamilleModèles réellement servis
Flashgemini-3.5-flash, gemini-3.6-flash, gemini-3.7-flash, gemini-3.8-flash
Flash Litegemini-3.1-flash-lite, gemini-3.5-flash-lite
Progemini-3.1-pro-preview
Imagegemini-3-pro-image, gemini-3.1-flash-image

Le modèle servi par défaut n'est pas le plus récent. La CLI 0.47.0 utilise gemini-3.5-flash alors que gemini-3.8-flash est disponible : le défaut suit la version de la CLI, pas le catalogue de l'API.

Une requête, deux modèles, deux fois votre quota

Section intitulée « Une requête, deux modèles, deux fois votre quota »

Un seul prompt consomme des requêtes sur deux modèles différents, et c'est invisible si on ne regarde pas les statistiques. Mesuré sur un prompt trivial, gemini -p "OK" :

ModèleRôleRequêtes
gemini-3.5-flashmain4
gemini-3.1-flash-liteutility_router1

Le second modèle est le routeur : il décide quel modèle traitera la demande, et il a son propre coût. Quand vous comptez « 250 requêtes par jour », ce n'est donc pas 250 prompts que vous pouvez taper.

Par défaut, la barre d'état du REPL affiche /model : Auto : la CLI choisit le modèle adapté à la demande. C'est confortable, mais quand on surveille un quota, on veut parfois imposer un modèle précis. Trois moyens, du plus ponctuel au plus permanent :

  1. Le temps d'une commande, avec le drapeau -m :

    Fenêtre de terminal
    gemini -m gemini-3.5-flash -p "Résume ce dépôt"
  2. Pendant une session, avec la commande /model. L'option --persist écrit le choix dans votre configuration :

    > /model set gemini-3.5-flash --persist
  3. De façon durable, dans un settings.json, via la clé model.name :

    {
    "model": {
    "name": "gemini-3.5-flash"
    }
    }

L'ordre de priorité est -m, puis GEMINI_MODEL, puis model.name. Le plus ponctuel l'emporte, ce qui est l'ordre attendu, mais le guide ne l'affirmait pas et il valait mieux le vérifier que le supposer. Mesuré le 20 septembre 2026 en empilant les trois contraintes, avec trois modèles différents pour distinguer lequel agit :

Contraintes poséesModèle réellement servi
model.name: gemini-3.5-flash-litegemini-3.5-flash-lite
la même, plus GEMINI_MODEL=gemini-3.1-flash-litegemini-3.1-flash-lite
les deux, plus -m gemini-3.5-flashgemini-3.5-flash

Placé dans le settings.json d'un projet, ce choix s'applique à toute l'équipe qui travaille sur le dépôt, comme vu dans le guide de configuration.

Les limites de la clé API gratuite sont pensées pour l'essai, pas pour un usage soutenu. La page officielle des quotas de Gemini CLI publie un seul chiffre pour cette voie : 250 requêtes par jour, sur le modèle Flash uniquement. C'est le même que celui du tableau plus haut, et il n'y a pas d'autre plafond journalier à connaître.

Elle ne publie en revanche aucune limite par minute, quelle que soit la méthode. Cette limite existe pourtant, et elle se découvre à l'usage : le serveur la nomme lui-même dans son refus, ce que la page d'installation détaille avec un 429 relevé sur une clé gratuite. Retenir un ordre de grandeur lu ailleurs serait donc une erreur, puisque la valeur dépend du modèle et du palier. Deux règles structurent ces limites :

  • Le quota est par projet, pas par clé : créer plusieurs clés sous le même projet n'augmente pas votre quota.
  • Le compteur journalier se remet à zéro à minuit, heure du Pacifique, pas à votre minuit local.

Au-delà du free tier, activer la facturation sur le projet lève l'essentiel des limites basses et donne accès à Pro. La consommation devient alors un coût à surveiller, ce qui rend le suivi ci-dessous encore plus utile.

Gemini CLI expose sa consommation, ce qui évite de découvrir le problème une fois le quota atteint. En session, la commande /stats affiche le détail par session, par modèle et par outil.

En mode headless, la sortie JSON contient un bloc stats exploitable dans un script. Sur une simple requête de test, on lit le modèle servi et le décompte précis des tokens :

"stats": {
"models": {
"gemini-3.5-flash": {
"api": { "totalRequests": 1, "totalErrors": 0 },
"tokens": {
"input": 2005,
"prompt": 8098,
"cached": 6093,
"thoughts": 291,
"total": 8390
}
}
}
}

Deux chiffres méritent l'attention. Le champ cached (ici 6093 tokens sur 8390) correspond au contexte réutilisé d'un tour à l'autre, souvent facturé moins cher : un contexte stable coûte moins. Le champ thoughts mesure les tokens de raisonnement interne, plus élevés sur les modèles Pro.

Quelques réglages et habitudes suffisent à garder la consommation sous contrôle, sans sacrifier la qualité des réponses :

  • Garder Flash par défaut et réserver Pro aux tâches complexes.
  • Limiter la longueur des sessions avec model.maxSessionTurns dans settings.json : un plafond évite les boucles qui consomment sans avancer.
  • Compresser le contexte : la clé model.compressionThreshold déclenche un résumé automatique quand la conversation grossit, ce qui réduit les tokens renvoyés à chaque tour.
  • Cadrer avant d'exécuter : préparer la tâche en lecture seule (le plan mode) évite les allers-retours coûteux dus à des actions mal ciblées.

Quand l'agent renvoie une erreur de type quota exceeded ou un code 429, la cause et la parade sont généralement claires :

SymptômeCause probableSolution
Erreur 429 en rafaleRequêtes par minute dépasséesRalentir la cadence, espacer les prompts
Blocage en fin de journéePlafond journalier atteintAttendre le reset (minuit Pacifique) ou activer la facturation
Pro inaccessibleModèle payant sans facturationActiver la facturation, ou rester sur Flash
Quota inchangé malgré une 2ᵉ cléLimite par projetUtiliser un autre projet, pas une autre clé
  1. La voie dépend de votre palier, pas de vos préférences. Palier gratuit ou Google One : Gemini CLI a été remplacé par Antigravity CLI le 18 juin 2026. Paliers payants (Code Assist, AI Pro, AI Ultra, Workspace) : la connexion par compte Google reste la voie recommandée par Google. La clé API Gemini reste ouverte à tous, à 250 requêtes par jour sur Flash.
  2. Flash est rapide et éligible au free tier ; Pro est payant et réservé aux tâches complexes.
  3. Le mode Auto choisit pour vous ; on force un modèle avec -m, /model set --persist ou model.name.
  4. Le quota gratuit est par projet et se réinitialise à minuit Pacifique ; les chiffres exacts évoluent, la doc officielle fait foi.
  5. /stats et la sortie JSON headless donnent la consommation réelle de tokens (dont cached et thoughts).
  6. On maîtrise les coûts avec Flash par défaut, maxSessionTurns, compressionThreshold et un contexte propre.

Ce site vous est utile ?

Sachez que moins de 1% des lecteurs soutiennent ce site.

Je maintiens ce site gratuitement, sans publicité, sans profilage et sans compte à créer. Un soutien, même symbolique, m'aide à couvrir l'hébergement et à garder ces ressources gratuites. Merci pour votre appui.

Le formulaire ne s'affiche pas ? Ouvrir Ko-fi dans un onglet.

Abonnez-vous et suivez mon actualité DevSecOps sur LinkedIn