Gemini CLI ne facture rien en soi : ce qui compte, c'est le modèle appelé et le quota de votre accès. Ce guide explique quel modèle l'agent utilise (Flash ou Pro), comment le choisir, quels sont les quotas de la clé API en 2026, et comment suivre puis maîtriser votre consommation de tokens. Il s'adresse à qui veut travailler sans exploser son quota ni sa facture, débutant comme intermédiaire.
Ce que vous allez apprendre
Section intitulée « Ce que vous allez apprendre »- Comment l'agent est authentifié en 2026 et ce que ça change
- La différence entre Gemini Flash et Gemini Pro, et lequel choisir
- Forcer un modèle par la ligne de commande, le REPL ou
settings.json - Suivre votre consommation de tokens avec
/stats - Réduire vos coûts sans dégrader la qualité
Prérequis
Section intitulée « Prérequis »- Gemini CLI installé et authentifié. Voir Installer Gemini CLI.
- Notions de configuration. Voir Configurer avec settings.json.
L'authentification a changé en 2026
Section intitulée « L'authentification a changé en 2026 »Ce qui a disparu le 18 juin 2026, c'est la voie GRATUITE par compte Google, pas le compte Google lui-même. La documentation officielle le formule sans détour : « Gemini CLI was replaced by Antigravity CLI on June 18th, 2026 », pour les utilisateurs du palier gratuit et de Google One. Les paliers payants, eux, continuent de fonctionner avec Gemini CLI.
Quatre voies restent ouvertes, et leur quota diffère d'un facteur six :
| Méthode | Palier | Requêtes par jour | Modèles accessibles |
|---|---|---|---|
| Compte Google | Gemini Code Assist | 1 000 | toute la famille Gemini, choisie par la CLI |
| Compte Google | Google AI Pro | 1 500 | idem |
| Compte Workspace | Code Assist Standard | 1 500 | idem |
| Clé API Gemini | gratuit | 250 | Flash uniquement |
| Vertex AI | Express | variable | selon le projet |
Deux lignes méritent qu'on s'y arrête. La clé API gratuite plafonne à 250 requêtes par jour et ne sert que du Flash : c'est quatre fois moins qu'un compte Code Assist, et sans accès aux modèles de raisonnement. Et une requête « par jour » n'est pas une requête « que vous tapez », la suite de cette page le mesure.
La méthode active se lit dans votre configuration, et pas ailleurs :
python3 -c "import json,pathlib;print(json.loads((pathlib.Path.home()/'.gemini'/'settings.json').read_text())['security']['auth']['selectedType'])"# gemini-api-keyFlash ou Pro : quel modèle
Section intitulée « Flash ou Pro : quel modèle »Gemini CLI s'appuie sur la famille Gemini 3. Deux profils de modèles couvrent l'essentiel des usages, et ils n'ont ni le même coût ni la même vocation :
| Modèle | Pour quoi | Accès |
|---|---|---|
Gemini Flash (gemini-3.5-flash) | Vitesse et volume : édition, questions, itérations rapides | Éligible au free tier |
Gemini Pro (gemini-3.1-pro-preview) | Raisonnement complexe, gros refactors, analyse profonde | Payant |
Le réflexe économique est simple : rester sur Flash par défaut, et ne basculer sur Pro que pour les tâches qui le justifient vraiment.
Écrivez le nom exact, la CLI ne vous rattrapera pas
Section intitulée « Écrivez le nom exact, la CLI ne vous rattrapera pas »Un nom de modèle inexistant produit un message qui ne nomme ni le modèle ni l'erreur. Relevé le 20 septembre 2026 avec Gemini CLI 0.47.0 :
gemini -m gemini-3-pro -p "OK"# An unexpected critical error occurred:[object Object]Derrière ce message se cache un 404 de l'API, avec is not found. Le nom
gemini-3-pro n'existe pas : la famille Pro s'appelle
gemini-3.1-pro-preview. La liste réelle se demande à l'API, pas à la
documentation :
curl -s -H "x-goog-api-key: $GEMINI_API_KEY" \ https://generativelanguage.googleapis.com/v1beta/models \ | jq -r '.models[] | select(.supportedGenerationMethods[]? == "generateContent") | .name | sub("^models/";"")' | grep '^gemini-3'Relevé ce jour-là, 50 modèles servis par la clé, dont ces familles :
| Famille | Modèles réellement servis |
|---|---|
| Flash | gemini-3.5-flash, gemini-3.6-flash, gemini-3.7-flash, gemini-3.8-flash |
| Flash Lite | gemini-3.1-flash-lite, gemini-3.5-flash-lite |
| Pro | gemini-3.1-pro-preview |
| Image | gemini-3-pro-image, gemini-3.1-flash-image |
Le modèle servi par défaut n'est pas le plus récent. La CLI 0.47.0 utilise
gemini-3.5-flash alors que gemini-3.8-flash est disponible : le défaut suit
la version de la CLI, pas le catalogue de l'API.
Une requête, deux modèles, deux fois votre quota
Section intitulée « Une requête, deux modèles, deux fois votre quota »Un seul prompt consomme des requêtes sur deux modèles différents, et c'est
invisible si on ne regarde pas les statistiques. Mesuré sur un prompt trivial,
gemini -p "OK" :
| Modèle | Rôle | Requêtes |
|---|---|---|
gemini-3.5-flash | main | 4 |
gemini-3.1-flash-lite | utility_router | 1 |
Le second modèle est le routeur : il décide quel modèle traitera la demande, et il a son propre coût. Quand vous comptez « 250 requêtes par jour », ce n'est donc pas 250 prompts que vous pouvez taper.
Le mode Auto et comment forcer un modèle
Section intitulée « Le mode Auto et comment forcer un modèle »Par défaut, la barre d'état du REPL affiche /model : Auto : la CLI
choisit le modèle adapté à la demande. C'est confortable, mais quand on
surveille un quota, on veut parfois imposer un modèle précis. Trois moyens,
du plus ponctuel au plus permanent :
-
Le temps d'une commande, avec le drapeau
-m:Fenêtre de terminal gemini -m gemini-3.5-flash -p "Résume ce dépôt" -
Pendant une session, avec la commande
/model. L'option--persistécrit le choix dans votre configuration :> /model set gemini-3.5-flash --persist -
De façon durable, dans un
settings.json, via la clémodel.name:{"model": {"name": "gemini-3.5-flash"}}
Qui gagne quand les trois se contredisent
Section intitulée « Qui gagne quand les trois se contredisent »L'ordre de priorité est -m, puis GEMINI_MODEL, puis model.name. Le plus
ponctuel l'emporte, ce qui est l'ordre attendu, mais le guide ne l'affirmait pas
et il valait mieux le vérifier que le supposer. Mesuré le 20 septembre 2026 en
empilant les trois contraintes, avec trois modèles différents pour distinguer
lequel agit :
| Contraintes posées | Modèle réellement servi |
|---|---|
model.name: gemini-3.5-flash-lite | gemini-3.5-flash-lite |
la même, plus GEMINI_MODEL=gemini-3.1-flash-lite | gemini-3.1-flash-lite |
les deux, plus -m gemini-3.5-flash | gemini-3.5-flash |
Placé dans le settings.json d'un projet, ce choix s'applique à toute
l'équipe qui travaille sur le dépôt, comme vu dans le
guide de configuration.
Comprendre les quotas de la clé API
Section intitulée « Comprendre les quotas de la clé API »Les limites de la clé API gratuite sont pensées pour l'essai, pas pour un usage soutenu. La page officielle des quotas de Gemini CLI publie un seul chiffre pour cette voie : 250 requêtes par jour, sur le modèle Flash uniquement. C'est le même que celui du tableau plus haut, et il n'y a pas d'autre plafond journalier à connaître.
Elle ne publie en revanche aucune limite par minute, quelle que soit la
méthode. Cette limite existe pourtant, et elle se découvre à l'usage : le
serveur la nomme lui-même dans son refus, ce que la page d'installation détaille
avec un 429 relevé sur une clé gratuite. Retenir un ordre de grandeur lu
ailleurs serait donc une erreur, puisque la valeur dépend du modèle et du palier.
Deux règles structurent ces limites :
- Le quota est par projet, pas par clé : créer plusieurs clés sous le même projet n'augmente pas votre quota.
- Le compteur journalier se remet à zéro à minuit, heure du Pacifique, pas à votre minuit local.
Au-delà du free tier, activer la facturation sur le projet lève l'essentiel des limites basses et donne accès à Pro. La consommation devient alors un coût à surveiller, ce qui rend le suivi ci-dessous encore plus utile.
Suivre sa consommation de tokens
Section intitulée « Suivre sa consommation de tokens »Gemini CLI expose sa consommation, ce qui évite de découvrir le problème une
fois le quota atteint. En session, la commande /stats affiche le détail
par session, par modèle et par outil.
En mode headless, la sortie JSON contient un bloc stats exploitable dans un
script. Sur une simple requête de test, on lit le modèle servi et le décompte
précis des tokens :
"stats": { "models": { "gemini-3.5-flash": { "api": { "totalRequests": 1, "totalErrors": 0 }, "tokens": { "input": 2005, "prompt": 8098, "cached": 6093, "thoughts": 291, "total": 8390 } } }}Deux chiffres méritent l'attention. Le champ cached (ici 6093 tokens sur
8390) correspond au contexte réutilisé d'un tour à l'autre, souvent facturé
moins cher : un contexte stable coûte moins. Le champ thoughts mesure
les tokens de raisonnement interne, plus élevés sur les modèles Pro.
Maîtriser ses coûts
Section intitulée « Maîtriser ses coûts »Quelques réglages et habitudes suffisent à garder la consommation sous contrôle, sans sacrifier la qualité des réponses :
- Garder Flash par défaut et réserver Pro aux tâches complexes.
- Limiter la longueur des sessions avec
model.maxSessionTurnsdanssettings.json: un plafond évite les boucles qui consomment sans avancer. - Compresser le contexte : la clé
model.compressionThresholddéclenche un résumé automatique quand la conversation grossit, ce qui réduit les tokens renvoyés à chaque tour. - Cadrer avant d'exécuter : préparer la tâche en lecture seule (le plan mode) évite les allers-retours coûteux dus à des actions mal ciblées.
Dépannage : quota atteint
Section intitulée « Dépannage : quota atteint »Quand l'agent renvoie une erreur de type quota exceeded ou un code 429, la cause et la parade sont généralement claires :
| Symptôme | Cause probable | Solution |
|---|---|---|
Erreur 429 en rafale | Requêtes par minute dépassées | Ralentir la cadence, espacer les prompts |
| Blocage en fin de journée | Plafond journalier atteint | Attendre le reset (minuit Pacifique) ou activer la facturation |
| Pro inaccessible | Modèle payant sans facturation | Activer la facturation, ou rester sur Flash |
| Quota inchangé malgré une 2ᵉ clé | Limite par projet | Utiliser un autre projet, pas une autre clé |
À retenir
Section intitulée « À retenir »- La voie dépend de votre palier, pas de vos préférences. Palier gratuit ou Google One : Gemini CLI a été remplacé par Antigravity CLI le 18 juin 2026. Paliers payants (Code Assist, AI Pro, AI Ultra, Workspace) : la connexion par compte Google reste la voie recommandée par Google. La clé API Gemini reste ouverte à tous, à 250 requêtes par jour sur Flash.
- Flash est rapide et éligible au free tier ; Pro est payant et réservé aux tâches complexes.
- Le mode
Autochoisit pour vous ; on force un modèle avec-m,/model set --persistoumodel.name. - Le quota gratuit est par projet et se réinitialise à minuit Pacifique ; les chiffres exacts évoluent, la doc officielle fait foi.
/statset la sortie JSON headless donnent la consommation réelle de tokens (dontcachedetthoughts).- On maîtrise les coûts avec Flash par défaut,
maxSessionTurns,compressionThresholdet un contexte propre.