Aller au contenu
medium

Formation IA pour ingénieurs : LLM, RAG, agents, MCP

10 min de lecture

Ce parcours vous mène de la compréhension d'un LLM jusqu'à une stack d'IA générative complète tournant sur vos propres machines. Vous apprenez à exécuter un modèle en local, à construire un RAG sur vos données, à outiller des agents, à exposer des serveurs MCP, puis à observer et sécuriser l'ensemble. L'angle est celui d'un ingénieur infrastructure et sécurité : self-hosting, reproductibilité et contrôle des coûts priment sur la dépendance à une API propriétaire. Chaque module s'appuie sur des labs reproductibles, aux versions épinglées. C'est la porte d'entrée du thème IA du site.

Elle vise les développeurs, DevOps, SRE et platform engineers qui veulent construire avec l'IA générative, pas seulement l'utiliser. Les prérequis sont un niveau Python intermédiaire, et l'aise avec Docker et la ligne de commande.

La progression va du débutant à l'avancé sur neuf modules. Les modules 1 à 4 (fondamentaux, exécution d'un LLM, fine-tuning, RAG) donnent déjà de quoi livrer un assistant utile en quelques jours de pratique. Les modules 5 à 9 (agents, MCP, observabilité, sécurité, projet intégrateur) amènent au niveau production. Suivez l'ordre si vous débutez ; ciblez directement le module qui vous concerne sinon, chacun se lit de façon autonome.

Ce qui distingue ce parcours des cursus IA classiques

Section intitulée « Ce qui distingue ce parcours des cursus IA classiques »

Beaucoup de cursus s'arrêtent à l'appel d'API d'un fournisseur ; celui-ci part du principe que tout doit pouvoir tourner chez vous. Quatre partis pris assumés en découlent, et ils ont des conséquences concrètes sur ce que vous apprenez.

  • Self-hosting d'abord : chaque brique a une variante qui tourne sans le cloud, vos données ne sortent pas de votre infrastructure.
  • Angle infrastructure et sécurité : l'observabilité, le coût et le durcissement sont traités comme en production, pas comme des annexes.
  • Des labs reproductibles : chaque module pratique s'appuie sur un lab testé, avec des versions épinglées plutôt qu'un « dernière version » qui casse trois mois plus tard.
  • Une couverture rare en français : le MCP et les agents sont traités en profondeur, là où la plupart des ressources se limitent à une démonstration.

L'objectif est d'acquérir des compétences durables, qui restent valables quand les modèles et les fournisseurs changent, ce qui arrive plusieurs fois par an dans ce domaine.

Le parcours compte neuf modules, dont deux accessibles sans expérience préalable de l'IA générative. Le tableau donne le niveau attendu pour chacun, afin de choisir un point d'entrée réaliste plutôt que de commencer par le module le plus spectaculaire.

ModulesThèmeNiveau
1 Fondamentaux, 2 Exécuter un LLMComprendre et servir un modèleDébutant
3 Fine-tuning, 4 RAGAdapter le modèle à vos donnéesIntermédiaire
5 Agents, 6 MCPDonner des outils au modèleIntermédiaire à avancé
7 Observabilité, 8 Sécurité LLMExploiter en productionAvancé
9 Projet fil rougeSynthèse de bout en boutAvancé

Les modules s'appuient sur les guides du parcours Python/IA, qui compte 70 leçons pour environ 43 heures de travail, labs compris. Vous pouvez donc lire cette page comme la carte du territoire, et le parcours Python/IA comme l'itinéraire détaillé, avec suivi de progression.

Chaque module ci-dessous répond à une question d'ingénierie précise et renvoie vers le guide qui l'ouvre. Ils se suivent dans l'ordre, mais rien n'interdit d'entrer par le milieu si votre besoin est identifié.

On commence par comprendre ce qu'est un LLM, comment il génère du texte token par token, et comment le piloter par le prompt. Ces bases conditionnent tout le reste : un prompt bien construit évite souvent un système complexe. Vous y voyez aussi les limites structurelles des modèles, hallucination et fenêtre de contexte comprises, pour garder un regard d'ingénieur sur l'outil.

Avant de construire, il faut servir un modèle. On part d'Ollama pour exécuter un LLM sur votre machine, puis on unifie les appels derrière la passerelle LiteLLM, et on passe aux moteurs d'inférence de production (vLLM, SGLang) et à la quantification, qui décide de la mémoire nécessaire. C'est le socle qui rend tout le reste souverain.

Quand le prompt et le RAG ne suffisent plus, on modifie le comportement du modèle. Le fine-tuning, via LoRA et QLoRA, spécialise un LLM sur vos données, mais c'est la solution la plus coûteuse et la plus souvent mal employée. L'essentiel de ce module est de savoir quand y recourir, et surtout quand l'éviter au profit d'une solution moins chère.

Le RAG ancre les réponses du modèle dans votre corpus, sans réentraînement. C'est la brique la plus demandée en entreprise, et celle où les détails d'ingénierie font toute la différence : découpage des documents, embeddings, base vectorielle, re-ranking et évaluation séparent une démonstration convaincante d'un système fiable.

Un agent est un LLM doté d'outils, d'une boucle de décision et d'une mémoire. Ce module couvre le function calling, les frameworks (PydanticAI, LangGraph), le multi-agents, la gestion de la mémoire et la sandbox d'exécution, indispensable dès qu'un agent exécute du code qu'il a lui-même écrit.

Le MCP est le standard qui connecte vos agents à vos outils et données, sans réécrire une intégration jetable à chaque fois. Ce module va de l'architecture du protocole à la construction de clients et de serveurs, jusqu'à la sécurité MCP et au déploiement, le tout appuyé sur des serveurs réellement construits et exploités.

C'est ce qui distingue un prototype d'un service de production. Une application IA pose des questions que la supervision classique ne couvre pas : quel prompt a produit cette réponse, à quel coût, avec quelle latence, et surtout quelle qualité ? L'observabilité et l'évaluation systématiques restent les chantiers les plus négligés, donc les plus différenciants.

Mettre un LLM en production ouvre une surface d'attaque inédite : injection de prompt, fuite de données, excès d'autonomie d'un agent. Ce module pose le panorama défensif, OWASP Top 10 LLM, garde-fous et défense en profondeur. C'est l'angle naturel d'un ingénieur infrastructure et sécurité, et le sujet sur lequel les projets se cassent le plus souvent la figure.

Le projet intégrateur assemble toutes les briques en une stack self-hostée : modèle local, base vectorielle, passerelle, assistant RAG agentique, serveur MCP et exposition sécurisée derrière un reverse proxy. C'est le meilleur moyen de voir comment les pièces s'emboîtent en conditions réelles, et où elles frottent.

Si votre besoin est d'écrire du code avec l'aide d'une IA plutôt que de construire des applications IA, ce sont d'autres parcours qui s'appliquent. Les deux agents de codage en ligne de commande ont chacun leur section, et le concept qui les sous-tend a la sienne.

Le bon point de départ dépend de ce que vous cherchez à obtenir, pas de votre niveau. Trois entrées couvrent la quasi-totalité des cas : expérimenter vite, monter en compétence dans l'ordre, ou viser directement la production.

Les huit termes ci-dessous reviennent dans tous les modules. Les fixer maintenant évite de buter dessus plus tard, parce qu'ils sont souvent employés de façon approximative dans la littérature en ligne.

  • LLM (Large Language Model) : modèle de langage qui génère du texte (Llama, Mistral, GPT).
  • RAG (Retrieval-Augmented Generation) : technique qui ancre les réponses dans vos documents, sans réentraînement.
  • Agent : un LLM doté d'outils, d'une boucle de décision et d'une mémoire.
  • MCP (Model Context Protocol) : standard qui connecte un LLM à vos outils et données.
  • Fine-tuning : réentraînement partiel d'un modèle pour changer son comportement, via LoRA ou QLoRA.
  • Embeddings : représentation vectorielle d'un texte, base de la recherche sémantique.
  • Quantification : réduction de la précision des poids pour faire tenir un modèle en mémoire.
  • Guardrails : contrôles d'entrée et de sortie qui encadrent ce qu'un LLM reçoit et renvoie.

Cinq questions reviennent systématiquement avant de se lancer. Les réponses ci-dessous fixent les prérequis, les arbitrages techniques les plus fréquents et le temps réellement nécessaire pour devenir opérationnel.

Ce site vous est utile ?

Sachez que moins de 1% des lecteurs soutiennent ce site.

Je maintiens +700 guides gratuits, sans pub ni tracking. Un soutien, même symbolique, m'aide à couvrir l'hébergement et à garder ces ressources gratuites. Merci pour votre appui.

Le formulaire ne s'affiche pas ? Ouvrir Ko-fi dans un onglet.

Abonnez-vous et suivez mon actualité DevSecOps sur LinkedIn