L’ingénierie IA ne se limite pas au choix d’un modèle. Les systèmes de production ont besoin d’identités, de frontières de données, d’outils contrôlés, d’un routage résilient, d’observabilité, d’évaluation et de preuves exploitables en audit ou en incident.
Cette page commence par l’architecture et le modèle d’exploitation que j’utilise, puis conserve l’écosystème d’outils comme référence secondaire plutôt que comme structure principale.
Architecture de ma plateforme IA
Une plateforme local-first structurée en couches plutôt qu’en catalogue de produits. LiteLLM constitue le plan de contrôle central entre interfaces, modèles, outils, workflows et observabilité.
- Open WebUI
- OpenClaw
- OpenCode / Codex / Cursor
- LiteLLM
- Redis cache
- routing · budgets · fallbacks · telemetry
- Ollama · local
- OpenAI API · remote
- FastAPI MCP
- Open Terminal
- OpenRAG
- SearXNG
- Paperless
Local-first et confidentialité
Les charges courantes privilégient Ollama dans le homelab. Le passage par LiteLLM permet de garder une politique commune de routage et de protection avant tout recours à une inférence distante.
Coût et résilience
Le cache Redis, les fallbacks et le routage centralisé réduisent les appels distants inutiles et évitent de coupler les clients à un modèle unique.
Mesurable
Langfuse, Opik et Prometheus séparent l’observabilité LLM, l’évaluation de qualité et les métriques opérationnelles tout en conservant une vue cohérente de la plateforme.
Workflow & orchestration
Trois rôles complémentaires : n8n pour composer rapidement les automatisations, Temporal pour garantir l’exécution durable et Langflow pour expérimenter et assembler des flux IA.
n8n
Couche d’automatisation visuelle pour connecter rapidement APIs, données, agents et services du homelab.
n8n Temporal
Couche d’orchestration durable pour les workflows stateful, longs et critiques : retries, état persistant, timers, étapes human-in-the-loop et activités LLM.
Temporal Langflow
Atelier visuel pour prototyper des chaînes LLM, agents, outils et RAG avant leur industrialisation dans les couches d’orchestration et de services.
Langflow OpenCommit
OpenCommit complète le workflow de développement avec des messages Conventional Commits cohérents ; il reste volontairement hors de la couche d’orchestration.
GitHub Référence modèles, frameworks & écosystème
Références secondaires pour des technologies pouvant s’inscrire derrière les contrôles de plateforme décrits plus haut. Les produits sont des exemples, pas des dépendances architecturales.
Modèles et ressources développeur sélectionnés
NVIDIA Nemotron
Une famille de modèles ouverts compacts, utile pour évaluer des empreintes d’inférence locale ou edge plus réduites.
En savoir plusContext7
Outillage de récupération de contexte et de documentation pour assistants de développement et workflows agents.
SiteAwesome MCP Servers
Un répertoire de serveurs et intégrations MCP pour explorer des capacités d’outils standardisées.
DépôtApprentissage & compréhension
Un guide visuel sur le raisonnement des LLM pour mieux comprendre les approches multi-étapes et pourquoi l’évaluation reste indispensable.
Lire l’articleBoussole de l’écosystème
Considérez cette liste comme des options d’implémentation remplaçables. Authentification, routage, politique, télémétrie et cycle de vie des données doivent rester indépendants d’un fournisseur unique.
API LLM & chat
- OpenAI
- Groq
- Cohere
- Anthropic
- Google Gemini
- Mistral AI
- Azure OpenAI
- Open WebUI
- LocalAI
Assistants de code & IDE
- GitHub Copilot
- Cursor
- Amazon Q Developer
- Dust
ML cloud & notebooks
- Azure Machine Learning
- Hugging Face
- AWS SageMaker
- Google Vertex AI
RAG, vecteurs & frameworks
- LangChain
- PGvector
- Elasticsearch
Agents & automatisation
- n8n
- LangGraph
- Zapier
- HubSpot
- CrewAI
- Temporal
Évaluations, traces & monitoring
- Weights & Biases
- Langfuse
- OpenTelemetry
- Opik
Inférence locale & open source
- Ollama
- LiteLLM
- vLLM
- llama.cpp
- LM Studio
- AnythingLLM
- OpenRAG
- Open Terminal
Observabilité, évaluation & FinOps LLM
Une vue unifiée de la qualité, des traces, des coûts, des tokens et des latences : évaluez les applications LLM, surveillez leur comportement en production et appliquez une discipline FinOps à la consommation des modèles.
Opik by Comet
Plateforme open source d’évaluation, de test et de monitoring des applications LLM, utile pour comparer les sorties des modèles et suivre leur qualité en production.
DocumentationLangfuse
Plateforme open source d’observabilité LLM pour les traces, prompts, scores, coûts et latences. Langfuse collecte notamment la télémétrie de LiteLLM et du serveur MCP afin de fournir une vue transverse des appels IA.
Langfuse Utilisation ChatGPT / Codex
Suivez l’utilisation de ChatGPT et Codex : crédits, tokens, modèles, activité et consommation. Les vues disponibles dépendent du type d’espace de travail ; Codex expose également des détails d’utilisation et de limites dans les paramètres pris en charge.
Analyses ChatGPT / CodexCursor
Examiner l’usage Cursor et les tendances de consommation de tokens afin d’identifier les workflows coûteux et anticiper les limites avant qu’elles ne gênent la livraison.
Analyses CursorLiteLLM
Utiliser LiteLLM comme gateway mesurée pour le routage, les budgets, les fallbacks et les preuves d’usage indépendantes des fournisseurs plutôt que répartir les contrôles de coût dans chaque client.
LiteLLM Pipeline du document vers la connaissance
Un flux PDF-vers-RAG contrôlé avec préparation explicite, archive/OCR, enrichissement, orchestration durable, revue privée et surface de retrieval partagée.
- 1
Stirling PDF
Normaliser, découper, fusionner ou nettoyer les PDF localement avant ingestion afin de fournir des entrées prévisibles à l’archive.
Stirling PDF - 2
Paperless-ngx
Archiver, OCRiser, taguer et indexer les documents préparés dans Paperless-ngx comme corpus durable de référence.
Paperless-ngx - 3
Paperless-AI
Enrichir les documents consommés avec classification et métadonnées uniquement après leur acceptation par l’archive canonique.
Paperless-AI - 4
Temporal
Exécuter résumé, traduction, retries et étapes human-in-the-loop comme workflows durables plutôt que comme scripts de fond fragiles.
Temporal - 5
AnythingLLM
Utiliser un workspace privé pour inspecter et questionner le corpus traité tout en validant OCR, tags et transformations aval.
AnythingLLM - 6
OpenRAG
Publier le corpus validé vers une couche RAG partagée puis exposer des capacités de retrieval contrôlées via MCP plutôt que réimplémenter l’accès pour chaque agent.
OpenRAG
Pratiques d’ingénierie & gouvernance
Les contrôles de plateforme n’ont de valeur que s’ils sont associés à des pratiques reproductibles et à des preuves explicites.
- Définir un objectif mesurable et des critères d’échec avant d’introduire un composant IA.
- Suivre qualité, latence, coût et modes de panne en continu plutôt que valider uniquement par quelques prompts.
- Modéliser les menaces sur prompts, outils, identités, mouvements de données et fournisseurs ; traiter biais et mésusage séparément de la sécurité d’infrastructure.
- Automatiser les contrôles répétitifs tout en gardant des validations humaines pour les actions agents destructives ou à fort impact.
- Versionner prompts, modèles, politiques et pipelines de retrieval afin d’expliquer les changements et de revenir en arrière.
- Tester le code déterministe, la qualité du retrieval, l’application des politiques et le comportement modèle au bon niveau.
- Conserver architecture, provenance des données, résultats d’évaluation et preuves opérationnelles compréhensibles par l’ingénierie, la sécurité et la gouvernance.