
LiteLLM
Proxy LLM compatible OpenAI, un endpoint unique vers 100+ fournisseurs, avec budgets, fallback et clés virtuelles.
LiteLLM expose un endpoint unique compatible OpenAI qui route vers 100+ fournisseurs (OpenRouter, Anthropic, Fireworks, Ollama local, etc.). Toutes vos apps, Hermes, n8n, ZeroClaw, MCP, RAG, appellent LiteLLM avec la même API. Suivi des coûts par utilisateur, budgets par clé virtuelle, fallback multi-fournisseur et cache des réponses.
Le problème
Chaque app IA embarque sa propre clé fournisseur. Pas de visibilité sur les coûts par projet, pas de fallback si un fournisseur tombe, et chaque équipe duplique la gestion de modèles. Un proxy LLM centralise les clés, mesure la consommation et permet d'arbitrer entre Ollama local et API cloud sans toucher au code des apps.
Fonctionnalités clés
100+ fournisseurs unifiés
OpenRouter, Anthropic, Fireworks, Mistral, OpenAI, AWS Bedrock, Vertex, Ollama local, vLLM. Une seule API compatible OpenAI.
Clés virtuelles & budgets
Une clé par app/utilisateur, avec budget mensuel, limite de débit et permissions par modèle. Suivi des coûts au token près.
Fallback automatique
OpenRouter → Anthropic → Ollama local. Si un fournisseur tombe ou dépasse le budget, LiteLLM bascule automatiquement.
Mix local + cloud
Vos modèles Ollama locaux sont exposés sous le nom
ollama/<modèle>. Combinez-les avec des modèles cloud dans la même app.Cache des réponses
Réutilise les réponses pour les requêtes identiques. Économies sur les usages répétitifs (classification, FAQ, validation).
Souveraineté des clés
Les clés API restent sur votre serveur, jamais dans les apps. Révocation centralisée d'une clé fournisseur compromise.
Sur votre serveur
Master key requise
Tous les appels passent par
Authorization: Bearer $LITELLM_MASTER_KEY. Aucun appel anonyme possible.Ollama auto-configuré
Si Ollama est activé, chaque modèle local est exposé automatiquement sous
ollama/<nom>. Aucune duplication de config.Persistance optionnelle
Active une base PostgreSQL pour stocker clés virtuelles, budgets et historique. Sans DB, fonctionne en mémoire pour usages simples.
Disponible sur votre serveur
LiteLLM est pré-configuré avec auto-discovery des modèles Ollama, master key obligatoire et secrets chiffrés via agenix. Activable en une ligne dans
server.nix.