LiteLLMLiteLLM

Proxy LLM compatible OpenAI, un endpoint unique vers 100+ fournisseurs, avec budgets, fallback et clés virtuelles.

LiteLLM expose un endpoint unique compatible OpenAI qui route vers 100+ fournisseurs (OpenRouter, Anthropic, Fireworks, Ollama local, etc.). Toutes vos apps, Hermes, n8n, ZeroClaw, MCP, RAG, appellent LiteLLM avec la même API. Suivi des coûts par utilisateur, budgets par clé virtuelle, fallback multi-fournisseur et cache des réponses.

Le problème

Chaque app IA embarque sa propre clé fournisseur. Pas de visibilité sur les coûts par projet, pas de fallback si un fournisseur tombe, et chaque équipe duplique la gestion de modèles. Un proxy LLM centralise les clés, mesure la consommation et permet d'arbitrer entre Ollama local et API cloud sans toucher au code des apps.

Fonctionnalités clés

    100+ fournisseurs unifiés
    OpenRouter, Anthropic, Fireworks, Mistral, OpenAI, AWS Bedrock, Vertex, Ollama local, vLLM. Une seule API compatible OpenAI.
    Clés virtuelles & budgets
    Une clé par app/utilisateur, avec budget mensuel, limite de débit et permissions par modèle. Suivi des coûts au token près.
    Fallback automatique
    OpenRouter → Anthropic → Ollama local. Si un fournisseur tombe ou dépasse le budget, LiteLLM bascule automatiquement.
    Mix local + cloud
    Vos modèles Ollama locaux sont exposés sous le nom ollama/<modèle>. Combinez-les avec des modèles cloud dans la même app.
    Cache des réponses
    Réutilise les réponses pour les requêtes identiques. Économies sur les usages répétitifs (classification, FAQ, validation).
    Souveraineté des clés
    Les clés API restent sur votre serveur, jamais dans les apps. Révocation centralisée d'une clé fournisseur compromise.

Sur votre serveur

    Master key requise
    Tous les appels passent par Authorization: Bearer $LITELLM_MASTER_KEY. Aucun appel anonyme possible.
    Ollama auto-configuré
    Si Ollama est activé, chaque modèle local est exposé automatiquement sous ollama/<nom>. Aucune duplication de config.
    Persistance optionnelle
    Active une base PostgreSQL pour stocker clés virtuelles, budgets et historique. Sans DB, fonctionne en mémoire pour usages simples.

Disponible sur votre serveur

LiteLLM est pré-configuré avec auto-discovery des modèles Ollama, master key obligatoire et secrets chiffrés via agenix. Activable en une ligne dans server.nix.
Copyright © 2026