
Ollama
Serveur de modèles de langage local, exécutez Llama, Mistral, Gemma et d'autres LLM directement sur votre serveur, sans API cloud.
Ollama transforme votre serveur en plateforme d'inférence IA locale. Exécutez des modèles comme Llama 3, Mistral, Gemma ou Phi directement sur votre infrastructure, sans envoyer vos données vers des API externes.
Le problème
Les API de modèles de langage (OpenAI, Anthropic, Google) facturent à l'usage et nécessitent d'envoyer vos données vers des serveurs tiers. Pour les cas d'usage internes, résumé de documents, classification, RAG, agents, c'est un coût récurrent et un risque de confidentialité. Et quand l'API tombe, vos automatisations s'arrêtent.
Fonctionnalités clés
Modèles locaux
Exécutez Llama 3, Mistral, Gemma, Phi, Qwen et des centaines d'autres modèles. Pas de tokens à payer, pas de données qui sortent de votre serveur.
Limite mémoire
Contrôlez précisément la RAM allouée à Ollama via une limite systemd. Évitez qu'un gros modèle consomme toutes les ressources du serveur.
Modèles pré-chargés
Déclarez les modèles à télécharger dans votre configuration. Ils sont prêts dès le démarrage du serveur, aucune commande manuelle.
API protégée par token
Protégez l'accès externe avec un bearer token au niveau Caddy. Les services internes (n8n, agents) accèdent en local sans restriction.
Accélération GPU
Support CUDA (NVIDIA), ROCm (AMD) et Vulkan. Passez de CPU à GPU en une seule option de configuration.
API compatible OpenAI
L'API Ollama est compatible avec le format OpenAI. Vos outils existants (LangChain, LlamaIndex, n8n) fonctionnent sans modification.
Cas d'usage
Automatisation IA locale
Connectez Ollama à n8n pour des workflows IA sans coût par requête : classification d'emails, résumés, extraction de données.
RAG & recherche augmentée
Combinez avec des embeddings locaux (nomic-embed-text) pour interroger vos documents sans envoyer de données à l'extérieur.
Chat interne
Avec Open WebUI, offrez à votre équipe une interface ChatGPT privée connectée à vos modèles locaux.
vs. API cloud (OpenAI, Anthropic)
Les API cloud sont incontournables pour les modèles les plus puissants (GPT-4, Claude). Mais pour les tâches récurrentes et volumineuses, résumés, classification, embeddings, un modèle local est gratuit après l'investissement serveur, garantit la confidentialité des données et fonctionne même hors connexion. Les deux approches sont complémentaires : Ollama pour le volume, API cloud pour la puissance.
Disponible sur votre serveur
Ollama est pré-configuré avec limite mémoire, reverse proxy sécurisé et modèles auto-chargés. Prêt à alimenter vos agents et automatisations IA.