Ollama : servir des LLM en local
Installer, servir et interroger des modèles de langage sur son propre matériel, sans envoyer une seule ligne à un fournisseur externe.
Durée du cours : 4h
Ce que vous allez apprendre
- Installer Ollama sur Windows, macOS ou Linux et vérifier que le service tourne
- Choisir une étiquette de modèle et une quantification adaptées à votre RAM
- Appeler les points d'entrée
generate,chatetembeddingsdepuis Python - Écrire un Modelfile pour créer un modèle dérivé avec sa consigne système
- Mesurer les jetons par seconde selon le matériel (CPU, GPU, Apple Silicon)
- Monter un système de questions-réponses entièrement hors ligne sur vos documents
- Savoir quand un déploiement local suffit et quand passer à une API distante
Prérequis
- Notions de ligne de commande (
cd, variables d'environnement,curl) - Grands modèles de langage (cours 16 recommandé)
Fil rouge
Nous équipons un cabinet juridique qui ne peut envoyer aucun document client vers un fournisseur externe. Nous montons pas à pas un assistant local qui répond aux questions de la clientèle, rédige des brouillons de courriers et interroge la jurisprudence interne, le tout sans que rien ne quitte l'ordinateur ni le réseau du cabinet.
Modules du cours
- Installation sur Windows, macOS et Linux
- Récupérer, lister et supprimer des modèles
- Session interactive et paramètres de génération
- Interface de programmation locale
- Fichiers Modelfile et modèles dérivés
- Quantification et empreinte mémoire
- Accélération matérielle
- Intégration avec des applications existantes
- Système de questions-réponses local sur documents
- Limites de l'exécution locale
Évaluation et attestation
Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable sur la plateforme.
Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.