Aller au contenu principal

Module 2 — Panorama des petits modèles ouverts

Le paysage des petits modèles ouverts change tous les trimestres. Ce module ne vise donc pas à distribuer des médailles, mais à donner la grille qui permet de choisir aujourd'hui et de rechoisir dans six mois sans repartir de zéro. Cinq familles dominent la fourchette 1 à 8 milliards de paramètres ; chacune fait un compromis clair entre qualité, langues, licence et coût d'exécution.

Les cinq familles à connaître

Phi (Microsoft). Série orientée « petit et costaud », entraînée sur un mélange soigneusement filtré de code, de manuels et de données synthétiques. Phi-3 et Phi-4 mini couvrent la fourchette 3 à 4 milliards de paramètres et brillent en raisonnement structuré et en code. La qualité en français est correcte mais inférieure à celle en anglais, à mesurer sur votre tâche avant tout engagement.

Llama (Meta). La référence de facto pour les tailles 3B, 8B et au-delà. La licence Llama est permissive mais pas MIT : elle interdit certains usages et impose une clause de nommage, et une bascule de licence est requise au-dessus de 700 millions d'utilisateurs mensuels — situation rare, mais à connaître. Llama 3 et 3.1 offrent une qualité multilingue solide, bien meilleure en français que les versions antérieures.

Mistral. Modèles français, souvent sous licence Apache 2.0 pour les plus petits (Mistral 7B, Ministral 3B et 8B) et sous licence de recherche pour les plus gros. Excellents en français, avec un tokenizer qui économise 15 à 25 % de jetons par rapport aux modèles pensés d'abord pour l'anglais. À taille égale, c'est souvent le meilleur candidat pour un produit francophone.

Gemma (Google). 2B et 7B, licence spécifique Gemma qui autorise l'usage commercial mais impose des restrictions d'usage. Bonne qualité générale, écosystème d'outils bien intégré à JAX et TensorFlow ; multilingue correct.

Qwen (Alibaba). Fourchette 0.5B à 72B, licences Apache 2.0 pour les plus petits. Qualité multilingue remarquable, notamment en chinois et en arabe ; performance en français en progrès rapides. Souvent le meilleur choix quand le produit doit servir plusieurs marchés hors zone euro-atlantique.

Lire une fiche de modèle sans se faire piéger

Une fiche de modèle (« model card ») contient au moins six sections qu'il faut savoir attaquer dans le bon ordre.

Licence. À lire en premier. Une licence non commerciale ferme la porte immédiatement pour un produit payant. Une licence Apache 2.0 ou MIT vous laisse tranquille. Une licence spécifique (Llama, Gemma) mérite dix minutes de lecture attentive.

Données d'entraînement. Le mélange approximatif et surtout les langues couvertes et la date de coupure (« knowledge cutoff »). Un modèle coupé en 2023 ne connaît pas vos produits sortis en 2025 : ce sera au RAG ou à l'affinage de combler l'écart.

Résultats évalués. Ne pas se contenter du score général — MMLU, HellaSwag, GSM8K parlent peu de votre tâche. Chercher les mesures par langue et les tâches proches de la vôtre. Si aucune mesure française n'est publiée, considérez que la performance annoncée n'est pas garantie en français.

Formats disponibles. Poids en 16 bits, en 8 bits, en 4 bits déjà quantifiés au format GGUF, images Ollama, exports ONNX. Un modèle avec un GGUF officiel maintenu par les auteurs simplifie la vie.

Longueur de contexte. 4 000, 8 000, 32 000, 128 000 jetons. La valeur affichée est un maximum théorique ; la qualité réelle chute souvent au-delà de la moitié de cette fenêtre. Mesurer sur des entrées de la taille attendue en production, jamais uniquement sur les valeurs de démo.

Restrictions d'usage. Certaines licences interdisent usages militaires, biométrie, décisions ayant des effets juridiques. Ces clauses vous engagent si vous distribuez un produit.

Choisir pour notre fil rouge

L'assistant de tickets doit fonctionner en français, sur un poste équipé d'un GPU d'entrée de gamme, avec une latence perçue inférieure à la seconde. Trois candidats crédibles sortent du panorama : Ministral 3B en Apache 2.0 pour la qualité française sans souci de licence, Phi-4 mini pour la solidité en raisonnement structuré, et Llama 3.2 3B pour la robustesse d'écosystème. Notre protocole du module 1 mesure les trois sur les 200 tickets d'évaluation ; le vainqueur est celui qui gagne, pas celui qu'un billet de blog recommande.

La démo ne prouve rien

Un modèle qui répond joliment à trois questions dans une démo publique peut échouer sur vos tickets. Les démonstrations sont conçues pour être flatteuses. La seule preuve est la mesure sur votre jeu d'évaluation.

En résumé

  • Cinq familles dominent la fourchette 1-8B : Phi, Llama, Mistral, Gemma, Qwen ; chacune fait un compromis identifiable sur langues et licence.
  • La licence se lit avant tout : Apache 2.0 ou MIT sont sans souci, Llama et Gemma imposent des clauses spécifiques, non commercial ferme la porte à un produit payant.
  • La fiche de modèle se lit dans l'ordre : licence, données, résultats par langue, formats disponibles, contexte utile, restrictions d'usage.
  • Pour un produit francophone, Ministral et Llama 3 sont les candidats naturels ; Phi brille en raisonnement structuré ; Qwen couvre les marchés hors euro-atlantique.

Module suivant : distiller un grand modèle vers un petit sur nos propres données de tickets, quand un modèle ouvert brut n'atteint pas la qualité visée.