Baguette.
Un modèle français.
Construit de zéro.
Le corpus, le tokenizer, l’architecture, l’entraînement. Une chaîne complète pour explorer ce qu’un petit modèle peut apprendre, avec un budget maîtrisé.
Explorer le dépôtCalcule : 88 + 59
Dizaines : 80 + 50 = 130.
Unités : 8 + 9 = 17.
Total : 130 + 17 = 147.
147
paramètres
coût d’entraînement
tokens de préentraînement
entraîné de zéro
Ce qu’il y a derrière les chiffres
Préentraînement en 3 h 20 sur A100, puis 25 minutes de fine-tuning. Vocabulaire BPE de 16 384 tokens, attention GQA et optimiseur Muon.
1,197 bit par octet sur 300 000 caractères de français réservés à l’évaluation, contre 1,504 pour GPT-fr small dans le benchmark du dépôt. Les 97 % en arithmétique portent sur 30 problèmes et incluent le fine-tuning : ils ne mesurent pas une capacité générale de raisonnement.
Le second jeu de 40 problèmes atteint 18/40 après ajout de deux familles au corpus d’entraînement. Les limites et les réponses complètes sont documentées.
Lire les résultats et le protocole sur GitHub