Un atelier de programmation pour comprendre l’entraînement d’un modèle de langage. Le kit implémente un réseau à embeddings, couche cachée tanh et sortie softmax, avec rétropropagation explicite. Le corpus pédagogique est séparé chronologiquement entre entraînement et validation. Ce petit réseau n’est pas un assistant conversationnel ni un modèle fondation.
Dans cette base
- Réseau neuronal entraînable sur CPU
- Rétropropagation et vérification numérique des gradients
- Génération avec température et graine
- Sauvegarde JSON sans pickle
- Corpus original et tests automatisés
Licence et prise en main
Code original sous licence MIT, copyright 2026 STELLARR STUDIO. Usage personnel et commercial autorisé, avec conservation de la notice de licence. Guides français et anglais inclus. Les marques et les dépendances conservent leurs droits propres.
Consultez le README pour les prérequis, les commandes de démarrage, les tests et les limites avant déploiement. L’hébergement, le calcul, les API externes et l’accompagnement ne sont pas inclus.
Fichiers inclus
.gitignoreexamples/corpus.txtkit.jsonLICENSEREADME.en.mdREADME.mdrequirements.txtTEST_REPORT.mdtest_tiny_lm.pyTHIRD_PARTY_NOTICES.mdtiny_lm.pyverification.json