contextetech / mistral7b-anonymisation-qlora
Configuration QLoRA de départ pour spécialiser Mistral 7B Instruct dans l'anonymisation RGPD, avec le dataset anonymisation-rgpd-fr. Tient sur un GPU de 24 Go.
Hyperparamètres
| Modèle de base | mistralai/Mistral-7B-Instruct-v0.3 |
|---|---|
| Méthode | QLoRA 4-bit |
| r / alpha / dropout | 16 / 32 / 0.05 |
| Modules ciblés | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
| Learning rate | 0.0002 |
| Epochs | 3 |
| Batch × accumulation | 4 × 4 = 16 |
| Longueur de séquence | 1024 |
Dataset associé
contextetech / anonymisation-rgpd-fr
Notes
Configuration de départ : elle n'a pas encore été entraînée ni évaluée par ContexteTech. Avec 20 exemples seulement, le dataset sert à tester la chaîne ; pour un vrai usage, visez plusieurs centaines d'exemples. Mesurez le résultat avec l'évaluation eval-anonymisation-rgpd.