LLM17 juin
Évaluer et fiabiliser un système LLM : évals et garde-fous
Construire un vrai jeu d'évals et le faire tourner : dataset de référence, vérifications automatiques, LLM-as-judge calibré et garde-fous d'exécution. Avec un harnais de test Python complet et reproductible.
5 min