AllenAI présente DiScoFormer, un transformer unifié pour estimer densité et score
- 01DiScoFormer est un transformer unique qui estime densité et score d'une distribution en un seul passage, sans réentraînement pour chaque nouvelle distribution.
- 02Le modèle couple deux têtes de sortie (densité et score) via une relation mathématique, générant une perte de cohérence qui permet l'adaptation à des données hors distribution.
- 03Cette approche réconcilie la généralité (pas de réentraînement) et la précision en haute dimension, contrairement aux méthodes classiques comme KDE ou le score-matching neuronal.

AllenAI propose DiScoFormer, un modèle transformer capable d'estimer à la fois la densité et le score d'une distribution à partir d'un ensemble de points de données, sans nécessiter de réentraînement pour chaque nouvelle distribution.
Le problème que résout DiScoFormer est fondamental en apprentissage automatique et en sciences : à partir d'une collection de données, récupérer la distribution sous-jacente. La densité mesure où les points se concentrent (version lissée d'un histogramme), tandis que le score—le gradient du logarithme de la densité—indique la direction vers les régions plus probables. Ce score est au cœur des modèles génératifs par diffusion (technologie des générateurs d'images comme Stable Diffusion et DALL-E), du sampling bayésien et des simulations de particules.
Les approches existantes imposent un compromis. L'estimation de densité par noyau (KDE) ne demande pas d'entraînement et s'applique à toute distribution, mais sa précision s'effondre en haute dimension. Les modèles de score-matching neuronal restent précis en haute dimension, mais chacun doit apprendre une distribution spécifique et être réentraîné pour une autre.
DiScoFormer utilise une architecture transformer avec un backbone partagé et deux têtes de sortie distinctes : l'une pour la densité, l'autre pour le score. Cette architecture exploite la relation mathématique entre les deux : le score est le gradient du logarithme de la densité. Cette couplage génère automatiquement une perte de cohérence sans labels : l'écart entre les gradients du score et ceux de la densité peut être minimisé. À l'inférence, le modèle peut s'adapter à des données hors distribution en effectuant quelques étapes de gradient sur cette perte de cohérence, sans données d'entraînement supplémentaires.
Le modèle utilise l'attention croisée pour évaluer densité et score en tout point, pas seulement où existent des données. Un seul passage avant suffit pour traiter un ensemble complet de points et produire les deux estimations.
