AVIS DE SOUTENANCE de Monsieur François BERTHOLOM

L’Ecole doctorale : Mathématiques Hadamard

et le Laboratoire de recherche SAMOVAR – Services répartis, Architectures, Modélisation, Validation, Administration des Réseaux

présentent

l’AVIS DE SOUTENANCE de Monsieur François BERTHOLOM

Autorisé à présenter ses travaux en vue de l’obtention du Doctorat de l’Institut Polytechnique de Paris, préparé à l’Institut Polytechnique de Paris Télécom SudParis en :

« Théorie et Algorithmes d’Inférence Approchée avec des Familles Exponentielles »

le MARDI 13 OCTOBRE 2026 à 14h00

à

Amphithéâtre 2
19 Place Marguerite Perey, 91120 Palaiseau

Membres du jury :

M. Randal DOUC, Professeur, Institut Polytechnique de Paris Télécom SudParis, FRANCE – Directeur de thèse
M. Victor ELVIRA, Professor, School of Mathematics, University of Edinburgh, ROYAUME-UNI – Rapporteur
M. Julyan ARBEL, Chargé de recherche, INRIA Grenoble, FRANCE – Rapporteur
Mme Céline LéVY-LEDUC, Professeure des universités, Université Paris Cité (UFR de mathématiques), FRANCE – Examinateur
M. Nicolas CHOPIN, Professeur, ENSAE, FRANCE – Examinateur

Invité : 

M. François ROUEFF, Professeur, Institut Polytechnique de Paris Télécom Paris, FRANCE – Co-directeur de thèse

« Théorie et Algorithmes d’Inférence Approchée avec des Familles Exponentielles »

présenté par Monsieur François BERTHOLOM

Résumé :

De nombreuses questions en statistique, en apprentissage automatique et en sciences physiques se ramènent au calcul d’espérances pour lesquelles il n’existe pas de forme close. Ce défi se pose en particulier dans deux grandes classes de problèmes : l’inférence bayésienne, où la distribution cible est connue à une constante de normalisation près, et la modélisation générative, où elle n’est accessible qu’au travers d’échantillons. Cette thèse développe théorie et algorithmes pour trois stratégies complémentaires permettant de relever ce défi : l’inférence variationnelle, la modélisation générative, et les méthodes de Monte Carlo par chaînes de Markov. La première partie pose le cadre des problèmes et introduit des outils importants qui serviront tout au long du manuscrit. En particulier, nous explorons certaines propriétés fondamentales des familles exponentielles. La deuxième partie étudie des méthodes de minimisation d’alpha-divergences dans le cas où la famille variationnelle est un modèle exponentiel. L’algorithme central est une procédure itérative dont le but est de faire correspondre les moments de la distribution variationnelle et d’une cible particulière. Nous établissons une analyse détaillée de la convergence de l’AM dans un cadre déterministe, et nous proposons ensuite deux extensions au cadre stochastique. Dans le contexte de l’approximation stochastique, nous introduisons une variante utilisant des estimateurs sans biais. Nous développons également un cadre d’Approximation par Moyenne Empirique, qui fixe des échantillons au début de la procédure d’optimisation. La troisième partie aborde la modélisation générative sous l’angle de l’inférence variationnelle. Nous rappelons d’abord l’équivalence formelle entre les auto-encodeurs variationnels hiérarchiques (HVAEs) et les modèles de diffusion, en mobilisant divers arguments de la littérature existante. Nous apportons une validation empirique originale des résultats théoriques sur plusieurs jeux de données. Nous introduisons ensuite M-Star, une méthode de diffusion permettant d’utiliser des distributions de familles exponentielles dans le processus de bruitage. Les méthodes précédemment proposées pour dépasser la limite des modèles se basant sur des bruits gaussiens nécessitaient de nouveaux calculs pour chaque type de distribution, ou présentaient des instabilités numériques. Nous proposons d’apprendre une projection markovienne d’un processus de bruitage non-markovien, conçu pour un bruit non-gaussien. Par sa généralité, la méthode est applicable à des géométries contraintes et à des données directionnelles, des situations dans lesquelles il ne serait pas viable d’utiliser des distributions gaussiennes. Une riche étude expérimentale confirme la validité de la méthode proposée. La quatrième partie compare des méthodes de Monte-Carlo par chaîne de Markov utilisant des propositions indépendantes. Nous étudions trois noyaux à essais multiples, le Multiple-Try Metropolis with Independent Balancing (MIB), le Multiple-Try Metropolis with Independent Sampling (MIS) et l’Iterated Sampling Importance Resampling (ISIR), et établissons une hiérarchie théorique stricte entre eux au sens de l’ordre de Peskun. Nous montrons en particulier que MIS domine à la fois MIB et ISIR. Nous obtenons des vitesses de convergence exactes pour chacun de ces noyaux lorsque les poids d’importance sont bornés, et montrons qu’ils ne peuvent jamais être géométriquement ergodiques lorsque ces poids sont non bornés. Or, cette situation correspond au régime pratique le plus courant. Cette limitation motive l’étude de l’Independent Importance Markov Chain (IIMC), qui repose sur une structure de renouvellement dans un espace d’états augmenté. Pour ce noyau, nous prouvons qu’une simple condition de moment exponentiel suffit à garantir l’ergodicité géométrique, tandis que l’ergodicité polynomiale repose sur une condition de moment polynomial pour les poids d’importance.
Abstract :

Many problems in statistics, machine learning, and the physical sciences reduce to computing expectations under intractable probability distributions. This thesis develops theory and algorithms for three complementary strategies to tackle this challenge: variational inference, generative modeling, and Markov Chain Monte-Carlo. The first part frames the problems and introduces important tools that will be used throughout the manuscript, in particular we focus on some properties of exponential families. The second part studies alpha-divergence minimization methods over exponential family variational distributions. The central algorithm is an iterative moment-matching scheme. We establish a detailed convergence analysis of the MA in a deterministic setting, and we propose two extensions to the stochastic setting. In the context of Stochastic Approximation, we introduce an unbiased stochastic variant. We also develop a Sample Average Approximation framework. The third part turns to generative modeling through the lens of variational inference. We first recall the formal equivalence between Hierarchical Variational Auto-Encoders (HVAEs) and diffusion models, invoking various arguments found in the existing literature to show that diffusion models arise as the infinite-depth limit of properly parameterized HVAEs. We provide novel empirical validation across several benchmark datasets. We then introduce M-Star, a diffusion framework that allows the noising process to use general exponential family distributions. The key idea is to learn a Markovian projection of a non-Markovian forward process designed for non-Gaussian noise, which makes the framework applicable to constrained geometries and directional data without requiring bespoke derivations for each target distribution. Extensive experiments confirm the validity of this new method. The fourth part compares Monte-Carlo methods based on independent proposals. We study three multiple-try kernels, the Multiple-Try Metropolis with Independent Balancing (MIB), the Multiple-Try Metropolis with Independent Sampling (MIS), and Iterated Sampling Importance Resampling (ISIR); and establish theoretical strict hierarchy among them via the Peskun ordering. Specifically, we show that MIS dominates both MIB and ISIR. We derive exact convergence rates for all three kernels when importance weights are bounded, and show that they fail to be geometrically ergodic when weights are unbounded. This limitation motivates the study of the Independent Importance Markov Chain, for which we prove geometric ergodicity under an exponential moment condition, and polynomial ergodicity under a polynomial moment condition. The results of this thesis are supported by publications at NeurIPS 2024, AISTATS 2026, ICLR 2026, and ICML 2026, as well as an unpublished paper currently under review.