En une phraseIn one sentence
Tout détecteur de texte IA qui juge un document isolé, sans connaître son auteur, doit choisir entre être inutile et accuser à tort — et cette impasse est un théorème, pas un défaut d'ingénierie. Any AI text detector that judges a single document without knowing its author must choose between being useless and accusing innocents — and this dead end is a theorem, not an engineering flaw.
- TypeType
- Papier de cadrage (position paper) — formalisation appliquée, pas de mathématiques nouvelles (revendiqué explicitement par l'auteur)Framing / position paper — applied formalisation, no new mathematics (explicitly claimed by the author)
- Outil uniqueSingle tool
- L'inégalité variationnelle de la distance en variation totaleThe variational inequality of total variation distance
- Résultat centralCentral result
- La diversité de la population testée impose un compromis puissance / fausses accusations qu'aucun détecteur « texte seul, un seul document » ne peut contournerDiversity of the tested population forces a power / false-accusation trade-off that no text-only, one-shot detector can escape
- Portée pratiquePractical reach
- Un score de détection ne doit jamais être une preuve unique ; protocole d'audit stratifié proposéA detection score should never serve as sole evidence; a stratified auditing protocol is proposed
Le problèmeThe problem
Les universités utilisent massivement des détecteurs de texte IA (Turnitin, GPTZero…). L'empirie est accablante : Weber-Wulff et al. (2023) testent 14 outils, aucun n'atteint 80 % de précision ; Liang et al. (2023) montrent que sept détecteurs classent 61,3 % d'essais TOEFL écrits par des non-anglophones comme générés par IA ; Hadra et al. (2026) concluent que ces outils sont « inaptes à servir d'arbitres d'auteur ». Mais la littérature traite ces échecs comme des propriétés de détecteurs particuliers, améliorables par une meilleure ingénierie. Universities deploy AI text detectors at scale (Turnitin, GPTZero…). The empirical record is damning: Weber-Wulff et al. (2023) test 14 tools, none reaches 80% accuracy; Liang et al. (2023) show that seven detectors flag 61.3% of TOEFL essays by non-native speakers as AI-generated; Hadra et al. (2026) conclude these tools are "unsuitable as authoritative arbiters of authorship". Yet the literature treats these failures as properties of particular detectors, fixable by better engineering.
La réponse est oui, et la source de la barrière n'est pas celle qu'on attend. Ce n'est pas que l'IA écrit « trop bien » (cela, Sadasivan et al. 2023 l'avaient déjà formalisé). C'est que la population humaine testée est diverse. The answer is yes, and the source of the barrier is not the expected one. It is not that AI writes "too well" (Sadasivan et al. 2023 had already formalised that). It is that the tested human population is diverse.
L'idée clé : l'hypothèse nulle compositeThe key idea: the composite null hypothesis
Les analyses théoriques antérieures modélisaient la détection comme un test entre deux distributions connues : \(p_H\) (« l'écriture humaine ») contre \(p_M\) (« l'écriture machine »). Le papier pointe ce que ce cadrage efface : dans une université, il n'existe pas de distribution humaine unique. Chaque étudiant \(i\) écrit selon sa propre distribution \(p_{\theta_i}\), où le paramètre \(\theta_i \in \Theta\) encode style, niveau, discipline, langue maternelle, effort — et le correcteur ne connaît pas \(\theta_i\). Earlier theoretical analyses modelled detection as a test between two known distributions: \(p_H\) ("human writing") versus \(p_M\) ("machine writing"). The paper points out what this framing erases: in a university, there is no single human distribution. Each student \(i\) writes from their own distribution \(p_{\theta_i}\), where the parameter \(\theta_i \in \Theta\) encodes style, ability, discipline, first language, effort — and the assessor does not know \(\theta_i\).
L'hypothèse nulle n'est donc pas « ce texte est tiré de \(p_H\) » mais : The null hypothesis is therefore not "this text was drawn from \(p_H\)" but:
\[ H_0 : x \sim p_\theta \quad \text{...} \; \theta \in \Theta \; \text{?} \]
« Ce document a été écrit par l'étudiant \(i\), dont la distribution d'écriture \(p_{\theta_i}\) est inconnue. » En théorie des tests (Lehmann & Romano), c'est une hypothèse nulle composite : le nul n'est pas une distribution connue mais une famille entière \(\{p_\theta : \theta \in \Theta\}\). "This document was written by student \(i\), whose writing distribution \(p_{\theta_i}\) is unknown." In hypothesis-testing language (Lehmann & Romano), this is a composite null: the null is not one known distribution but an entire family \(\{p_\theta : \theta \in \Theta\}\).
Conséquence géométrique : certains \(p_\theta\) sont très proches de \(p_M\). Un étudiant L2 au style formulaïque, un étudiant d'une discipline aux normes rédactionnelles rigides, une tâche contrainte (« résumez cet article en 500 mots ») — tous rapprochent l'écriture humaine de la sortie machine. Le détecteur, qui ne voit qu'un document et ne sait pas quel \(\theta\) s'applique, ne peut pas séparer ces étudiants de l'IA. Geometric consequence: some \(p_\theta\) are very close to \(p_M\). An L2 student with formulaic style, a student in a discipline with rigid writing norms, a constrained task ("summarise this article in 500 words") — all pull human writing toward machine output. The detector, which sees one document and does not know which \(\theta\) applies, cannot separate these students from the AI.
Le papier note une asymétrie structurelle intéressante avec la stylométrie classique (vérification d'auteur sans corpus de référence) : ici l'alternative \(p_M\) est en principe connue — on peut échantillonner l'IA à volonté. Le nul reste composite, mais cette asymétrie rend possible un audit spécifique (voir plus bas). The paper notes an interesting structural asymmetry with classical stylometry (authorship verification without enrolment): here the alternative \(p_M\) is in principle known — the AI can be sampled at will. The null remains composite, but this asymmetry enables a specific form of auditing (see below).
L'outil unique : la distance en variation totaleThe single tool: total variation distance
Tout le papier repose sur une seule définition et une seule inégalité. La distance en variation totale entre deux distributions \(P\) et \(Q\) sur l'espace \(\mathcal{X}\) de tous les documents possibles : The whole paper rests on one definition and one inequality. The total variation distance between two distributions \(P\) and \(Q\) over the space \(\mathcal{X}\) of all possible documents:
\[ \mathrm{TV}(P,Q) \;=\; \sup_{A} \left| P(A) - Q(A) \right| \;=\; \tfrac{1}{2} \int_{\mathcal{X}} \left| p(x) - q(x) \right| \, d\mu(x) . \]
Intuition : le plus grand écart de probabilité que les deux distributions peuvent donner à un même événement. \(\mathrm{TV}=0\) : indiscernables. \(\mathrm{TV}=1\) : parfaitement séparables. Intuition: the largest probability gap the two distributions can assign to the same event. \(\mathrm{TV}=0\): indistinguishable. \(\mathrm{TV}=1\): perfectly separable.
Un détecteur est une fonction mesurable \(\varphi : \mathcal{X} \to [0,1]\) — la probabilité de déclarer « IA » sur le document \(x\). Pour tout détecteur, l'inégalité variationnelle donne : A detector is a measurable function \(\varphi : \mathcal{X} \to [0,1]\) — the probability of declaring "AI" on document \(x\). For any detector, the variational inequality gives:
\[ \left| \mathbb{E}_P[\varphi] - \mathbb{E}_Q[\varphi] \right| \;\le\; \mathrm{TV}(P,Q) . \]
C'est le seul outil mathématique utilisé — l'auteur y insiste. On définit ensuite : le taux de faux positifs par étudiant \(\alpha(\theta;\varphi) = \mathbb{E}_{p_\theta}[\varphi]\), la puissance \(\beta(\varphi) = \mathbb{E}_{p_M}[\varphi]\), une mesure \(\pi\) sur \(\Theta\) (la composition de la population), et l'ensemble de recouvrement \(\Theta^*(\delta) = \{\theta : \mathrm{TV}(p_\theta, p_M) \le \delta\}\) — les étudiants dont l'écriture est à distance \(\le \delta\) de l'IA. Toutes les quantités sont relatives à une tâche d'évaluation \(\tau\) fixée. This is the only mathematical tool used — the author insists on it. One then defines: the per-student false positive rate \(\alpha(\theta;\varphi) = \mathbb{E}_{p_\theta}[\varphi]\), the power \(\beta(\varphi) = \mathbb{E}_{p_M}[\varphi]\), a measure \(\pi\) on \(\Theta\) (the population's composition), and the overlap set \(\Theta^*(\delta) = \{\theta : \mathrm{TV}(p_\theta, p_M) \le \delta\}\) — students whose writing lies within distance \(\delta\) of the AI. All quantities are relative to a fixed assessment task \(\tau\).
Les trois résultatsThe three results
Si une fraction \(\pi(\Theta^*)\) des étudiants écrit à distance TV \(\le \delta\) de l'IA, alors tout détecteur de puissance \(\beta_0\) subit un taux moyen de faux positifs : If a fraction \(\pi(\Theta^*)\) of students writes within TV distance \(\delta\) of the AI, then any detector with power \(\beta_0\) incurs an average false positive rate:
\[ \bar{\alpha} \;\ge\; \pi(\Theta^*) \cdot (\beta_0 - \delta) . \]
Exemple du papier. 10 % d'étudiants proches de l'IA (\(\pi(\Theta^*)=0{,}10\), \(\delta=0{,}05\)), détecteur de puissance 80 % (\(\beta_0=0{,}8\)) : \(\bar{\alpha} \ge 0{,}10 \times (0{,}80-0{,}05) = 7{,}5\,\%\). Sur 10 000 étudiants : ~750 fausses accusations. Non parce que le détecteur est mauvais, mais parce que le problème l'exige. (Chiffres illustratifs, choisis pour reproduire les taux de 10–20 % observés empiriquement ; les vraies valeurs de \(\pi(\Theta^*)\) et \(\delta\) sont inconnues.) Paper's example. 10% of students close to the AI (\(\pi(\Theta^*)=0.10\), \(\delta=0.05\)), detector with 80% power (\(\beta_0=0.8\)): \(\bar{\alpha} \ge 0.10 \times (0.80-0.05) = 7.5\%\). At a 10,000-student institution: ~750 false accusations. Not because the detector is bad, but because the problem demands it. (Illustrative figures, chosen to reproduce the 10–20% rates observed empirically; the true values of \(\pi(\Theta^*)\) and \(\delta\) are unknown.)
Si l'université exige qu'aucun étudiant individuel ne subisse un taux de faux positifs supérieur à \(\alpha_0\) — c'est-à-dire \(\sup_\theta \alpha(\theta;\varphi) \le \alpha_0\) — alors la puissance est bornée : If the university requires that no individual student face a false positive rate above \(\alpha_0\) — that is, \(\sup_\theta \alpha(\theta;\varphi) \le \alpha_0\) — then power is bounded:
\[ \beta(\varphi) \;\le\; \alpha_0 + \delta^*, \qquad \delta^* = \inf_{\theta} \mathrm{TV}(p_\theta, p_M) , \]
où \(\delta^*\) est la distance entre l'IA et l'humain le plus proche de la cohorte. where \(\delta^*\) is the distance between the AI and the nearest human writer in the cohort.
Exemple du papier. Humain le plus proche à \(\delta^* = 0{,}05\), exigence de faux positifs \(\le 1\,\%\) pour chacun (\(\alpha_0 = 0{,}01\)) : la puissance ne peut dépasser \(0{,}01 + 0{,}05 = 6\,\%\). Protéger chaque étudiant rend le détecteur presque inutile. L'auteur précise que c'est une condition nécessaire sur tout test valide, pas un théorème minimax à la Huber : la borne majore la puissance atteignable, elle n'identifie pas de test optimal. Paper's example. Nearest human at \(\delta^* = 0.05\), false-positive requirement \(\le 1\%\) for everyone (\(\alpha_0 = 0.01\)): power cannot exceed \(0.01 + 0.05 = 6\%\). Protecting every student renders the detector nearly useless. The author notes this is a necessary condition on any valid test, not a Huber-style minimax theorem: the bound caps achievable power but identifies no optimal test.
Les quantités \(\pi(\Theta^*)\) et \(\delta^*\) portent sur des distributions individuelles, inobservables. On partitionne alors les étudiants en sous-groupes \(G_1, \dots, G_K\) (langue maternelle, filière, année…). La distribution de mélange \(\bar{p}_{G_k} = \int_{G_k} p_\theta \, d\pi(\theta \mid G_k)\) est celle d'un document produit par un étudiant tiré au hasard dans \(G_k\) — estimable à partir des copies réelles. Alors pour tout détecteur : The quantities \(\pi(\Theta^*)\) and \(\delta^*\) involve individual distributions, which are unobservable. So partition students into subgroups \(G_1, \dots, G_K\) (first language, programme, year…). The mixture distribution \(\bar{p}_{G_k} = \int_{G_k} p_\theta \, d\pi(\theta \mid G_k)\) is that of a document produced by a randomly drawn student of \(G_k\) — estimable from pooled real submissions. Then for any detector:
\[ \bar{\alpha}_{G_k}(\varphi) \;\ge\; \beta(\varphi) - \mathrm{TV}(\bar{p}_{G_k}, p_M) . \]
Lecture : si l'écriture agrégée d'un sous-groupe est proche de l'IA (petit \(\mathrm{TV}(\bar{p}_{G_k}, p_M)\)), tout détecteur utile doit produire un fort taux de faux positifs sur ce groupe. C'est l'explication théorique des 61,3 % de faux positifs de Liang et al. sur les essais TOEFL. En agrégeant : Reading: if a subgroup's pooled writing is close to the AI (small \(\mathrm{TV}(\bar{p}_{G_k}, p_M)\)), any useful detector must produce a high false positive rate on that group. This is the theoretical explanation of Liang et al.'s 61.3% false positive rate on TOEFL essays. Aggregating:
\[ \text{FPR}_{\text{institution}} \;\ge\; \sum_{k=1}^{K} \pi_k \left( \beta(\varphi) - \mathrm{TV}(\bar{p}_{G_k}, p_M) \right) . \]
Remarque de convexité (importante pour ne pas sur-interpréter) : par convexité jointe de TV, \(\mathrm{TV}(\bar{p}_{G_k}, p_M) \le \int_{G_k} \mathrm{TV}(p_\theta, p_M) \, d\pi(\theta \mid G_k)\). Un mélange proche de l'IA n'implique pas que chaque étudiant du groupe le soit individuellement. Convexity remark (important against over-reading): by joint convexity of TV, \(\mathrm{TV}(\bar{p}_{G_k}, p_M) \le \int_{G_k} \mathrm{TV}(p_\theta, p_M) \, d\pi(\theta \mid G_k)\). A mixture close to the AI does not imply every student in the group is individually close.
Deux sources de difficulté, logiquement indépendantesTwo logically independent sources of difficulty
La contribution conceptuelle la plus nette du papier est cette séparation : The paper's sharpest conceptual contribution is this separation:
Source 1 — Convergence de l'IASource 1 — AI convergence
À mesure que les modèles s'améliorent, \(\mathrm{TV}(p_M, p_H) \to 0\) pour tous les humains à la fois (Sadasivan et al. 2023). Leviers : dégrader la sortie IA, watermarking, signaux imposés aux fournisseurs. As models improve, \(\mathrm{TV}(p_M, p_H) \to 0\) for all humans at once (Sadasivan et al. 2023). Levers: degrading AI output, watermarking, provider-embedded signals.
Source 2 — Diversité de la populationSource 2 — Population diversity
Même avec une IA figée, si certains étudiants recouvrent la sortie machine, le compromis taille/puissance est inévitable. Leviers : refonte des évaluations, évaluation par processus (brouillons, oraux), profils d'écriture longitudinaux. Even with a frozen AI, if some students overlap with machine output, the size/power trade-off is unavoidable. Levers: assessment redesign, process-based assessment (drafts, orals), longitudinal writing profiles.
Le point crucial : la Source 2 ne peut pas être traitée en construisant un meilleur détecteur. Elle est une propriété du nul composite — de la population testée — pas du détecteur. La seule issue est de changer la structure d'information : recueillir plus qu'un document isolé, et transformer ainsi le nul composite en nul (partiellement) connu. The crucial point: Source 2 cannot be addressed by building a better detector. It is a property of the composite null — of the tested population — not of the detector. The only way out is to change the information structure: collect more than a single document, thereby turning the composite null into a (partially) known one.
De la théorie à la pratiqueFrom theory to practice
Estimer TV ? Piège de directionEstimating TV? A direction trap
On peut entraîner un classifieur à distinguer les copies d'un sous-groupe des textes IA. S'il atteint une précision \(\hat{a}\) (classes équilibrées), la précision Bayes-optimale vérifie \(a^* = \tfrac{1}{2}(1+\mathrm{TV})\), d'où \(\mathrm{TV}(\bar{p}_{G_k}, p_M) \ge 2\hat{a} - 1\). Mais c'est une borne inférieure sur TV — or le Résultat 3 a besoin d'une borne supérieure (un petit TV) pour être informatif. Un classifieur qui échoue suggère que TV est petit, sans le prouver : il est peut-être juste sous-optimal. Le papier en tire une recommandation honnête : ne pas estimer TV, auditer directement les taux de faux positifs. One can train a classifier to distinguish a subgroup's submissions from AI text. If it reaches accuracy \(\hat{a}\) (balanced classes), the Bayes-optimal accuracy satisfies \(a^* = \tfrac{1}{2}(1+\mathrm{TV})\), hence \(\mathrm{TV}(\bar{p}_{G_k}, p_M) \ge 2\hat{a} - 1\). But this is a lower bound on TV — while Result 3 needs an upper bound (a small TV) to be informative. A failing classifier suggests TV is small without proving it: it may simply be suboptimal. The paper draws an honest recommendation: do not estimate TV; audit false positive rates directly.
Le protocole d'audit stratifié proposéThe proposed stratified auditing protocol
- Constituer des corpus de textes humains confirmés, stratifiés par sous-groupes observables (L1/L2, filière, année, type de tâche).Assemble corpora of confirmed human-written texts, stratified by observable subgroups (L1/L2, programme, year, task type).
- Faire tourner le détecteur candidat sur chaque strate et relever \(\hat{\bar{\alpha}}_{G_k}\).Run the candidate detector on each stratum and record \(\hat{\bar{\alpha}}_{G_k}\).
- Rapporter le FPR stratifié à côté de la puissance (estimée sur un corpus parallèle de textes IA pour la même tâche).Report stratified FPR alongside power (estimated on a parallel corpus of AI text for the same task).
- Évaluer par type de tâche : les tâches contraintes produisent plus de recouvrement que les tâches ouvertes ou réflexives.Evaluate per task type: constrained tasks produce more overlap than open-ended or reflective ones.
- Fixer les seuils de déploiement par strate, jamais un seuil institutionnel unique.Set deployment thresholds per stratum, never a single institution-wide threshold.
Implications de politiquePolicy implications
Un score de détection ne doit jamais servir de preuve unique dans une procédure disciplinaire : les Résultats 1–2 rendent le risque de fausse accusation mathématiquement inévitable. Investir dans de « meilleurs détecteurs » ne lève pas la barrière ; investir dans le design des évaluations, si — avec le bénéfice annexe de mieux garantir la validité de ce qu'on évalue. A detection score should never serve as sole evidence in misconduct proceedings: Results 1–2 make the risk of false accusation mathematically unavoidable. Investing in "better detectors" does not lift the barrier; investing in assessment design does — with the side benefit of better assuring the validity of what is assessed.
Limites reconnuesAcknowledged limitations
Le papier les liste lui-même : les paramètres des exemples sont illustratifs et non mesurés ; le modèle traite chaque copie comme un tirage unique (pas de structure interne du document, pas de données longitudinales) ; la frontière binaire humain/IA est floue (l'écriture « assistée » occupe un continuum, le problème est partiellement mal posé à ses bords) ; et les bornes ne parlent que du cadre « texte seul, un document » — elles ne disent rien des protocoles qui changent la structure d'information. The paper lists them itself: the example parameters are illustrative, not measured; the model treats each submission as a single draw (no internal document structure, no longitudinal data); the binary human/AI boundary is blurry ("assisted" writing occupies a continuum, the problem is partially ill-posed at its edges); and the bounds speak only to the text-only, one-shot setting — they say nothing about protocols that change the information structure.
Pourquoi cette référence est iciWhy this reference is here
Ce papier croise plusieurs questions de la trajectoire BAAM. D'abord une question d'épistémologie de l'inférence : qu'est-ce qui est détectable en principe à partir d'une trace unique, quand la structure qui a produit la trace est inaccessible ? La barrière de Garland est exactement une limite de ce type — un recouvrement distributionnel rend deux origines indiscernables, quelle que soit la finesse de l'instrument. Cela résonne avec le travail sur les signatures de structures inaccessibles. This paper intersects several questions of the BAAM trajectory. First, an epistemology-of-inference question: what is detectable in principle from a single trace, when the structure that produced the trace is inaccessible? Garland's barrier is exactly a limit of this kind — distributional overlap makes two origins indistinguishable, however fine the instrument. This resonates with the work on signatures of inaccessible structures.
Ensuite, un renversement intéressant : la difficulté ne vient pas de la machine qui imite l'humain, mais de la diversité humaine qui recouvre la machine. La question « qu'est-ce qui distingue une écriture humaine d'une écriture générée ? » n'a pas de réponse au niveau du document isolé — elle n'en a qu'au niveau des distributions, et encore, seulement quand elles ne se recouvrent pas. C'est un argument fort pour penser la détection (et l'identité stylistique) comme propriété de trajectoires et de processus, pas d'objets isolés — un déplacement que le papier opère lui-même en recommandant profils longitudinaux et évaluation par processus. Second, an interesting reversal: the difficulty does not come from the machine imitating the human, but from human diversity overlapping the machine. The question "what distinguishes human writing from generated writing?" has no answer at the level of the isolated document — only at the level of distributions, and even then only when they do not overlap. This is a strong argument for thinking of detection (and stylistic identity) as a property of trajectories and processes, not isolated objects — a shift the paper itself performs when recommending longitudinal profiles and process-based assessment.