Nequdot — Monte Carlo du contre-corpus

Genere le 2026-08-18 — ticket 8eda0de2 — 10000 repetitions, graine 20260818

Protocole pre-enregistre : Nequdot-protocole-preenregistre-pilotes-67-17-78

Verdict

  • Observe : 5 hits sur 15 (occurrences 2, 4, 5, 9, 12).
  • Attendu sous H0 (tirages dans les MEMES versets) : 4.17 ± 1.72 hits.
  • p = 0.4028 (P[X ≥ 5]) — variante mot apparie en longueur : p = 0.5805.
  • Sur le TAUX : le taux observe ne se distingue pas du hasard.
  • Doublon EFP complet : observe 2 triplet(s) partage(s) ([29.11.2], [67.22.4]) ; sous H0, P[≥ 1] = 0.4615 et P[≥ 2] = 0.0981 — au-dessus du seuil de 5 %, donc pas concluant non plus.

1. Taux de hits — distribution sous H0

Regle de hit reproduite a l’identique : E(groupe pointe) ∈ cibles OU E(mot porteur) ∈ cibles, appartenance stricte (sans les « petits multiples »). Les occurrences 11 a 14 n’ont pas de groupe pointe fixe dans le releve observe : elles ne sont testees que sur le mot porteur, dans l’observe comme sous H0. L’occurrence 10 (Dt 29,28) n’a pas de porteur unique : groupe de lettres seul.

Combine (regle du protocole)

  • observe : 5
  • H0 : moyenne 4.166, ecart-type 1.716
  • p = P[X ≥ 5] = 0.4028
  • distribution : 0:72 · 1:404 · 2:1168 · 3:2021 · 4:2307 · 5:1877 · 6:1219 · 7:627 · 8:222 · 9:66 · 10:15 · 11:2

Lettres pointees seules

  • observe : 3
  • H0 : moyenne 1.491, ecart-type 1.129
  • p = P[X ≥ 3] = 0.1749
  • distribution : 0:1996 · 1:3473 · 2:2782 · 3:1246 · 4:400 · 5:88 · 6:14 · 7:1

Mots porteurs seuls

  • observe : 4
  • H0 : moyenne 2.924, ecart-type 1.494
  • p = P[X ≥ 4] = 0.3343
  • distribution : 0:340 · 1:1371 · 2:2447 · 3:2499 · 4:1902 · 5:957 · 6:342 · 7:111 · 8:28 · 9:3

Variante : mot porteur apparie en longueur

Le porteur aleatoire est tire parmi les mots du verset ayant EXACTEMENT la longueur du porteur reel (repli sur tirage libre si aucun). H0 : 4.892 ± 1.639 — p = 0.5805.

2. Doublon EFP — le test le plus discriminant

Les 14 mots porteurs identifiables ont les triplets suivants :

#Porteur[E.F.P]lettres
1וביניך[65.20.2]6
2אליו[29.11.2]4
3ובקומה[51.24.6]6
4וישקהו[67.22.4]6
5אתצאן[67.22.4]5
6ואהרן[57.21.3]5
7רחקה[52.16.7]4
8אשר[42.6.6]3
9ועשרון[94.31.4]6
11יצא[29.11.2]3
12המה[23.14.5]3
13ההיכל[43.16.7]5
14מהקצעות[99.36.9]7
15לולא[31.13.4]4

Triplets partages observes : 2.

  • [29.11.2] — occ. 2 אליו / occ. 11 יצא
  • [67.22.4] — occ. 4 וישקהו / occ. 5 אתצאן

Le releve initial n’avait retenu que [67.22.4]. Le calcul en trouve un second, [29.11.2] (אליו Gn 18,9 / יצא 2 S 19,20). Deux collisions plutot qu’une : c’est un argument DE PLUS pour la banalite du phenomene, pas pour sa rarete — voir la simulation ci-dessous.

Sous H0 : 14 mots tires au hasard dans TOUT le corpus, longueurs imposees identiques a celles des porteurs reels.

  • P[au moins un doublon] = 0.4615
  • P[au moins 2 doublons, soit l’observe] = 0.0981
  • nombre moyen de doublons = 0.569
  • distribution : 0:5385 · 1:3634 · 2:892 · 3:85 · 4:4

Lecture : un doublon EFP parmi 14 mots courts n’est PAS un evenement rare — il survient dans pres d’une simulation sur deux. Les triplets [E.F.P] sont fortement contraints (F et P derivent de E et de la composition en lettres), donc les collisions sont mecaniquement frequentes des que les longueurs se ressemblent. C’est le chiffre a opposer a l’intuition « trois coordonnees identiques, c’est enorme ».

Le fait d’en avoir DEUX est moins banal (p ≈ 0,1) sans atteindre le seuil de 5 %. Ce test reste le plus discriminant des deux, et c’est celui qui merite d’etre repris si le corpus s’elargit (Esther 8,13 et les variantes de tradition porteraient l’effectif au-dela de 15).

3. Controle massoretique-specifique

Meme protocole applique a 15 versets tires au hasard dans tout le corpus (memes tailles de groupe et longueurs de porteur). Repond a : « les versets des nequdot sont-ils particuliers, ou seulement les positions pointees ? »

  • H0 versets quelconques : 3.821 ± 1.606 hits
  • H0 versets des nequdot : 4.166 ± 1.716 hits

Un ecart entre ces deux moyennes signalerait que les versets pointes ont par eux-memes un profil numerique atypique, independamment du pointage.

Limites

  • Le releve observe ne fixe pas les lettres pointees des occurrences 11 a 14 ; elles pesent donc moins dans le test que les autres. Completer la tradition massoretique sur ces quatre cas resserrerait le protocole.
  • La liste de cibles compte 26 valeurs concentrees sous 100, la ou les mots courts se concentrent aussi : le taux de base est structurellement eleve, ce que la simulation capture (voir la moyenne H0).
  • Le tirage suppose l’echangeabilite des positions dans le verset ; il ignore la syntaxe. Un mot pointe est souvent un mot saillant, potentiellement plus long ou plus rare que la moyenne — la variante appariee en longueur borne partiellement cet effet.
  • Le signal qualitatif (coherence semantique des hits) n’est pas testable par ce dispositif : il reste hors du champ de ce Monte Carlo.