← EAAE
ÉTR · Traité de référence

Ligne cognitive d’une IA

ÉTR — Équation des transformations relationnelles
Édition 2026
ÉTR · Représentation → Comparaison → Transformation → Décision → Mémoire
Première partie

Pourquoi un nouveau langage relationnel ?

Chapitre 1 Comparer est plus difficile qu'il n'y paraît

« Toute intelligence compare. Pourtant, peu de systèmes décrivent réellement leurs comparaison. » Lorsqu'un être humain observe deux objets, il a rarement l'impression d'effectuer un calcul. Il reconnaît immédiatement des ressemblances, des différences, des analogies, des ruptures ou des continuités. Deux visages semblent appartenir à une même famille. Deux musiques évoquent une émotion similaire. Deux textes parlent du même sujet, bien qu'ils n'utilisent presque aucun mot identique. Deux entreprises poursuivent des stratégies comparables malgré des secteurs d'activité très différents. Cette capacité paraît naturelle. Pourtant, elle constitue l'un des problèmes les plus complexes de l'informatique moderne. Car un ordinateur ne perçoit ni ressemblances, ni intentions, ni significations. Il manipule uniquement des représentations. Toute comparaison commence donc par une question plus fondamentale : Comment représenter une information de manière à pouvoir ensuite la comparer ? Cette question précède toutes les autres. Avant de reconnaître une image, il faut savoir comment la représenter. Avant de comparer deux phrases, il faut décider ce qu'est une phrase pour la machine. Avant de retrouver un document, il faut choisir la manière dont ce document sera décrit. Avant de produire une réponse, il faut construire une représentation interne du contexte. Autrement dit, toute intelligence artificielle repose sur deux problèmes distincts : . Comment représenter le monde ?

. Comment comparer ces représentations ?

Ces deux questions sont souvent étudiées ensemble, alors qu'elles correspondent à deux difficultés différentes.

La première concerne la description. La seconde concerne la relation.

Une même réalité, plusieurs représentations Imaginons une situation très simple. Une personne prononce la phrase : Le chat dort sur le canapé. Pour un être humain, cette phrase semble unique. Pour un ordinateur, elle peut pourtant être représentée de nombreuses manières. Comme une suite de caractères : L e

c h a t ... Comme une suite de codes Unicode. Comme une suite de bits. Comme une liste de mots. Comme un arbre syntaxique. Comme un vecteur. Comme un ensemble de probabilités. Comme un graphe. Comme une séquence de transformations. Aucune de ces représentations n'est fausse. Elles répondent simplement à des objectifs différents. C'est probablement l'idée la plus importante à retenir avant d'aborder l'intelligence artificielle moderne. Une représentation n'est jamais la réalité. Elle est une manière de rendre cette réalité exploitable pour résoudre un problème particulier.

Pourquoi existe-t-il autant de modèles différents ? Cette diversité surprend souvent. Pourquoi les chercheurs ont-ils construit des CNN, puis des Transformers, puis des GNN, puis des moteurs vectoriels, puis des graphes de connaissances ? Pourquoi ne pas avoir développé un unique modèle capable de tout faire ? La réponse est simple. Parce que les problèmes ne sont pas les mêmes.

Reconnaître un visage n'est pas retrouver un document. Retrouver un document n'est pas dialoguer avec un utilisateur. Dialoguer n'est pas piloter un robot. Piloter un robot n'est pas organiser la mémoire d'une entreprise. Chaque architecture est donc une réponse spécialisée à une famille de problèmes. Le succès actuel des grands modèles de langage ne doit pas masquer cette réalité. Les Transformers excellent dans certaines tâches. Les réseaux convolutifs restent parmi les meilleurs outils pour de nombreuses applications de vision. Les graphes de connaissances permettent de représenter explicitement des relations que les modèles statistiques ne décrivent pas directement. Les moteurs de recherche documentaires demeurent extrêmement performants lorsqu'il s'agit d'indexer plusieurs milliards de documents. Aucun de ces systèmes n'est universel. Ils sont complémentaires. Comprendre cette complémentarité est indispensable avant d'introduire l'ÉTR.

Comparer n'est pas seulement mesurer Lorsque nous comparons deux objets, nous avons souvent tendance à imaginer une distance. Deux villes peuvent être séparées de cent kilomètres. Deux couleurs peuvent être proches dans un espace colorimétrique. Deux vecteurs peuvent former un angle faible. Deux nombres peuvent différer de quelques unités. Ces comparaisons sont utiles. Mais elles ne décrivent qu'une partie du problème. Supposons maintenant les deux phrases suivantes : Le médecin examine le patient. Le chirurgien ausculte le malade. Une représentation fondée uniquement sur les mots constatera que les deux phrases utilisent un vocabulaire différent. Une représentation vectorielle pourra apprendre qu'elles sont proches. Un graphe pourra relier les concepts. Un modèle de langage pourra produire une interprétation contextuelle. Toutes ces approches apportent une réponse pertinente. Mais elles ne décrivent pas nécessairement quelles transformations permettent de passer d'une représentation à l'autre. Autrement dit, elles répondent principalement à la question : À quel point ces deux objets se ressemblent-ils ? L'ÉTR ajoute une question différente :

Par quelles transformations relationnelles ces deux objets deviennent-ils comparables ? La différence paraît subtile. Elle est pourtant profonde. Comparer une distance revient à observer un résultat. Comparer une transformation revient à observer un processus.

Une autre manière de regarder les systèmes Pendant plusieurs décennies, la plupart des progrès de l'intelligence artificielle ont consisté à améliorer la manière de représenter les données. Des représentations plus riches. Des représentations plus compactes. Des représentations apprises automatiquement. Des représentations contextuelles. L'ÉTR ne remet pas en cause cette évolution. Elle propose simplement de déplacer le centre de gravité. Au lieu de considérer que la représentation constitue l'objet principal du calcul, elle considère que ce sont les transformations entre représentations qui méritent d'être décrites comme des objets scientifiques à part entière. Ce changement de perspective ne remplace pas les approches existantes. Il les complète. Une image peut toujours être représentée par un CNN. Une phrase peut toujours être représentée par un Transformer. Un document peut toujours être indexé par un moteur de recherche. L'ÉTR intervient lorsque l'on souhaite décrire, conserver, comparer et auditer les transformations qui relient ces représentations, indépendamment de la technologie qui les a produites.

Ce que le lecteur découvrira dans ce livre Les chapitres suivants présenteront progressivement les principales familles d'intelligence artificielle utilisées aujourd'hui. Chacune sera étudiée selon la même méthode :

Ce n'est qu'après ce parcours que l'Équation des Transformations Relationnelles sera introduite. Ce choix est volontaire. Comprendre une nouvelle théorie est beaucoup plus facile lorsqu'on comprend d'abord les questions auxquelles les théories existantes répondent déjà avec succès. L'objectif de ce livre n'est donc pas d'opposer les approches, mais de montrer qu'elles occupent des places différentes dans un paysage scientifique beaucoup plus vaste, où la représentation, la comparaison et la transformation constituent trois problèmes complémentaires plutôt qu'un seul.

Première partie

Pourquoi un nouveau langage relationnel ?

Chapitre 2 — Représenter n’est pas expliquer

Une intelligence artificielle ne traite jamais directement un objet du monde. Elle traite une représentation calculable de cet objet. Une photographie devient un tableau de valeurs numériques. Une phrase devient une séquence de symboles ou de vecteurs. Une entreprise devient un ensemble de données, de catégories, de flux et d’indicateurs. Une personne devient, selon le système considéré, un profil, un historique d’actions, un ensemble de préférences ou un nœud dans un réseau. Cette conversion est indispensable. Un calcul ne peut commencer que lorsque l’objet a été transformé en une forme compatible avec les opérations du système. Mais une difficulté devient visible immédiatement : La représentation sélectionne déjà ce que le système sera capable de voir. Une représentation n’est donc jamais neutre. Elle conserve certaines propriétés, en simplifie d’autres et en rend certaines impossibles à retrouver sans certaines clefs. Considérons une image réduite à sa couleur moyenne. Cette représentation permet de comparer rapidement la dominante chromatique de plusieurs images. Elle ne permet plus de savoir si l’image contenait un visage, un paysage ou un texte. Considérons maintenant une phrase réduite à la fréquence de ses mots. Cette représentation permet d’identifier certains thèmes. Elle ne conserve pas nécessairement l’ordre des mots, la négation, la syntaxe ni la progression argumentative. Dans les deux cas, l’objet représenté existe encore sous une forme calculable, mais une partie de sa structure a disparu.

La première exigence d’un système scientifique rigoureux devrait donc être la suivante :

\[\text{Toute représentation doit déclarer ce qu’elle conserve et ce qu’elle perd.}\]

Cette exigence paraît simple. Elle est pourtant rarement appliquée de manière complète.

2.1.La représentation comme transformation initiale

Soit un objet (x) appartenant à un domaine (\mathcal{X}).

Une représentation peut être décrite par une application :

\[\Phi : \mathcal{X} \rightarrow \mathcal{Y}\]

où :

Par exemple :

\[\Phi_{\text{image}} : \text{Image} \rightarrow \mathbb{R}^{H \times W \times C}\]

transforme une image en tenseur numérique. De même :

\[\Phi_{\text{texte}} : \text{Phrase} \rightarrow (\text{Tokens})^{*}\]

transforme une phrase en séquence de tokens. Mais cette écriture ne suffit pas. Elle indique seulement qu’une transformation existe. Elle ne nous dit pas quelles propriétés ont été conservées.

Pour rendre la transformation scientifiquement lisible, il faut lui associer un contrat. Nous pouvons écrire :

\[\mathcal{C}_{\Phi} \left( I_c, I_t, I_a, I_s, I_{\varnothing} \right)\]

avec :

Ce contrat ne décrit pas encore l’ÉTR dans son ensemble. Il introduit seulement l’une de ses disciplines fondamentales : une opération n’est pas entièrement définie tant que ses effets informationnels ne le sont pas.

2.2.La différence entre perte, transformation et indétermination

Ces trois notions sont souvent confondues. Transformation Une information est transformée lorsqu’elle change de forme tout en restant récupérable, au moins partiellement. Par exemple, une image convertie d’un espace colorimétrique RGB vers un espace Lab change de représentation, mais une transformation inverse peut théoriquement être définie avec une précision élevée. Suppression Une information est supprimée lorsqu’elle est volontairement retirée. Par exemple, anonymiser un document en supprimant les noms propres constitue une suppression déclarée. Indétermination Une information devient indéterminable lorsque plusieurs objets différents

produisent la même représentation et qu’il n’est plus possible de savoir lequel était l’objet initial. Soit :

\[\Phi(x_1)=\Phi(x_2) \qquad \text{avec} \qquad x_1\neq x_2\]

Alors la lecture inverse n’est pas unique.

\[\Phi^{-1}(\Phi(x_1))\]

ne désigne plus un objet précis, mais un ensemble de candidats possibles. Cette distinction est décisive. Une perte déclarée peut être acceptable. Une transformation inversible peut être maîtrisée. Une indétermination non déclarée peut produire une illusion de précision.

2.3.Compression et décision

Les systèmes d’intelligence artificielle compressent continuellement l’information. Un CNN compresse progressivement une image en caractéristiques. Un Transformer transforme une séquence de tokens en représentations contextuelles distribuées. Un moteur vectoriel représente un document par un vecteur de dimension finie. Un système de recommandation condense l’historique d’un utilisateur en variables exploitables. Cette compression n’est pas un défaut. Elle est nécessaire. Sans compression, un système devrait conserver et recalculer tous les détails de toutes les entrées à chaque opération. Une telle architecture deviendrait rapidement inutilisable. Le problème n’est donc pas la compression. Le problème apparaît lorsque la compression et la décision deviennent indistinguables. Considérons un système qui transforme un document (d) en vecteur (v_d), puis compare ce vecteur à une requête (q).

\[d \overset{\Phi}{\longmapsto} v_d\]
\[q \overset{\Phi}{\longmapsto} v_q\]

Puis :

\[s(d,q)=\cos(v_d,v_q)\]

Le score (s) est souvent utilisé comme base de classement. Mais il faut distinguer trois opérations : . représenter le document ;

. comparer les représentations ;

. décider du classement.

Formellement :

\[d \overset{\Phi}{\longmapsto} v_d\]
\[(v_d,v_q) \overset{\rho}{\longmapsto} s\]
\[s \overset{\Delta}{\longmapsto} \text{rang}\]

où :

Ces trois opérations ne sont pas équivalentes. Un bon vecteur ne garantit pas une bonne métrique. Une bonne métrique ne garantit pas une bonne décision.

Une bonne décision locale ne garantit pas un bon comportement global. L’ÉTR exige donc que ces niveaux restent séparés.

\[\text{Représentation} \neq \text{Comparaison} \neq \text{Décision}\]

2.4.Exemple : la négation

Prenons deux phrases : Le traitement est efficace. Le traitement n’est pas efficace. Elles partagent presque tous leurs mots. Une représentation naïve fondée sur la fréquence lexicale peut les considérer comme très proches. Cette proximité n’est pas fausse. Les deux phrases parlent bien du même sujet. Mais leur orientation propositionnelle est opposée. Cela signifie qu’une seule relation de similarité ne suffit pas à les décrire. Nous pourrions distinguer :

Ainsi, la relation entre les deux phrases n’est pas correctement résumée par un nombre unique. Elle ressemble davantage à une structure :

\[\rho(s_1,s_2) \left( \rho_{\text{lex}}, \rho_{\text{sujet}}, \rho_{\text{logique}}, \rho_{\text{syntaxe}} \right)\]

avec, par exemple :

\[\rho_{\text{lex}} \approx \text{forte proximité}\]
\[\rho_{\text{sujet}} = \text{identité}\]
\[\rho_{\text{logique}} = \text{opposition}\]
\[\rho_{\text{syntaxe}} = \text{proximité élevée}\]

Une moyenne de ces dimensions pourrait produire un score intermédiaire. Mais ce score effacerait la propriété la plus importante : les phrases portent des conclusions opposées. C’est ici qu’apparaît une limite générale des agrégations prématurées.

\[\text{Un résultat compact peut être calculable tout en étant explicativement pauvre.}\]

2.5.Un vecteur n’est pas une explication

Les représentations vectorielles sont extrêmement puissantes. Elles permettent de situer des objets dans des espaces où la proximité devient calculable. Mais un vecteur, à lui seul, ne constitue pas une explication. Supposons qu’un modèle associe à une phrase un vecteur :

\[v \in \mathbb{R}^{d}\]

Ce vecteur peut encoder de nombreuses propriétés distribuées entre ses composantes. Cependant, les questions suivantes restent distinctes :

Une représentation peut être prédictive sans être directement explicative. Cette distinction est essentielle pour comprendre les LLM. Les grands modèles de langage ne stockent pas généralement leurs connaissances sous la forme d’une encyclopédie explicite où chaque information serait localisée dans une cellule identifiable. Leur comportement résulte d’une distribution complexe de paramètres et d’activations, de sélection d’argument et score appliqués. Ils peuvent donc produire une réponse correcte sans fournir spontanément la chaîne causale exacte qui a conduit à cette réponse. L’explication produite après coup est elle-même une génération du modèle. Elle ne doit pas être automatiquement confondue avec une trace complète de son calcul interne.

2.6.La question de l’inversion

Une représentation est parfaitement inversible lorsque l’objet initial peut être reconstruit sans ambiguïté.

\[\exists \Phi^{-1} \quad \text{tel que} \quad \Phi^{-1}(\Phi(x))=x\]

Dans la pratique, de nombreuses représentations ne sont que partiellement inversibles. Par exemple :

fidélité ;

spatiale ;

reconstruit mot pour mot.

Cette propriété influence profondément l’usage du système. Une représentation non inversible peut être excellente pour classer et médiocre pour auditer. Une représentation compressée peut être excellente pour rechercher et insuffisante pour justifier. Une représentation locale peut être excellente pour reconnaître un motif et inadéquate pour décrire une causalité globale. Il n’existe donc pas de représentation universellement supérieure. Il existe des représentations adaptées à des contrats d’usage.

2.7.Le problème du référentiel implicite

Toute représentation est produite relativement à un système de conventions. Une couleur dépend d’un espace colorimétrique. Une position dépend d’un système de coordonnées. Une mesure dépend d’une unité. Un score dépend d’une fonction. Une proximité dépend d’une métrique. Une interprétation dépend d’un contexte. Pourtant, les systèmes informatiques manipulent souvent ces objets comme si leur sens était intrinsèque. Considérons la valeur :

\[0{,}82\]

Que signifie-t-elle ? Sans référentiel, nous ne le savons pas. Il peut s’agir :

La valeur ne devient interprétable qu’avec son contexte :

\[v (\text{valeur},\text{domaine},\text{méthode},\text{échelle}, \text{provenance})\]

De même, une relation ne devient exploitable que lorsqu’on connaît le référentiel dans lequel elle a été calculée.

L’ÉTR nomme explicitement ce référentiel. Il ne s’agit pas nécessairement d’un espace géométrique. Un référentiel peut contenir :

Nous pouvons le représenter provisoirement par :

\[R ( \mathcal{O}, \mathcal{F}, \mathcal{M}, \mathcal{B}, \Pi )\]

où :

Deux résultats numériques identiques produits dans deux référentiels différents ne sont donc pas nécessairement équivalents.

2.8.Ce que signifie réellement « comprendre »

Dans le langage courant, comprendre signifie souvent être capable de répondre correctement. Mais plusieurs niveaux doivent être distingués. Reconnaissance Le système identifie une forme connue. Association Le système relie une entrée à des éléments proches ou statistiquement compatibles. Prédiction Le système estime la sortie la plus probable selon son état et ses paramètres. Justesse Le système reçoit un signal de réalisation, de succès selon son référentiel et nuances. Explication Le système produit une description intelligible des facteurs ayant conduit au résultat. Traçabilité Le système conserve les transformations effectives ayant produit ce résultat. Réversibilité Le système permet de revenir, au moins partiellement, vers les états antérieurs. Un modèle peut être performant en reconnaissance et faible en traçabilité. Il peut être performant en prédiction et limité en réversibilité. Il peut produire des explications linguistiquement convaincantes sans que celles-ci soient des journaux exacts de ses opérations internes. L’ÉTR ne propose pas de redéfinir arbitrairement l’intelligence. Elle impose seulement de ne pas confondre ces capacités.

\[\text{Répondre correctement} \not\Rightarrow \text{tracer complètement la transformation}\]

2.9.Première conséquence pour l’ÉTR

L’ÉTR ne doit pas seulement représenter des objets. Elle doit représenter les opérations qui affectent ces objets. Si (x) devient (y), il ne suffit pas de sauver (x) et (y). Il faut également préserver, lorsque cela est applicable :

\[f : x \mapsto y\]

ainsi que le contrat de (f). On obtient alors :

\[(x,f,y,R,\Pi,U)\]

où :

Cet ensemble forme une unité de lecture plus riche qu’un simple couple entrée-sortie. Il devient possible de demander :

Ces questions fondent progressivement le langage de l’ÉTR.

Chapitre 3 — Comparer, transformer, composer

Comparer deux objets est souvent présenté comme une opération élémentaire. On choisit une métrique, on calcule une distance, puis on classe les résultats. Cette méthode fonctionne remarquablement bien dans de nombreux contextes. Mais elle repose sur une hypothèse rarement énoncée : les objets sont déjà comparables. Or la comparabilité n’est pas toujours donnée. Elle doit parfois être construite. Comparer deux températures exprimées dans des unités différentes exige une conversion. Comparer deux documents rédigés dans des langues différentes exige une traduction, une représentation commune ou une médiation. Comparer une image et une phrase exige une architecture multimodale capable de les projeter dans un espace partagé. Comparer deux stratégies d’entreprise exige de définir des dimensions, des horizons temporels, les règles, codes et les critères communs. Ainsi, avant la mesure, il existe souvent une transformation.

\[x \longrightarrow \widetilde{x}\]
\[y \longrightarrow \widetilde{y}\]

puis seulement :

\[\rho(\widetilde{x},\widetilde{y})\]

La comparaison dépend donc des transformations qui ont rendu les objets comparables.

3.1.Le prédicat de comparabilité

Soient deux objets (x) et (y). Nous définissons un prédicat :

\[\operatorname{Comp}(x,y;R) \in {\text{vrai},\text{faux},\text{partiel}}\]

Il indique si (x) et (y) peuvent être comparés dans le référentiel (R). La comparabilité peut dépendre de plusieurs conditions :

On peut donc écrire :

\[\operatorname{Comp}(x,y;R) \bigwedge_{k=1}^{n} c_k(x,y;R)\]

où chaque (c_k) représente une condition. Dans les systèmes réels, cette valeur n’est pas toujours binaire. Deux objets peuvent être comparables lexicalement et incomparables causalement. Ils peuvent être comparables à court terme et incomparables à long terme. Ils peuvent être comparables selon une dimension et indéterminés selon une autre. La comparabilité doit donc parfois être structurée :

\[\operatorname{Comp}(x,y;R) (c_1,c_2,\ldots,c_n)\]

3.2.Relation et transformation

Une relation décrit une correspondance, un rapport ou une propriété entre des objets. Une transformation décrit une opération produisant un changement. Ces notions sont liées, mais elles ne sont pas identiques. Une relation peut être descriptive :

\[\rho(x,y)=r\]

Une transformation est opératoire :

\[f(x)=y\]

Dans certains cas, la relation peut définir une transformation. Dans d’autres, elle ne fait que caractériser les objets. Par exemple :

\[\rho(a,b)=\frac{b}{a}\]

décrit le rapport entre deux valeurs positives. Mais savoir que :

\[\frac{b}{a}=2\]

ne précise pas nécessairement le mécanisme physique ou causal ayant transformé (a) en (b). Le passage de (a) à (b) peut résulter :

La même relation finale peut donc être produite par plusieurs transformations.

\[f_1(a)=b\]
\[f_2(a)=b\]

avec :

\[f_1\neq f_2\]

Cette distinction est fondamentale pour la traçabilité.

3.3.La transformation comme objet déclaré

Dans l’ÉTR, une transformation ne doit pas être réduite à sa fonction d’application. Nous pouvons la représenter comme un objet :

\[\mathfrak{f} ( \operatorname{type}, \operatorname{dom}, \operatorname{cod}, \operatorname{apply}, \operatorname{pre}, \operatorname{post}, \operatorname{inv}, \Pi, U )\]

où :

Cette structure rend explicites des propriétés souvent enfouies dans le code ou supposées par le lecteur.

3.4.Les familles de transformations

Plusieurs familles doivent être distinguées. Lecture Une lecture extrait ou construit une représentation.

\[\Phi : x \mapsto q\]

Transport Un transport déplace un état dans un espace ou un référentiel sans nécessairement changer sa nature.

\[T : q_i \mapsto q_j\]

Qualification Une qualification ajoute ou modifie une lecture sémantique, contextuelle ou normative.

\[\Lambda : q \mapsto q'\]

Substitution Une substitution remplace un élément par un autre selon une règle déclarée.

\[S(x,a\rightarrow b)=x'\]

Mise à jour Une mise à jour modifie une mémoire ou un référentiel.

\[\operatorname{Update}(\Omega,x) \Omega'\]

Décision Une décision sélectionne une sortie ou une action parmi plusieurs possibilités.

\[D: \mathcal{Q} \rightarrow \mathcal{A}\]

Ces familles ne doivent pas être confondues. Qualifier n’est pas transporter. Lire n’est pas décider. Décider n’est pas mettre à jour. Mettre à jour n’est pas simplement ajouter.

3.5.La composition

Une transformation isolée est rarement suffisante. Les systèmes réels sont constitués de chaînes :

\[x \overset{f_1}{\longmapsto} x_1 \overset{f_2}{\longmapsto} x_2 \overset{f_3}{\longmapsto} y\]

La composition est notée :

\[f_3\circ f_2\circ f_1\]

avec :

\[(f_3\circ f_2\circ f_1)(x)=y\]

Mais la simple notation fonctionnelle ne dit pas tout. Lorsque plusieurs transformations sont composées, leurs effets informationnels s’accumulent. Si (f_1) perd l’ordre, aucune transformation ultérieure ne peut le restaurer avec certitude sans information externe. Si (f_2) ajoute une qualification contextuelle, cette qualification peut influencer toutes les étapes suivantes. Si (f_3) agrège plusieurs dimensions en un seul score, les dimensions initiales deviennent potentiellement indéterminables. Le contrat global de composition ne peut donc pas être obtenu par une simple juxtaposition descriptive. Il doit être calculé.

\[\mathcal{C}_{f_3\circ f_2\circ f_1} \operatorname{ComposeContracts} ( \mathcal{C}{f_1}, \mathcal{C}{f_2}, \mathcal{C}_{f_3} )\]

3.6.L’ordre des transformations

Dans certains systèmes, l’ordre n’a pas d’importance. Si deux opérations commutent :

\[f\circ g=g\circ f\]

alors leur ordre peut être échangé sans modifier le résultat. Mais de nombreuses opérations linguistiques, cognitives et perceptives ne commutent pas.

\[f\circ g \neq g\circ f\]

Prenons un exemple simple. Appliquer une négation, puis une intensification : pas bon vraiment pas bon n’est pas nécessairement équivalent à : vraiment bon pas vraiment bon Les mêmes éléments sont présents, mais leur ordre d’application modifie la lecture. De même, dans une image :

ne produisent pas le même résultat. Dans un système de décision :

peuvent conduire à des ensembles différents.

La composition ordonnée devient donc un objet central.

3.7.Compose dans l’ÉTR

Compose désigne la construction ordonnée d’un état à partir d’une séquence de transformations. Soit une séquence :

\[\Gamma (a_1,a_2,\ldots,a_n)\]

À chaque unité (a_i) est associé un opérateur (A_i). L’état final peut être construit par :

\[Q_n A_nA_{n-1}\cdots A_2A_1Q_0\]

L’ordre conventionnel d’écriture doit être déclaré, car la première opération appliquée est ici (A_1). Si les opérateurs ne commutent pas :

\[A_iA_j \neq A_jA_i\]

alors Compose conserve intrinsèquement l’ordre de la séquence. C’est important pour le langage. Les phrases : Le chien poursuit le chat. et : Le chat poursuit le chien. contiennent presque les mêmes unités, mais leur ordre modifie les rôles et le sens. Une représentation fondée sur une collection non ordonnée ne suffit donc pas. Compose ne prétend pas, à lui seul, produire le sens complet. Il construit une structure ordonnée qui pourra ensuite être qualifiée. Cette séparation est centrale :

\[\text{Compose construit la structure ; la qualification intervient séparément.}\]

3.8.Structure et qualification

Supposons que Compose produise un état :

\[Q_{\text{struct}}\]

Une qualification contextuelle produit ensuite :

\[Q_{\text{qual}} \Lambda(Q_{\text{struct}},R,\Pi)\]

où :

Cette architecture évite d’introduire implicitement le sens dans la construction structurelle. Elle permet aussi de comparer plusieurs qualifications d’une même structure.

\[Q_{\text{qual}}^{(1)} \Lambda_1(Q_{\text{struct}})\]
\[Q_{\text{qual}}^{(2)} \Lambda_2(Q_{\text{struct}})\]

On peut alors étudier :

Cette distinction est particulièrement utile lorsqu’un mot est polysémique. Le terme « avocat » conserve sa forme structurelle. Sa qualification dépend du contexte :

La structure ne doit pas être reconstruite arbitrairement à chaque interprétation. C’est la qualification qui doit déclarer le changement de lecture.

3.9.Pourquoi borner la qualification

Une qualification non contrainte pourrait transformer n’importe quelle structure en n’importe quelle interprétation. Le système deviendrait alors impossible à falsifier. Pour éviter cela, l’ÉTR introduit l’idée d’un domaine admissible de modulation.

\[\Lambda \in \mathcal{A}_{\kappa}\]
où (\mathcal{A}_{\kappa}) décrit l’ensemble des qualifications autorisées
selon une amplitude (\kappa).

Le principe n’impose pas encore une forme unique. Il pose une exigence : Une qualification doit être limitée par un domaine déclaré avant son application. Cette limite peut dépendre :

Dans un système médical, une qualification sémantique incertaine devra être fortement bornée. Dans une application artistique, le domaine admissible pourra être plus large. La même architecture peut donc accueillir plusieurs régimes sans modifier son principe.

3.10.Le chemin comme information

Dans de nombreux systèmes, seul l’état final est conservé.

\[x \rightarrow y\]

Mais si plusieurs chemins conduisent à (y), ils ne sont pas nécessairement équivalents.

\[x \overset{f_1}{\longrightarrow} a \overset{f_2}{\longrightarrow} y\]

et :

\[x \overset{g_1}{\longrightarrow} b \overset{g_2}{\longrightarrow} y\]

peuvent produire le même résultat tout en ayant :

L’ÉTR conserve donc le chemin :

\[\Gamma (f_1,f_2,\ldots,f_n)\]

et pas seulement son extrémité. Cette conservation ouvre une possibilité importante : comparer des processus, et non seulement des résultats.

3.11.Chemins fermés et cohérence

Un chemin fermé revient à son point de départ.

\[Q_0 \overset{T_1}{\longmapsto} Q_1 \overset{T_2}{\longmapsto} \cdots \overset{T_n}{\longmapsto} Q_0'\]

Si le système est parfaitement cohérent et réversible selon le contrat annoncé, on peut attendre :

\[Q_0'=Q_0\]

ou, pour des transports multiplicatifs :

\[T_nT_{n-1}\cdots T_1=I\]

où (I) est l’identité. Si ce produit diffère de l’identité, le cycle présente un résidu.

\[H_{\Gamma} T_n\cdots T_1 \neq I\]

Ce résidu peut signaler :

Il ne doit pas être interprété automatiquement comme une anomalie. Il

constitue d’abord une observation à expliquer.

3.12.La mémoire comme ensemble structuré de transformations

Une mémoire conventionnelle conserve des données. Une mémoire relationnelle conserve également les transformations qui relient ces données. Nous pouvons représenter une mémoire ÉTR par :

\[\Omega ( V,E,\Gamma,\Pi,R )\]

où :

Une mise à jour ne consiste donc pas seulement à ajouter un nouvel élément.

\[\Omega_{t+1} \operatorname{Update}(\Omega_t,x)\]

Elle doit préciser :

La mémoire devient ainsi un système d’évolution, non un simple stockage.

3.13.Comparaison avec le Transformer

Un Transformer transforme une séquence de tokens en représentations contextuelles en utilisant notamment l’attention. Pour une forme simplifiée :

\[Q=XW_Q\]
\[K=XW_K\]
\[V=XW_V\]

puis :

\[\operatorname{Attention}(Q,K,V) \operatorname{softmax} \left( \frac{QK^{\top}}{\sqrt{d_k}} \right)V\]

Cette opération permet à chaque position de pondérer l’information provenant des autres positions. Le Transformer construit donc des relations contextuelles très riches. Mais son objectif principal n’est pas de déclarer chaque transformation relationnelle comme un objet externe typé et auditable. Ces relations sont intégrées au calcul du modèle. L’ÉTR adopte un autre niveau d’abstraction. Elle ne cherche pas à remplacer l’attention. Elle cherche à pouvoir déclarer :

Un Transformer peut donc constituer l’un des producteurs de qualification ou de lecture d’un système ÉTR.

3.14.Comparaison avec le CNN

Un réseau convolutif applique des noyaux locaux partagés. Pour une convolution 2D simplifiée :

\[Y_o(p) \sum_{i,\delta} K_{o,i,\delta} X_i(p+\delta)\]

Le noyau (K) détecte des motifs locaux. Les couches successives construisent des représentations de plus en plus abstraites. Le CNN excelle lorsque la structure locale et la régularité spatiale sont importantes. Mais, comme le Transformer, il n’a pas pour objectif premier de produire un registre explicite de toutes les transformations informationnelles. Dans une architecture combinée :

\[\text{Image} \overset{\text{CNN}}{\longrightarrow} Q_{\text{visuel}}\]

puis :

\[Q_{\text{visuel}} \overset{\text{ÉTR}}{\longrightarrow} \text{comparaison, routage, mémoire, décision}\]

Le CNN extrait. L’ÉTR déclare, relie, compare et préserve. Cette formulation ne hiérarchise pas les deux systèmes. Elle distingue leurs fonctions.

3.15.Ce que cette différence implique

Un modèle neuronal apprend principalement des paramètres lui permettant de produire des représentations ou des sorties utiles. L’ÉTR structure principalement les conditions dans lesquelles des transformations deviennent déclarables, comparables et auditables. On peut résumer ainsi :

\[\text{Modèle neuronal} : \text{apprendre une fonction efficace}\]
\[\text{ÉTR} : \text{déclarer et organiser les transformations}\]

Les deux approches peuvent être combinées. Le modèle neuronal produit une lecture. L’ÉTR inscrit cette lecture dans un référentiel. Le modèle neuronal estime une qualification. L’ÉTR vérifie son admissibilité. Le modèle neuronal propose une décision. L’ÉTR conserve le chemin, les conditions et la mise à jour qui en résultent.

Conclusion de la première partie

Les trois premiers chapitres ont établi une progression logique. Premièrement, toute intelligence artificielle dépend d’une représentation. Deuxièmement, toute représentation transforme l’objet initial et doit déclarer ses effets informationnels. Troisièmement, une comparaison n’est valide que si les objets ont été rendus comparables dans un référentiel défini. Quatrièmement, les transformations qui construisent cette comparabilité doivent être distinguées des décisions qui en exploitent les résultats. Cinquièmement, l’ordre, les chemins, la provenance et les pertes constituent eux-mêmes des informations. L’ÉTR commence ici, cet endroit précis. Elle ne commence pas par une nouvelle architecture neuronale. Elle commence par une exigence scientifique :

\[\text{Une transformation ne doit pas seulement être exécutée ; elle doit pouvoir être décrite.}\]

La partie suivante examinera les grandes familles d’intelligence artificielle selon cette grille : représentation, transformation, comparaison, décision, mémoire et traçabilité.

Deuxième partie

Comprendre les grandes familles d’intelligence artificielle

Chapitre 4 — Les moteurs de recherche : retrouver avant de comprendre

Avant les grands modèles de langage, avant les réseaux neuronaux profonds et avant les systèmes multimodaux, une question structurait déjà une grande partie de l’informatique : Comment retrouver une information pertinente dans un ensemble beaucoup plus vaste que ce qu’un humain peut parcourir ? Cette question paraît plus simple que la compréhension du langage. Elle ne l’est pas nécessairement. Un moteur de recherche doit accomplir au moins quatre opérations distinctes : . représenter les documents ;

. représenter la requête ;

. comparer la requête aux documents ;

. classer les résultats.

On retrouve déjà la séparation introduite précédemment :

\[\text{Représentation} \neq \text{Comparaison} \neq \text{Décision}\]

Le moteur de recherche n’a pas nécessairement besoin de « comprendre » les documents au sens humain du terme. Il doit produire un ordre utile entre eux. Cette nuance est essentielle.

4.1.Le problème documentaire

Soit un corpus :

\[\mathcal{D} {d_1,d_2,\ldots,d_N}\]

et une requête :

\[q\]

Le moteur cherche à produire un classement :

\[\operatorname{Rank}(q,\mathcal{D}) (d_{i_1},d_{i_2},\ldots,d_{i_k})\]

tel que les premiers documents soient les plus utiles relativement à la requête. Mais le terme « utile » doit être défini. Un document peut être jugé pertinent parce qu’il :

Ainsi, la pertinence n’est pas une propriété purement intrinsèque du document. Elle est une relation :

\[\operatorname{Rel}(d,q;R,U,C)\]

où :

Le même document peut être très pertinent dans un contexte et inutile dans un autre.

4.2.L’indexation

Parcourir tous les documents à chaque requête serait trop coûteux. Les moteurs construisent donc un index. L’idée la plus simple consiste à associer chaque terme aux documents qui le contiennent. Par exemple :

\[\text{robotique} \mapsto {d_3,d_{18},d_{52},d_{981}}\]
\[\text{navigation} \mapsto {d_4,d_{18},d_{27},d_{981}}\]

Cette structure est appelée index inversé. Elle inverse la relation naturelle :

\[\text{document} \rightarrow \text{termes}\]

en :

\[\text{terme} \rightarrow \text{documents}\]

L’indexation est déjà une transformation. Elle conserve :

Elle peut perdre ou simplifier :

Le contrat de cette représentation dépend de la sophistication de l’index.

4.3.La fréquence des termes

Une première méthode consiste à compter les occurrences d’un mot dans un document. Soit :

\[\operatorname{TF}(t,d)\]

la fréquence du terme (t) dans le document (d). Un terme fréquent dans un document peut être important pour ce document. Mais cette règle produit immédiatement un problème. Des termes comme :

apparaissent dans de très nombreux documents sans être discriminants. Il faut donc combiner la fréquence locale avec la rareté globale. On introduit alors :

\[\operatorname{IDF}(t) \log \left( \frac{N}{\operatorname{df}(t)} \right)\]

où :

Le produit :

\[\operatorname{TFIDF}(t,d) \operatorname{TF}(t,d) \cdot \operatorname{IDF}(t)\]

attribue davantage de poids aux termes fréquents dans un document, mais rares dans le corpus. Cette méthode a joué un rôle fondamental dans la recherche documentaire. Elle ne « comprend » pas le document. Elle construit une représentation discriminante.

4.4.Le modèle vectoriel documentaire

Un document peut être représenté par un vecteur :

\[v_d (w_{1,d},w_{2,d},\ldots,w_{m,d})\]

où chaque composante correspond à un terme du vocabulaire. La requête devient elle aussi un vecteur :

\[v_q\]

La similarité peut alors être calculée avec le cosinus :

\[\operatorname{sim}(q,d) \frac{ v_q\cdot v_d }{ |v_q||v_d| }\]

Cette méthode permet de comparer les orientations plutôt que les seules magnitudes. Deux documents de longueurs différentes peuvent être considérés

comme proches s’ils distribuent leurs termes de manière similaire. Le moteur produit alors :

\[s_i \operatorname{sim}(q,d_i)\]

puis trie les documents selon (s_i). Cette architecture est claire :

\[d_i \overset{\Phi}{\longmapsto} v_{d_i}\]
\[q \overset{\Phi}{\longmapsto} v_q\]
\[(v_q,v_{d_i}) \overset{\rho}{\longmapsto} s_i\]
\[{s_i} \overset{\Delta}{\longmapsto} \operatorname{Rank}\]

Elle illustre parfaitement la distinction entre lecture, comparaison et décision.

4.5.BM25 : la pertinence comme fonction calibrée

Les moteurs documentaires modernes (Base théorique 1976 - Okapi BM25) utilisent souvent des fonctions plus élaborées, comme BM25. Une forme simplifiée s’écrit :

\[\operatorname{BM25}(q,d) \sum_{t\in q} \operatorname{IDF}(t) \cdot \frac{ f(t,d)(k_1+1) }{ f(t,d)+k_1 \left( 1-b+b\frac{|d|}{\operatorname{avgdl}} \right) }\]

où :

BM25 montre qu’un bon système ne se contente pas d’ajouter des occurrences. Il introduit des hypothèses :

Ces choix ne sont pas neutres. Ils constituent un modèle de pertinence.

4.6.Ce que le moteur documentaire sait réellement

Un moteur documentaire classique sait très bien :

Il peut aussi intégrer :

Il ne faut donc pas réduire la recherche documentaire à un simple comptage de mots. Cependant, même lorsqu’il est sophistiqué, le moteur poursuit principalement un objectif :

\[\text{ordonner les documents selon une fonction de pertinence}\]

Il ne cherche pas nécessairement à reconstruire un chemin relationnel complet entre la requête et chaque document.

4.7.La différence entre retrouver et expliquer

Supposons qu’un moteur place un document en première position. Il peut parfois expliquer ce résultat par :

Mais cette explication reste souvent agrégée. Le moteur ne décrit pas nécessairement :

comparable ;

delà du score final.

L’ÉTR ne remplace pas le moteur de recherche. Elle peut lui ajouter une couche de déclaration. Par exemple :

\[q \rightarrow \Phi_q \rightarrow R \rightarrow {\rho_i} \rightarrow \Delta \rightarrow \operatorname{Rank}\]

avec, pour chaque résultat :

\[\mathcal{E}_i ( \text{relations activées}, \text{transformations}, \text{provenance}, \text{incertitude}, \text{pertes} )\]

Le classement devient alors accompagné d’un dossier relationnel.

4.8.Exemple : recherche sur un terme ambigu

Considérons la requête : avocat responsabilité civile

Le terme « avocat » peut désigner :

Le moteur documentaire exploite le contexte « responsabilité civile » pour favoriser l’interprétation juridique. Cette désambiguïsation peut être produite par :

L’ÉTR demanderait que cette transformation soit déclarée comme qualification :

\[\Lambda( \text{avocat}, \text{responsabilité civile} ) \text{avocat-juriste}\]

avec :

Ainsi, la désambiguïsation ne disparaît pas dans le score final. Elle reste une opération inspectable.

4.9.La recherche comme pipeline relationnel

Un moteur enrichi par l’ÉTR pourrait être décrit ainsi :

\[\text{requête brute}\]
\[\downarrow\]
\[\text{segmentation}\]
\[\downarrow\]
\[\text{qualification}\]
\[\downarrow\]
\[\text{sélection du référentiel}\]
\[\downarrow\]
\[\text{comparaison documentaire}\]
\[\downarrow\]
\[\text{routage}\]
\[\downarrow\]
\[\text{classement}\]
\[\downarrow\]
\[\text{mise à jour de mémoire}\]

Chaque étape possède son propre contrat. Cela permettrait de distinguer plusieurs causes d’échec. Un mauvais résultat peut provenir :

Sans séparation, ces erreurs sont souvent confondues dans une même « mauvaise réponse ».

4.10.Ce que l’ÉTR apporte à la recherche documentaire

L’apport potentiel n’est pas d’améliorer automatiquement tous les classements. Il est de rendre le processus plus structuré. L’ÉTR peut permettre de :

Ainsi, le moteur documentaire continue de retrouver. L’ÉTR ajoute la possibilité de décrire comment la recherche a été construite.

Chapitre 5 — Les embeddings : construire un espace de proximité

Les embeddings ont transformé la recherche, la recommandation et le traitement du langage. Leur principe général est puissant : représenter des objets complexes par des vecteurs dans un espace où certaines relations deviennent géométriquement calculables. Un mot, une phrase, une image ou un utilisateur peuvent être associés à un vecteur :

\[e(x) \in \mathbb{R}^{d}\]

La fonction :

\[e: \mathcal{X} \rightarrow \mathbb{R}^{d}\]

est appelée fonction d’encodage. Le but n’est pas nécessairement de conserver toutes les propriétés de (x). Le but est de conserver celles qui sont utiles à la tâche.

5.1.De la représentation symbolique à la représentation distribuée

Dans une représentation symbolique classique, un terme possède une identité distincte. Par exemple :

\[\text{chat} \neq \text{chien}\]

Dans un encodage one-hot, chaque mot correspond à une dimension différente. Si le vocabulaire contient quatre termes :

\[V { \text{chat}, \text{chien}, \text{voiture}, \text{maison} }\]

on peut écrire :

\[\text{chat} (1,0,0,0)\]
\[\text{chien} (0,1,0,0)\]
\[\text{voiture} (0,0,1,0)\]

Cette représentation conserve parfaitement l’identité. Mais elle ne représente aucune proximité. La distance entre « chat » et « chien » est la même que celle entre « chat » et « voiture ». Les embeddings modifient cela. Ils apprennent des représentations distribuées :

\[e(\text{chat}) (0{,}12,-0{,}34,\ldots)\]
\[e(\text{chien}) (0{,}11,-0{,}31,\ldots)\]

Les vecteurs proches peuvent alors correspondre à des objets sémantiquement proches.

5.2.Le principe distributionnel

Une intuition historique importante du traitement du langage est la suivante : des mots apparaissant dans des contextes similaires tendent à partager certaines propriétés sémantiques. Un mot n’est donc plus défini uniquement par une entrée lexicale. Il est aussi défini par les relations statistiques de son usage.

Soit (w) un mot et (C(w)) son ensemble de contextes observés. Une représentation peut être apprise comme :

\[e(w) F(C(w))\]

où (F) condense les régularités contextuelles. Le sens n’est pas explicitement écrit dans chaque composante. Il est distribué dans la géométrie de l’espace.

5.3.La proximité géométrique

Deux objets peuvent être comparés par distance euclidienne :

\[d(x,y) |e(x)-e(y)|_2\]

ou par similarité cosinus :

\[\operatorname{cos}(x,y) \frac{ e(x)\cdot e(y) }{ |e(x)||e(y)| }\]

Une valeur élevée indique une orientation proche. Cette approche permet de retrouver des objets similaires sans exiger qu’ils partagent les mêmes mots. Par exemple : défaillance du moteur électrique peut être rapproché de : panne du système de propulsion même si les formulations diffèrent. C’est un progrès majeur par rapport à une recherche purement lexicale.

5.4.Une proximité n’est pas une identité

Deux vecteurs proches ne signifient pas nécessairement que les objets sont équivalents. Ils peuvent partager :

Mais ils peuvent aussi diverger sur un point essentiel. Reprenons : Le médicament réduit le risque. Le médicament ne réduit pas le risque. Leur proximité vectorielle peut rester élevée parce que presque tout leur contexte est identique. Pourtant, leur valeur propositionnelle est opposée. Ainsi :

\[\operatorname{sim}(x,y) \text{ élevée}\]

n’implique pas :

\[x \equiv y\]

La similarité est une relation parmi d’autres.

5.5.La compression sémantique

Un embedding compresse un objet potentiellement très riche dans un vecteur de dimension finie. Soit un document contenant plusieurs milliers de mots. Il peut devenir :

\[e(d)\in\mathbb{R}^{768}\]

ou dans un autre espace de dimension différente. Cette compression rend la recherche extrêmement rapide. Mais elle implique une agrégation. Des propriétés multiples sont condensées dans une même représentation. Il devient difficile de savoir précisément :

Les embeddings sont donc très performants pour la récupération approximative, mais moins naturellement adaptés à une explication relationnelle détaillée.

5.6.L’espace n’est pas neutre

L’espace vectoriel dépend du modèle et de son apprentissage. Deux modèles peuvent associer au même objet deux représentations différentes :

\[e_1(x) \neq e_2(x)\]

et produire des voisinages différents.

\[\mathcal{N}{e_1}(x) \neq \mathcal{N}{e_2}(x)\]

Le référentiel implicite dépend donc :

L’espace vectoriel constitue lui-même un référentiel appris. Mais ce référentiel n’est pas toujours déclaré de manière explicite dans l’usage final.

5.7.Les dimensions interprétables et latentes

Dans certains espaces, chaque dimension possède une signification claire. Par exemple :

\[x ( \text{température}, \text{pression}, \text{humidité} )\]

Dans un embedding appris, les dimensions sont généralement latentes. La composante (x_{317}) ne signifie pas directement « négation », « fruit » ou « droit ». Le sens est distribué entre plusieurs dimensions et plusieurs interactions. Cette distribution augmente la puissance de représentation. Elle diminue l’interprétabilité directe. Le système peut donc savoir distinguer des objets sans pouvoir fournir une définition simple de chaque axe.

5.8.Les analogies vectorielles

Certains espaces d’embeddings permettent des opérations analogiques. On a popularisé des relations de type :

\[e(\text{roi}) e(\text{homme}) + e(\text{femme}) \approx e(\text{reine})\]

L’intérêt de cet exemple n’est pas sa perfection, mais l’idée qu’une transformation sémantique puisse être représentée par une direction.

\[\Delta e(\text{reine})-e(\text{roi})\]

Cette direction peut être interprétée comme une transformation approximative dans l’espace. L’ÉTR rencontre ici un point de contact important. Mais elle pose une question supplémentaire : Cette direction constitue-t-elle une transformation déclarée, stable, typée et transférable, ou seulement une régularité géométrique observée ?

Une analogie vectorielle peut être utile sans constituer une loi générale.

5.9.L’embedding comme lecture

Dans le langage de l’ÉTR, un embedding peut être considéré comme une lecture :

\[\Phi_e : x \mapsto e(x)\]

Cette lecture possède un contrat. Elle conserve potentiellement :

Elle transforme :

Elle peut rendre indéterminables :

Cette description ne critique pas l’embedding. Elle explicite sa fonction.

5.10.L’embedding comme référentiel partiel

L’espace d’embedding peut aussi être vu comme un référentiel partiel :

\[R_e ( \mathbb{R}^{d}, \rho_e, \mathcal{N}, \Pi_e )\]

où :

Mais ce référentiel ne contient pas nécessairement :

L’ÉTR peut donc encapsuler l’espace vectoriel sans s’y réduire.

5.11.Recherche vectorielle et approximation

Lorsque la base contient des millions de vecteurs, comparer la requête à tous les objets devient coûteux. On utilise alors des structures de recherche approximative des plus proches voisins. L’objectif est de trouver rapidement :

\[\operatorname{ANN}(e(q)) \approx \operatorname{NN}(e(q))\]

où ANN signifie approximate nearest neighbors. Cette approximation est un choix calculatoire. Elle peut introduire une différence entre :

Dans un système ÉTR, cette différence devrait être déclarée. Le pipeline devient :

\[q \overset{\Phi_e}{\longmapsto} e(q)\]
\[e(q) \overset{\operatorname{ANN}}{\longmapsto} C_k\]
\[C_k \overset{\Delta}{\longmapsto} \text{résultats}\]

avec :

La recherche vectorielle n’est donc pas une opération unique, mais une chaîne de transformations.

5.12.Les limites structurelles du score unique

Supposons qu’un système compare deux objets selon plusieurs dimensions :

\[r_1 \text{proximité thématique}\]
\[r_2 \text{compatibilité logique}\]
\[r_3 \text{proximité temporelle}\]
\[r_4 \text{fiabilité de source}\]

Un score global pourrait être :

\[S \alpha_1r_1 + \alpha_2r_2 + \alpha_3r_3 + \alpha_4r_4\]

Mais cette agrégation peut masquer des profils très différents. Deux documents peuvent obtenir le même score :

\[S(d_1)=S(d_2)\]

tout en ayant :

\[(r_1,r_2,r_3,r_4){d_1} \neq (r_1,r_2,r_3,r_4){d_2}\]

L’un peut être très proche thématiquement mais peu fiable. L’autre peut être plus distant, mais parfaitement cohérent et documenté. Le score unique produit un ordre. Il ne conserve pas nécessairement la structure relationnelle.

5.13.La relation comme profil plutôt que comme nombre

L’ÉTR propose de conserver un profil relationnel :

\[\rho(x,y) ( r_1,r_2,\ldots,r_n )\]

avant toute agrégation. La décision peut ensuite dépendre de la tâche. Pour une recherche exploratoire :

\[\Delta_{\text{exploration}}\]

favorisera la diversité. Pour une recherche juridique :

\[\Delta_{\text{juridique}}\]

favorisera la fiabilité, la précision et la temporalité normative. Pour une recommandation culturelle :

\[\Delta_{\text{culture}}\]

pourra accepter davantage de distance. Le même profil relationnel peut donc être routé différemment. Cette séparation évite d’inscrire une politique de décision dans la représentation elle-même.

5.14.L’embedding et la mémoire

Une base vectorielle conserve souvent :

Cette structure est très efficace. Mais elle ne conserve pas nécessairement :

L’ÉTR peut ajouter une mémoire d’évolution :

\[e_t(x) \rightarrow e_{t+1}(x)\]

avec :

\[\Delta e e_{t+1}(x)-e_t(x)\]

mais surtout avec le contexte de transformation :

\[\mathcal{T}_{t\rightarrow t+1} ( \text{modèle}, \text{corpus}, \text{version}, \text{règles}, \text{effets} )\]

La variation géométrique devient alors documentée.

5.15.Compatibilité entre embeddings et ÉTR

Les embeddings constituent probablement l’un des composants les plus immédiatement compatibles avec l’ÉTR. Ils peuvent servir à :

L’ÉTR peut ensuite :

L’architecture devient :

\[\text{objet} \overset{\text{embedding}}{\longrightarrow} \text{représentation latente}\]
\[\downarrow\]
\[\text{profil relationnel ÉTR}\]
\[\downarrow\]
\[\text{routage selon le référentiel}\]
\[\downarrow\]
\[\text{décision traçable}\]

5.16.Ce que l’embedding apporte et ce qu’il ne déclare pas

L’embedding apporte :

Il ne déclare pas nécessairement :

L’ÉTR n’abolit pas cette puissance. Elle cherche à la rendre composable dans un système plus explicite.

Chapitre 6 — Les réseaux convolutifs : apprendre par motifs locaux

Les réseaux convolutifs, ou CNN, ont joué un rôle déterminant dans le développement de la vision artificielle moderne. Leur force provient d’une hypothèse simple et puissante : les motifs locaux sont importants, et un même motif peut apparaître à plusieurs positions. Un bord vertical reste un bord vertical qu’il apparaisse à gauche ou à droite de l’image. Une texture peut se répéter. Une forme locale peut contribuer à la reconnaissance d’un objet global. Le CNN exploite cette régularité spatiale.

6.1.L’image comme tenseur

Une image numérique peut être représentée par :

\[X \in \mathbb{R}^{H\times W\times C}\]

où :

Pour une image RGB :

\[C=3\]

Chaque pixel possède donc trois composantes principales. Le CNN ne reçoit pas directement « un visage » ou « une voiture ». Il reçoit une organisation de valeurs numériques.

6.2.Le noyau convolutif

Un noyau, ou filtre, est un petit tenseur de poids. Pour simplifier :

\[K \in \mathbb{R}^{k_h\times k_w}\]

Il est déplacé sur l’image. À chaque position (p), il calcule une combinaison locale :

\[Y(p) \sum_{\delta} K(\delta) X(p+\delta)\]

Le même noyau est partagé spatialement.

\[K(p)=K\]

Cette propriété s’appelle partage de poids. Elle réduit fortement le nombre de paramètres et introduit une forme d’équivariance à la translation.

6.3.Détecter sans nommer

Un filtre peut répondre fortement à certains motifs :

Mais le filtre ne porte pas nécessairement un nom sémantique explicite. Il apprend une fonction utile à l’optimisation globale. Dans les premières couches, certaines activations sont relativement interprétables. Dans les couches profondes, les représentations deviennent plus composites. Le réseau peut apprendre à reconnaître un visage sans posséder une règle symbolique simple : si deux yeux, un nez et une bouche, alors visage. La décision émerge de nombreuses transformations successives.

6.4.Hiérarchie des représentations

Un CNN profond construit plusieurs niveaux :

\[X \rightarrow F_1 \rightarrow F_2 \rightarrow \cdots \rightarrow F_n\]

Les premières couches détectent souvent des structures locales simples. Les couches intermédiaires combinent ces motifs. Les couches profondes peuvent répondre à des formes plus abstraites. Cette hiérarchie est l’une des grandes forces du CNN. Elle permet au réseau d’apprendre les caractéristiques plutôt que de les coder entièrement à la main.

6.5.Convolution et localité

La convolution impose un voisinage local. Une unité de sortie dépend d’une fenêtre limitée de l’entrée. Après plusieurs couches, le champ réceptif s’élargit. Ainsi, une activation profonde peut dépendre d’une région importante de l’image. Mais cette dépendance globale est construite progressivement.

\[\text{local} \rightarrow \text{composé} \rightarrow \text{global}\]

Cette progression correspond bien aux structures spatiales. Elle est moins naturellement adaptée à certaines dépendances longues ou non locales, ce qui a motivé d’autres architectures.

6.6.Pooling et réduction

Les CNN utilisent souvent des opérations de réduction spatiale. Par exemple, le max-pooling :

\[Y(p) \max_{\delta\in\mathcal{N}(p)} X(p+\delta)\]

conserve l’activation maximale dans une région. Cette opération réduit la résolution. Elle peut améliorer la robustesse aux petites translations. Mais elle supprime une partie de l’information de position précise. Dans le contrat de transformation :

Le pooling est donc un exemple clair de transformation utile mais non neutre.

6.7.Invariance et équivariance

Deux notions doivent être distinguées. Équivariance Une transformation de l’entrée produit une transformation correspondante de la sortie.

Pour une translation (\tau) :
\[f(\tau X) \tau f(X)\]

Invariance La sortie reste identique malgré une transformation de l’entrée.

\[f(\tau X) f(X)\]

Les couches convolutives sont principalement équivariantes aux translations dans certaines conditions. Les opérations de pooling et d’agrégation contribuent à une invariance partielle. Cette distinction montre que le réseau ne « supprime » pas immédiatement la position. Il transforme progressivement la manière dont elle compte.

6.8.Le CNN comme composition de transformations

Un CNN peut être représenté par :

\[f_{\theta} f_n \circ f_{n-1} \circ \cdots \circ f_1\]

Chaque couche applique :

\[X_{l+1} \sigma( K_l*X_l+b_l )\]

où :

Le réseau entier est une composition ordonnée.

L’ordre des couches est déterminant.

\[f_i\circ f_j \neq f_j\circ f_i\]

dans le cas général. Cela rejoint directement la question de Compose dans l’ÉTR. Mais le CNN compose des transformations apprises dans un but prédictif. L’ÉTR cherche à déclarer leur rôle relationnel, leurs contrats et leurs effets.

6.9.Ce que le CNN conserve

Selon son architecture, un CNN peut conserver ou exploiter :

Il peut transformer ou réduire :

Le réseau n’est pas « infidèle » à l’image. Il construit une représentation orientée vers son objectif.

6.10.Une activation n’est pas une relation explicite

Supposons qu’un réseau reconnaisse un animal. Certaines activations ont contribué à la décision. Mais le réseau ne produit pas nécessairement une structure explicite comme :

\[\text{oreille} \rightarrow \text{forme triangulaire} \rightarrow \text{compatibilité avec chat}\]

Il peut être possible de produire des cartes d’activation ou des méthodes d’explication. Mais celles-ci sont des lectures supplémentaires du modèle. Elles ne sont pas toujours équivalentes à un registre natif de transformations déclarées. Cette différence ne diminue pas la performance du CNN. Elle précise son architecture.

6.11.Comparaison entre CNN et moteur documentaire

Le moteur documentaire traite principalement des occurrences et des relations lexicales ou sémantiques entre documents. Le CNN traite principalement des structures locales organisées dans l’espace. Le moteur documentaire demande : Quels documents correspondent à cette requête ? Le CNN demande : Quels motifs permettent de produire la sortie attendue ? Le premier construit un classement. Le second apprend une fonction de représentation et de décision. Leur notion de proximité n’est pas la même.

6.12.Le noyau fixe et le contexte

Dans une convolution classique, le noyau appris reste généralement identique pour toutes les positions :

\[K(p)=K\]

Cela signifie que la règle locale est partagée. Cette propriété est efficace lorsque le même motif doit être reconnu partout. Mais certaines situations exigent une adaptation à la position ou au contexte. C’est précisément l’une des motivations des réseaux involutifs et des mécanismes dynamiques.

6.13.CNN et ÉTR

Un CNN peut produire une lecture visuelle :

\[\Phi_{\text{CNN}}(I) Q_{\text{visuel}}\]

L’ÉTR peut ensuite traiter cet état comme un objet typé. Par exemple :

\[Q_{\text{visuel}} \overset{\Lambda}{\longmapsto} Q_{\text{qualifié}}\]
\[(Q_{\text{qualifié}},R) \overset{\rho}{\longmapsto} \text{profil relationnel}\]
\[\text{profil} \overset{D}{\longmapsto} \text{décision}\]

Le CNN reste responsable de l’extraction perceptive. L’ÉTR devient responsable de la déclaration relationnelle. Cette séparation peut être particulièrement utile en robotique, en médecine ou dans les systèmes multimodaux.

6.14.Exemple : inspection industrielle

Une caméra observe une pièce mécanique. Le CNN détecte :

Il produit :

\[Q_{\text{vision}}\]

L’ÉTR peut ensuite relier cette lecture à :

La chaîne devient :

\[\text{image} \rightarrow \text{détection} \rightarrow \text{qualification} \rightarrow \text{comparaison} \rightarrow \text{décision} \rightarrow \text{mémoire}\]

Le CNN ne doit pas être remplacé. Il doit être inséré dans un système où ses résultats deviennent explicites et contextualisés.

6.15.Limites importantes

Un CNN peut être sensible :

Une forte précision moyenne ne garantit pas une robustesse universelle. Le référentiel d’apprentissage définit en partie le monde dans lequel le modèle est compétent.

L’ÉTR peut contribuer à déclarer cette frontière.

\[\mathcal{B}_{\text{CNN}} \text{domaine de validité estimé}\]

Une prédiction hors de cette frontière doit pouvoir être qualifiée comme incertaine ou inadmissible.

6.16.Ce que le CNN apporte et ce que l’ÉTR ajoute

Le CNN apporte :

L’ÉTR ajoute potentiellement :

La combinaison devient plus puissante que l’opposition.

Transition Les moteurs de recherche ont montré comment retrouver. Les embeddings ont montré comment construire une géométrie de proximité. Les CNN ont montré comment apprendre des motifs locaux et les composer hiérarchiquement.

Le chapitre suivant introduira une architecture située à l’intersection de plusieurs intuitions :

centrale.

Cette architecture est celle des réseaux involutifs. Elle permettra ensuite d’aborder plus rigoureusement les Transformers, où la relation contextuelle ne constitue plus un ajout périphérique, mais le mécanisme principal du calcul.

Chapitre 7 — Les réseaux involutifs : lorsque le noyau dépend du contexte

Les réseaux convolutifs reposent sur un principe de partage spatial :

\[K(p)=K\]

Le même noyau est appliqué à plusieurs positions. Cette stabilité constitue l’une de leurs forces. Elle réduit le nombre de paramètres et permet de reconnaître un même motif dans différentes régions de l’image. Mais elle impose également une hypothèse : la règle de traitement locale peut rester identique quel que soit le contenu rencontré à cette position. Cette hypothèse est souvent utile. Elle n’est pas toujours suffisante. Une texture, une forme ou une structure locale peut nécessiter un traitement différent selon :

Les réseaux involutifs introduisent précisément cette variation. Au lieu d’appliquer un noyau spatialement partagé, ils construisent un noyau qui dépend de la position ou du contenu local.

\[H=H(p,X)\]

Le traitement n’est plus seulement :

\[\text{appliquer une règle apprise}\]

mais :

\[\text{produire la règle locale adaptée, puis l’appliquer}\]

Cette différence est importante pour comprendre l’évolution des architectures neuronales modernes.

7.1.Le terme « involution »

Le mot involution possède un sens mathématique classique. Une fonction (f) est involutive lorsqu’elle est sa propre inverse :

\[f(f(x))=x\]

Mais le terme utilisé dans certaines architectures de vision ne désigne pas nécessairement une involution au sens strict de l’algèbre. Il indique plutôt une inversion partielle du principe de convolution. Dans une convolution :

Dans une involution architecturale :

Il faut donc éviter une confusion de vocabulaire.

\[\text{Involution architecturale} \neq \text{fonction involutive au sens } f\circ f=I\]

Le nom décrit une inversion de conception, non une propriété générale d’inversibilité.

7.2.Convolution : noyau fixe relativement à la position

Pour une convolution simplifiée :

\[Y_o(p) \sum_{i,\delta} K_{o,i,\delta} X_i(p+\delta)\]

où :

Le noyau ne dépend pas de (p).

\[K_{o,i,\delta}(p)=K_{o,i,\delta}\]

Le même motif est donc recherché dans tout l’espace.

7.3.Involution : noyau produit à la position

Dans une forme simplifiée d’involution :

\[Y_c(p) \sum_{\delta} H_{p,\delta} X_c(p+\delta)\]
Le noyau (H_{p,\delta}) dépend de la position (p), souvent par

l’intermédiaire de l’entrée locale.

\[H_p G(X(p))\]

où (G) est une fonction génératrice de noyau. Le calcul complet devient :

\[X(p) \overset{G}{\longmapsto} H_p\]

puis :

\[(H_p,\mathcal{N}(p)) \longmapsto Y(p)\]

Il y a donc deux transformations successives : . production de l’opérateur ;

. application de l’opérateur.

Cette distinction rapproche l’involution d’une logique méta-opérationnelle. Le système ne choisit plus seulement une sortie. Il construit localement la transformation qui produira cette sortie.

7.4.Opérateur fixe et opérateur conditionnel

Nous pouvons distinguer deux formes. Opérateur fixe

\[T(x)=Kx\]

Le paramètre (K) est appris, puis réutilisé. Opérateur conditionnel

\[T_x(z)=K(x)z\]

L’opérateur dépend d’un état (x). Le calcul devient :

\[(x,z) \mapsto K(x) \mapsto K(x)z\]

Cette structure est plus expressive.

Mais elle est également plus difficile à auditer. Car la transformation appliquée n’est plus uniquement déterminée par les paramètres globaux du modèle. Elle dépend aussi de l’entrée. Deux positions peuvent subir deux transformations différentes :

\[T_{x_1}\neq T_{x_2}\]

même lorsqu’elles appartiennent à la même couche.

7.5.Pourquoi générer un noyau dynamique ?

Un noyau dynamique peut s’adapter à plusieurs situations. Variation de forme Une même catégorie d’objet peut présenter des structures locales très différentes. Variation de contexte Un motif peut avoir une signification différente selon son voisinage. Variation de position Certaines régions d’une image peuvent nécessiter une attention ou une résolution différente. Variation de contenu Le système peut privilégier certains voisins selon l’information locale. Le noyau devient ainsi un mécanisme de sélection contextuelle.

7.6.Exemple intuitif

Supposons qu’une image contienne :

Une convolution classique applique les mêmes filtres à toutes les régions. Les activations diffèrent, mais le mécanisme local reste partagé. Une architecture involutive peut produire :

Le traitement local dépend alors du contenu rencontré. Cette adaptabilité est proche de ce qu’un humain pourrait décrire comme : ne pas regarder toutes les régions de la même manière.

7.7.Le noyau comme sortie intermédiaire

Dans un CNN, le noyau est un paramètre du modèle. Dans une involution, le noyau local devient une sortie intermédiaire.

\[H_p G_\theta(X,p)\]

Le noyau appartient donc à un niveau différent de la donnée. Il est à la fois :

Cette structure mérite d’être explicitement distinguée.

\[\text{Une transformation peut produire une autre transformation.}\]

Cette proposition dépasse le cas des réseaux involutifs. Elle apparaît également dans :

7.8.Lecture ÉTR d’un opérateur généré

Dans un cadre ÉTR, une transformation générée pourrait être décrite en deux niveaux.

Niveau 1 — Génération

\[G: (Q,R,\Pi) \mapsto T_Q\]

Niveau 2 — Application

\[T_Q : X \mapsto Y\]

Le contrat complet doit donc déclarer :

On ne doit pas confondre :

\[G\]

qui génère l’opérateur, avec :

\[T_Q\]

qui transforme l’état.

7.9.La question de l’identité de la transformation

Lorsque l’opérateur dépend de l’entrée, une question apparaît : s’agit-il encore de la même transformation ? Si l’on note simplement :

\[T\]

on masque la dépendance contextuelle. Une notation plus rigoureuse serait :

\[T_{Q,R,\Pi}\]

ou :

\[T(\cdot\mid Q,R,\Pi)\]

Deux applications appartiennent à la même famille, mais ne sont pas nécessairement le même opérateur.

\[T_{Q_1}\neq T_{Q_2}\]

Cette distinction est cruciale pour la comparaison expérimentale. On ne peut pas conclure qu’une couche « applique le même mécanisme » si le mécanisme est généré différemment à chaque entrée.

7.10.Stabilité et variation

La puissance d’un opérateur dynamique vient de sa variation. Sa fragilité potentielle vient également de cette variation. Si une faible modification de l’entrée provoque une forte variation du noyau :

\[|X-X'|\ll 1\]

mais :

\[|H(X)-H(X')|\gg 1\]

alors le système peut devenir instable. Il faut donc étudier :

Une architecture dynamique ne doit pas seulement être expressive. Elle doit être contrôlable.

7.11.Domaine admissible des opérateurs dynamiques

L’ÉTR propose ici une discipline naturelle. L’opérateur produit doit appartenir à un domaine admissible :

\[T_Q\in\mathcal{A}\]

La fonction génératrice ne peut donc pas produire n’importe quelle transformation.

\[G(Q)\in\mathcal{A} \quad \forall Q\in\mathcal{D}\]
Le domaine (\mathcal{A}) peut imposer :

La dynamique reste alors flexible, mais non arbitraire.

7.12.Involution et qualification

Une involution architecturale peut être rapprochée d’une qualification locale. L’état (X(p)) produit un opérateur qui module la lecture de son voisinage.

\[X(p) \longrightarrow H_p \longrightarrow Y(p)\]

Cependant, cette analogie doit rester précise. Dans l’ÉTR, une qualification est une famille déclarée de transformations contextuelles. Dans une architecture neuronale, le noyau dynamique est appris selon une fonction de perte. Les deux peuvent être compatibles, mais ils ne sont pas identiques par définition. L’ÉTR fournit le langage de description. L’involution fournit une implémentation possible d’une modulation locale.

7.13.Comparaison avec Compose

Compose conserve l’ordre d’une séquence de transformations. L’involution modifie la transformation selon l’état courant. Nous pouvons combiner les deux :

\[Q_{n+1} T_{Q_n,a_n}(Q_n)\]

où l’opérateur dépend :

La chaîne devient :

\[Q_0 \overset{T_{Q_0,a_1}}{\longmapsto} Q_1 \overset{T_{Q_1,a_2}}{\longmapsto} Q_2 \overset{T_{Q_2,a_3}}{\longmapsto} \cdots\]

Nous ne composons plus une suite d’opérateurs fixes. Nous composons une suite d’opérateurs générés en fonction de l’histoire

du calcul. Cette structure est plus proche de nombreux phénomènes linguistiques. Le sens d’un mot dépend de l’état construit par les mots précédents.

7.14.Dépendance au chemin

Lorsque chaque opérateur dépend de l’état courant, le chemin devient déterminant. Supposons :

\[Q_1=T_a(Q_0)\]

puis :

\[Q_2=T_{Q_1,b}(Q_1)\]

L’opérateur appliqué à (b) dépend de la transformation précédente. Si l’ordre est inversé :

\[Q_1'=T_b(Q_0)\]

puis :

\[Q_2'=T_{Q_1',a}(Q_1')\]

alors :

\[Q_2'\neq Q_2\]

dans le cas général. La non-commutativité ne provient plus seulement des matrices. Elle provient aussi de la génération contextuelle des opérateurs.

7.15.Le risque d’un système sans frontière

Si toute entrée peut produire librement son propre opérateur, le système peut devenir difficile à falsifier. Toute erreur peut être expliquée après coup par une « adaptation contextuelle ». Pour conserver une valeur scientifique, il faut donc déclarer :

Un opérateur contextuel n’est pas scientifique parce qu’il s’adapte. Il devient scientifique lorsqu’on peut mesurer les conditions et les limites de cette adaptation.

7.16.Comparaison structurée

         Propriété                 Convolution                Involution
architecturale
 Noyau                        appris et partagé        généré selon la
position ou le contenu
 Dépendance spatiale          faible ou indirecte      explicite
 Partage                      spatial                  souvent entre groupes
de canaux
 Adaptation locale            par activation           par génération de
noyau
 Traçabilité                  noyau global             noyaux locaux
                              inspectable              nombreux et variables
 Risque principal             rigidité contextuelle    instabilité ou
suradaptation
 Lecture ÉTR                  transport local fixe     transformation
conditionnelle

7.17.Ce que les réseaux involutifs apportent

Ils apportent :

Ils rendent également plus visible une question générale : la règle doit-elle être fixe, ou doit-elle être produite par la situation ? Cette question sera centrale dans le chapitre suivant.

Les Transformers ne produisent pas exactement des noyaux convolutifs dynamiques. Mais ils déterminent, à chaque entrée, quelles positions doivent influencer quelles autres positions. Le contexte ne modifie plus seulement un filtre local. Il modifie la structure relationnelle du calcul.

Chapitre 8 — Les Transformers : construire une représentation par relations contextuelles

Les Transformers constituent aujourd’hui l’architecture dominante des grands modèles de langage. Ils sont également utilisés en vision, en audio, en biologie, en robotique et dans de nombreuses tâches multimodales. Leur succès repose sur plusieurs propriétés :

Mais leur mécanisme central est souvent simplifié à l’excès. On dit parfois : le Transformer comprend les mots grâce à l’attention. Cette formulation est insuffisante. Un Transformer ne reçoit pas directement des mots, ni des concepts déjà constitués. Il reçoit des tokens transformés en vecteurs, puis modifie ces vecteurs à travers plusieurs couches. L’attention ne constitue pas une interprétation humaine. Elle est une opération de pondération et d’agrégation contextuelle.

8.1.Du texte aux tokens

Une phrase : Le chat dort sur le canapé. est d’abord transformée en une séquence de tokens.

\[s \overset{\tau}{\longmapsto} (t_1,t_2,\ldots,t_n)\]

Un token peut correspondre à :

Le découpage dépend du tokenizer. Deux modèles peuvent tokeniser la même phrase différemment.

\[\tau_1(s)\neq\tau_2(s)\]

La tokenisation constitue donc une première transformation structurante. Elle influence :

8.2.Tokenisation et perte

La tokenisation est souvent largement réversible. Mais elle n’est pas neutre. Elle peut fragmenter certains mots de manière inhabituelle. Elle peut traiter différemment :

Le contrat de tokenisation doit donc déclarer :

Dans une lecture ÉTR :

\[\Phi_{\tau} : \text{texte brut} \rightarrow \text{chemin de tokens}\]

8.3.De l’identité du token au vecteur

Chaque token reçoit une représentation vectorielle initiale.

\[e_i E[t_i]\]

où (E) est une matrice d’embedding. On obtient :

\[X (e_1,e_2,\ldots,e_n)\]

À ce stade, le même token possède généralement la même représentation initiale. Mais son interprétation finale dépendra du contexte. Le mot « avocat » commence par un vecteur lexical commun.

Ses représentations internes divergeront ensuite selon la phrase.

8.4.La position

L’attention seule ne connaît pas nécessairement l’ordre. Il faut donc introduire une information positionnelle. On peut écrire :

\[x_i e_i+p_i\]

où (p_i) encode la position. D’autres architectures utilisent des encodages positionnels relatifs ou rotatifs. La fonction est la même au niveau conceptuel : permettre au modèle de distinguer les positions et leurs relations. Sans cette information, les séquences : le chien poursuit le chat et : le chat poursuit le chien risqueraient d’être insuffisamment distinguées par une opération symétrique.

8.5.Query, Key et Value

À partir de la matrice d’entrée (X), le Transformer produit trois projections :

\[Q=XW_Q\]
\[K=XW_K\]
\[V=XW_V\]

où :

Ces mots peuvent induire en erreur s’ils sont interprétés trop littéralement.

Ils désignent trois rôles mathématiques. Query La requête représente ce qu’une position cherche relativement aux autres positions. Key La clé représente la manière dont une position peut être comparée à une requête. Value La valeur représente l’information qui sera agrégée si cette position reçoit du poids. Le mécanisme sépare donc :

8.6.Le score d’attention

Pour une position (i) et une position (j) :

\[s_{ij} \frac{ q_i\cdot k_j }{ \sqrt{d_k} }\]

Le produit scalaire mesure une compatibilité entre la requête de (i) et la clé de (j).

La division par (\sqrt{d_k}) stabilise l’échelle.

Les scores sont ensuite transformés par softmax :

\[\alpha_{ij} \frac{ \exp(s_{ij}) }{ \sum_m \exp(s_{im}) }\]

Ainsi :

\[\sum_j \alpha_{ij}=1\]

Chaque position reçoit une distribution de poids sur les autres positions. La sortie est :

\[y_i \sum_j \alpha_{ij}v_j\]

La position (i) est donc reconstruite à partir d’une combinaison contextuelle des valeurs.

8.7.Ce que réalise réellement l’attention

L’attention produit une agrégation dépendante du contexte. Elle ne dit pas directement : ce mot est le sujet grammatical. Elle calcule : compte tenu des représentations actuelles, quelles autres positions doivent contribuer à la mise à jour de cette position ? La relation est apprise et dynamique.

\[\alpha_{ij} f(q_i,k_j)\]

Elle dépend :

Ainsi, la matrice d’attention change selon l’entrée.

\[A(X_1)\neq A(X_2)\]

8.8.Attention et transformation relationnelle

L’attention peut être décrite comme une transformation relationnelle distribuée.

\[X \mapsto A(X) \mapsto A(X)V(X)\]

Le modèle produit d’abord une structure de pondération :

\[A(X) \operatorname{softmax} \left( \frac{QK^\top}{\sqrt{d_k}} \right)\]

puis l’utilise pour transformer les valeurs. Comme dans une involution, une transformation produit un opérateur dépendant de l’entrée. Mais ici, l’opérateur est une matrice de relations entre positions.

\[A_{ij} \text{poids de contribution de }j\text{ vers }i\]

8.9.Attention n’est pas explication

Une matrice d’attention peut être visualisée. Cela ne signifie pas qu’elle constitue à elle seule une explication complète de la décision du modèle. Plusieurs raisons l’interdisent.

sorties proches.

L’attention fournit une trace partielle du calcul. Elle ne résume pas l’intégralité du mécanisme causal.

8.10.Multi-head attention

Un Transformer utilise généralement plusieurs têtes d’attention. Pour chaque tête (h) :

\[Q_h=XW_Q^{(h)}\]
\[K_h=XW_K^{(h)}\]
\[V_h=XW_V^{(h)}\]

puis :

\[\operatorname{head}_h \operatorname{Attention}(Q_h,K_h,V_h)\]

Les têtes sont concaténées :

\[\operatorname{MHA}(X) \operatorname{Concat} ( \operatorname{head}_1,\ldots,\operatorname{head}_H ) W_O\]

Chaque tête peut apprendre des relations différentes. Certaines peuvent devenir sensibles à :

Mais cette spécialisation n’est ni garantie ni parfaitement stable.

8.11.Les connexions résiduelles

La sortie d’un bloc n’écrase pas entièrement son entrée. On utilise une connexion résiduelle :

\[X' X+\operatorname{MHA}(X)\]

Puis, après normalisation et passage dans un réseau feed-forward :

\[X'' X'+\operatorname{MLP}(X')\]

Les résidus facilitent l’optimisation et conservent une voie directe pour l’information. Dans une lecture informationnelle, ils empêchent chaque transformation de remplacer totalement l’état précédent. Le nouvel état devient :

\[\text{ancien état} + \text{transformation contextuelle}\]

Cette structure ressemble à une mise à jour incrémentale.

8.12.Le réseau feed-forward

Après l’attention, chaque position traverse généralement un réseau non linéaire. Une forme simplifiée :

\[\operatorname{MLP}(x) W_2\sigma(W_1x+b_1)+b_2\]

L’attention mélange l’information entre positions. Le MLP transforme ensuite chaque représentation. Ainsi :

\[\text{relation entre positions} \rightarrow \text{transformation interne}\]

Le bloc Transformer alterne donc :

8.13.La profondeur

Une couche d’attention ne suffit pas à construire toutes les relations utiles. Les couches successives produisent une hiérarchie contextuelle :

\[X_0 \rightarrow X_1 \rightarrow X_2 \rightarrow \cdots \rightarrow X_L\]

Chaque couche travaille sur les représentations produites par la précédente. La relation calculée à la couche (l) dépend donc de l’histoire du calcul.

\[A_l A_l(X_{l-1})\]

La structure relationnelle est dynamique et profonde.

8.14.Modèle causal

Dans un modèle génératif causal, une position ne peut généralement regarder que les positions précédentes. On utilise un masque :

\[M_{ij} \begin{cases} 0 & j\leq i \ -\infty & j>i \end{cases}\]

Le score devient :

\[A \operatorname{softmax} \left( \frac{QK^\top}{\sqrt{d_k}} + M \right)\]

Ainsi, pour prédire le token suivant, le modèle n’accède pas au futur. La séquence est générée pas à pas.

8.15.Prédiction du token suivant

L’objectif d’apprentissage fondamental d’un LLM causal peut être écrit :

\[\max_\theta \sum_t \log P_\theta ( t_t \mid t_1,\ldots,t_{t-1} )\]

Le modèle apprend à estimer :

\[P_\theta( t_{n+1} \mid t_1,\ldots,t_n )\]

Il ne reçoit pas directement une règle universelle du langage. Il apprend des régularités statistiques permettant de prédire la continuation. Cette tâche simple en apparence contraint le modèle à apprendre de nombreuses structures :

La capacité émergente provient de la richesse de l’objectif et des données.

8.16.Générer n’est pas retrouver

Un moteur de recherche sélectionne des documents existants. Un LLM produit une distribution sur des tokens.

\[P(t_{n+1})\]

Puis une stratégie de décodage choisit un token.

\[t_{n+1} \sim P_\theta\]

La sortie est ensuite réinjectée :

\[(t_1,\ldots,t_n,t_{n+1}) \rightarrow P(t_{n+2})\]

La génération est donc récursive. Le modèle construit progressivement un chemin.

8.17.Le décodage comme décision

La distribution produite par le modèle n’est pas encore la sortie finale. Il faut une règle de décodage. Maximum

\[t^* \arg\max_t P(t)\]

Température

\[P_T(t) \frac{ \exp(z_t/T) }{ \sum_j\exp(z_j/T) }\]

Top-k On conserve les (k) tokens les plus probables. Top-p On conserve le plus petit ensemble dont la probabilité cumulée dépasse (p). Ainsi :

\[\text{modèle} \neq \text{politique de génération}\]

Le même modèle peut produire des comportements différents selon le décodage.

8.18.Représentation, comparaison et décision dans le Transformer

Nous pouvons décomposer un LLM ainsi :

\[\text{texte} \overset{\tau}{\longmapsto} \text{tokens}\]
\[\text{tokens} \overset{E}{\longmapsto} X_0\]
\[X_0 \overset{\mathcal{T}_\theta}{\longmapsto} X_L\]
\[X_L \overset{W_{\text{vocab}}}{\longmapsto} z\]
\[z \overset{\operatorname{softmax}}{\longmapsto} P\]
\[P \overset{\Delta}{\longmapsto} t_{n+1}\]

Chaque étape possède une fonction différente.

Cette séparation évite d’attribuer toutes les propriétés au seul mot « Transformer ».

8.19.Mémoire du contexte

Un LLM standard utilise le contexte fourni dans sa fenêtre. Il ne possède pas nécessairement une mémoire persistante au sens d’une base relationnelle durable. Son état dépend de :

Une information absente du contexte peut ne pas être activée de manière fiable. Une information présente peut être oubliée au cours d’une longue séquence ou insuffisamment pondérée. Il faut donc distinguer :

\[\text{mémoire paramétrique}\]
\[\text{mémoire de contexte}\]
\[\text{mémoire externe}\]
\[\text{mémoire relationnelle}\]

Ces quatre objets ne sont pas équivalents.

8.20.Mémoire paramétrique

Les paramètres du modèle condensent des régularités acquises durant l’apprentissage. Cette mémoire est :

Elle ne ressemble pas à une base de faits explicite. Modifier un fait isolé peut nécessiter une intervention complexe.

8.21.Mémoire de contexte

La fenêtre de contexte contient les tokens disponibles durant l’inférence. Elle est :

Le modèle peut utiliser cette information sans l’intégrer durablement à ses paramètres.

8.22.Mémoire externe

Une architecture RAG peut interroger une base externe.

\[q \rightarrow \text{recherche} \rightarrow \text{documents} \rightarrow \text{prompt} \rightarrow \text{LLM}\]

Le LLM devient alors un composant d’un système plus large. La qualité dépend :

Un échec ne doit pas être attribué automatiquement au modèle.

8.23.La représentation contextuelle

Le même token peut recevoir des états différents.

\[x_i^{(L)} F_\theta( t_i, t_1,\ldots,t_n )\]

Ainsi :

\[x_{\text{avocat-juriste}} \neq x_{\text{avocat-fruit}}\]

Le Transformer construit donc une qualification contextuelle implicite. Mais cette qualification est distribuée dans le calcul. Elle n’est pas nécessairement produite comme un objet externe nommé :

\[\Lambda_{\text{juridique}}\]

L’ÉTR peut extraire ou reconstruire une telle qualification, mais elle n’est pas donnée par défaut.

8.24.Hallucination

Un LLM produit le token le plus compatible avec son état et sa politique de décodage. Il ne vérifie pas automatiquement chaque affirmation dans une source externe. Une séquence peut donc être :

Cette propriété découle de l’objectif.

\[\text{probabilité de continuation} \neq \text{preuve de vérité}\]

L’hallucination n’est pas une anomalie inexplicable. Elle est un risque structurel lorsque la génération n’est pas contrainte par une vérification externe.

8.25.Confiance linguistique et confiance épistémique

Un modèle peut produire une phrase avec une forte probabilité locale. Cela ne signifie pas que le contenu est vrai. Il faut distinguer :

\[C_{\text{ling}}\]

la cohérence linguistique, de :

\[C_{\text{épist}}\]

la confiance épistémique. Une formulation fluide peut avoir :

\[C_{\text{ling}}\text{ élevée}\]

et :

\[C_{\text{épist}}\text{ faible}\]

L’ÉTR doit conserver cette séparation.

8.26.LLM et explication

Un LLM peut expliquer une réponse. Mais cette explication est elle-même une génération. Elle peut :

Il faut donc distinguer :

\[\text{explication produite}\]

et :

\[\text{trace effective du calcul}\]

L’ÉTR s’intéresse principalement à la seconde lorsqu’elle est disponible, et à la provenance de la première lorsqu’elle ne l’est pas.

8.27.LLM comme producteur de qualifications

Dans une architecture ÉTR, un LLM peut remplir plusieurs rôles. Qualification sémantique

\[\Lambda_{\text{LLM}}(x,R) q\]

Proposition de relations

\[\operatorname{Rel}_{\text{LLM}}(x,y)\]

Extraction structurée

\[\Phi_{\text{LLM}}(d) \text{objets typés}\]

Génération de candidats

\[G_{\text{LLM}}(Q) {c_1,\ldots,c_k}\]

Explication

\[E_{\text{LLM}}(D) \text{texte explicatif}\]

Dans tous les cas, la sortie doit être accompagnée de :

8.28.LLM et décision

Le LLM peut proposer une décision. Il ne doit pas nécessairement être l’autorité finale. Une architecture contrôlée peut écrire :

\[D_{\text{proposé}} \operatorname{LLM}(Q)\]

puis :

\[D_{\text{validé}} \operatorname{Router} ( D_{\text{proposé}}, R, \mathcal{C}, U )\]

Le routeur peut :

Ainsi, la génération et la gouvernance sont séparées.

8.29.Comparaison Transformer / ÉTR

        Dimension                 Transformer                    ÉTR
 Objet central                représentation            transformation
                              contextuelle              déclarée
 Relation                     poids internes appris     objet typé et traçable
 Mémoire                      paramètres, contexte,     états, chemins,
                              outils                    référentiels,
provenances
 Objectif                     prédiction ou             description,
Objet central              représentation           transformation
                           contextuelle             déclarée
Relation                   poids internes appris    objet typé et traçable
Mémoire                    paramètres, contexte,    états, chemins,
                           outils                   référentiels,
provenances
Objectif                   prédiction ou            description,
                           transformation de        comparaison, routage,
                           séquence                 mise à jour
Interprétabilité           partielle et indirecte   exigence
architecturale
Qualification              distribuée dans le       transformation
                           calcul                   distincte
Décision                   décodage ou tête de      routeur explicite
sortie
Perte                      généralement implicite déclarée par contrat
Réversibilité              non garantie             propriété déclarée
Compatibilité              modèle exécutable        cadre intégrateur

8.30.Complémentarité

Le Transformer peut produire des lectures sémantiques extrêmement riches. L’ÉTR peut leur fournir :

L’architecture combinée peut être :

\[\text{entrée} \rightarrow \text{LLM} \rightarrow \text{qualification candidate} \rightarrow \text{validation ÉTR} \rightarrow \text{comparaison} \rightarrow \text{routage} \rightarrow \text{mémoire}\]

Le Transformer apporte la puissance d’inférence. L’ÉTR apporte la discipline de transformation.

8.31.Exemple : question documentaire

Un utilisateur demande : Quelles sont les causes probables de cette défaillance industrielle ? Le système peut suivre ce pipeline.

1.Lecture de la question

\[Q_{\text{user}}\]

2.Extraction des contraintes

3.Recherche documentaire

\[\mathcal{D}_{\text{cand}}\]

4.Lecture des documents par le LLM

\[\Lambda_{\text{LLM}}(\mathcal{D}_{\text{cand}})\]

5.Construction d’un profil relationnel

\[\rho( Q_{\text{user}}, \mathcal{D}_{\text{cand}} )\]

6.Vérification des contradictions

\[\operatorname{Conflict}\]

7.Décision

\[D { \text{causes probables}, \text{incertitudes}, \text{tests recommandés} }\]

8.Mise à jour

\[\Omega_{t+1} \operatorname{Update}( \Omega_t, D, \Pi )\]

Le LLM ne constitue qu’un composant. Le système complet produit une réponse plus traçable.

Conclusion du chapitre

Le Transformer a déplacé le centre du calcul. Le CNN applique des filtres locaux partagés. L’involution génère des filtres locaux dépendants du contexte. Le Transformer construit des relations globales entre positions et utilise ces relations pour reconfigurer les représentations. La progression peut être résumée ainsi :

\[\text{noyau fixe} \rightarrow \text{noyau contextuel} \rightarrow \text{relation contextuelle globale}\]

Mais, dans tous les cas, la question de la déclaration reste ouverte. Le système calcule des transformations.

L’ÉTR demande : lesquelles, dans quel référentiel, avec quelles pertes, pour quelle décision et avec quelle mémoire ? Le prochain chapitre abordera les graphes de connaissances et les réseaux neuronaux sur graphes. Ils occupent une position particulière. Contrairement aux Transformers, ils représentent souvent les relations de manière explicite. Mais représenter explicitement une relation ne signifie pas encore représenter explicitement sa transformation.

Chapitre 9 — Les graphes de connaissances : représenter explicitement des relations

Les architectures étudiées jusqu’ici représentent principalement l’information sous forme de séquences, de tenseurs ou de vecteurs. Les graphes adoptent une autre logique. Ils partent d’une idée simple : certains objets ne sont correctement décrits qu’à travers les relations qu’ils entretiennent avec d’autres objets. Un graphe contient généralement :

On peut écrire :

\[G=(V,E)\]

où :

Dans un graphe de connaissances, les arêtes sont souvent typées.

\[(u,r,v)\]

signifie : l’objet (u) entretient la relation (r) avec l’objet (v). Par exemple :

\[(\text{Paris},\text{capitale_de},\text{France})\]
\[(\text{Curie},\text{a_travaillé_sur},\text{radioactivité})\]
\[(\text{entreprise A},\text{concurrent_de},\text{entreprise B})\]

La relation devient ici visible. Elle n’est plus seulement implicite dans une distance ou une activation. C’est une évolution conceptuelle majeure.

9.1.Le triplet comme unité minimale

Le triplet relationnel peut être écrit :

\[(h,r,t)\]

où :

Cette structure encode une proposition élémentaire.

\[h \overset{r}{\longrightarrow} t\]

Par exemple :

\[\text{Caméra} \overset{\text{capteur_de}}{\longrightarrow} \text{Robot}\]

ou :

\[\text{Document} \overset{\text{cite}}{\longrightarrow} \text{Article}\]

Le graphe permet donc une représentation explicite des dépendances.

9.2.Relation explicite ne signifie pas relation suffisante

Le graphe nomme la relation. Mais il ne décrit pas nécessairement :

Ainsi :

\[(u,r,v)\]

est une assertion relationnelle. Ce n’est pas encore un contrat complet de transformation. Pour obtenir une structure plus riche, il faudrait écrire :

\[e ( u, r, v, R, \Pi, U, T, \mathcal{C} )\]

où :

Le graphe de connaissances fournit donc une base naturellement compatible avec l’ÉTR, mais il doit être enrichi pour satisfaire les exigences complètes du système.

9.3.Graphe homogène et graphe hétérogène

Dans un graphe homogène, les nœuds et relations appartiennent à peu de types distincts. Dans un graphe hétérogène, plusieurs types coexistent. Par exemple :

\[V V_{\text{personnes}} \cup V_{\text{entreprises}} \cup V_{\text{documents}} \cup V_{\text{événements}}\]

et :

\[E E_{\text{travaille_pour}} \cup E_{\text{cite}} \cup E_{\text{participe}} \cup E_{\text{finance}}\]

Un graphe hétérogène est particulièrement adapté aux environnements complexes. Mais il exige un typage rigoureux. Une relation :

\[\text{finance}\]

ne peut pas être appliquée arbitrairement entre tous les nœuds. Il faut préciser :

\[\operatorname{dom}(\text{finance}) V_{\text{organisation}}\]
\[\operatorname{cod}(\text{finance}) V_{\text{projet}}\]

Cette logique rejoint directement la notion de signature dans l’ÉTR.

9.4.Ontologie et schéma

Un graphe de connaissances s’appuie souvent sur une ontologie. L’ontologie définit :

Par exemple :

\[\text{Chercheur} \subseteq \text{Personne}\]
\[\text{Université} \subseteq \text{Organisation}\]
\[\text{travaille_pour} : \text{Personne} \rightarrow \text{Organisation}\]

L’ontologie structure ce qui peut exister dans le graphe. Elle ne doit pas être confondue avec le graphe lui-même.

\[\text{Ontologie} \neq \text{instances}\]

L’ontologie définit le langage. Le graphe contient les occurrences concrètes.

9.5.Le raisonnement symbolique

Un graphe peut permettre des inférences. Supposons :

\[A \overset{\text{parent_de}}{\longrightarrow} B\]
\[B \overset{\text{parent_de}}{\longrightarrow} C\]

Avec une règle :

\[\text{parent_de}\circ\text{parent_de} \Rightarrow \text{grand-parent_de}\]

on obtient :

\[A \overset{\text{grand-parent_de}}{\longrightarrow} C\]

Cette inférence est explicite. La règle est déclarée. Le chemin est identifiable. C’est l’une des grandes forces des systèmes symboliques.

9.6.Composition de relations

Soient deux relations :

\[r_1 \subseteq A\times B\]
\[r_2 \subseteq B\times C\]

Leur composition est :

\[r_2\circ r_1 { (a,c) \mid \exists b\in B, (a,b)\in r_1, (b,c)\in r_2 }\]

Cette écriture formalise un chemin relationnel.

\[a \overset{r_1}{\longrightarrow} b \overset{r_2}{\longrightarrow} c\]

Mais, là encore, la composition relationnelle ne décrit pas nécessairement une transformation de l’état (a). Elle établit une relation dérivée entre (a) et (c). La distinction est essentielle :

\[\text{relation composée} \neq \text{transformation composée}\]

9.7.Propriété transitive et fausse transitivité

Certaines relations sont transitives.

\[aRb \land bRc \Rightarrow aRc\]

Par exemple :

\[a<b \land b<c \Rightarrow a<c\]

Mais de nombreuses relations ne le sont pas.

\[A \text{ est ami de } B\]

et :

\[B \text{ est ami de } C\]

n’implique pas :

\[A \text{ est ami de } C\]

De même :

\[A \text{ est similaire à } B\]

et :

\[B \text{ est similaire à } C\]

n’impliquent pas nécessairement une forte similarité entre (A) et (C). Le système doit donc déclarer les propriétés de chaque relation :

Sans cela, le graphe peut produire des inférences illégitimes.

9.8.La temporalité

Une relation peut être vraie à un instant et fausse à un autre.

\[r_t(u,v)\]

Par exemple :

\[\text{dirige}(x,\text{entreprise},2025)\]

peut ne plus être vrai en 2026. Il faut donc distinguer :

\[(u,r,v)\]

de :

\[(u,r,v,[t_0,t_1])\]

ou :

\[(u,r,v,t,\Pi)\]

Un graphe sans temporalité peut conserver des relations devenues obsolètes comme si elles étaient encore valides. L’ÉTR traite cette question par la provenance et le versionnement des états.

9.9.Contradictions

Un graphe réel peut contenir :

\[(u,r,v)\]

et :

\[(u,\neg r,v)\]

ou plusieurs assertions incompatibles provenant de sources différentes. Il faut alors éviter de supprimer prématurément la contradiction. On peut conserver :

\[e_1 (u,r,v,\Pi_1,U_1)\]
\[e_2 (u,\neg r,v,\Pi_2,U_2)\]

La contradiction devient un objet du système. Elle peut être :

Une mémoire scientifique sérieuse ne doit pas transformer automatiquement l’incertitude en unicité.

9.10.Les graphes probabilistes

Certaines relations sont pondérées.

\[w(u,r,v)\in[0,1]\]

Ce poids peut représenter :

Mais une nouvelle fois, la signification du poids doit être déclarée.

\[0{,}8\]

n’a aucun sens sans type. Il faut écrire :

\[w ( 0{,}8, \text{confiance_source}, \text{méthode}, \text{date} )\]

Le graphe pondéré ne résout donc pas à lui seul la question de l’interprétation.

9.11.Les embeddings de graphes

Un graphe peut être projeté dans un espace vectoriel. Chaque nœud reçoit :

\[e(v)\in\mathbb{R}^{d}\]

Chaque relation peut aussi être représentée. Par exemple, dans certaines méthodes :

\[e(h)+e(r)\approx e(t)\]

Le graphe symbolique devient alors compatible avec la recherche vectorielle. Cette hybridation permet :

Mais elle réintroduit les mêmes problèmes que les embeddings classiques :

9.12.Graphe de connaissances et ÉTR

La compatibilité est forte. Le graphe fournit :

L’ÉTR ajoute :

On pourrait écrire :

\[G_t \overset{\operatorname{Update}}{\longmapsto} G_{t+1}\]

mais l’ÉTR demande également :

\[\operatorname{Update} ( \text{ajouts}, \text{retraits}, \text{modifications}, \text{invariants}, \text{indéterminations} )\]

9.13.Exemple : graphe scientifique

Un système de recherche scientifique peut contenir :

Relations :

\[\text{article} \overset{\text{utilise}}{\longrightarrow} \text{méthode}\]
\[\text{article} \overset{\text{teste}}{\longrightarrow} \text{hypothèse}\]
\[\text{résultat} \overset{\text{contredit}}{\longrightarrow} \text{résultat}\]
\[\text{article} \overset{\text{cite}}{\longrightarrow} \text{article}\]

L’ÉTR peut alors conserver non seulement les relations, mais les transformations scientifiques :

\[\text{hypothèse} \rightarrow \text{protocole} \rightarrow \text{observation} \rightarrow \text{révision}\]

Le graphe décrit l’état du savoir. L’ÉTR décrit son évolution.

Chapitre 10 — Les réseaux neuronaux sur graphes : apprendre par propagation relationnelle

Les graphes de connaissances rendent les relations explicites. Les réseaux neuronaux sur graphes, ou GNN, ajoutent une capacité d’apprentissage. Ils cherchent à produire des représentations en utilisant la structure du graphe. Le principe général est : un nœud peut être compris à partir de ses propriétés et de celles de ses voisins. Un nœud ne dépend donc pas uniquement de lui-même. Il dépend de son environnement relationnel.

10.1.État initial des nœuds

Chaque nœud (v) possède une représentation initiale :

\[h_v^{(0)}\]

Cette représentation peut contenir :

Le GNN produit ensuite des états successifs :

\[h_v^{(0)} \rightarrow h_v^{(1)} \rightarrow \cdots \rightarrow h_v^{(L)}\]

10.2.Message passing

Une forme générale de propagation est :

\[m_v^{(l)} \operatorname{AGG} \left( \left{ M_l( h_v^{(l)}, h_u^{(l)}, e_{uv} ) : u\in\mathcal{N}(v) \right} \right)\]

puis :

\[h_v^{(l+1)} U_l( h_v^{(l)}, m_v^{(l)} )\]

où :

Cette structure sépare :

Elle est donc naturellement lisible dans le langage de l’ÉTR.

10.3.Le message comme transformation locale

Pour chaque arête :

\[u \overset{e_{uv}}{\longrightarrow} v\]

un message est calculé :

\[m_{u\rightarrow v} M(h_u,h_v,e_{uv})\]

Ce message représente l’influence de (u) sur (v). Il ne constitue pas nécessairement une relation symbolique. Il s’agit d’une transformation numérique apprise. Le GNN convertit donc une relation explicite en contribution latente.

10.4.Agrégation

Les messages entrants sont agrégés. Exemples :

\[\operatorname{AGG} \sum\]
\[\operatorname{AGG} \operatorname{mean}\]
\[\operatorname{AGG} \max\]

Cette opération doit souvent être invariante à la permutation des voisins. Si l’ordre des voisins n’a pas de sens :

\[\operatorname{AGG} ( m_1,m_2,\ldots,m_n ) \operatorname{AGG} ( m_{\pi(1)},m_{\pi(2)},\ldots,m_{\pi(n)} )\]
pour toute permutation (\pi).

Cette invariance est adaptée aux ensembles. Mais elle peut supprimer l’ordre lorsqu’il est pertinent.

10.5.Mise à jour du nœud

Après agrégation :

\[h_v^{(l+1)} U_l( h_v^{(l)}, m_v^{(l)} )\]

Le nouvel état combine :

Un nœud devient progressivement une représentation de son contexte local. Après (L) couches, il dépend approximativement de son voisinage à (L) sauts.

10.6.Profondeur et rayon relationnel

Une couche lit les voisins directs. Deux couches lisent les voisins des voisins.

\[L=1 \Rightarrow \mathcal{N}_1(v)\]
\[L=2 \Rightarrow \mathcal{N}_2(v)\]

La profondeur élargit donc le rayon relationnel. Mais elle peut produire deux difficultés. Sur-lissage Les représentations deviennent trop similaires.

\[h_u^{(L)} \approx h_v^{(L)}\]

pour de nombreux nœuds. Sur-écrasement Trop d’informations doivent être condensées dans une représentation de dimension limitée. Le système perd alors certaines distinctions.

10.7.GCN simplifié

Une couche de convolution sur graphe peut être écrite :

\[H^{(l+1)} \sigma \left( \widetilde{D}^{-\frac12} \widetilde{A} \widetilde{D}^{-\frac12} H^{(l)} W^{(l)} \right)\]

où :

Cette formule montre que les états sont diffusés selon la structure du graphe.

10.8.Attention sur graphe

Un GNN peut utiliser l’attention. Pour une arête ((u,v)) :

\[\alpha_{uv} \operatorname{softmax}_u \left( a( Wh_u, Wh_v ) \right)\]

Puis :

\[h_v' \sigma \left( \sum_{u\in\mathcal{N}(v)} \alpha_{uv}Wh_u \right)\]

Le réseau apprend quels voisins comptent davantage. On retrouve alors un principe proche du Transformer, mais contraint par le graphe. Le Transformer peut connecter de nombreuses positions. Le GNN respecte généralement la structure relationnelle disponible.

10.9.Graphe donné et graphe appris

Un GNN suppose souvent qu’un graphe existe déjà. Mais ce graphe peut être :

La qualité du GNN dépend alors de la qualité du graphe.

\[\text{mauvais graphe} \Rightarrow \text{propagation inadéquate}\]

Le modèle peut apprendre à pondérer les relations, mais il ne corrige pas toujours une ontologie mal définie.

10.10.Relations typées

Dans un graphe hétérogène, les relations peuvent avoir des transformations distinctes.

\[m_{u\rightarrow v}^{(r)} M_r(h_u,h_v)\]

Chaque type (r) possède ses paramètres. Par exemple :

\[M_{\text{cite}} \neq M_{\text{finance}} \neq M_{\text{travaille_avec}}\]

Cette séparation est essentielle. Toutes les arêtes ne produisent pas le même type d’influence.

10.11.Sens de propagation

Une relation orientée ne doit pas être traitée comme symétrique.

\[u \overset{r}{\longrightarrow} v\]

n’implique pas :

\[v \overset{r}{\longrightarrow} u\]

Dans certains systèmes, on introduit une relation inverse :

\[r^{-1}\]

Par exemple :

\[\text{emploie}\]

et :

\[\text{employé_par}\]

Cette inversion doit être déclarée. Elle n’est pas toujours une simple symétrie.

10.12.Le GNN comme système de qualification relationnelle

Un GNN transforme l’état d’un nœud selon son environnement. On peut écrire :

\[h_v' \Lambda_{\mathcal{N}(v)} (h_v)\]

La qualification dépend du voisinage. Cette lecture est utile. Mais elle ne doit pas conduire à assimiler automatiquement le GNN à l’ÉTR. Le GNN apprend une fonction. L’ÉTR décrit le contrat de cette fonction, ses effets et son inscription dans une mémoire.

10.13.Traçabilité des messages

Un GNN standard peut agréger plusieurs messages :

\[m_v \sum_{u\in\mathcal{N}(v)} m_{u\rightarrow v}\]

Après agrégation, les contributions individuelles peuvent devenir difficiles à isoler. Si l’on souhaite une traçabilité forte, il faut conserver :

\[\Gamma_v^{(l)} { m_{u\rightarrow v}^{(l)} }\]

ainsi que :

Sans cela, le GNN produit une représentation efficace, mais le chemin relationnel est compressé.

10.14.Comparaison avec le Transformer

Le Transformer construit un graphe dense implicite entre positions. Le GNN utilise un graphe explicite, souvent plus parcimonieux. On peut résumer :

\[\text{Transformer} : \text{relations dynamiques apprises sur une séquence}\]
\[\text{GNN} : \text{propagation apprise sur une structure relationnelle}\]

Le premier part d’une séquence. Le second part d’un graphe. Les deux utilisent des transformations contextuelles.

10.15.Comparaison avec le CNN

Le CNN exploite un voisinage régulier. Le GNN exploite un voisinage irrégulier. Dans une image :

\[\mathcal{N}(p)\]

est défini par la grille. Dans un graphe :

\[\mathcal{N}(v)\]

est défini par les arêtes. Le GNN peut donc être compris comme une généralisation de certaines opérations locales à des structures non euclidiennes.

10.16.Limites du GNN

Les principales limites incluent :

Un graphe explicite ne garantit donc pas une intelligence explicite. La propagation neuronale réintroduit une représentation latente.

10.17.GNN et ÉTR

Une architecture combinée pourrait fonctionner ainsi :

\[G_t \overset{\text{GNN}}{\longmapsto} H_t\]

où (H_t) contient les états appris. Puis :

\[H_t \overset{\text{ÉTR}}{\longmapsto} \mathcal{R}_t\]
où (\mathcal{R}_t) contient :

Le GNN permet l’inférence relationnelle latente. L’ÉTR permet la déclaration et l’organisation de cette inférence.

10.18.Exemple : réseau d’entreprise

Les nœuds sont :

Les arêtes sont :

Un GNN peut détecter :

L’ÉTR peut ensuite déclarer :

Le GNN détecte une structure. L’ÉTR transforme cette détection en objet gouvernable.

Chapitre 11 — Les systèmes multi-agents : lorsque plusieurs unités décident et transforment

Les systèmes multi-agents introduisent un niveau supplémentaire. Jusqu’ici, nous avons surtout étudié des architectures qui reçoivent une entrée et produisent une sortie. Un système multi-agent contient plusieurs unités capables de :

Un agent peut être humain, logiciel, robotique ou hybride. On peut représenter un agent (a_i) par :

\[a_i ( P_i, M_i, D_i, A_i, G_i )\]

où :

Le système global devient :

\[\mathcal{S} {a_1,a_2,\ldots,a_n}\]

avec un ensemble de relations et d’interactions.

11.1.Un agent n’est pas seulement un modèle

Un LLM peut constituer le cœur cognitif d’un agent. Mais un agent complet possède également :

Ainsi :

\[\text{LLM} \subset \text{agent}\]

dans de nombreuses architectures.

Le modèle génère. L’agent agit.

11.2.Boucle perception–décision–action

Une boucle simple s’écrit :

\[o_t \operatorname{Perceive}(s_t)\]
\[d_t \operatorname{Decide}(o_t,m_t,g)\]
\[a_t \operatorname{Act}(d_t)\]
\[s_{t+1} \operatorname{Environment}(s_t,a_t)\]
\[m_{t+1} \operatorname{Update}(m_t,o_t,d_t,a_t)\]

Le système est récursif. Chaque décision modifie l’environnement qui produira les perceptions suivantes.

11.3.Interaction entre agents

Deux agents peuvent échanger des messages :

\[a_i \overset{m}{\longrightarrow} a_j\]

Mais le message n’est pas nécessairement compris de la même manière par les deux agents.

\[\Phi_i(m) \neq \Phi_j(m)\]

Ils peuvent posséder :

La communication ne garantit donc pas l’alignement.

11.4.Coordination et conflit

Les agents peuvent :

Le système doit distinguer :

\[\text{accord}\]
\[\text{compatibilité}\]
\[\text{coordination}\]
\[\text{consensus}\]

Ces notions ne sont pas équivalentes. Deux agents peuvent se coordonner sans partager le même objectif. Ils peuvent être d’accord sur une action pour des raisons différentes. Ils peuvent produire un consensus erroné.

11.5.Mémoire individuelle et mémoire collective

Chaque agent possède :

\[\Omega_i\]

Le système peut également posséder une mémoire commune :

\[\Omega_{\text{global}}\]

La mise à jour doit alors préciser :

Une mémoire collective sans gouvernance peut devenir incohérente.

11.6.Propagation des erreurs

Dans un système multi-agent, une erreur peut se propager.

\[a_1 \rightarrow a_2 \rightarrow a_3 \rightarrow a_4\]

Si chaque agent considère le message précédent comme une preuve, l’incertitude initiale peut être transformée en certitude apparente. Il faut donc conserver la provenance transitive.

\[\Pi(m_4) (\Pi_1,\Pi_2,\Pi_3,\Pi_4)\]

Un agent ne doit pas être traité comme une source indépendante s’il répète une information provenant du même origine.

11.7.Autorité et permission

Tous les agents ne doivent pas posséder les mêmes capacités. On peut définir :

\[\operatorname{Perm}(a_i) { \text{read}, \text{write}, \text{propose}, \text{execute}, \text{validate} }\]

Un agent peut proposer une action sans pouvoir l’exécuter. Un autre peut valider sans produire. Un humain peut conserver le pouvoir final. Cette séparation est essentielle dans les systèmes sensibles.

11.8.Le routeur

Un routeur détermine quel agent doit intervenir.

\[\operatorname{Route}(q) a_i\]

Mais la sélection peut dépendre de :

Le routeur constitue donc une décision relationnelle. Il compare une tâche à des profils d’agents.

11.9.ÉTR et systèmes multi-agents

L’ÉTR peut fournir un langage commun. Chaque agent produit :

\[\mathcal{T}_i ( \text{entrée}, \text{transformation}, \text{sortie}, \text{provenance}, \text{incertitude} )\]

Le système peut alors comparer :

Le choix final ne repose plus uniquement sur un vote ou une confiance globale. Il repose sur la structure des transformations.

11.10.Consensus relationnel

Un consensus simple peut être :

\[D \operatorname{majorité}(D_1,\ldots,D_n)\]

Mais une majorité ne garantit pas la validité. L’ÉTR permet un consensus pondéré par la qualité des relations :

\[D \operatorname{Router} ( \mathcal{T}_1, \ldots, \mathcal{T}_n )\]

Le routeur peut tenir compte :

Ainsi, trois agents répétant la même source ne valent pas nécessairement trois confirmations indépendantes.

11.11.Agent comme transformation continue

Un agent ne produit pas seulement des réponses. Il transforme un environnement.

\[s_t \overset{a_t}{\longrightarrow} s_{t+1}\]

Cette action peut être :

Le contrat d’action doit donc déclarer :

\[\mathcal{C}_{a_t} ( \text{préconditions}, \text{effets}, \text{risques}, \text{réversibilité}, \text{autorité} )\]

Cette exigence devient cruciale pour la robotique et l’entreprise.

11.12.Exemple : équipe d’agents scientifiques

Un agent recherche les publications. Un agent extrait les méthodes. Un agent vérifie les statistiques. Un agent cherche les contradictions. Un agent synthétise. La chaîne devient :

\[a_{\text{search}} \rightarrow a_{\text{extract}} \rightarrow a_{\text{verify}} \rightarrow a_{\text{conflict}} \rightarrow a_{\text{synthesis}}\]

Sans traçabilité, le résultat final peut sembler cohérent tout en reposant sur une erreur ancienne. Avec l’ÉTR, chaque passage devient un objet inspectable.

Conclusion de la deuxième partie

Les architectures étudiées répondent à des problèmes distincts. Le moteur documentaire retrouve. L’embedding rapproche. Le CNN extrait des motifs locaux. L’involution adapte l’opérateur au contexte. Le Transformer construit des représentations contextuelles globales. Le graphe explicite les relations.

Le GNN propage l’information selon ces relations. Le système multi-agent distribue perception, décision et action entre plusieurs unités. Aucune de ces architectures n’est réductible à une autre. Elles peuvent être combinées. Leur complémentarité peut être représentée ainsi :

\[\text{perception} \rightarrow \text{représentation} \rightarrow \text{relation} \rightarrow \text{inférence} \rightarrow \text{décision} \rightarrow \text{action} \rightarrow \text{mémoire}\]

L’ÉTR intervient comme langage transversal. Elle ne demande pas : quel modèle doit remplacer les autres ? Elle demande : comment déclarer les transformations qui relient leurs productions ? La partie suivante introduira donc directement le système ÉTR. Nous passerons des comparaisons externes à son architecture interne :

Oui — il manque bien le Chapitre 12. La transition précédente annonçait directement la troisième partie, mais le numéro n’a pas été matérialisé. Il doit précisément remplir la fonction que tu avais posée dès le début : expliquer l’ensemble du système ÉTR avant d’en détailler chaque objet.

Troisième partie

Comprendre l’Équation des Transformations Relationnelles

Chapitre 12 — Vue d’ensemble du système ÉTR

L’Équation des Transformations Relationnelles ne désigne pas une équation unique qui résoudrait tous les problèmes relationnels. Elle désigne un système scientifique plus large, composé :

Le mot « équation » doit donc être compris dans un sens architectural. L’ÉTR cherche à formaliser le passage :

\[\text{objet initial} \longrightarrow \text{état relationnel} \longrightarrow \text{transformation} \longrightarrow \text{nouvel état}\]

tout en conservant les conditions ayant rendu ce passage possible. Elle ne cherche pas seulement à produire une sortie. Elle cherche à décrire :

La forme générale du système peut être représentée ainsi :

\[\text{Entrée} \rightarrow \text{Lecture} \rightarrow \text{Compose} \rightarrow \text{Qualification} \rightarrow \text{Comparaison} \rightarrow \text{Routage} \rightarrow \text{Décision} \rightarrow \text{Update}\]

Cette chaîne constitue le squelette fonctionnel de l’ÉTR.

12.1.Le problème auquel répond l’ÉTR

De nombreux systèmes informatiques produisent d’excellents résultats sans rendre explicites les transformations qui les ont produits. Un Transformer peut générer une réponse cohérente. Un CNN peut reconnaître un défaut. Un moteur vectoriel peut retrouver un document proche. Un GNN peut prédire une relation entre deux nœuds. Mais, dans chacun de ces cas, plusieurs questions restent souvent séparées du calcul principal :

L’ÉTR ne prétend pas que les architectures existantes sont incapables de fournir ces informations. Elle affirme seulement qu’elles ne les considèrent pas nécessairement comme leur objet scientifique central. L’ÉTR place donc la transformation déclarée au centre du système.

12.2.L’objet central : la transformation déclarée

Une transformation classique peut être écrite :

\[f(x)=y\]

Cette écriture indique qu’un objet (x) devient un objet (y). Mais elle reste insuffisante pour un système traçable. L’ÉTR considère qu’une transformation complète doit inclure davantage d’informations :

\[\mathfrak{f} ( \operatorname{type}, \operatorname{dom}, \operatorname{cod}, \operatorname{apply}, \operatorname{pre}, \operatorname{post}, \operatorname{inv}, \Pi, U )\]

où :

Une transformation n’est donc pas définie uniquement par son résultat. Elle est définie par son contrat.

12.3.Une transformation doit déclarer ses effets informationnels

Toute transformation doit préciser cinq catégories.

\[\mathcal{C}_{\mathfrak{f}} ( I_c, I_t, I_a, I_s, I_{\varnothing} )\]

avec :

Cette règle est fondamentale. Supposons qu’une phrase soit transformée en embedding. La transformation peut conserver :

Elle transforme :

Elle peut rendre indéterminables :

Le vecteur reste utile. Mais son contrat devient explicite.

12.4.Les niveaux du système

L’ÉTR sépare plusieurs niveaux qui sont souvent confondus. Ontologie

Elle définit les objets qui existent dans le système. Par exemple :

Théorie Elle définit les propriétés que ces objets peuvent satisfaire. Par exemple :

Algèbre Elle définit les opérations formelles. Par exemple :

\[T_2\circ T_1\]
\[\rho(Q_i,Q_j)\]
\[\operatorname{Update}(\Omega,Q)\]

Implémentation Elle indique comment les objets sont réalisés en code. Par exemple :

Application Elle indique dans quel domaine le système est utilisé. Par exemple :

Une implémentation ne doit pas redéfinir l’ontologie. Une application ne doit pas transformer une hypothèse locale en loi générale.

12.5.L’entrée

L’entrée peut être de nature variée :

\[x_{\text{in}} \in \mathcal{X}\]

Elle peut être :

L’ÉTR ne suppose pas que toutes les entrées possèdent la même structure. Elle exige seulement que leur type soit déclaré.

\[\operatorname{Type}(x_{\text{in}}) \tau_x\]

Le type détermine les lectures admissibles.

12.6.La lecture

Une lecture transforme l’entrée en un état exploitable.

\[\Phi : x_{\text{in}} \mapsto Q_0\]

Cette lecture peut être produite par :

L’ÉTR ne fixe pas une méthode unique de lecture. Elle impose que la méthode soit déclarée.

\[Q_0 \Phi(x_{\text{in}};R,\Pi)\]

où :

Le même objet peut recevoir plusieurs lectures.

\[Q_0^{(1)} \Phi_1(x)\]
\[Q_0^{(2)} \Phi_2(x)\]

Ces lectures peuvent être comparées sans être immédiatement fusionnées.

12.7.L’état relationnel

Un état relationnel n’est pas nécessairement une position géométrique unique. Il peut contenir :

On peut écrire :

\[Q ( S, \mathcal{R}, \Gamma, \Pi, U )\]

où :

L’état constitue donc une lecture compacte, mais non nécessairement réductrice à un seul vecteur.

12.8.Compose

Compose construit un état ordonné à partir d’une séquence. Soit :

\[\Gamma (a_1,a_2,\ldots,a_n)\]

Chaque unité (a_i) produit ou sélectionne une transformation :

\[T_i\]

L’état final devient :

\[Q_n T_n \circ T_{n-1} \circ \cdots \circ T_1 (Q_0)\]

Si les transformations ne commutent pas :

\[T_i\circ T_j \neq T_j\circ T_i\]

alors l’ordre est conservé par la construction elle-même. Compose sert ainsi à représenter une séquence comme un chemin et non comme une simple collection.

12.9.Pourquoi Compose ne suffit pas

Compose produit une structure ordonnée. Mais une structure ordonnée ne constitue pas encore une interprétation complète. Considérons : L’avocat est mûr. et : L’avocat présente sa défense. Le terme « avocat » possède la même identité lexicale. Sa qualification varie selon le contexte. L’ÉTR sépare donc :

\[Q_{\text{struct}} \operatorname{Compose}(\Gamma)\]

de :

\[Q_{\text{qual}} \Lambda( Q_{\text{struct}}, R, \Pi )\]

Cette séparation évite de confondre structure et sens.

12.10.La qualification

Une qualification ajoute une lecture contextuelle.

\[\Lambda : Q \mapsto Q'\]

Elle peut être produite par :

La qualification peut préciser :

Mais elle doit rester contrainte.

\[\Lambda \in \mathcal{A}_{\kappa}\]
où (\mathcal{A}_{\kappa}) représente le domaine admissible de

qualification. L’objet fondamental n’est donc pas une qualification isolée. C’est l’espace des qualifications autorisées.

12.11.Pourquoi borner la qualification

Sans limite, une qualification pourrait produire n’importe quelle interprétation. Le système pourrait toujours expliquer un résultat en modifiant le contexte après coup. Il deviendrait alors impossible à falsifier. Une qualification scientifique doit donc avoir :

La souplesse ne doit pas devenir arbitraire.

12.12.Le référentiel

Une relation n’est interprétable que dans un référentiel. On peut représenter un référentiel par :

\[R ( \mathcal{O}, \mathcal{F}, \mathcal{M}, \mathcal{B}, \Pi_R )\]

où :

Un référentiel juridique n’utilise pas nécessairement les mêmes relations qu’un référentiel artistique. Un référentiel médical ne tolère pas la même incertitude qu’un système exploratoire. Le référentiel détermine donc les règles de lecture et de décision.

12.13.Plusieurs référentiels

Un même objet peut être lu dans plusieurs référentiels.

\[Q^{(R_1)} \neq Q^{(R_2)}\]

Par exemple, un contrat peut être lu :

Ces lectures ne doivent pas être fusionnées sans déclaration. Une transformation inter-référentielle est nécessaire :

\[T_{R_1\rightarrow R_2} : Q^{(R_1)} \mapsto Q^{(R_2)}\]

Cette transformation doit préciser les correspondances et les pertes.

12.14.La comparabilité

Avant de comparer deux états, le système doit vérifier leur comparabilité.

\[\operatorname{Comp}(Q_i,Q_j;R)\]

Cette fonction peut retourner :

\[{ \text{comparable}, \text{partiellement comparable}, \text{non comparable}, \text{indéterminé} }\]

La comparabilité dépend :

Une distance calculée entre des objets non comparables n’a pas de signification scientifique.

12.15.La relation

Lorsque les objets sont comparables, une relation peut être calculée.

\[\rho(Q_i,Q_j;R)\]

Mais l’ÉTR ne suppose pas que cette relation doive toujours être un nombre unique. Elle peut être un profil :

\[\rho(Q_i,Q_j) ( r_1, r_2, \ldots, r_n )\]

Par exemple :

\[\rho ( \text{proximité lexicale}, \text{compatibilité logique}, \text{distance temporelle}, \text{cohérence contextuelle} )\]

Cette pluralité évite une agrégation trop précoce.

12.16.La relation multiplicative

Dans certaines familles de l’ÉTR, la relation entre deux états positifs peut être définie par un rapport :

\[\rho(A,B) \frac{B}{A}\]

Pour des états multidimensionnels :

\[\rho(A,B) \left( \frac{b_1}{a_1}, \ldots, \frac{b_d}{a_d} \right)\]

L’identité relationnelle est alors :

\[\rho(A,A)=\mathbf{1}\]

Cette relation permet de décrire une transformation proportionnelle. Mais elle ne doit pas être présentée comme l’unique famille de relations possible dans l’ÉTR. Le traité doit pouvoir accueillir plusieurs algèbres selon les objets et les tâches.

12.17.Le transport

Un transport est une transformation particulière.

\[T_{ij} : Q_i \mapsto Q_j\]

Il peut être associé à une relation :

\[T_{ij} \rho(Q_i,Q_j)\]

dans certains régimes. Mais toutes les transformations ne sont pas des transports. Une lecture, une qualification, une substitution ou une mise à jour ne doivent pas être forcées dans le type Transport. L’ensemble englobant est :

\[\mathcal{F} { \text{Lecture}, \text{Transport}, \text{Qualification}, \text{Substitution}, \text{Update}, \text{Décision}, \ldots }\]

Cette distinction empêche une réduction abusive du système.

12.18.La comparaison multi-signal

Une décision peut dépendre de plusieurs relations.

\[R(Q,x) ( r_{\text{proximité}}, r_{\text{cohérence}}, r_{\text{fiabilité}}, r_{\text{nouveauté}}, r_{\text{risque}} )\]

Le système ne doit pas nécessairement les fusionner immédiatement. Il peut conserver ce profil jusqu’au routeur. Deux objets peuvent obtenir le même score agrégé tout en présentant des structures très différentes. L’ÉTR préserve cette différence.

12.19.Le routeur

Le routeur reçoit un ensemble de relations et produit une orientation.

\[D \operatorname{Router} ( Q, R, \Omega, \mathcal{C} )\]

où :

Le routeur peut décider :

Le routeur est distinct de la relation. Une relation n’impose pas à elle seule une action.

12.20.Exemple de routage

Supposons qu’un document possède :

\[r_{\text{proximité}}=0{,}91\]
\[r_{\text{fiabilité}}=0{,}42\]
\[r_{\text{récence}}=0{,}87\]

Dans une recherche exploratoire, il peut être affiché. Dans une décision médicale, il peut être rejeté ou soumis à vérification. Le profil relationnel reste identique. La politique de décision change.

\[D_{\text{exploration}} \neq D_{\text{médical}}\]

La décision appartient donc au référentiel d’usage.

12.21.La décision

Une décision est une sortie formelle du routeur.

\[D \in \mathcal{D}\]

Elle peut être :

Une décision n’est pas nécessairement une action. Elle peut encore nécessiter une compilation :

\[D \overset{\operatorname{Compile}}{\longmapsto} A\]

où (A) est une action applicable au système ou au monde.

12.22.L’action

Une action modifie un environnement.

\[A: S_t \mapsto S_{t+1}\]

Elle doit déclarer :

Dans un système sensible, le passage de la décision à l’action peut exiger une validation humaine.

\[D_{\text{IA}} \rightarrow V_{\text{humain}} \rightarrow A\]

12.23.La mémoire

La mémoire relationnelle ne conserve pas uniquement des résultats. Elle conserve :

On peut écrire :

\[\Omega ( V, E, \Gamma, R, \Pi )\]

où :

12.24.Update

La mise à jour transforme la mémoire.

\[\Omega_{t+1} \operatorname{Update} ( \Omega_t, Q, D, \Pi )\]

Mais Update ne signifie pas simplement « ajouter ». Elle peut :

Le contrat d’Update doit être aussi rigoureux que celui des autres transformations.

12.25.Mémoire croissante et révision

Une mémoire croissante ne signifie pas qu’aucun élément ne peut devenir obsolète. Elle signifie que l’histoire des transformations n’est pas effacée sans déclaration. Si une relation change :

\[r_t \rightarrow r_{t+1}\]

le système conserve :

La mémoire devient versionnée.

12.26.Le chemin

Un chemin est une suite ordonnée de transformations.

\[\Gamma ( T_1, T_2, \ldots, T_n )\]

Son application est :

\[Q_n T_n \circ \cdots \circ T_1 (Q_0)\]

Deux chemins peuvent produire le même résultat :

\[\Gamma_1(Q_0) \Gamma_2(Q_0)\]

sans être équivalents.

Ils peuvent différer par :

L’ÉTR compare donc également les chemins.

12.27.Les cycles

Un cycle revient vers un état de départ.

\[Q_0 \rightarrow Q_1 \rightarrow \cdots \rightarrow Q_n\]

avec une comparaison entre :

\[Q_n\]

et :

\[Q_0\]

Le transport total peut être :

\[H_{\Gamma} T_n \cdots T_1\]

Si :

\[H_{\Gamma}=I\]

le cycle revient à l’identité dans le cadre déclaré. Si :

\[H_{\Gamma}\neq I\]

un résidu apparaît. Ce résidu peut indiquer :

Il constitue un objet d’analyse, non automatiquement une faute.

12.28.L’incertitude

L’incertitude ne doit pas être réduite à une unique probabilité. Elle peut provenir :

On peut écrire :

\[U ( U_{\text{donnée}}, U_{\text{modèle}}, U_{\text{relation}}, U_{\text{décision}} )\]

Cette structure évite de produire une confiance globale artificiellement précise.

12.29.L’abstention

Un système relationnel rigoureux doit pouvoir ne pas conclure.

\[D \operatorname{ABSTAIN}\]

L’abstention peut être déclenchée lorsque :

L’abstention constitue une sortie valide. Elle n’est pas un échec d’exécution.

12.30.Les statuts scientifiques

Chaque objet ou affirmation doit recevoir un statut.

Le registre historique peut également conserver :

Cette discipline empêche de confondre définition, preuve et intuition.

12.31.L’équation générale du système

Une forme générale peut être écrite :

\[\mathcal{G} : ( x_t, \Omega_t, R, \Pi ) \mapsto ( D_t, \Omega_{t+1} )\]

Le système reçoit :

Il produit :

Une forme développée devient :

\[Q_0 \Phi(x_t)\]
\[Q_s \operatorname{Compose}(Q_0,\Gamma)\]
\[Q_q \Lambda(Q_s,R,\Pi)\]
\[\mathcal{R}_t \rho(Q_q,\Omega_t;R)\]
\[D_t \operatorname{Router} ( \mathcal{R}_t, R, U )\]
\[\Omega_{t+1} \operatorname{Update} ( \Omega_t, Q_q, D_t, \Pi )\]

Cette écriture présente l’ensemble du système sans imposer une implémentation unique.

12.32.Une phrase complète comme exemple

Considérons : Le robot ralentit parce qu’un obstacle est détecté. Entrée

\[x \text{phrase brute}\]

Lecture

\[Q_0 \Phi_{\text{texte}}(x)\]

Compose Le système conserve l’ordre :

\[\text{robot} \rightarrow \text{ralentit} \rightarrow \text{parce que} \rightarrow \text{obstacle} \rightarrow \text{détecté}\]

Qualification Le LLM ou le parseur identifie :

Comparaison Le système compare cet état aux scénarios connus :

\[\rho( Q, \Omega_{\text{sécurité}} )\]

Routage Le routeur détermine :

Décision

\[D \text{maintenir le ralentissement}\]

Update La mémoire conserve :

La phrase n’est donc pas seulement comprise ou classée. Elle devient un chemin de transformation traçable.

12.33.Comparaison globale avec un LLM

Un LLM peut effectuer plusieurs opérations de cette chaîne implicitement. Il peut :

Mais ces fonctions restent souvent fusionnées dans une même génération. L’ÉTR les sépare :

\[\text{LLM} \text{producteur possible de transformations}\]
\[\text{ÉTR} \text{système de déclaration et d’organisation}\]

Le LLM peut donc être intégré sans devenir l’ensemble du système.

12.34.Comparaison globale avec un CNN

Un CNN produit une lecture perceptive.

\[\text{image} \overset{\text{CNN}}{\longmapsto} Q_{\text{vision}}\]

L’ÉTR prend ensuite en charge :

Le CNN reconnaît. L’ÉTR inscrit la reconnaissance dans une chaîne gouvernée.

12.35.Comparaison globale avec un GNN

Un GNN produit une représentation relationnelle apprise à partir d’un graphe. L’ÉTR conserve :

Le GNN propage. L’ÉTR déclare la propagation et ses effets.

12.36.Ce que l’ÉTR ne prétend pas faire

L’ÉTR ne garantit pas :

Elle garantit seulement un cadre dans lequel ces questions peuvent être posées explicitement.

12.37.Ce que l’ÉTR cherche à rendre possible

L’ÉTR cherche à rendre possible :

Sa puissance ne repose donc pas sur une promesse d’infaillibilité. Elle repose sur une augmentation de la lisibilité scientifique.

Conclusion du chapitre

L’Équation des Transformations Relationnelles est un système destiné à organiser le passage entre information, relation, décision et mémoire. Son architecture générale est :

\[x \overset{\Phi}{\longmapsto} Q_0 \overset{\operatorname{Compose}}{\longmapsto} Q_s \overset{\Lambda}{\longmapsto} Q_q \overset{\rho}{\longmapsto} \mathcal{R} \overset{\operatorname{Router}}{\longmapsto} D \overset{\operatorname{Update}}{\longmapsto} \Omega'\]

Chaque flèche est une transformation distincte. Chaque transformation possède un contrat. Chaque contrat doit déclarer ses effets. Chaque décision doit être rattachée à un référentiel. Chaque mise à jour doit préserver sa provenance. Cette vue d’ensemble constitue la carte du système.

Les chapitres suivants pourront maintenant isoler chacun de ses

composants :

Chapitre 13 — Ontologie minimale de l’ÉTR

L’ontologie définit les objets que le système reconnaît comme distincts. Elle ne décrit pas encore leur implémentation ni leur efficacité. Elle fixe leur identité, leur rôle et leurs relations de type. L’ÉTR repose sur une distinction stricte entre :

\[\text{Objet} \neq \text{État} \neq \text{Relation} \neq \text{Transformation} \neq \text{Décision}\]

Confondre ces catégories produit des erreurs de conception.

13.1.Objet

Un objet est une entité admissible dans un référentiel.

\[x\in\mathcal{O}_R\]

Il peut s’agir :

L’objet n’est pas nécessairement directement calculable. Il doit d’abord être lu.

13.2.Lecture

Une lecture transforme un objet en représentation exploitable.

\[\Phi_R : \mathcal{O}_R \rightarrow \mathcal{Q}_R\]
\[Q=\Phi_R(x)\]

La lecture dépend du référentiel et de la méthode. Une même entrée peut donc produire plusieurs états :

\[\Phi_1(x)\neq\Phi_2(x)\]

Exemple :

\[\text{document} \rightarrow \begin{cases} Q_{\text{lexical}}\ Q_{\text{sémantique}}\ Q_{\text{juridique}} \end{cases}\]

13.3.État relationnel

Un état relationnel est une représentation typée d’un objet ou d’un chemin.

\[Q= (S,\Gamma,\Pi,U)\]

où :

Un état n’est pas l’objet initial.

\[Q\neq x\]

Il est une lecture de cet objet.

13.4.Relation

Une relation caractérise un lien ou un rapport entre deux états comparables.

\[\rho_R : \mathcal{Q}_R\times\mathcal{Q}_R \rightarrow \mathcal{L}_R\]
\[r=\rho_R(Q_i,Q_j)\]

La relation peut être :

Exemple :

\[\rho(Q_1,Q_2) ( \text{proximité élevée}, \text{opposition logique} )\]

Une relation ne transforme pas nécessairement un état. Elle peut seulement le décrire relativement à un autre.

13.5.Transformation

Une transformation produit un nouvel état ou un nouvel objet.

\[T: \mathcal{X} \rightarrow \mathcal{Y}\]
\[y=T(x)\]

Elle doit déclarer :

\[T= ( \operatorname{dom}, \operatorname{cod}, \operatorname{pre}, \operatorname{apply}, \operatorname{post}, \Pi,U )\]

Une transformation est valide seulement si :

\[x\in\operatorname{dom}(T)\]

et si ses préconditions sont satisfaites.

13.6.Familles de transformations

L’ensemble des transformations est noté :

\[\mathcal{F}\]

Il contient notamment :

\[\mathcal{F} { \Phi, T, \Lambda, S, D, \operatorname{Update} }\]

avec :

Le transport n’est donc qu’un sous-type de transformation.

\[\text{Transport}\subset\mathcal{F}\]

13.7.Transport

Un transport déplace un état vers un autre état compatible.

\[T_{ij} : Q_i \mapsto Q_j\]

Dans un régime multiplicatif :

\[T_{ij} \rho(Q_i,Q_j)\]

et :

\[Q_j=T_{ij}\odot Q_i\]
Cette forme n’est valide que si l’opération (\odot) et les types sont

déclarés.

13.8.Qualification

Une qualification modifie la lecture d’un état sans redéfinir son identité structurelle.

\[\Lambda : Q_{\text{struct}} \mapsto Q_{\text{qual}}\]

Exemple :

\[\Lambda( \text{avocat}, \text{contexte juridique} ) \text{avocat-juriste}\]

La qualification doit appartenir à un domaine admissible :

\[\Lambda\in\mathcal{A}_\kappa\]

Elle ne peut donc pas produire arbitrairement toute interprétation.

13.9.Chemin

Un chemin est une suite ordonnée de transformations.

\[\Gamma= (T_1,T_2,\ldots,T_n)\]

Son application est :

\[\Gamma(Q_0) T_n\circ\cdots\circ T_1(Q_0)\]

L’ordre appartient au chemin.

\[(T_1,T_2)\neq(T_2,T_1)\]

dans le cas général. Le chemin constitue une information distincte de son résultat.

13.10.Référentiel

Un référentiel fixe les conditions de lecture, de transformation et de comparaison.

\[R= ( \mathcal{O}, \mathcal{Q}, \mathcal{F}, \mathcal{L}, \mathcal{B}, \Pi_R )\]

où :

Un résultat n’est interprétable qu’avec son référentiel.

\[r \quad\text{seul}\]

est insuffisant. Il faut :

\[(r,R)\]

13.11.Comparabilité

La comparabilité est un prédicat préalable à la relation.

\[\operatorname{Comp}_R(Q_i,Q_j)\]

Elle peut prendre les valeurs :

\[{ \text{vrai}, \text{partiel}, \text{faux}, \text{indéterminé} }\]

Une relation ne doit pas être calculée lorsque :

\[\operatorname{Comp}_R(Q_i,Q_j)=\text{faux}\]

Cette règle évite les comparaisons de type incorrect.

13.12.Mémoire

La mémoire conserve les états et leur évolution.

\[\Omega= (V,E,\Gamma,R,\Pi)\]

où :

La mémoire ne contient donc pas seulement des résultats. Elle conserve également les conditions de leur production.

13.13.Décision

Une décision sélectionne une orientation parmi plusieurs possibilités.

\[D= \operatorname{Router} ( Q, \rho, R, \Omega, U )\]

Une décision peut être :

\[D\in { \text{accepter}, \text{refuser}, \text{différer}, \text{vérifier}, \text{explorer}, \text{s’abstenir} }\]

La décision n’est pas une relation.

\[\rho\neq D\]

Une même relation peut produire plusieurs décisions selon le référentiel.

13.14.Action

Une action modifie un système externe ou interne.

\[A: S_t \mapsto S_{t+1}\]

La décision peut précéder l’action :

\[D \overset{\operatorname{Compile}}{\longmapsto} A\]

Cette séparation permet une validation avant exécution.

13.15.Provenance

La provenance décrit l’origine d’un objet, d’une lecture ou d’une transformation.

\[\Pi= ( \text{source}, \text{date}, \text{méthode}, \text{version}, \text{acteur} )\]

Deux états formellement identiques mais issus de provenances différentes ne sont pas nécessairement équivalents.

\[Q_1=Q_2\]

n’implique pas :

\[\Pi_1=\Pi_2\]

13.16.Incertitude

L’incertitude accompagne un résultat sans le remplacer.

\[U= ( U_{\text{donnée}}, U_{\text{lecture}}, U_{\text{relation}}, U_{\text{décision}} )\]

Elle ne constitue pas automatiquement une probabilité. Son type doit être déclaré.

13.17.Frontière

Une frontière définit la limite de validité d’un objet ou d’une opération.

\[\mathcal{B}_R\]

Elle peut concerner :

Hors frontière :

\[x\notin\mathcal{B}_R\]

le système doit :

13.18.Invariant

Un invariant est une propriété conservée par une transformation.

\[I(T(x))=I(x)\]

Exemples possibles :

Chaque transformation doit déclarer ses invariants attendus.

13.19.Perte

Une perte est une information non conservée par une transformation.

\[L_T(x)\]

Elle peut être :

La perte doit être distinguée de l’erreur. Une compression peut perdre de l’information tout en fonctionnant conformément à son contrat.

13.20.Erreur de type

Une erreur de type survient lorsqu’un objet est utilisé comme s’il appartenait à une autre catégorie. Exemples :

\[\text{relation} \neq \text{position}\]
\[\text{score} \neq \text{probabilité}\]
\[\text{explication} \neq \text{trace}\]
\[\text{qualification} \neq \text{preuve}\]

L’ontologie sert d’abord à empêcher ces confusions.

13.21.Schéma minimal

L’architecture ontologique minimale est :

\[x \in \mathcal{O}\]
\[Q=\Phi(x)\]
\[Q'=\Lambda(Q)\]
\[r=\rho(Q',M)\]
\[D=\operatorname{Router}(r)\]
\[\Omega'=\operatorname{Update}(\Omega,Q',D)\]

avec conservation de :

\[(\Gamma,\Pi,U,R)\]

13.22.Exemple concis

Entrée : Cette machine vibre anormalement. Lecture :

\[Q_0= { \text{machine}, \text{vibration}, \text{anomalie} }\]

Qualification :

\[Q_1= \Lambda_{\text{maintenance}}(Q_0)\]

Comparaison :

\[r= \rho( Q_1, \Omega_{\text{incidents}} )\]

Décision :

\[D= \text{inspection requise}\]

Mise à jour :

\[\Omega_{t+1} \operatorname{Update} ( \Omega_t, Q_1, D, \Pi )\]

Chaque étape demeure distincte.

Conclusion du chapitre

L’ontologie minimale de l’ÉTR repose sur une règle simple :

\[\text{Chaque objet possède un type unique et une fonction déclarée.}\]

L’objet est lu. L’état est transformé. La relation compare. Le référentiel rend la comparaison valide. Le routeur décide. L’action exécute. La mémoire conserve. La provenance permet l’audit. L’incertitude limite la conclusion. Le chapitre suivant peut maintenant traiter précisément Compose, c’est- à-dire la construction ordonnée des états et des chemins.

Chapitre 14 — Compose : construire un état ordonné

Compose est l’opération qui transforme une séquence d’unités en un état relationnel structuré. Son rôle n’est pas de produire directement le sens complet. Son rôle est plus précis :

\[\text{conserver l’ordre, appliquer les transformations successives et produire un chemin calculable}\]

Compose répond donc à une question centrale : Comment construire un état sans réduire une séquence à une simple collection de ses éléments ?

14.1.Entrée de Compose

Soit une séquence ordonnée :

\[\Gamma (a_1,a_2,\ldots,a_n)\]

Chaque unité (a_i) peut être :

La séquence appartient à un niveau déclaré :

\[\Gamma^{(k)} \in \left(\Sigma^{(k)}\right)^*\]

où :

ce niveau.

Exemples :

\[\Sigma^{(0)} \text{caractères}\]
\[\Sigma^{(1)} \text{termes}\]
\[\Sigma^{(2)} \text{phrases ou propositions}\]

Compose ne doit pas mélanger plusieurs niveaux sans transformation explicite.

14.2.État initial

Compose agit à partir d’un état initial :

\[Q_0\]

Cet état doit être typé. Il peut être :

La forme générale est :

\[\operatorname{Compose} : (Q_0,\Gamma,R,\Pi) \mapsto (Q_n,\Gamma_T)\]

où :

14.3.Transformation associée à chaque unité

Chaque unité (a_i) est associée à une transformation :

\[A_i \mathcal{G}(a_i,Q_{i-1},R,\Pi_i)\]
La fonction (\mathcal{G}) peut produire :

L’état évolue selon :

\[Q_i A_i(Q_{i-1})\]

Ainsi :

\[Q_n A_n \circ A_{n-1} \circ \cdots \circ A_1 (Q_0)\]

La première transformation appliquée est (A_1).

14.4.Forme stationnaire et forme contextuelle

Deux régimes doivent être distingués. Compose stationnaire Une même unité produit toujours la même transformation :

\[A_i A(a_i)\]

La transformation dépend uniquement de l’unité. Compose contextuel La transformation dépend aussi de l’état courant :

\[A_i A(a_i,Q_{i-1},R,\Pi_i)\]

Dans ce cas, la même unité peut agir différemment selon le chemin précédent.

\[A(a,Q_1) \neq A(a,Q_2)\]

Cette distinction doit être déclarée dans toute implémentation.

14.5.Conservation de l’ordre

Compose doit différencier :

\[(a,b)\]

et :

\[(b,a)\]

Il faut donc que, dans le cas général :

\[A_b\circ A_a \neq A_a\circ A_b\]

Cette non-commutativité peut provenir :

L’ordre ne doit pas être ajouté après le calcul comme une simple métadonnée si l’objectif est qu’il participe réellement à la construction de l’état.

14.6.Exemple linguistique

Considérons : Le chien poursuit le chat.

et : Le chat poursuit le chien. Les unités principales sont proches, mais leur ordre diffère. Pour la première phrase :

\[Q_1 A_{\text{Le}}(Q_0)\]
\[Q_2 A_{\text{chien}}(Q_1)\]
\[Q_3 A_{\text{poursuit}}(Q_2)\]
\[Q_4 A_{\text{le}}(Q_3)\]
\[Q_5 A_{\text{chat}}(Q_4)\]

Pour la seconde phrase, l’ordre des transformations change.

\[Q_5' A_{\text{chien}} \circ A_{\text{le}} \circ A_{\text{poursuit}} \circ A_{\text{chat}} \circ A_{\text{Le}} (Q_0)\]

Dans le cas général :

\[Q_5 \neq Q_5'\]

Compose conserve donc une différence que la simple collection de mots ne conserverait pas.

14.7.Compose ne produit pas automatiquement le sens

Il faut maintenir une séparation stricte :

\[\operatorname{Compose}(\Gamma) Q_{\text{struct}}\]

puis :

\[\Lambda(Q_{\text{struct}},R,\Pi) Q_{\text{qual}}\]

Compose construit :

La qualification construit ou précise :

Ainsi :

\[\text{Compose n’est pas une fonction sémantique totale}\]

Il constitue le support ordonné sur lequel une qualification peut agir.

14.8.Pourquoi cette séparation est nécessaire

Si Compose produisait directement toute interprétation, il deviendrait impossible de distinguer :

Avec la séparation :

\[Q_{\text{struct}}\]

reste disponible même si :

\[\Lambda_1(Q_{\text{struct}}) \neq \Lambda_2(Q_{\text{struct}})\]

Deux modèles peuvent donc qualifier différemment la même construction sans modifier son chemin structurel.

14.9.Compose hiérarchique

Compose peut être appliqué à plusieurs niveaux. Niveau caractère

\[\Gamma^{(0)} (\ell_1,\ell_2,\ldots,\ell_m)\]
\[Q_w \operatorname{Compose}^{(0)}(\Gamma^{(0)})\]

produit un état de terme.

Niveau terme

\[\Gamma^{(1)} (w_1,w_2,\ldots,w_n)\]
\[Q_s \operatorname{Compose}^{(1)}(\Gamma^{(1)})\]

produit un état de phrase. Niveau proposition

\[\Gamma^{(2)} (s_1,s_2,\ldots,s_p)\]
\[Q_d \operatorname{Compose}^{(2)}(\Gamma^{(2)})\]

produit un état de discours ou de document. Chaque changement de niveau exige une opération déclarée :

\[\operatorname{Lift}^{(k\rightarrow k+1)}\]

14.10.Un résultat de Compose devient une unité

Le résultat d’un niveau peut devenir l’unité du niveau suivant.

\[Q_w \in \Sigma^{(1)}\]
\[Q_s \in \Sigma^{(2)}\]

Cela permet une construction récursive :

\[\text{caractères} \rightarrow \text{termes} \rightarrow \text{phrases} \rightarrow \text{discours}\]

Mais cette récursivité ne doit pas effacer les niveaux inférieurs. La provenance doit conserver :

\[\Gamma^{(0)}, \Gamma^{(1)}, \Gamma^{(2)}\]

lorsque ces chemins restent nécessaires à l’audit.

14.11.Le chemin de Compose

Compose produit non seulement un état final, mais un chemin :

\[\Gamma_T (A_1,A_2,\ldots,A_n)\]

Ce chemin permet de reconstruire les états intermédiaires :

\[Q_i A_i(Q_{i-1})\]

On obtient donc :

\[(Q_0,Q_1,\ldots,Q_n)\]

Cette suite permet :

14.12.États intermédiaires

Les états intermédiaires ne sont pas nécessairement tous conservés en production. Deux régimes sont possibles. Conservation intégrale

\[\Omega \supset {Q_0,Q_1,\ldots,Q_n}\]

Avantage :

Coût :

Conservation sélective

\[\Omega \supset {Q_{i_1},Q_{i_2},\ldots,Q_{i_k}}\]

Avantage :

Limite :

Le protocole doit indiquer quels états sont conservés et lesquels deviennent indéterminables.

14.13.Contrat de Compose

Compose doit déclarer au minimum :

\[\mathcal{C}_{\operatorname{Compose}} ( \operatorname{dom}, \operatorname{cod}, \operatorname{level}, \operatorname{order}, \operatorname{state}, \operatorname{loss}, \operatorname{provenance} )\]

avec :

Préconditions :

\[Q_0\in\mathcal{Q}_R\]
\[a_i\in\Sigma^{(k)}\]
\[A_i : \mathcal{Q}_R \rightarrow \mathcal{Q}_R\]

Postcondition :

\[Q_n\in\mathcal{Q}_R\]

14.14.Clôture

Compose est clos sur un espace d’états si :

\[Q_{i-1}\in\mathcal{Q}_R \Rightarrow Q_i\in\mathcal{Q}_R\]

pour toute transformation admissible. Si une transformation produit un état hors domaine :

\[Q_i\notin\mathcal{Q}_R\]

le système doit :

La projection ne doit jamais être implicite.

14.15.Compose partiel

Compose peut être une fonction partielle.

\[\operatorname{Compose} : \mathcal{D} \rightharpoonup \mathcal{Q}\]

Cela signifie que certaines séquences ne produisent pas d’état valide. Causes possibles :

L’échec de Compose constitue un résultat exploitable.

14.16.Compose et identité

Une transformation identité peut être définie :

\[I(Q)=Q\]

Elle représente l’absence de changement structurel. Pour une séquence vide :

\[\varepsilon\]

on attend généralement :

\[\operatorname{Compose}(Q_0,\varepsilon) Q_0\]

Cette propriété doit être déclarée comme convention du système.

14.17.Compose et associativité

La composition fonctionnelle est associative :

\[(A_3\circ A_2)\circ A_1 A_3\circ(A_2\circ A_1)\]

Mais cette propriété ne signifie pas que la séquence peut être réordonnée. Associativité :

\[(A_3\circ A_2)\circ A_1 A_3\circ(A_2\circ A_1)\]

Commutativité :

\[A_2\circ A_1 A_1\circ A_2\]

Ce sont deux propriétés différentes. Compose utilise l’associativité pour regrouper les calculs, tout en conservant l’ordre des transformations.

14.18.Compose contextuel et associativité opérationnelle

Dans le cas contextuel :

\[A_i A(a_i,Q_{i-1})\]

les opérateurs ne sont pas connus indépendamment des états intermédiaires. La composition reste séquentiellement définie, mais elle ne peut pas toujours être pré-calculée comme un simple produit d’opérateurs fixes. On doit exécuter :

\[Q_1=A(a_1,Q_0)(Q_0)\]

puis :

\[Q_2=A(a_2,Q_1)(Q_1)\]

puis :

\[Q_3=A(a_3,Q_2)(Q_2)\]

La dépendance à l’état interdit certaines optimisations. Elle augmente en revanche l’expressivité.

14.19.Modulation de Compose

Une transformation peut être modulée :

\[A_{i,\mathrm{eff}} \mathcal{M}(A_i,\Lambda_i)\]

où :

La loi (\mathcal{M}) doit être déclarée.

Elle peut prendre plusieurs formes :

\[A_{i,\mathrm{eff}} \Lambda_i\circ A_i\]

ou :

\[A_{i,\mathrm{eff}} A_i\circ\Lambda_i\]

ou encore :

\[A_{i,\mathrm{eff}} G_iA_iG_i^{-1}\]

Ces formes ne sont pas équivalentes. L’ÉTR ne doit pas en imposer une sans justification.

14.20.Domaine admissible de modulation

La modulation doit appartenir à un domaine :

\[\Lambda_i \in \mathcal{A}_\kappa\]

Cette contrainte empêche la qualification de remplacer totalement la structure. Le système doit vérifier :

\[\operatorname{Admissible}(\Lambda_i)=\text{vrai}\]

avant l’application. Sinon :

\[A_{i,\mathrm{eff}}\]

est rejeté ou projeté selon une règle déclarée.

14.21.Invariants de Compose

Compose peut être conçu pour conserver certains invariants. Exemples :

\[I_{\text{type}}(Q_i) I_{\text{type}}(Q_0)\]
\[I_{\text{provenance}}(Q_i) \supseteq I_{\text{provenance}}(Q_{i-1})\]
\[I_{\text{ordre}}(\Gamma) \text{conservé}\]
\[I_{\text{domaine}}(Q_i) R\]

Ces invariants dépendent de l’implémentation. Ils doivent être testés, non supposés.

14.22.Perte dans Compose

Compose peut perdre de l’information lorsque :

Le contrat global doit agréger ces pertes.

\[L_{\Gamma} L_{A_1} \cup L_{A_2} \cup \cdots \cup L_{A_n}\]

Cette union doit être comprise comme une composition de pertes, et non nécessairement comme une simple somme.

14.23.Inversion

Si chaque transformation est inversible :

\[A_i^{-1}\]

alors le chemin inverse est :

\[\Gamma^{-1} ( A_n^{-1}, A_{n-1}^{-1}, \ldots, A_1^{-1} )\]

et :

\[\Gamma^{-1}(\Gamma(Q_0)) Q_0\]

sous les préconditions déclarées. Mais si une seule transformation est non inversible, le chemin complet peut devenir non inversible.

\[\exists i,\ A_i^{-1}\text{ absent} \Rightarrow \Gamma^{-1}\text{ non garantie}\]

14.24.Compose et mémoire

Compose peut lire et modifier une mémoire. Forme sans mise à jour :

\[Q_n \operatorname{Compose}(Q_0,\Gamma,\Omega_t)\]

Forme avec mémoire évolutive :

\[(Q_n,\Omega_{t+1}) \operatorname{ComposeUpdate}(Q_0,\Gamma,\Omega_t)\]

Ces deux régimes doivent être distingués. Compose ne doit pas modifier la mémoire implicitement. La mise à jour doit rester une transformation déclarée.

14.25.Compose et parallélisation

Un Compose strictement séquentiel suit :

\[Q_i=A_i(Q_{i-1})\]

Il possède donc une dépendance temporelle. Certaines opérations peuvent néanmoins être parallélisées si :

On peut construire :

\[Q_A \operatorname{Compose}(\Gamma_A)\]
\[Q_B \operatorname{Compose}(\Gamma_B)\]

puis :

\[Q \operatorname{Merge}(Q_A,Q_B)\]
Mais (\operatorname{Merge}) devient alors une transformation distincte

avec son propre contrat.

14.26.Compose et Transformer

Un Transformer construit des représentations contextuelles à plusieurs couches. On peut le considérer comme un producteur d’états :

\[Q_{\text{LLM}} \Phi_{\text{Transformer}}(\Gamma)\]

Mais son mécanisme n’est pas identique à Compose. Le Transformer :

Compose :

Le Transformer peut fournir les transformations ou les qualifications utilisées par Compose.

14.27.Compose et CNN

Un CNN compose également des couches :

\[Q_L f_L\circ\cdots\circ f_1(X)\]

La différence principale réside dans l’objet suivi. Le CNN conserve principalement des activations. Compose vise à conserver :

Un CNN peut donc être encapsulé comme une transformation de lecture :

\[\Phi_{\text{CNN}} : X \mapsto Q_{\text{visuel}}\]

14.28.Exemple minimal d’application

Séquence :

\[\Gamma ( \text{machine}, \text{vibre}, \text{fortement} )\]

État initial :

\[Q_0 I\]

Transformations :

\[A_1 A_{\text{machine}}\]
\[A_2 A_{\text{vibre}}\]
\[A_3 A_{\text{fortement}}\]

Composition :

\[Q_3 A_3 \circ A_2 \circ A_1 (Q_0)\]

Le résultat structurel conserve :

La qualification peut ensuite produire :

\[\Lambda_{\text{maintenance}}(Q_3) \text{anomalie vibratoire probable}\]

Compose n’effectue pas à lui seul ce diagnostic.

14.29.Forme algorithmique minimale

Entrées : état initial Q séquence ordonnée Γ référentiel R

Pour chaque unité aᵢ de Γ : vérifier le type de aᵢ produire ou sélectionner Aᵢ vérifier les préconditions de Aᵢ calculer Qᵢ = Aᵢ(Qᵢ₋₁) vérifier Qᵢ ∈ codomaine(Aᵢ) enregistrer la provenance enregistrer les pertes déclarées

Retourner : état final Qₙ chemin Γ_T rapport de validation Cette forme constitue le noyau opérationnel minimal.

14.30.Sortie de Compose

La sortie ne doit pas être seulement :

\[Q_n\]

Elle doit idéalement contenir :

\[\operatorname{ComposeResult} ( Q_n, \Gamma_T, \Pi, U, L, V )\]

où :

Conclusion du chapitre

Compose est l’opérateur de construction ordonnée de l’ÉTR. Sa forme générale est :

\[Q_n A_n \circ A_{n-1} \circ \cdots \circ A_1 (Q_0)\]

Mais sa définition complète comprend davantage que cette équation. Compose doit déclarer :

Il ne produit pas automatiquement le sens. Il produit la structure et le chemin nécessaires à une qualification ultérieure.

\[\text{Compose ordonne et construit ; la qualification interprète.}\]

Chapitre 15 — Les référentiels : le cadre dans lequel une relation prend son sens

Jusqu'à présent, nous avons introduit les objets, les états, les transformations et Compose. Une question demeure pourtant ouverte : Comment savoir si deux états peuvent être comparés ? La réponse est simple en apparence : Ils doivent appartenir au même cadre d'interprétation. Ce cadre est appelé référentiel. Sans référentiel, une relation ne possède pas de signification scientifique.

15.1.Pourquoi un référentiel ?

Considérons le nombre :

À lui seul, il ne signifie rien. Il peut représenter :

Le nombre est identique. Le sens change. Le référentiel est précisément ce qui permet de déterminer l'interprétation admissible. Autrement dit :

\[\text{une valeur n'a de sens qu'à l'intérieur d'un référentiel déclaré}\]

15.2.Définition

Un référentiel est un ensemble cohérent de règles permettant de :

On peut l'écrire :

\[R= (\mathcal O,\mathcal Q,\mathcal F,\mathcal L,\mathcal D)\]

où :

Le référentiel constitue donc le cadre logique dans lequel les opérations deviennent valides.

15.3.Deux objets identiques peuvent changer de sens

Considérons le mot : avocat Dans un référentiel culinaire : fruit. Dans un référentiel juridique : profession. L'objet est identique. La lecture change. Compose n'a pas changé. Le référentiel, lui, a changé.

15.4.Les référentiels ne sont pas des modèles

Il est important de distinguer :

Un modèle calcule. Un référentiel définit les règles du calcul. Un LLM peut être remplacé. Le référentiel peut rester identique. Inversement : le même LLM peut fonctionner sous plusieurs référentiels. L'ÉTR sépare volontairement ces deux notions.

15.5.Plusieurs référentiels peuvent coexister

Un même objet peut être interprété simultanément selon plusieurs points

de vue. Une entreprise peut être décrite :

On obtient alors :

\[Q^{(R_1)}, Q^{(R_2)}, \dots, Q^{(R_n)}\]

Ces états ne sont pas contradictoires. Ils correspondent à des lectures différentes.

15.6.Comparer exige un référentiel commun

Comparer deux objets suppose une règle commune. Comparer :

n'a aucun sens. Avant toute relation, l'ÉTR vérifie donc :

\[\operatorname{Comp}_R(Q_i,Q_j)\]

Si les états ne sont pas comparables dans le référentiel considéré, la relation ne doit pas être calculée. L'absence de comparaison est ici un résultat valide.

15.7.Changer de référentiel

Il est parfois nécessaire de passer d'un référentiel à un autre. Cette opération constitue une transformation.

\[T_{R_i\rightarrow R_j}\]

Elle doit déclarer :

Changer de référentiel ne consiste donc pas à renommer des objets. C'est une transformation à part entière.

15.8.Le rôle des référentiels dans l'ÉTR

Les référentiels occupent une place centrale. Ils permettent :

Autrement dit, ils ne produisent pas directement les résultats. Ils définissent le cadre dans lequel ces résultats deviennent scientifiquement interprétables.

Tu as raison : le chapitre 15 doit présenter non seulement le référentiel comme cadre logique, mais aussi le Référentiel Relationnel Unitaire comme modèle opératoire, son échelle multiplicative, ses architectures de coordonnées et le mécanisme permettant de sélectionner un référentiel plutôt qu’un autre. La suite du chapitre peut être complétée ainsi.

15.9.Le Référentiel Relationnel Unitaire

Le Référentiel Relationnel Unitaire est une famille particulière de référentiels dans laquelle la relation élémentaire entre deux valeurs strictement positives est définie par leur rapport :

\[\rho(a,b)=\frac{b}{a}\]

Le résultat n’exprime pas une différence additive, mais le facteur permettant de passer de (a) à (b). Exemples :

\[\rho(1,2)=2\]
\[\rho(2,3)=\frac{3}{2}=1{,}5\]
\[\rho(4,5)=\frac{5}{4}=1{,}25\]

Le nombre obtenu est donc une relation de transformation :

\[b=a\cdot \rho(a,b)\]

Ainsi :

\[2=1\cdot2\]
\[3=2\cdot1{,}5\]
\[5=4\cdot1{,}25\]

15.10.L’unité comme identité relationnelle

Dans ce modèle, l’unité (1) n’est pas nécessairement le premier point d’un axe. Elle est d’abord la relation neutre :

\[\rho(a,a)=\frac{a}{a}=1\]

Elle signifie :

Si :

\[\rho_x=1\]

alors la dimension (x) ne change pas. L’unité appartient donc à l’espace des relations avant d’être éventuellement utilisée comme coordonnée dans une représentation graphique. Cette distinction évite de confondre :

\[\text{valeur }1\]

et :

\[\text{relation identité}\]

15.11.L’échelle relationnelle

Sur un axe additif classique, les écarts :

\[1\rightarrow2\]

et :

\[2\rightarrow3\]

ont la même différence :

\[2-1=1\]
\[3-2=1\]

Dans une échelle relationnelle, ils ne représentent pas la même transformation :

\[\rho(1,2)=2\]
\[\rho(2,3)=1{,}5\]

Ainsi, l’écart graphique entre deux repères ne doit pas être interprété

automatiquement comme une unité additive constante. Chaque intervalle représente son propre facteur relationnel.

\[1\rightarrow2 \quad\Longleftrightarrow\quad \times2\]
\[2\rightarrow3 \quad\Longleftrightarrow\quad \times1{,}5\]
\[3\rightarrow4 \quad\Longleftrightarrow\quad \times\frac43\]

La suite générale est :

\[\rho(n,n+1) \frac{n+1}{n} 1+\frac1n\]

et :

\[\lim_{n\rightarrow\infty} \frac{n+1}{n}\]

Lorsque les valeurs augmentent additivement d’une unité, leur transformation relative se rapproche progressivement de l’identité.

15.12.Coordonnées multidimensionnelles

Un référentiel peut comporter plusieurs dimensions. Soient :

\[A=(a_1,a_2,\ldots,a_d)\]

et :

\[B=(b_1,b_2,\ldots,b_d)\]

La relation de (A) vers (B) est calculée dimension par dimension :

\[R_{A\rightarrow B} \left( \frac{b_1}{a_1}, \frac{b_2}{a_2}, \ldots, \frac{b_d}{a_d} \right)\]

Pour l’exemple présenté dans les figures :

\[A=(1,2,4)\]
\[B=(3,2,5)\]

on obtient :

\[R_{A\rightarrow B} \left( \frac31, \frac22, \frac54 \right)\]

donc :

\[R_{A\rightarrow B} (3,1,1{,}25)\]

La lecture dimensionnelle est alors :

\[\rho_x=3\]

transformation multiplicative forte sur (x) ;

\[\rho_y=1\]

identité relationnelle sur (y) ;

\[\rho_z=1{,}25\]

transformation multiplicative modérée sur (z). Le résultat n’est donc pas une distance unique entre (A) et (B). Il constitue un profil de transformation.

15.13.Position et relation

Le modèle doit distinguer deux objets :

\[A,\ B\]

qui sont des états ou des coordonnées, et :

\[R_{A\rightarrow B}\]

qui est la relation permettant de passer de l’un à l’autre. Dans le régime multiplicatif :

\[B=A\odot R_{A\rightarrow B}\]
où (\odot) désigne le produit composante par composante.

Pour l’exemple :

\[(1,2,4)\odot(3,1,1{,}25) (3,2,5)\]

La relation n’est donc pas la seconde position. Elle constitue la transformation entre les deux positions.

15.14.Parcours relationnel

Le passage de (A) à (B) peut être représenté comme une trajectoire paramétrée :

\[P(t) A\odot R_{A\rightarrow B}^{,t}\]

avec :

\[t\in[0,1]\]

et une exponentiation composante par composante. Ainsi :

\[P(0)=A\]

et :

\[P(1)=B\]

Dans l’exemple :

\[P(t) \left( 1\cdot3^t, 2\cdot1^t, 4\cdot1{,}25^t \right)\]

À mi-parcours :

\[P(0{,}5) \left( \sqrt3, 2, 4\sqrt{1{,}25} \right)\]

soit approximativement :

\[P(0{,}5) \approx (1{,}732,\ 2,\ 4{,}472)\]

Cette trajectoire représente une évolution proportionnelle dans chacune des dimensions. Elle n’impose pas que tout phénomène réel suive cette interpolation. Elle constitue une simulation définie dans le référentiel multiplicatif considéré.

15.15.Architecture interne de coordonnées

Un référentiel peut contenir sa propre architecture de coordonnées :

\[\mathcal{K}_R (k_1,k_2,\ldots,k_d)\]

Chaque coordonnée (k_i) correspond à une dimension explicitement définie dans ce référentiel. Une fonction de lecture positionne un objet :

\[\kappa_R : \mathcal O_R \rightarrow (\mathbb R_+^*)^d\]

Ainsi :

\[Q^{(R)} \kappa_R(x)\]

Les dimensions ne doivent pas être de simples axes anonymes. Chacune doit posséder :

Le référentiel ne se limite donc pas à déclarer les objets comparables. Il peut aussi définir l’architecture dans laquelle ils sont situés.

15.16.Coordonnées et relations sémantiques

Dans un référentiel sémantique, les coordonnées peuvent représenter des structures relationnelles telles que :

Il faut cependant distinguer deux architectures. Coordonnées sémantiques explicites Chaque dimension possède un sens déclaré :

\[Q ( q_{\text{causalité}}, q_{\text{temporalité}}, q_{\text{compatibilité}} )\]

La relation est alors lisible dimension par dimension. Coordonnées sémantiques latentes Les coordonnées sont produites par un modèle et ne possèdent pas nécessairement une interprétation individuelle stable.

\[Q (q_1,q_2,\ldots,q_d)\]

Dans ce cas, le référentiel doit déclarer que les axes sont latents et préciser le protocole ayant produit leur géométrie. L’ÉTR peut accueillir ces deux formes, mais elle ne doit pas les confondre.

15.17.Un référentiel comme espace de positionnement sémantique

Un référentiel sémantique peut être représenté par :

\[R_s ( \mathcal V_s, \mathcal K_s, \kappa_s, \rho_s, \mathcal F_s, \mathcal B_s, \Pi_s )\]

où :

admissibles ;

Le référentiel devient ainsi une structure complète de lecture et de navigation. Il contient à la fois :

15.18.Plusieurs architectures de coordonnées

Deux référentiels peuvent décrire les mêmes objets au moyen de coordonnées différentes. Pour un même objet (x) :

\[Q^{(R_1)} \kappa_{R_1}(x)\]

et :

\[Q^{(R_2)} \kappa_{R_2}(x)\]

avec :

\[Q^{(R_1)} \neq Q^{(R_2)}\]

Par exemple, une publication peut être positionnée dans :

\[R_{\text{thématique}}\]

selon son domaine et ses concepts ; dans :

\[R_{\text{intention}}\]

selon l’objectif exprimé ; dans :

\[R_{\text{temporalité}}\]

selon sa relation au passé, au présent ou au futur ; dans :

\[R_{\text{interaction}}\]

selon les comportements qu’elle provoque. Le contenu source reste identique. La structure de coordonnées active change.

15.19.Référentiel actif

Tous les référentiels disponibles ne doivent pas nécessairement être actifs simultanément. On définit un ensemble :

\[\mathfrak R { R_1,R_2,\ldots,R_n }\]

et un état d’activation :

\[\alpha_i \in { 0,1 }\]

où :

\[\alpha_i=1\]

signifie que (R_i) est actif, et :

\[\alpha_i=0\]

qu’il est inactif pour l’opération courante. L’ensemble actif est :

\[\mathfrak R_{\mathrm{actif}} { R_i\in\mathfrak R \mid \alpha_i=1 }\]

La désactivation d’un référentiel ne signifie pas sa suppression. Elle signifie que ses règles, ses coordonnées et ses relations ne participent pas à la lecture ou à la décision courante.

15.20.Sélection d’un référentiel

Un sélecteur peut choisir le référentiel pertinent :

\[R^* \operatorname{SelectRef} ( x, C, \Omega, G )\]

où :

Exemples :

\[\operatorname{SelectRef} ( \text{contrat}, \text{audit légal} ) R_{\text{juridique}}\]
\[\operatorname{SelectRef} ( \text{contrat}, \text{prévision de trésorerie} ) R_{\text{financier}}\]

Le même objet est lu différemment selon la mission active.

15.21.Désactivation au profit d’un autre référentiel

Le système peut effectuer une transition :

\[R_i \rightarrow R_j\]

Cette opération comporte deux décisions distinctes :

\[\operatorname{Deactivate}(R_i)\]

et :

\[\operatorname{Activate}(R_j)\]

Elle ne doit pas être confondue avec une transformation directe des coordonnées. Trois cas sont possibles. Relecture depuis l’objet source

\[x \overset{\kappa_{R_j}}{\longmapsto} Q^{(R_j)}\]

Le système reprend l’objet initial et le positionne dans le nouveau référentiel. Transport inter-référentiel

\[T_{R_i\rightarrow R_j} : Q^{(R_i)} \mapsto Q^{(R_j)}\]

Cette opération n’est valide que si une correspondance explicite existe. Absence de correspondance Si aucune transformation admissible n’existe :

\[T_{R_i\rightarrow R_j} \text{ indéfini}\]

le système doit relire l’objet source ou s’abstenir. Il ne doit pas inventer une équivalence.

15.22.Référentiel principal et référentiels secondaires

Une opération peut utiliser un référentiel principal :

\[R_{\mathrm{principal}}\]

et plusieurs référentiels secondaires :

\[R_{\mathrm{secondaires}} { R_{s_1},R_{s_2},\ldots }\]

Le référentiel principal détermine :

Les référentiels secondaires peuvent fournir :

Exemple :

\[R_{\mathrm{principal}} R_{\text{médical}}\]

avec :

\[R_{\text{secondaires}} { R_{\text{linguistique}}, R_{\text{documentaire}} }\]

Le référentiel linguistique aide à lire la demande, mais ne gouverne pas la décision médicale.

15.23.Conflit entre référentiels

Deux référentiels peuvent produire des orientations différentes.

\[D^{(R_1)} \neq D^{(R_2)}\]

Ce conflit ne constitue pas nécessairement une erreur. Il peut révéler que les référentiels poursuivent des objectifs différents. Par exemple :

\[R_{\text{commercial}}\]

peut favoriser la rapidité, tandis que :

\[R_{\text{juridique}}\]

favorise la conformité. Le système doit alors déclarer :

15.24.Activation contextuelle et stabilité

Un changement de référentiel peut modifier fortement le résultat. Le système doit donc éviter une commutation arbitraire. La sélection peut être soumise à :

On peut écrire :

\[\operatorname{Switch}(R_i,R_j)\]

uniquement si :

\[\operatorname{AdmissibleSwitch}(R_i,R_j,C)=\text{vrai}\]

Cette discipline empêche le système de choisir après coup le référentiel qui justifie le résultat désiré.

15.25.Registre d’activation

Chaque changement doit être conservé dans la provenance :

\[\Pi_{\mathrm{switch}} ( R_i, R_j, \text{cause}, \text{date}, \text{acteur}, \text{règle} )\]

Le système doit pouvoir répondre :

Le changement de référentiel devient ainsi auditable.

15.26.Exemple sémantique

Considérons la phrase : Cette stratégie est agressive. Dans un référentiel commercial :

\[R_{\text{commercial}}\]

« agressive » peut être qualifié comme :

Dans un référentiel comportemental :

\[R_{\text{comportemental}}\]

le même terme peut évoquer :

Dans un référentiel financier :

\[R_{\text{financier}}\]

il peut signifier :

Le terme source ne change pas. L’architecture de coordonnées et les relations disponibles changent. Le système ne doit donc pas fusionner immédiatement ces trois lectures. Il doit identifier le référentiel actif.

15.27.Exemple pour Cercle

Une publication peut être positionnée dans plusieurs référentiels de pintones :

\[R_{\text{proximité}}\]
\[R_{\text{exploration}}\]
\[R_{\text{apprentissage}}\]
\[R_{\text{modération}}\]

Le moteur peut activer :

\[R_{\text{proximité}}\]

pour rechercher les publications proches de la LOI de l’utilisateur. Il peut ensuite le désactiver et activer :

\[R_{\text{exploration}}\]

afin d’introduire une distance contrôlée. Enfin :

\[R_{\text{modération}}\]

peut intervenir comme référentiel de contrôle sans déterminer la navigation principale. Ainsi, le choix d’une publication ne dépend pas d’un espace sémantique universel unique. Il dépend du référentiel et de l’objectif actifs.

15.28.Schéma général enrichi

Le fonctionnement devient :

\[x\]
\[\downarrow\]
\[R^* \operatorname{SelectRef}(x,C,\Omega,G)\]
\[\downarrow\]
\[Q^{(R^*)} \kappa_{R^*}(x)\]
\[\downarrow\]
\[\rho_{R^} ( Q^{(R^)}, \Omega^{(R^*)} )\]
\[\downarrow\]
\[D^{(R^*)}\]

Puis, si l’objectif change :

\[\operatorname{Deactivate}(R^*)\]
\[\operatorname{Activate}(R')\]
\[Q^{(R')} \kappa_{R'}(x)\]

Le changement d’objectif entraîne donc un changement déclaré de référentiel, et potentiellement une nouvelle position de l’objet.

Conclusion révisée du chapitre 15

Un référentiel n’est pas seulement un contexte abstrait. Il peut contenir une architecture complète de coordonnées dans laquelle les objets sont positionnés et reliés. Dans le Référentiel Relationnel Unitaire :

\[\rho(a,b)=\frac ba\]

et, en plusieurs dimensions :

\[R_{A\rightarrow B} \left( \frac{b_1}{a_1}, \ldots, \frac{b_d}{a_d} \right)\]

L’unité :

est l’identité relationnelle. L’échelle décrit des facteurs de transformation et non des distances additives uniformes. Chaque référentiel peut définir :

Plusieurs référentiels peuvent coexister, mais ils ne doivent pas nécessairement être actifs simultanément. Le système peut :

\[\text{activer, désactiver ou remplacer un référentiel selon l’objectif déclaré}\]

sans supprimer les autres référentiels ni fusionner leurs coordonnées. La formulation centrale du chapitre devient donc :

\[\text{Un objet n’a pas une position universelle : il possède une position relativement à l’architecture du référentiel actif.}\]

Et le changement de référentiel constitue lui-même une transformation traçable, soumise à des conditions de validité.

Conclusion

Un référentiel n'est ni une base de données, ni un modèle d'intelligence artificielle, ni un ensemble de règles métier. Il constitue le langage commun dans lequel les objets, les transformations et les relations acquièrent une signification. Dans l'ÉTR, aucune relation ne devrait être interprétée sans que son référentiel soit explicitement identifié.

\[\text{La relation dépend des états ; les états dépendent des lectures ; les lectures dépendent des référentiels.}\]

Chapitre 16 — Relations et mesures : comparer sans réduire selon le temps

Après la lecture, Compose, la qualification et séquence de sélection du référentiel, le système doit comparer des états. Cette comparaison ne doit pas être confondue avec la décision. Elle répond à une question précise : Quelle relation existe entre deux états comparables dans un référentiel donné ? La forme générale est :

\[\rho_R : \mathcal Q_R \times \mathcal Q_R \rightarrow \mathcal L_R\]

où :

16.1.La comparaison exige une comparabilité préalable

Avant tout calcul, le système vérifie :

\[\operatorname{Comp}_R(Q_i,Q_j)\]

Cette vérification porte au minimum sur :

La comparaison n’est autorisée que si :

\[\operatorname{Comp}_R(Q_i,Q_j) \in { \text{vrai}, \text{partiel} }\]

Si la comparabilité est partielle, les dimensions non comparables doivent être explicitement exclues ou marquées comme indéterminées.

16.2.Relation, distance et similarité

Ces trois notions doivent être distinguées. Relation Une relation décrit le rapport entre deux états.

\[r=\rho_R(Q_i,Q_j)\]

Distance Une distance mesure une séparation.

\[d_R(Q_i,Q_j)\geq 0\]

Une distance peut satisfaire :

\[d(Q_i,Q_j)=0 \iff Q_i=Q_j\]
\[d(Q_i,Q_j)=d(Q_j,Q_i)\]
\[d(Q_i,Q_k) \leq d(Q_i,Q_j)+d(Q_j,Q_k)\]

si elle est métrique. Similarité Une similarité mesure une proximité ou une compatibilité.

\[s_R(Q_i,Q_j)\]

Elle peut être bornée, par exemple :

\[s_R(Q_i,Q_j)\in[0,1]\]

Une relation n’est pas nécessairement une distance. Une distance n’est pas nécessairement une similarité. Une similarité n’est pas nécessairement symétrique.

16.3.Relation orientée

L’ÉTR distingue :

\[\rho_R(Q_i,Q_j)\]

de :

\[\rho_R(Q_j,Q_i)\]

Dans un régime multiplicatif :

\[\rho_R(a,b)=\frac ba\]

et :

\[\rho_R(b,a)=\frac ab\]

donc :

\[\rho_R(b,a) \rho_R(a,b)^{-1}\]

La relation possède une orientation. Elle décrit un passage de source vers cible. Cette orientation disparaît si l’on remplace trop tôt la relation par une distance symétrique.

16.4.Relation élémentaire multiplicative

Pour deux valeurs strictement positives :

\[a,b\in\mathbb R_+^*\]

la relation est :

\[\rho(a,b)=\frac ba\]

Interprétation :

\[\rho(a,b)>1\]

indique une expansion ;

\[\rho(a,b)=1\]

indique l’identité ;

\[0<\rho(a,b)<1\]

indique une contraction relative. Exemples :

\[\rho(2,6)=3\]
\[\rho(5,5)=1\]
\[\rho(8,2)=\frac14\]

16.5.Relation multidimensionnelle

Pour :

\[A=(a_1,\ldots,a_d)\]

et :

\[B=(b_1,\ldots,b_d)\]

avec toutes les composantes strictement positives :

\[R_{A\rightarrow B} \left( \frac{b_1}{a_1}, \ldots, \frac{b_d}{a_d} \right)\]

Le résultat est un profil relationnel. Chaque composante conserve son sens propre. Pour :

\[A=(1,2,4)\]
\[B=(3,2,5)\]

on obtient :

\[R_{A\rightarrow B} (3,1,1{,}25)\]

Cette forme conserve :

16.6.Le profil relationnel

Dans un référentiel sémantique, la relation peut contenir plusieurs dimensions hétérogènes :

\[\rho_R(Q_i,Q_j) ( r_{\text{proximité}}, r_{\text{opposition}}, r_{\text{causalité}}, r_{\text{temporalité}}, r_{\text{fiabilité}} )\]

Le profil relationnel précède l’agrégation. Il permet de conserver des combinaisons telles que :

\[\text{proximité forte}\]

et simultanément :

\[\text{opposition logique forte}\]

Une valeur globale unique masquerait cette structure.

16.7.Mesure par dimension

Chaque dimension peut avoir sa propre fonction :

\[\rho_k : \mathcal Q_R\times\mathcal Q_R \rightarrow \mathcal L_k\]

Le profil complet devient :

\[\rho_R(Q_i,Q_j) \left( \rho_1(Q_i,Q_j), \ldots, \rho_d(Q_i,Q_j) \right)\]

Les dimensions peuvent être :

Le système ne doit pas les forcer dans une même échelle sans transformation explicite.

16.8.Agrégation

Une agrégation transforme un profil en résultat compact :

\[S \operatorname{Aggregate} ( r_1,\ldots,r_d )\]

Exemple pondéré :

\[S \sum_{k=1}^{d} \alpha_k r_k\]

avec :

\[\sum_k\alpha_k=1\]

Cette opération doit déclarer :

L’agrégation n’est pas la relation. Elle est une transformation appliquée à la relation.

16.9.Risque de compensation

Une agrégation additive peut produire une compensation. Supposons :

\[r_1=1\]
\[r_2=0\]

et :

\[S=\frac{r_1+r_2}{2}=0{,}5\]

Le même résultat peut être produit par :

\[r_1=0{,}5\]
\[r_2=0{,}5\]

Les deux profils sont pourtant différents.

\[(1,0)\neq(0{,}5,0{,}5)\]

Une agrégation peut donc rendre plusieurs structures relationnelles indiscernables.

16.10.Veto et contrainte dure

Certaines dimensions ne doivent pas être compensées. Exemple :

\[r_{\text{sécurité}} \text{échec}\]

Même avec une forte proximité sémantique, la décision peut être interdite. On distingue alors : Signal pondérable

\[r_k\]

peut participer à une agrégation. Contrainte dure

\[c_j(Q_i,Q_j)\in{\text{vrai},\text{faux}}\]

doit être satisfaite. La fonction de validité devient :

\[\operatorname{Valid} \bigwedge_j c_j\]

puis seulement, si elle est vraie :

\[S=\operatorname{Aggregate}(r_1,\ldots,r_d)\]

16.11.Relation et contexte

Une relation peut dépendre du contexte :

\[\rho_R(Q_i,Q_j\mid C)\]

Le même couple peut être lu différemment selon :

Mais le contexte doit être déclaré. Sinon, deux calculs différents paraissent contradictoires alors qu’ils répondent à des conditions différentes.

16.12.Relation et provenance

La relation doit conserver la provenance de ses entrées et de sa méthode.

\[\Pi_\rho ( \Pi_{Q_i}, \Pi_{Q_j}, \Pi_{\text{méthode}}, \text{date}, \text{version} )\]

Deux relations numériquement identiques peuvent ne pas avoir la même qualité si elles proviennent :

16.13.Relation et incertitude

Une relation peut être accompagnée d’une incertitude :

\[\widehat{\rho} ( \rho, U_\rho )\]

Exemple :

\[\rho_{\text{sémantique}}=0{,}84\]
\[U_{\rho}=0{,}12\]
Mais cette écriture n’est valide que si le sens de (U_\rho) est défini.

Il peut représenter :

16.14.Relation inverse

Dans un régime inversible :

\[\rho(Q_i,Q_j)^{-1} \rho(Q_j,Q_i)\]

Pour le rapport multiplicatif :

\[\left(\frac{b}{a}\right)^{-1} \frac{a}{b}\]

En plusieurs dimensions :

\[R_{B\rightarrow A} R_{A\rightarrow B}^{-1}\]

avec inversion composante par composante. Cette propriété doit être testée lorsque le système la revendique.

16.15.Composition des relations

Pour trois états :

\[Q_i,Q_j,Q_k\]

un régime multiplicatif cohérent satisfait :

\[R_{i\rightarrow j} \odot R_{j\rightarrow k} R_{i\rightarrow k}\]
où (\odot) est le produit composante par composante.

En dimension unique :

\[\frac{b}{a} \cdot \frac{c}{b} \frac{c}{a}\]

Cette propriété permet de composer des transports. Elle ne doit pas être étendue automatiquement à toutes les relations sémantiques.

16.16.Relation directe et relation composée

Deux calculs peuvent être comparés :

\[R_{i\rightarrow k}^{\text{direct}}\]

et :

\[R_{i\rightarrow k}^{\text{composé}} R_{j\rightarrow k} \odot R_{i\rightarrow j}\]

L’écart :

\[\Delta_{ijk} \operatorname{Compare} \left( R_{i\rightarrow k}^{\text{direct}}, R_{i\rightarrow k}^{\text{composé}} \right)\]

mesure une cohérence de composition. Si :

\[\Delta_{ijk}=0\]

la composition est cohérente dans le cadre déclaré. Sinon, le système doit rechercher :

16.17.Relations non composables

Deux relations ne sont composables que si leurs signatures sont compatibles.

\[r_1 : A\rightarrow B\]
\[r_2 : B\rightarrow C\]

Alors :

\[r_2\circ r_1 : A\rightarrow C\]

Mais si :

\[r_1 : A\rightarrow B\]

et :

\[r_2 : D\rightarrow C\]

avec :

\[B\neq D\]

la composition n’est pas définie sans médiation. Le typage précède donc la composition.

16.18.Mesures relationnelles possibles

L’ÉTR n’impose pas une métrique universelle. Selon le référentiel, on peut utiliser :

La méthode doit appartenir au référentiel :

\[\rho_R\in\mathcal M_R\]

16.19.Relation sémantique explicite

Une relation sémantique peut être typée :

\[r ( \text{type}, \text{orientation}, \text{intensité}, \text{confiance} )\]

Exemple :

\[r ( \text{cause probable}, Q_i\rightarrow Q_j, 0{,}72, 0{,}63 )\]

Le type « cause probable » ne doit pas être confondu avec une simple proximité. Deux objets proches ne sont pas nécessairement causalement liés.

16.20.Relation sémantique issue d’un modèle

Un LLM ou un embedding peut proposer une relation :

\[\widetilde{\rho}_{\text{modèle}}(Q_i,Q_j)\]

Cette relation reste une estimation. Elle doit contenir :

L’ÉTR n’élève pas automatiquement une estimation de modèle au statut de relation validée.

16.21.Comparaison entre référentiels

Deux référentiels peuvent produire :

\[\rho_{R_1}(Q_i,Q_j)\]

et :

\[\rho_{R_2}(Q_i,Q_j)\]

Ces relations ne doivent pas être directement comparées si leurs codomaines diffèrent. Il faut une transformation :

\[T_{R_1\rightarrow R_2}^{\mathcal L}\]

ou un espace commun :

\[\mathcal L_{\text{commun}}\]

Sans cela, la comparaison inter-référentielle est indéfinie.

16.22.Référentiel désactivé

Lorsqu’un référentiel est désactivé :

\[\alpha_R=0\]

ses relations ne doivent plus contribuer au calcul courant. Les résultats antérieurs restent toutefois en mémoire :

\[\Omega \supset \rho_R^{(t-1)}\]

Le système doit distinguer :

16.23.Exemple documentaire

Requête : responsabilité d’un dirigeant en cas de faute de gestion Document (D_1) :

Document (D_2) :

Profils :

\[\rho(Q,D_1) ( 0{,}92, 0{,}35, 0{,}20 )\]
\[\rho(Q,D_2) ( 0{,}74, 0{,}91, 0{,}95 )\]

avec les dimensions :

\[( \text{proximité}, \text{récence}, \text{compatibilité juridique} )\]

Le document (D_1) n’est pas automatiquement préférable. Le routeur décidera selon le référentiel juridique.

16.24.Exemple Cercle

Une publication peut être comparée à une LOI selon :

\[\rho ( r_{\text{proximité}}, r_{\text{direction}}, r_{\text{nouveauté}}, r_{\text{compatibilité}} )\]

Dans le référentiel de proximité, le système privilégie :

\[r_{\text{proximité}}\]

Dans le référentiel d’exploration, il peut privilégier :

\[r_{\text{nouveauté}}\]

sous contrainte de :

\[r_{\text{compatibilité}} \geq \theta\]

Le profil ne change pas. La politique d’exploitation change.

16.25.Sortie de la comparaison

La sortie complète doit être :

\[\operatorname{RelationResult} ( \rho, R, \Pi, U, C, V )\]

où :

Cette sortie est transmise au routeur. Elle ne constitue pas encore une décision.

Conclusion du chapitre

Comparer dans l’ÉTR consiste à produire une relation typée entre des états comparables dans un référentiel déclaré. La relation peut être :

Le principe central est :

\[\text{Conserver le profil relationnel avant toute réduction décisionnelle.}\]

La comparaison décrit. L’agrégation compresse. Le routeur décidera. Le chapitre suivant peut donc traiter précisément le routeur, c’est-à-dire la transformation qui convertit un profil relationnel en orientation, sélection, abstention ou action proposée.

Chapitre 17 — La mémoire : conserver les états, les relations et leurs transformations

Dans l’ÉTR, la mémoire ne se réduit pas à un espace de stockage. Elle conserve :

Sa fonction centrale est la suivante :

\[\text{conserver non seulement ce qui a été produit, mais aussi comment et dans quel cadre cela a été produit}\]

17.1.Définition générale

La mémoire relationnelle est notée :

\[\Omega\]

Une forme minimale est :

\[\Omega ( V, E, \Gamma, \mathfrak R, \Pi )\]

où :

Cette mémoire est donc à la fois :

17.2.Mémoire de données et mémoire relationnelle

Une mémoire classique peut conserver :

\[x\]

ou :

\[(x,y)\]

Une mémoire relationnelle conserve plutôt :

\[(x,T,y,R,\Pi,U)\]

où :

Deux résultats identiques peuvent ainsi rester distincts s’ils ont été produits par des chemins différents.

17.3.Mémoire paramétrique, contextuelle et relationnelle

Ces trois formes doivent être distinguées. Mémoire paramétrique Elle est contenue dans les paramètres d’un modèle. Exemple :

\[\theta_{\text{LLM}}\]

Elle est :

Mémoire contextuelle Elle contient les informations disponibles durant l’inférence. Exemple :

\[C_t (t_1,\ldots,t_n)\]

Elle est :

Mémoire relationnelle Elle conserve explicitement :

\[\Omega_t ( \text{objets}, \text{relations}, \text{chemins}, \text{provenances} )\]

Elle est :

Ces mémoires peuvent coopérer sans être confondues.

17.4.Unité mémorielle minimale

Une unité mémorielle peut être définie par :

\[m ( id, x, Q, R, \Pi, U, t )\]

où :

Si l’état provient d’une transformation :

\[m' ( id', m, T, Q', \Pi_T, U_T, t' )\]

La mémoire conserve alors le lien entre les versions.

17.5.La mémoire comme graphe orienté

La mémoire peut être représentée par un graphe :

\[G_\Omega (V_\Omega,E_\Omega)\]

Les nœuds représentent :

Les arêtes représentent :

Exemple :

\[Q_1 \overset{T_{12}}{\longrightarrow} Q_2\]

La relation entre les deux états reste distincte du transport :

\[\rho(Q_1,Q_2) \neq T_{12}\]

sauf si le régime considéré les identifie explicitement.

17.6.Update

La mémoire évolue par une transformation déclarée :

\[\Omega_{t+1} \operatorname{Update} ( \Omega_t, \Delta_t )\]
où (\Delta_t) est la modification proposée.

Une forme plus développée est :

\[\operatorname{Update} : ( \Omega_t, Q, R, \Pi, D ) \mapsto \Omega_{t+1}\]

La mise à jour peut être déclenchée par :

17.7.Update ne signifie pas seulement ajouter

Une mise à jour peut produire plusieurs effets :

\[\Delta_t ( \Delta^+, \Delta^\sim, \Delta^-, \Delta^?, \Delta^! )\]

où :

L’ancienne information ne doit pas être effacée sans déclaration.

17.8.Mémoire croissante

Une mémoire croissante conserve l’histoire des transformations. Si :

\[Q_t \rightarrow Q_{t+1}\]

la mémoire garde :

\[(Q_t,T_{t\rightarrow t+1},Q_{t+1})\]

Elle ne remplace pas simplement :

\[Q_t\]

par :

\[Q_{t+1}\]

La croissance concerne donc la traçabilité, non l’accumulation aveugle. Une information peut devenir inactive tout en restant historiquement accessible.

17.9.État actif et état historique

La mémoire distingue :

\[Q^{\text{actif}}\]

de :

\[Q^{\text{historique}}\]

Un état historique peut être :

Mais il reste conservé avec son statut. Exemple :

\[Q_1 \overset{\text{corrigé par}}{\longrightarrow} Q_2\]

La mémoire doit permettre de comprendre pourquoi (Q_1) n’est plus actif.

17.10.Versionnement

Chaque objet mémorisé peut recevoir une suite de versions :

\[x^{(0)}, x^{(1)}, \ldots, x^{(n)}\]

avec :

\[x^{(k+1)} T_k(x^{(k)})\]

Le registre de version conserve :

Le dernier état n’annule pas l’histoire.

17.11.Provenance

La provenance est obligatoire.

\[\Pi ( \text{source}, \text{acteur}, \text{date}, \text{méthode}, \text{version}, \text{contexte} )\]

Une donnée sans provenance peut être stockée, mais elle ne doit pas être traitée comme équivalente à une donnée vérifiée. La mémoire doit distinguer :

\[\text{contenu}\]

de :

\[\text{qualité de provenance}\]

17.12.Provenance transitive

Lorsqu’une information traverse plusieurs agents ou modèles, la provenance ne doit pas être remplacée par celle du dernier intermédiaire. Si :

\[s \rightarrow a_1 \rightarrow a_2 \rightarrow a_3\]

la provenance finale doit conserver la chaîne :

\[\Pi_3 ( \Pi_s, T_1, T_2, T_3 )\]

Trois agents répétant la même source ne constituent pas trois sources indépendantes.

17.13.Contradictions

La mémoire peut contenir plusieurs assertions incompatibles.

\[r_1(x,y)\]

et :

\[\neg r_2(x,y)\]

Le système ne doit pas nécessairement supprimer immédiatement l’une d’elles. Il peut créer un objet conflit :

\[C ( r_1, r_2, \Pi_1, \Pi_2, U_1, U_2 )\]

Le conflit peut recevoir un statut :

17.14.Ne pas confondre contradiction et changement de référentiel

Deux relations peuvent diverger parce qu’elles appartiennent à deux référentiels différents :

\[\rho_{R_1}(x,y) \neq \rho_{R_2}(x,y)\]

Ce n’est pas nécessairement une contradiction. La contradiction n’existe que si les assertions sont incompatibles dans un même cadre de validité. Il faut donc comparer :

\[(R_1,\Pi_1,t_1)\]

et :

\[(R_2,\Pi_2,t_2)\]

avant de conclure à un conflit.

17.15.Mémoire et référentiels actifs

Chaque référentiel peut posséder une mémoire locale :

\[\Omega^{(R_i)}\]

La mémoire globale devient :

\[\Omega \bigcup_i \Omega^{(R_i)}\]

avec conservation des frontières entre référentiels. Lorsqu’un référentiel est désactivé :

\[\alpha_i=0\]

sa mémoire n’est pas supprimée. Elle cesse seulement d’alimenter le calcul courant.

17.16.Activation mémorielle

Une requête ne doit pas charger toute la mémoire. Une fonction d’activation sélectionne un sous-ensemble :

\[\Omega_t^{*} \operatorname{ActivateMemory} ( Q, R, G, C )\]

où :

La mémoire totale reste :

\[\Omega\]

mais seule une partie devient active :

\[\Omega_t^{*} \subseteq \Omega\]

17.17.Rappel et recherche

La mémoire peut être interrogée par :

Exemples :

\[\operatorname{RecallByRelation}(\rho)\]
\[\operatorname{RecallByPath}(\Gamma)\]
\[\operatorname{RecallByRef}(R)\]
\[\operatorname{RecallByTime}(t_0,t_1)\]

La recherche mémorielle n’est pas limitée à une similarité vectorielle.

17.18.Mémoire et Compose

Compose peut utiliser un état mémoriel :

\[Q_0 \operatorname{Recall}(\Omega,R,C)\]

puis construire :

\[Q_n \operatorname{Compose}(Q_0,\Gamma)\]

La mémoire influence donc l’état initial.

Mais Compose ne doit pas modifier automatiquement (\Omega).

La mise à jour reste une transformation distincte :

\[\Omega_{t+1} \operatorname{Update}(\Omega_t,Q_n)\]

17.19.Mémoire et qualification

Une qualification peut dépendre de la mémoire :

\[Q_{\text{qual}} \Lambda(Q_{\text{struct}},\Omega,R,\Pi)\]

Exemple : le terme « Java » peut être qualifié différemment selon que la mémoire active concerne :

La mémoire aide à sélectionner le référentiel et la qualification. Elle ne constitue pas une preuve de leur validité.

17.20.Mémoire et décision

Le routeur peut consulter :

\[\Omega_t^{*}\]

pour déterminer :

La décision devient :

\[D_t \operatorname{Router} ( \rho_t, R, \Omega_t^{*}, U_t )\]

Une mémoire inadéquate peut donc orienter une décision incorrecte. La sélection mémorielle doit elle aussi être traçable.

17.21.Écriture conditionnelle

Toute sortie ne doit pas nécessairement être inscrite en mémoire durable. Une condition d’écriture peut être définie :

\[\operatorname{WriteAllowed} ( Q, D, R, U, \Pi )\]

La mémoire peut refuser l’écriture lorsque :

17.22.Mémoire temporaire et durable

On distingue : Mémoire de travail

\[\Omega_{\text{court}}\]

Elle conserve les états nécessaires au calcul courant. Mémoire de session

\[\Omega_{\text{session}}\]

Elle persiste pendant une interaction ou une mission. Mémoire durable

\[\Omega_{\text{long}}\]

Elle conserve les objets validés au-delà de la session. Le passage de l’une à l’autre constitue une transformation :

\[\operatorname{Consolidate} : \Omega_{\text{court}} \rightarrow \Omega_{\text{long}}\]

Cette consolidation doit être contrôlée.

17.23.Oubli et suppression

Une mémoire rigoureuse doit permettre l’oubli. Mais plusieurs opérations doivent être distinguées. Désactivation

\[\operatorname{Deactivate}(m)\]

L’élément ne participe plus au calcul. Archivage

\[\operatorname{Archive}(m)\]

L’élément reste consultable historiquement. Suppression logique

\[\operatorname{DeleteLogical}(m)\]

L’élément devient inaccessible aux usages ordinaires. Suppression physique

\[\operatorname{DeletePhysical}(m)\]

Les données sont effectivement retirées. Ces opérations ne sont pas équivalentes.

17.24.Compression de mémoire

Une mémoire exhaustive devient coûteuse. Une opération de compression peut produire :

\[\Omega' \operatorname{Compress}(\Omega)\]

Elle peut :

Mais elle doit déclarer les informations devenues indéterminables. Une mémoire compressée ne doit pas être présentée comme identique à l’historique complet.

17.25.Prototype et membre réel

Un référentiel peut être représenté provisoirement par un prototype :

\[m_R \in \Omega\]

Ce prototype peut être :

Il sert à accélérer la comparaison. Mais il ne remplace pas l’ensemble des membres du référentiel.

\[m_R \neq R\]

Il constitue une lecture compacte du référentiel.

17.26.Mémoire non destructive

Une mise à jour non destructive conserve les états antérieurs.

\[\Omega_{t+1} \Omega_t \cup \Delta_t\]

Cette formule doit être nuancée : l’union ne suffit pas toujours, car certaines relations changent de statut. Une forme plus précise est :

\[\Omega_{t+1} \operatorname{VersionedMerge} ( \Omega_t, \Delta_t )\]

Le système ajoute les nouveaux objets et met à jour les statuts sans effacer l’histoire.

17.27.Validation d’Update

Une mise à jour est valide si :

\[\operatorname{ValidUpdate} ( \Omega_t, \Delta_t ) \text{vrai}\]

Les contrôles peuvent porter sur :

Si la mise à jour échoue :

\[\Omega_{t+1} \Omega_t\]

et le système conserve un rapport d’échec.

17.28.Transactions

Une mise à jour comportant plusieurs opérations doit être atomique lorsque cela est nécessaire.

\[\Delta_t (\delta_1,\delta_2,\ldots,\delta_n)\]

Deux résultats sont alors admissibles :

\[\text{toutes les opérations réussissent}\]

ou :

\[\text{aucune modification n’est appliquée}\]

Cette propriété évite les mémoires partiellement mises à jour.

17.29.Permissions

L’écriture peut dépendre de l’acteur :

\[\operatorname{Perm}(a,R)\]

Les droits peuvent inclure :

Un LLM peut proposer une mise à jour sans avoir le droit de la consolider.

17.30.Exemple documentaire

Un article affirme : Le procédé réduit la consommation de 30 %. La mémoire conserve :

\[Q_1 \text{réduction annoncée de 30 %}\]

avec :

\[\Pi_1 \text{article source}\]

Une étude ultérieure mesure :

\[Q_2 \text{réduction observée de 12 %}\]

La mémoire ne remplace pas simplement (30%) par (12%). Elle conserve :

\[Q_1 \overset{\text{contesté par}}{\longrightarrow} Q_2\]

avec les protocoles, dates et incertitudes correspondants.

17.31.Exemple pour Cercle

Pour un utilisateur, la mémoire peut conserver :

On peut écrire :

\[\Omega_u ( \Gamma_u, R_u, P_u, \Pi_u )\]

Le système ne conserve pas seulement les contenus aimés. Il conserve les chemins relationnels ayant conduit à leur activation.

17.32.Changement de référentiel et mémoire

Lorsqu’un référentiel change :

\[R_i \rightarrow R_j\]

la mémoire doit conserver :

\[\Pi_{\text{switch}} ( R_i, R_j, \text{cause}, \text{temps}, \text{acteur} )\]

Les états du référentiel précédent restent disponibles :

\[\Omega^{(R_i)}\]

mais cessent d’être actifs si :

\[\alpha_i=0\]

Les nouveaux états sont recalculés ou transportés dans :

\[\Omega^{(R_j)}\]

17.33.Sortie d’Update

La sortie complète d’une mise à jour est :

\[\operatorname{UpdateResult} ( \Omega_{t+1}, \Delta_{\text{appliqué}}, \Delta_{\text{refusé}}, C, \Pi, V )\]

où :

Conclusion du chapitre

La mémoire de l’ÉTR n’est pas un simple réservoir de données. Elle conserve :

\[\text{les états, les relations, les transformations et l’histoire de leurs changements}\]

Sa transformation centrale est :

\[\Omega_{t+1} \operatorname{Update} ( \Omega_t, \Delta_t )\]

Toute mise à jour doit préciser :

La mémoire permet ainsi au système de ne pas seulement produire des décisions, mais d’apprendre sans effacer les conditions de cet apprentissage.

Chapitre 18 — Le routeur : transformer un profil relationnel en décision

La comparaison produit une relation. Le routeur détermine ce qu’il faut en faire. Cette distinction est fondamentale :

\[\text{La relation décrit ; le routeur décide.}\]

Une forte proximité, une forte cohérence ou une forte distance ne constituent pas encore une décision. Le routeur applique une politique déclarée à un profil relationnel, dans un référentiel donné, avec des contraintes, une mémoire et un niveau de risque.

18.1.Définition générale

Le routeur est une transformation :

\[\operatorname{Router} : ( \mathcal L_R, R, \Omega, C, U ) \rightarrow \mathcal D_R\]

où :

La forme opérationnelle est :

\[D \operatorname{Router} ( \rho, R, \Omega, C, U )\]

18.2.Entrée du routeur

Le routeur ne doit pas recevoir uniquement un score.

Il reçoit idéalement un objet complet :

\[\operatorname{RelationResult} ( \rho, R, \Pi, U, C_{\text{comp}}, V )\]

avec :

Le routeur doit donc pouvoir refuser de décider si l’entrée est insuffisante.

18.3.La décision n’est pas contenue dans la relation

Supposons :

\[\rho_{\text{proximité}}=0{,}91\]

Cette valeur peut conduire à plusieurs décisions. Dans un moteur de recherche :

\[D=\text{afficher}\]

Dans un moteur d’exploration :

\[D=\text{écarter pour éviter la redondance}\]

Dans un système de détection de fraude :

\[D=\text{signaler comme duplication potentielle}\]

La relation reste identique. Le référentiel et l’objectif changent.

18.4.Décisions admissibles

Le routeur peut produire :

\[D \in { \text{accepter}, \text{refuser}, \text{classer}, \text{sélectionner}, \text{différer}, \text{vérifier}, \text{explorer}, \text{rediriger}, \text{s’abstenir} }\]

Selon l’application, il peut aussi produire :

18.5.Politique de routage

Le routeur applique une politique :

\[\pi_R\]

On écrit :

\[D \pi_R( \rho, \Omega, C, U )\]

La politique doit être distincte du référentiel, même si elle lui est rattachée. Le référentiel définit :

La politique définit :

18.6.Routeur déterministe

Un routeur déterministe produit toujours la même décision pour les mêmes entrées.

\[\operatorname{Router}(x)=D\]

Exemple :

\[r_{\text{sécurité}}<\theta \Rightarrow D=\text{refus}\]

Avantages :

Limite :

18.7.Routeur probabiliste

Un routeur probabiliste produit une distribution :

\[P(D\mid\rho,R,\Omega,C)\]

puis sélectionne :

\[D\sim P\]

Ce régime peut être utile pour :

Mais la probabilité de décision ne doit pas être confondue avec la confiance dans la relation.

18.8.Routeur par règles

Une politique peut être décrite par des règles. Exemple :

\[\begin{cases} r_{\text{compatibilité}}<0{,}4 &\Rightarrow \text{refus}\ r_{\text{fiabilité}}<0{,}6 &\Rightarrow \text{vérification}\ r_{\text{proximité}}>0{,}8 &\Rightarrow \text{sélection}\ \text{sinon} &\Rightarrow \text{exploration} \end{cases}\]

Les règles doivent être :

18.9.Routeur multi-signal

Le routeur peut utiliser plusieurs dimensions :

\[\rho ( r_1, r_2, \ldots, r_n )\]

Il peut appliquer :

\[D \operatorname{Policy} ( r_{\text{proximité}}, r_{\text{cohérence}}, r_{\text{fiabilité}}, r_{\text{nouveauté}}, r_{\text{risque}} )\]

Le routeur ne doit pas obligatoirement réduire ces signaux en une moyenne unique. Il peut conserver des règles conditionnelles.

18.10.Contraintes dures

Certaines conditions interdisent une décision.

\[c_j(\rho,R,\Omega) \in { \text{vrai}, \text{faux} }\]

La validité est :

\[\operatorname{Valid} \bigwedge_j c_j\]

Si :

\[\operatorname{Valid} \text{faux}\]

le routeur ne doit pas compenser ce résultat par d’autres signaux favorables. Exemple :

\[r_{\text{sécurité}}=\text{échec}\]

implique :

\[D=\text{refus}\]

même si :

\[r_{\text{proximité}}\]

est élevé.

18.11.Seuils

Un seuil transforme une mesure continue en décision discrète.

\[r\geq\theta \Rightarrow D_1\]
\[r<\theta \Rightarrow D_2\]

Le seuil doit être déclaré avec :

Un seuil arbitraire ne constitue pas une politique scientifique.

18.12.Zone d’incertitude

Un système rigoureux peut définir une zone intermédiaire :

\[\theta_1 < r < \theta_2\]

Dans cette zone :

\[D=\text{vérification}\]

Ainsi, le routeur ne force pas une décision binaire lorsque la relation est ambiguë.

18.13.Abstention

L’abstention est une décision valide.

\[D=\operatorname{ABSTAIN}\]

Elle peut être produite lorsque :

L’abstention protège le système contre la décision forcée.

18.14.Vérification

Le routeur peut produire :

\[D=\operatorname{VERIFY}\]

Cette décision peut déclencher :

Le routeur devient alors un orchestrateur.

18.15.Sélection d’un référentiel

Le routeur peut décider que le référentiel actuel n’est pas adapté.

\[D \operatorname{SwitchRef}(R_i,R_j)\]

Cette décision doit déclarer :

Le changement de référentiel ne doit pas être implicite.

18.16.Sélection d’un agent

Dans un système multi-agent :

\[D \operatorname{RouteTo}(a_i)\]

Le choix peut dépendre de :

\[( \text{compétence}, \text{coût}, \text{disponibilité}, \text{confiance}, \text{permission} )\]

Le routeur ne choisit donc pas seulement une réponse. Il peut choisir le producteur de la prochaine transformation.

18.17.Décision et action

Une décision n’est pas nécessairement une action.

\[D \neq A\]

La décision doit parfois être compilée :

\[A \operatorname{Compile}(D,R,C)\]

Exemple :

\[D=\text{ralentir}\]

doit devenir :

\[A=\text{commande moteur précise}\]

La compilation possède son propre contrat.

18.18.Validation humaine

Dans un système sensible :

\[D_{\text{IA}} \rightarrow V_{\text{humain}} \rightarrow A\]

Le routeur peut produire :

\[D=\text{proposition soumise à validation}\]

L’humain reste l’autorité finale. Cette séparation est importante en :

18.19.Routeur et mémoire

Le routeur peut consulter :

\[\Omega^* \subseteq \Omega\]

afin d’utiliser :

La décision devient :

\[D_t \operatorname{Router} ( \rho_t, R, \Omega_t^*, C, U )\]

La mémoire activée doit être enregistrée dans la provenance.

18.20.Routeur sans mise à jour implicite

Le routeur produit une décision. Il ne doit pas modifier directement la mémoire sauf si cette fonction est explicitement déclarée. Régime séparé :

\[D_t \operatorname{Router}(\cdots)\]

puis :

\[\Omega_{t+1} \operatorname{Update}( \Omega_t, D_t )\]

Cette séparation permet de contrôler l’écriture.

18.21.Routeur hiérarchique

Plusieurs routeurs peuvent être organisés en niveaux.

\[R_1 \rightarrow R_2 \rightarrow R_3\]

Exemple : . routeur de sécurité ;

. routeur de domaine ;

. routeur de pertinence ;

. routeur d’action.

Le premier peut bloquer les suivants.

\[D_{\text{sécurité}}=\text{refus} \Rightarrow \text{arrêt}\]

Cette architecture évite qu’une décision commerciale compense une contrainte de sécurité.

18.22.Routeur parallèle

Plusieurs politiques peuvent produire des décisions :

\[D_1, D_2, \ldots, D_n\]

Un arbitre produit :

\[D^* \operatorname{Arbitrate} ( D_1,\ldots,D_n )\]

Cette architecture permet de comparer :

Les divergences doivent être conservées.

18.23.Conflit de décisions

Si :

\[D^{(R_1)} \neq D^{(R_2)}\]

le système crée un conflit :

\[C_D ( D^{(R_1)}, D^{(R_2)}, R_1, R_2, \Pi )\]

Le conflit peut être :

Le routeur ne doit pas masquer cette divergence par une moyenne.

18.24.Priorité

Une politique peut définir une relation de priorité :

\[R_{\text{sécurité}} \succ R_{\text{performance}}\]

Cela signifie que la sécurité domine la performance en cas de conflit. La priorité doit être :

18.25.Coût

Une décision peut être évaluée par son coût :

\[C(D)\]

Le routeur peut chercher :

\[D^* \arg\min_D C(D)\]

sous contraintes :

\[\operatorname{Valid}(D)=\text{vrai}\]

Le coût peut inclure :

18.26.Utilité

Une politique peut utiliser une fonction d’utilité :

\[U(D\mid R,G)\]

et choisir :

\[D^* \arg\max_D U(D\mid R,G)\]

Mais la fonction d’utilité doit être distincte de l’incertitude (U). La notation doit éviter toute ambiguïté.

18.27.Exploration et exploitation

Le routeur peut arbitrer entre : Exploitation Choisir l’option la plus proche ou la plus performante connue. Exploration Choisir une option plus distante pour acquérir de l’information ou diversifier. Une politique simple peut être :

\[D \begin{cases} \text{exploitation} & \text{avec probabilité }1-\varepsilon\ \text{exploration} & \text{avec probabilité }\varepsilon \end{cases}\]

Dans l’ÉTR, la distance exploratoire peut être contrainte par un référentiel actif.

18.28.Exemple documentaire

Profil :

\[\rho ( 0{,}88, 0{,}93, 0{,}41 )\]

avec :

\[( \text{proximité}, \text{compatibilité juridique}, \text{fiabilité} )\]

Politique :

\[r_{\text{compatibilité}}\geq0{,}8\]

mais :

\[r_{\text{fiabilité}}<0{,}6\]

Décision :

\[D=\text{vérification de la source}\]

Le document n’est ni accepté ni rejeté immédiatement.

18.29.Exemple pour Cercle

Profil d’une publication :

\[\rho ( r_{\text{proximité}}, r_{\text{nouveauté}}, r_{\text{compatibilité}}, r_{\text{risque}} )\]

Dans le référentiel de proximité :

\[D=\text{afficher}\]

si :

\[r_{\text{proximité}}\geq\theta_p\]

Dans le référentiel d’exploration :

\[D=\text{afficher}\]

si :

\[r_{\text{nouveauté}}\geq\theta_n\]

et :

\[r_{\text{compatibilité}}\geq\theta_c\]

Le même profil peut donc être exploité différemment.

18.30.Exemple robotique

Un robot détecte un obstacle. Profil :

\[\rho ( \text{distance}, \text{vitesse relative}, \text{confiance capteur}, \text{risque collision} )\]

Le routeur peut produire :

\[D= \begin{cases} \text{continuer} & r_{\text{risque}}<\theta_1\ \text{ralentir} & \theta_1\leq r_{\text{risque}}<\theta_2\ \text{arrêt} & r_{\text{risque}}\geq\theta_2 \end{cases}\]

La décision est ensuite compilée en commande.

18.31.Provenance de la décision

Toute décision doit conserver :

\[\Pi_D ( \rho, R, \pi_R, \Omega^*, C, U, t )\]

Le système doit pouvoir répondre :

18.32.Explication de décision

Une explication peut être produite à partir du registre :

\[E_D \operatorname{Explain}(\Pi_D)\]

Cette explication repose sur les transformations enregistrées. Elle ne doit pas être remplacée par une justification générée sans accès aux causes effectives. Un LLM peut formuler l’explication, mais le contenu doit venir du registre décisionnel.

18.33.Test du routeur

Le routeur doit être testé sur :

On vérifie notamment :

\[\operatorname{Router}(x)=D\]

et :

\[\operatorname{Router}(x')=D'\]

pour de faibles variations de (x). Une forte instabilité doit être mesurée.

18.34.Sortie du routeur

La sortie complète est :

\[\operatorname{RouterResult} ( D, R, \pi_R, C, U, \Pi, V )\]

où :

Conclusion du chapitre

Le routeur transforme un profil relationnel en décision. Sa forme générale est :

\[D \operatorname{Router} ( \rho, R, \Omega, C, U )\]

Il ne crée pas la relation. Il ne doit pas modifier implicitement la mémoire. Il applique une politique déclarée à des relations déjà calculées. Le routeur permet ainsi de séparer :

\[\text{ce que le système observe} \neq \text{ce qu’il décide} \neq \text{ce qu’il exécute}\]

Cette séparation rend possible :

Je pense que c'est effectivement le chapitre central du livre. En prenant du recul sur tout ce que nous avons écrit, je dirais même ceci : Compose est le cœur mécanique de l'ÉTR. La Qualification est son cœur cognitif. C'est probablement ici que l'ÉTR se différencie le plus des architectures actuelles. Les LLM produisent directement une interprétation. Dans l'ÉTR, l'interprétation devient une transformation explicite, avec un contrat, une provenance et une possibilité d'audit. Je proposerais donc de traiter ce chapitre comme un véritable pilier du livre.

Chapitre XIX — La Qualification De la structure à la connaissance

19.1.Pourquoi Compose ne suffit pas

Compose construit un état. Il ne lui attribue pas encore de signification. Considérons la phrase : Le Jaguar accélère rapidement. Après lecture et Compose, le système connaît :

Mais une question demeure ouverte : De quel « Jaguar » s'agit-il ?

La structure est correcte. L'interprétation reste ouverte. C'est précisément le rôle de la qualification.

19.2.Définition

La qualification transforme un état structurel en un état interprété relativement à un référentiel.

\[\Lambda : (Q_{\mathrm{struct}},R,\Omega,C) \longrightarrow Q_{\mathrm{qual}}\]

où :

Contrairement à Compose, la qualification n'est pas universelle. Elle dépend du cadre choisi.

19.3.La qualification n'est pas une vérité

Une qualification ne transforme jamais une hypothèse en vérité. Elle exprime : l'interprétation actuellement la plus cohérente avec le référentiel actif. Autrement dit,

\[Q_{\mathrm{qual}} \neq \text{vérité}\]

mais :

\[Q_{\mathrm{qual}} \text{interprétation déclarée}\]

Cette distinction protège le système contre les affirmations implicites.

19.4.Les quatre piliers de la qualification

Toute qualification repose simultanément sur quatre éléments. La structure Ce que Compose a effectivement construit.

Le référentiel Le domaine dans lequel cette structure est lue.

La mémoire Les connaissances déjà disponibles.

Le contexte L'objectif poursuivi au moment de l'interprétation. Une modification de l'un de ces quatre éléments peut conduire à une qualification différente.

19.5.Une même structure, plusieurs qualifications

Considérons : Le Jaguar accélère rapidement. Structure :

\[Q_{\mathrm{struct}}\]

Référentiel automobile :

\[\Lambda_{\mathrm{auto}} (Q_{\mathrm{struct}}) \text{véhicule}\]

Référentiel zoologique :

\[\Lambda_{\mathrm{zoo}} (Q_{\mathrm{struct}}) \text{félin}\]

La structure est identique. La qualification change.

19.6.Les familles de qualification

L'ÉTR ne limite pas la qualification au langage. Elle peut être :

Chaque famille possède son propre référentiel.

19.7.Qualification hiérarchique

Une qualification peut être construite progressivement. Mot ↓ expression ↓ phrase ↓ document ↓ raisonnement ↓ décision Chaque niveau enrichit le précédent sans le remplacer.

19.8.Qualification locale et globale

Une structure peut recevoir : une qualification locale :

\[\Lambda_{\mathrm{local}}\]

puis une qualification globale :

\[\Lambda_{\mathrm{global}}\]

Par exemple : chaque phrase d'un document est qualifiée individuellement, puis l'ensemble du document reçoit une qualification globale. Les deux niveaux ne doivent pas être confondus.

19.9.Qualification et mémoire

La mémoire influence la qualification. Mais elle ne doit jamais la déterminer automatiquement. Deux mémoires différentes peuvent produire deux qualifications différentes. La mémoire éclaire. Elle ne démontre pas.

19.10.Qualification et intelligence artificielle

Un modèle d'IA peut produire une qualification. Par exemple :

\[Q_{\mathrm{qual}} \Lambda_{\mathrm{LLM}} (Q_{\mathrm{struct}})\]

Dans l'ÉTR, cette sortie possède un statut précis : proposition de qualification. Elle doit pouvoir être :

Le modèle n'est donc plus le détenteur de la connaissance. Il devient un producteur d'hypothèses.

19.11.Qualification humaine

Le même mécanisme vaut pour un expert.

Une qualification humaine possède également :

L'ÉTR place donc humain et IA sur un même plan méthodologique. La différence réside dans leur provenance, non dans leur statut logique.

19.12.Qualification collective

Plusieurs qualifications peuvent coexister. Le système peut conserver :

\[{ \Lambda_1, \Lambda_2, \Lambda_3 }\]

sans les fusionner immédiatement. Il devient possible :

19.13.Qualification et incertitude

Toute qualification devrait être accompagnée de son niveau d'incertitude. Cette incertitude peut provenir :

Ainsi :

\[Q_{\mathrm{qual}} (\Lambda,U,\Pi)\]

La qualification devient un objet pleinement traçable.

19.14.Qualification et évolution

Une qualification peut évoluer. La structure initiale peut rester inchangée. La mémoire peut évoluer. Le référentiel peut évoluer. Le contexte peut évoluer. L'ÉTR autorise donc :

\[\Lambda_t(Q) \neq \Lambda_{t+1}(Q)\]

sans considérer cette évolution comme une erreur.

19.15.Contrat de qualification

Toute qualification devrait déclarer :

Ainsi, une qualification devient une transformation scientifique à part entière.

19.16.Une architecture ouverte

L'un des apports majeurs de l'ÉTR est de considérer que la qualification n'appartient à aucune technologie particulière. Elle peut être produite par :

Tous deviennent des moteurs de qualification, insérés dans une architecture commune. Le noyau de l'ÉTR reste inchangé.

Conclusion

Compose construit une structure. La qualification lui attribue une interprétation. La relation compare ces interprétations. Le routeur choisit une orientation. La mémoire conserve leur histoire. Cette séparation constitue l'un des principes fondateurs de l'ÉTR :

\[\text{Une connaissance n'est pas la structure d'un objet ; elle peut-être un référentiel organisé, représentation implicite des relations de celui-ci et elle est la qualification de cette structure dans un référentiel déclaré. la connaissance n'est plus un résultat implicite d'un modèle, mais une transformation explicite, traçable, révisable et contextualisée}\]

Chapitre XX — Validation scientifique, technique et protocoles d’évaluation De la proposition à l’épreuve Depuis le début de cet ouvrage, l’ÉTR a été présentée à travers ses objets fondamentaux : la lecture, Compose, les référentiels, la qualification, les

relations, la mémoire et le routeur. Ces objets ont été distingués, définis, articulés et rapportés aux fonctions qu’ils rendent possibles. Cette construction théorique ne suffit cependant pas à établir leur validité. Une architecture ne devient pas scientifique parce qu’elle possède un vocabulaire cohérent, parce qu’elle peut être implémentée ou parce qu’elle produit quelques résultats favorables. Elle devient scientifiquement examinable lorsque les affirmations qui la composent sont suffisamment précises pour être confrontées à des observations, à des démonstrations ou à des contre-exemples susceptibles de les soutenir, de les limiter, de les réviser ou de les contredire. La question :

\[\text{L’ÉTR fonctionne-t-elle ?}\]

est donc trop générale pour recevoir une réponse scientifique. Elle réunit sous une même formulation plusieurs problèmes distincts. Les objets de l’ÉTR sont-ils définis sans ambiguïté ? Les transformations qui leur sont attribuées respectent-elles les propriétés annoncées ? Les algorithmes proposés réalisent-ils effectivement ces transformations ? Le logiciel implémente-t-il fidèlement les algorithmes décrits ? Les performances observées proviennent-elles des mécanismes revendiqués ? Ces performances demeurent-elles lorsque les données, les référentiels, les paramètres ou les contraintes changent ? L’architecture répond-elle à un besoin réel ? Peut-elle être qualifiée pour un domaine d’usage déterminé ? Ces interrogations sont nécessaires, mais elles ne doivent pas rester suspendues dans le texte. Chacune doit être transformée en une affirmation localisée, puis reliée à un protocole définissant l’objet éprouvé, la portée de la proposition, les conditions expérimentales, les mesures effectuées, les traces conservées et les résultats susceptibles d’en modifier le statut. La structure méthodologique du chapitre peut ainsi être résumée par la chaîne suivante :

\[\mathcal C \overset{\mathcal P}{\longrightarrow} \mathcal D_{\mathrm{preuve}} \longrightarrow \operatorname{Stat}(\mathcal C)\]

où :

éprouvée ;

par cette épreuve ;

à l’affirmation au regard des éléments disponibles. Cette chaîne exprime la thèse centrale du chapitre : un protocole ne valide pas une architecture ; il produit des éléments de preuve qui modifient le statut d’une affirmation déterminée. Le présent chapitre ne cherchera donc pas à démontrer par avance que l’ÉTR est supérieure aux architectures existantes. Il établira les conditions dans lesquelles une telle affirmation — ou toute autre affirmation portant sur l’ÉTR — pourrait être scientifiquement évaluée. Cette posture produit une conséquence plus générale. Les principes formulés ici ne sont pas exclusivement applicables à l’ÉTR. Ils peuvent également servir à examiner un Transformer, un réseau convolutif, un réseau de neurones sur graphes, un moteur documentaire, un système multi-agent ou toute autre architecture computationnelle. Le chapitre atteint ainsi la frontière entre deux entreprises : le traité particulier de l’ÉTR et une théorie générale de l’évaluation des architectures computationnelles. Cette frontière doit être rendue visible, mais non entièrement franchie. L’objet demeure ici la validation de l’ÉTR.

20.1.Une architecture ne se valide pas en bloc

Une architecture contient plusieurs catégories d’affirmations. Certaines portent sur l’existence, la définition ou la distinction d’un objet. D’autres décrivent une propriété mathématique, une relation causale, une capacité algorithmique, une conformité logicielle, une performance expérimentale, une aptitude applicative ou une condition de qualification. Ces affirmations n’ont pas le même statut. Elles ne peuvent donc pas être établies par les mêmes moyens. Une preuve mathématique peut montrer qu’une transformation conserve un invariant sous des hypothèses déterminées. Elle ne démontre pas que le programme censé appliquer cette transformation est exempt d’erreur. Une suite de tests peut établir qu’un programme respecte sa spécification sur un ensemble de situations. Elle ne démontre pas que cette spécification décrit correctement le problème réel auquel le système est destiné.

Une expérience favorable peut montrer une amélioration sur un jeu de données. Elle ne démontre pas que cette amélioration provient du mécanisme théorique avancé. Une réplication indépendante peut renforcer la confiance dans un phénomène empirique. Elle ne transforme pas ce phénomène en théorème. Une conformité réglementaire peut autoriser ou encadrer un usage. Elle ne démontre ni la cohérence scientifique de l’architecture ni la justesse de ses résultats. Il faut donc renoncer à la formulation générale :

\[\text{l’architecture est validée}\]

et lui substituer des propositions localisées :

\[\text{la propriété } P \text{ de l’objet } O \text{ est soutenue dans la portée } \Sigma, \text{ sous les hypothèses } H, \text{ selon la méthode } \mu.\]

Une validation ne porte jamais sur l’architecture entière indépendamment de ses conditions. Elle porte sur une affirmation déterminée, concernant une définition, une famille algorithmique, une implémentation, une version ou une expérience déterminée, dans un domaine et une portée explicitement déclarés. L’ÉTR doit donc être considérée non comme un bloc à défendre ou à rejeter, mais comme un système d’affirmations localisées, interdépendantes et révisables. Une contradiction affectant une affirmation ne réfute pas nécessairement l’ensemble du système. Inversement, la confirmation d’une propriété particulière ne valide pas automatiquement toutes les autres. La première fonction d’une architecture scientifique de la preuve consiste précisément à déterminer ce qui est atteint lorsqu’un résultat change.

20.2.La grammaire normative de l’affirmation scientifique

Toute affirmation portant sur une architecture doit pouvoir être représentée par une structure minimale :

\[\mathcal C (O,\ P,\ \Sigma,\ H,\ \mu,\ A,\ F)\]

où :

l’affirmation ;

la limiter ou d’imposer sa révision. Cette écriture n’est pas une notation décorative. Elle constitue une discipline de formulation. Dire que « l’ÉTR est plus robuste » ne précise ni l’objet concerné, ni le type de perturbation auquel la robustesse se rapporte, ni la métrique retenue, ni le système de comparaison, ni l’amplitude de variation considérée comme acceptable. Une affirmation exploitable serait plus précisément formulée ainsi : Dans un environnement où les données, le référentiel, les paramètres, la version logicielle et les sources d’aléa restent constants, deux exécutions déterministes de la même chaîne de qualification doivent produire une structure relationnelle identique, à la tolérance numérique préalablement déclarée. L’objet est identifié. La propriété est localisée. Les hypothèses sont explicites. La méthode d’épreuve peut être construite. Un résultat incompatible peut être reconnu. L’affirmation entre alors dans le domaine de l’épreuve scientifique. La grammaire impose également de distinguer plusieurs propositions souvent confondues :

\[\begin{aligned} \mathcal C_1 &: \text{Compose est défini comme conservant l’ordre},\ \mathcal C_2 &: \text{un algorithme donné conserve l’ordre},\ \mathcal C_3 &: \text{une implémentation donnée conserve l’ordre},\ \mathcal C_4 &: \text{l’ordre a été conservé dans une expérience donnée}. \end{aligned}\]

Ces affirmations peuvent être liées, mais elles ne sont pas interchangeables.

Une démonstration de (\mathcal C_1) ne suffit pas à établir (\mathcal
C_3). Une observation compatible avec (\mathcal C_4) ne suffit pas à
établir (\mathcal C_1) pour toutes les entrées admissibles.

Encadré — Les deux grammaires de la preuve

La grammaire (\mathcal C) décrit ce qui est affirmé.
La grammaire (\mathcal P), définie plus loin, décrit comment cette

affirmation est éprouvée. Leur séparation empêche qu’une expérience soit confondue avec la proposition qu’elle examine. Une même affirmation peut être soumise à plusieurs protocoles indépendants. Un même protocole peut également produire des éléments de preuve concernant plusieurs affirmations distinctes.

20.3.La portée scientifique d’une affirmation

Le domaine d’une affirmation ne suffit pas à en déterminer la signification. Deux propositions peuvent concerner le même domaine tout en possédant des extensions scientifiques très différentes. Considérons l’énoncé :

\[\text{Compose conserve l’ordre.}\]

Cette proposition peut signifier : . que l’ordre est conservé par la définition abstraite de Compose ; . qu’il est conservé par tout algorithme conforme à cette définition ; . qu’il est conservé par une implémentation particulière ; . qu’il a été conservé dans une version déterminée du logiciel ; . qu’il a été conservé dans les expériences effectivement réalisées ; . qu’il est conservé seulement pour certaines catégories d’entrées ; . qu’il est conservé exactement ou seulement à une tolérance donnée. Ces formulations ne sont pas équivalentes. La portée scientifique peut être représentée par :

\[\Sigma (D,\ \mathscr P,\ G,\ \varepsilon)\]

où :

d’approximation associé à la proposition.

La portée (\mathscr P) peut notamment distinguer :
\[\mathscr P \in { \text{définition}, \text{famille algorithmique}, \text{algorithme}, \text{implémentation}, \text{version}, \text{configuration}, \text{expérience} }.\]

Le degré de généralité (G) indique si la proposition vaut :

La précision (\varepsilon) indique si la propriété est :

Une affirmation ne doit jamais être étendue au-delà de la portée réellement examinée.

Un résultat obtenu sur une implémentation ne démontre pas automatiquement une propriété de toutes les implémentations possibles. Une expérience conduite sur un domaine restreint ne démontre pas une propriété universelle. Une stabilité observée à une certaine tolérance ne doit pas être transformée en égalité exacte. La portée n’est donc pas une réserve ajoutée après la conclusion. Elle constitue une partie de la conclusion elle-même. Une conclusion scientifique complète ne dit pas seulement ce qui est soutenu. Elle dit jusqu’où cela l’est.

20.4.Les dimensions du statut scientifique

La validation ne doit pas être réduite à une opposition entre trois états :

\[\text{validé}, \qquad \text{réfuté}, \qquad \text{indéterminé}.\]

La pratique scientifique produit des statuts plus nuancés. Mais ces statuts ne doivent pas davantage être disposés sur une échelle unique. Une propriété formellement démontrée et un phénomène empiriquement répliqué ne relèvent pas du même axe. Une démonstration mathématique peut être complète sans qu’aucune implémentation n’ait encore été testée. À l’inverse, un phénomène peut être empiriquement robuste sans disposer d’une démonstration formelle générale. Le statut d’une affirmation doit donc être décrit par plusieurs dimensions. On pourra écrire :

\[\operatorname{Stat}(\mathcal C) \bigl( \operatorname{Stat}{\mathrm{formel}}, \operatorname{Stat}{\mathrm{impl}}, \operatorname{Stat}{\mathrm{emp}}, \operatorname{Stat}{\mathrm{usage}} \bigr)\]

où :

conceptuelle ou mathématique ;

algorithmique et logicielle ;

expérimental ;

applicative et de qualification.

20.4.1.Statut formel

Le statut formel peut être décrit par :

\[\operatorname{Stat}_{\mathrm{formel}}(\mathcal C) \in { \mathrm{NF}, \mathrm{Conj}, \mathrm{Part}, \mathrm{Étab} }\]

avec :

20.4.2.Statut d’implémentation

Le statut d’implémentation peut être décrit par :

\[\operatorname{Stat}_{\mathrm{impl}}(\mathcal C) \in { \mathrm{NI}, \mathrm{Proto}, \mathrm{Conf}, \mathrm{Vér} }\]

avec :

moyens déclarés.

20.4.3.Statut empirique

Le statut empirique peut être décrit par :

\[\operatorname{Stat}_{\mathrm{emp}}(\mathcal C) \in { \mathrm H,\mathrm O,\mathrm S,\mathrm{Re},\mathrm{Rp} }\]

avec :

  Symbole                 Statut                   Signification
 (\mathrm H)              Hypothèse empirique      La proposition est
formulée, mais ne
dispose pas encore
d’une épreuve
suffisante.
 (\mathrm O)              Observation              Le phénomène a été
constaté dans une
situation déterminée.
 (\mathrm S)              Résultat soutenu         Un protocole défini
produit des
observations
compatibles avec
l’affirmation.
 (\mathrm{Re})            Résultat reproduit       Le résultat est
retrouvé avec le même
protocole et des
conditions
équivalentes.
 (\mathrm{Rp})            Résultat répliqué        Un résultat compatible
est obtenu
indépendamment,
avec d’autres
données, une autre
équipe ou une autre
implémentation.

20.4.4.Statut d’usage

Le statut d’usage peut enfin distinguer :

\[\operatorname{Stat}_{\mathrm{usage}}(\mathcal C) \in { \mathrm{NE}, \mathrm{Pilote}, \mathrm{ValApp}, \mathrm{Qual} }\]

avec :

déterminées ;

Ces dimensions ne forment pas une progression automatique. Une propriété peut être formellement établie, correctement implémentée, empiriquement soutenue, mais non encore répliquée. Elle peut être techniquement robuste sans être qualifiée pour un usage sensible. Elle peut être applicativement utile alors que son explication théorique demeure partielle. Le terme « établi » ne signifie jamais « vrai sans condition ». Il signifie : suffisamment établi pour la portée, les hypothèses, la méthode et le niveau de précision déclarés. Le statut scientifique demeure révisable. Un nouveau résultat peut augmenter ou diminuer le niveau de confiance associé à une affirmation. Il peut également modifier une seule dimension de son statut sans affecter les autres. La confiance scientifique n’est donc pas un label irréversible. Elle est l’état provisoire d’un dossier de preuve.

20.5.La grammaire du protocole

À la grammaire de l’affirmation répond une grammaire du protocole :

\[\mathcal P (I,\ V,\ C,\ \mathscr E,\ B,\ \mathcal M,\ \tau,\ F,\ T)\]

où :

de comparaison ;

d’inconclusion ;

contestation. Une expérience n’est donc pas définie uniquement par les données qu’elle utilise et le score qu’elle produit. Elle doit indiquer quelle version de l’architecture a été examinée, quelles ressources lui ont été attribuées, quelles variations ont été autorisées, quelles configurations ont servi de contrôle, quelles mesures ont été retenues et comment un résultat contraire sera interprété. Les critères d’interprétation doivent être déterminés avant l’analyse finale. Une métrique ajoutée après l’observation des résultats, un seuil déplacé afin de préserver une hypothèse ou une exclusion décidée parce qu’un cas contredit la tendance initiale ne possèdent pas le même statut qu’une procédure préalablement définie. Toute modification du protocole demeure possible. Elle doit cependant être enregistrée comme une déviation, justifiée et distinguée du protocole initial. Le protocole doit également préciser ce qu’il n’est pas capable d’établir. Cette exigence est essentielle. Une expérience consacrée à la stabilité numérique ne peut pas, à elle seule, conclure sur la pertinence sémantique du système. Un protocole de performance applicative ne démontre pas automatiquement l’existence du mécanisme causal revendiqué. La validité d’un protocole dépend donc autant de la précision de ses conclusions positives que de la clarté de ses limites.

20.6.Le protocole comme objet scientifique : le contrat expérimental

Un protocole ne doit pas seulement décrire une expérience. Il doit posséder son propre contrat. Cette exigence prolonge les contrats déjà attribués aux objets de l’ÉTR. Si Compose, la qualification ou le routeur déclarent leurs entrées, leurs préconditions et leurs sorties, le protocole chargé de les examiner doit être soumis à une discipline comparable. Le contrat expérimental peut être représenté par :

\[\mathcal K_{\mathcal P} (I,\ Q,\ J,\ \mathscr E,\ O,\ \mathcal M,\ F,\ T)\]

où :

Les préconditions (Q) déterminent les situations dans lesquelles le protocole possède une signification. Un protocole destiné à examiner un comportement déterministe ne peut pas être appliqué sans adaptation à un système dont les sources d’aléa ne sont ni identifiées ni contrôlées. Un protocole consacré à l’effet d’un référentiel ne peut pas être interprété si plusieurs autres variables changent simultanément sans avoir été enregistrées. Les invariants (J) définissent ce qui doit demeurer constant pendant l’expérience : version du code, budget, référentiel, corpus, ordre des opérations, politique de décision, matériel, méthode de prétraitement ou

procédure d’échantillonnage. Les sorties (O) ne se réduisent pas à un score. Elles peuvent inclure :

Le contrat expérimental permet ainsi de contrôler le protocole lui-même. Un résultat ne peut être interprété lorsque les préconditions du protocole ne sont pas satisfaites. Une expérience ne peut être déclarée comparable lorsque ses invariants ont été modifiés sans justification. Une conclusion ne peut être reproduite lorsque ses sorties et ses traces n’ont pas été conservées. Le protocole devient alors un objet scientifique autonome : définissable, spécifiable, versionnable, testable, auditable et révisable.

20.7.L’espace expérimental

Une expérience n’existe jamais isolément. Elle appartient à un espace expérimental. Cet espace peut être représenté par :

\[\mathbb E (\mathcal X,\ \Theta,\ \mathcal R,\ \mathcal C,\ \mathcal B)\]

où :

humaines et opérationnelles ;

Le budget (\mathcal B) peut inclure :

Deux expériences ne sont pas comparables simplement parce qu’elles produisent une métrique portant le même nom. Elles doivent appartenir à des espaces identiques ou suffisamment compatibles dans les dimensions qui affectent l’affirmation étudiée. On pourra écrire :

\[\mathbb E_1 \equiv_{\Phi,\mathcal C_*} \mathbb E_2\]
pour signifier qu’une transformation déclarée (\Phi) rend les deux espaces

comparables relativement à l’ensemble de contraintes pertinentes

(\mathcal C_*).

La relation d’équivalence est donc relative à la question examinée. Deux expériences peuvent être comparables pour la latence sans l’être pour l’énergie. Elles peuvent être comparables pour l’exactitude sans l’être pour l’intervention humaine. Elles peuvent être comparables pour une fonction de recherche sans l’être pour l’auditabilité. Cette compatibilité ne requiert pas toujours une identité absolue. Deux systèmes peuvent utiliser des matériels différents si leur consommation ou leur débit sont normalisés selon une méthode justifiée. Deux expériences peuvent employer des jeux de données distincts si ceux-ci représentent des distributions comparables selon des critères contrôlés. Deux architectures peuvent posséder des nombres de paramètres différents si la comparaison porte explicitement sur une contrainte de

latence, d’énergie ou de coût plutôt que sur leur taille. L’essentiel est que l’équivalence retenue soit déclarée avant l’interprétation et limitée aux dimensions pour lesquelles elle est défendable. Sans définition de l’espace expérimental, une comparaison risque de confondre les propriétés du système avec celles de son environnement.

20.8.La chaîne de validité

La validation de l’ÉTR doit être organisée selon plusieurs niveaux liés sans être confondus :

\[\text{conceptuel} \rightarrow \text{formel} \rightarrow \text{algorithmique} \rightarrow \text{logiciel} \rightarrow \text{expérimental} \rightarrow \text{applicatif} \rightarrow \text{qualification}\]

La validation conceptuelle établit que les objets sont définis, distincts et compatibles. La validation formelle examine les équations, les transformations, les propriétés, les domaines et les invariants. La validation algorithmique détermine si les procédures proposées réalisent effectivement les opérations formelles. La validation logicielle vérifie si le programme implémente fidèlement ces procédures dans les conditions déclarées. La validation expérimentale observe le comportement du système dans des environnements contrôlés. La validation applicative mesure son aptitude à résoudre un problème réel. La qualification examine enfin les conditions dans lesquelles ce système

peut être utilisé : exigences juridiques, réglementaires, sectorielles, éthiques, organisationnelles et opérationnelles. Ces niveaux forment une chaîne de dépendances, mais non une simple succession chronologique. Si la définition de la qualification demeure ambiguë, il devient impossible de déterminer ce qu’une expérience consacrée à cette fonction mesure réellement. Si Compose est formellement défini mais que le programme lui ajoute silencieusement une règle, les résultats du logiciel ne peuvent plus être attribués à Compose tel qu’il a été théorisé. Si une performance est observée sur des données déjà utilisées pour construire ou régler le système, elle ne permet pas d’établir sa capacité de généralisation. Si un prototype fonctionne dans un environnement contrôlé, cela ne suffit pas à le qualifier pour un environnement critique. Une faiblesse à un niveau ne rend pas nécessairement tout le système inutile. Elle limite toutefois la portée des conclusions pouvant être tirées aux niveaux qui en dépendent. La chaîne de validité protège ainsi contre deux erreurs opposées :

réalité la théorie.

20.9.Les invariants scientifiques

Une expérience ne mesure pas seulement ce qui varie. Elle doit également établir ce qui n’a pas changé. Cette seconde dimension est fondamentale. Une architecture peut augmenter son exactitude tout en détruisant une propriété qu’elle avait précisément pour fonction de conserver. Elle peut réduire sa latence en supprimant la provenance des transformations. Elle peut améliorer un score global en fusionnant la relation et la décision. Elle peut produire une représentation plus compacte en rendant impossible la reconstruction des étapes antérieures. Une amélioration de performance peut donc constituer une régression scientifique. On appellera invariant scientifique toute propriété qui doit demeurer stable au cours d’une transformation, d’une composition, d’une optimisation ou d’une évolution de l’architecture, sauf déclaration explicite du contraire.

Pour une transformation :

\[T:X\rightarrow Y\]

et un invariant (J), la propriété de conservation peut s’écrire :

\[J(T(x))=J(x).\]

Cette égalité peut être exacte, approximative, probabiliste ou conditionnelle. Son statut doit être précisé. Dans l’ÉTR, les invariants possibles dépendent des objets étudiés. Pour Compose, l’ordre des éléments, leur typage, leur identité ou leur provenance peuvent constituer des invariants lorsque la spécification exige leur conservation. Pour le routeur, l’invariant peut porter sur la politique de routage : à conditions identiques, un changement extérieur à cette politique ne doit pas modifier arbitrairement la destination. Pour la qualification, le référentiel utilisé doit rester identifiable. Une qualification dont le résultat subsiste mais dont le référentiel disparaît ne conserve pas entièrement sa signification. Pour la mémoire relationnelle, la provenance, la temporalité, l’identité des objets et la nature des relations peuvent constituer des invariants plus importants que la simple présence d’une information. La validation doit donc accompagner chaque mesure de performance d’un contrôle des invariants concernés. Une transformation peut être décrite par son bilan structurel :

\[\Delta_T (K,\ X_f,\ A,\ S,\ U)\]

où :

Cette dernière catégorie est essentielle.

Une propriété ne doit pas être considérée comme conservée simplement parce que sa perte n’a pas été mesurée.

\[\text{L’indétermination n’est pas une conservation.}\]

20.10.Variables, dépendances et observabilité

Une validation rigoureuse exige de distinguer les catégories de variables mobilisées par l’architecture et par le protocole. La variable indépendante est manipulée par le protocole. Elle constitue la cause expérimentale dont on cherche à mesurer les effets : changement de référentiel, suppression de Compose, variation du volume de mémoire, modification de la politique de routage ou altération contrôlée des relations. La variable dépendante est la grandeur dont on observe la variation : exactitude, stabilité, coût, nombre d’erreurs, temps de restitution, conservation d’un invariant ou taux d’abstention. La variable contrôlée est maintenue constante afin d’empêcher qu’elle explique à tort la variation observée. La variable observée est directement accessible à la mesure : latence, destination choisie, relation enregistrée, valeur restituée ou quantité de mémoire utilisée. La variable calculée résulte d’une opération déterminée sur plusieurs observations : moyenne, variance, score de stabilité, taux d’erreur ou coût agrégé. La variable dérivée combine plusieurs mesures afin de représenter une propriété plus générale. Un indice d’auditabilité peut, par exemple, agréger le taux de reconstruction, la présence de la provenance et la localisation des transformations. La variable latente désigne une propriété supposée mais non directement observable. Elle ne peut être admise sans indicateurs, sans modèle d’inférence ou sans expérience permettant d’en isoler les effets. La variable confondante influence à la fois la variable indépendante et la variable dépendante. Elle peut produire une relation apparente qui n’est pas causale. La variable médiatrice décrit un mécanisme par lequel l’intervention produit son effet.

Cette classification prévient une confusion fréquente entre ce qui est mesuré et ce qui est interprété. Lorsqu’un système produit un score élevé de cohérence, ce score est une variable observée ou calculée. La « compréhension » qu’on pourrait lui attribuer demeure une interprétation, à moins qu’un protocole indépendant n’en définisse les manifestations, les limites et les conditions défavorables. La même exigence s’applique à toutes les architectures. Dans un Transformer, les poids d’attention peuvent être observés, mais leur signification causale ne doit pas être déduite de leur seule présence. Dans un réseau convolutif, l’activation d’un filtre peut être mesurée, mais elle ne constitue pas automatiquement une explication. Dans l’ÉTR, une relation enregistrée peut être observée, mais son adéquation au phénomène étudié doit encore être validée. La classification des variables oblige ainsi à séparer :

\[\text{observation} \neq \text{calcul} \neq \text{interprétation} \neq \text{cause}.\]

20.11.Le socle fonctionnel commun des architectures

Toute architecture computationnelle peut être ramenée à une structure minimale :

\[X\xrightarrow{T}Y\]

où une entrée (X) est transformée par une opération (T) en une sortie (Y). À ce niveau d’abstraction, les architectures partagent plusieurs éléments : une entrée, une représentation, une transformation, un état intermédiaire éventuel, une sortie et un critère d’évaluation. Leur différence apparaît dans les objets qu’elles rendent explicites et dans les opérations qu’elles privilégient. Un réseau convolutif introduit la convolution locale et hiérarchique comme principe de transformation.

Un Transformer introduit l’attention comme mécanisme de mise en relation contextuelle. Un réseau de neurones sur graphes organise la propagation à travers des nœuds, des arêtes et des règles d’agrégation. L’ÉTR rend notamment explicites le référentiel, la qualification, la relation, la mémoire relationnelle et le routage. Ces architectures ne doivent donc pas être décrites uniquement par leur nom ou leur famille historique. Elles peuvent être examinées à partir des fonctions qu’elles réalisent :

\[\mathcal F \left{ \begin{array}{l} \text{lecture},\ \text{représentation},\ \text{qualification},\ \text{recherche},\ \text{relation},\ \text{mémoire},\ \text{navigation},\ \text{décision},\ \text{explication} \end{array} \right}.\]

Aucune architecture n’est tenue de réaliser l’ensemble de ces fonctions. Une même fonction peut également être répartie entre plusieurs composants. Cette description fonctionnelle permet une comparaison plus équitable. Une fonction de recherche doit être comparée à une autre fonction de recherche. Une mémoire relationnelle doit être confrontée à un autre mécanisme de mémoire. Une politique de routage doit être examinée face à une politique remplissant un rôle comparable. Comparer des architectures uniquement comme des blocs indivisibles revient souvent à confronter des systèmes qui ne répondent ni aux mêmes problèmes ni aux mêmes contraintes. Comparer leurs fonctions permet au contraire de déterminer leurs complémentarités, leurs recouvrements, leurs différences et leurs éventuels déplacements d’ontologie.

20.12.Optimisation, extension et rupture scientifique

Toutes les différences entre architectures ne constituent pas des ruptures. Une optimisation améliore une propriété mesurable sans modifier les objets fondamentaux du système. Réduire la latence d’une opération, améliorer la précision d’un modèle ou diminuer sa consommation mémoire relève généralement de cette catégorie. Une extension architecturale ajoute une fonction, un composant ou un mécanisme tout en conservant l’ontologie principale du système. Une rupture scientifique apparaît lorsqu’un objet auparavant implicite devient explicite, lorsqu’une transformation jusque-là confondue avec une autre reçoit une autonomie, ou lorsqu’un nouveau niveau d’organisation modifie la manière même de formuler les problèmes. La rupture ne réside donc pas nécessairement dans une amélioration immédiate des performances. Elle peut résider dans la possibilité :

Plusieurs déplacements proposés par l’ÉTR peuvent être examinés sous cet angle :

\[\begin{array}{ccc} \text{qualification implicite} &\longrightarrow& \text{qualification déclarée} \[4pt] \text{contexte global indifférencié} &\longrightarrow& \text{référentiel explicite} \[4pt] \text{mémoire comme effet} &\longrightarrow& \text{mémoire comme objet} \[4pt] \text{relation confondue avec l’action} &\longrightarrow& \text{séparation relation / décision} \[4pt] \text{décision interne indifférenciée} &\longrightarrow& \text{routeur identifiable} \end{array}\]

Ces déplacements ne doivent pas être déclarés révolutionnaires par définition. Leur portée doit être éprouvée. Pour chacun, le protocole doit déterminer si l’objet nouvellement explicité permet :

Une rupture scientifique n’est pas proclamée par le vocabulaire qui l’accompagne. Elle est établie lorsque la nouvelle décomposition produit des capacités d’analyse, de contrôle ou d’action qui ne pouvaient pas être obtenues de manière équivalente dans le cadre précédent.

20.13.Le graphe des protocoles

Les protocoles de validation ne sont pas indépendants. Ils forment un système de dépendances dans lequel les conclusions de certains protocoles deviennent les préconditions d’autres protocoles. Ce système peut être représenté par un graphe :

\[\mathcal G_{\mathcal P} (V_{\mathcal P},E_{\mathcal P})\]

où :

Pour l’ÉTR, une structure minimale peut être exprimée ainsi :

\[\mathcal P_{\mathrm{concept}} \longrightarrow \begin{cases} \mathcal P_{\mathrm{Compose}},\ \mathcal P_{\mathrm{référentiel}} \end{cases} \longrightarrow \mathcal P_{\mathrm{qualification}} \longrightarrow \mathcal P_{\mathrm{relation}} \longrightarrow \begin{cases} \mathcal P_{\mathrm{mémoire}},\ \mathcal P_{\mathrm{routeur}} \end{cases} \longrightarrow \mathcal P_{\mathrm{applicatif}} \longrightarrow \mathcal P_{\mathrm{qualification\ d’usage}}.\]

Cette représentation ne signifie pas qu’un protocole antérieur doive être définitivement achevé avant toute expérience ultérieure. Elle signifie que la portée des conclusions ultérieures dépend du niveau de confiance accordé aux résultats antérieurs. La validation du routeur dépend, par exemple, de la stabilité de la qualification et de la relation qu’il exploite. Si ces objets sont mal définis ou instables, une erreur de routage ne peut pas être attribuée avec certitude au routeur lui-même. Le graphe permet également de localiser les conséquences d’une révision. Lorsqu’une propriété de Compose est modifiée, tous les protocoles dépendant de cette propriété doivent être identifiés. Certaines expériences devront être répétées. D’autres resteront valides si elles n’utilisaient pas l’invariant ou la propriété révisés. On peut associer à chaque arête du graphe une dépendance explicite :

\[\mathcal P_i \xrightarrow{\mathcal C_k} \mathcal P_j\]
pour signifier que le protocole (\mathcal P_j) dépend d’une affirmation
(\mathcal C_k) soutenue ou établie par (\mathcal P_i).

Cette organisation transforme la validation en infrastructure cumulative plutôt qu’en succession d’expériences isolées.

20.14.Protocole de validation conceptuelle

La première validation de l’ÉTR porte sur l’identité de ses objets. Chaque terme fondamental doit disposer :

objets voisins. Le protocole conceptuel peut être mené par reconstruction indépendante. Plusieurs lecteurs ou évaluateurs reçoivent les définitions, les exemples et les contrats d’entrée et de sortie. Ils doivent pouvoir : . identifier les objets mobilisés dans une chaîne donnée ; . distinguer les opérations successives ; . reconstruire l’ordre des transformations ; . localiser les dépendances ; . reconnaître les cas où un terme est utilisé hors de son domaine ; . résoudre les désaccords en revenant à une source normative. Le protocole réussit lorsque les divergences d’interprétation peuvent être résolues par référence à une définition localisée. Il échoue notamment lorsqu’un même terme désigne plusieurs fonctions incompatibles, lorsqu’une opération dépend d’un objet non défini, lorsqu’une distinction annoncée disparaît dans les exemples ou lorsqu’aucune source normative ne permet de trancher les divergences. La validation conceptuelle ne requiert pas une identité absolue de formulation entre tous les lecteurs. Elle exige que l’architecture possède une structure normative suffisamment précise pour que les désaccords puissent être localisés et résolus.

20.15.Protocole de validation formelle

La validation formelle examine les propriétés des objets et des transformations. Pour chaque opération, le protocole doit préciser :

Les propriétés générales doivent être démontrées lorsqu’une démonstration est possible. Les propriétés portant sur des espaces finis peuvent être vérifiées exhaustivement. Les propriétés calculatoires peuvent être soumises à des tests génératifs, à des tests fondés sur les invariants ou à des méthodes de vérification formelle. Aucune propriété algébrique ne doit être présumée. L’associativité, la commutativité, l’idempotence, l’existence d’un élément neutre, l’inversibilité ou la réversibilité de Compose ne doivent être affirmées que si elles appartiennent effectivement à sa définition et si elles ont été établies dans une portée explicite. La notation mathématique ne remplace pas la preuve. Elle permet seulement de formuler avec précision ce qui doit être prouvé, réfuté ou laissé indéterminé. La validation formelle doit aussi distinguer :

\[\text{propriété définitoire} \neq \text{propriété démontrée} \neq \text{propriété observée}.\]

Une propriété définitoire résulte d’une convention de construction. Une propriété démontrée résulte d’un raisonnement valide sous certaines hypothèses.

Une propriété observée résulte d’une exécution ou d’une mesure. Ces statuts peuvent converger, mais ils ne doivent jamais être confondus.

20.16.Protocole de conformité algorithmique et logicielle

Entre la théorie et l’exécution se trouvent deux traductions :

\[\text{spécification} \longrightarrow \text{algorithme} \longrightarrow \text{implémentation}.\]

Une divergence peut apparaître à chaque passage. Toute fonction critique doit donc être rattachée à la propriété qu’elle est censée implémenter. Les entrées, les sorties, les effets de bord, les tolérances numériques, les états internes et les erreurs possibles doivent être déclarés. Une implémentation de référence, volontairement simple, peut servir d’oracle à une version optimisée. Les deux sont exécutées sur les mêmes entrées et leurs résultats sont comparés selon une relation de conformité définie à l’avance. Les tests unitaires vérifient des cas déterminés. Les tests de propriétés examinent les invariants sur des ensembles d’entrées générées. Les tests différentiels comparent plusieurs implémentations indépendantes. Les tests de mutation contrôlent la capacité de la suite de tests à détecter des altérations volontaires. Les tests d’intégration examinent les effets produits lors du passage d’un composant au suivant. Les tests de non-régression vérifient qu’une évolution du système ne détruit pas des propriétés antérieurement établies. Les tests de précision numérique examinent les effets de représentation, d’arrondi, d’ordre d’opération et de matériel. Une implémentation n’est pas conforme parce qu’elle ne provoque aucune erreur visible. Elle l’est lorsque les opérations prévues peuvent être localisées dans le code, que leurs sorties correspondent à la spécification et que leurs propriétés résistent aux contrôles définis.

20.17.Protocoles propres aux objets de l’ÉTR

Les protocoles généraux doivent être appliqués aux objets particuliers de l’architecture.

20.17.1.Validation de Compose

Compose doit être évalué selon les propriétés qui lui sont effectivement attribuées. Le protocole spécifie :

Une étude d’ablation compare ensuite plusieurs conditions :

\[\begin{aligned} B_0 &: \text{chaîne complète avec Compose},\ B_1 &: \text{Compose neutralisé},\ B_2 &: \text{Compose remplacé par une opération simplifiée},\ B_3 &: \text{ordre des éléments modifié},\ B_4 &: \text{provenance supprimée},\ B_5 &: \text{types relâchés ou fusionnés}. \end{aligned}\]

La comparaison doit mesurer non seulement le résultat final, mais également les invariants concernés. Si la performance augmente alors que l’ordre, le typage ou la provenance sont détruits, l’amélioration doit être rapportée avec cette perte. Elle ne peut pas être présentée comme un progrès global de Compose. La contribution de Compose est soutenue lorsqu’elle est reproductible, localisée, compatible avec le mécanisme annoncé et absente ou diminuée lorsque les propriétés essentielles de Compose sont retirées.

20.17.2.Validation des référentiels

L’explicitation du référentiel implique une double exigence. À référentiel constant, les résultats doivent demeurer stables dans les limites prévues.

Lorsqu’un référentiel est modifié, les variations doivent correspondre aux dépendances déclarées. Le protocole exécute une même entrée sous plusieurs référentiels :

\[R_1,\ R_2,\ \ldots,\ R_n\]

en maintenant constantes les autres variables. Il mesure :

référentiel ;

Le protocole échoue lorsqu’un changement extérieur au référentiel modifie arbitrairement la qualification ou lorsqu’une variation locale du référentiel produit des effets globaux non attribuables.

20.17.3.Validation de la qualification

La qualification doit être distinguée de la représentation initiale et de la décision finale. Le protocole fixe l’entrée et le référentiel, puis examine si la qualification produite correspond aux règles annoncées. Il modifie ensuite le référentiel en maintenant l’entrée constante, puis l’entrée en maintenant le référentiel constant. Cette intervention croisée peut être représentée par :

\[\begin{array}{c|cc} & R_1 & R_2\ \hline X_1 & Q_{11} & Q_{12}\ X_2 & Q_{21} & Q_{22} \end{array}\]

Elle permet de distinguer l’effet de l’entrée de celui du référentiel. La qualification est soutenue comme transformation autonome lorsque ses variations peuvent être attribuées soit à l’entrée, soit au référentiel, sans dépendre silencieusement de la décision qui sera prise ensuite.

20.17.4.Validation de la séparation entre relation et décision

Cette séparation doit être éprouvée par intervention. Dans une première expérience, la structure relationnelle est maintenue constante tandis que plusieurs politiques de décision sont appliquées :

\[\mathcal R \text{ constante}, \qquad D_1,\ D_2,\ \ldots,\ D_n.\]

Les décisions peuvent varier. La relation ne doit cependant pas être réécrite afin de correspondre au choix final. Dans une seconde expérience, la politique de décision reste constante tandis que la relation est modifiée de manière contrôlée :

\[D \text{ constant}, \qquad \mathcal R_1,\ \mathcal R_2,\ \ldots,\ \mathcal R_n.\]

Les variations de décision doivent alors pouvoir être expliquées par les variations relationnelles introduites. La séparation échoue si la couche de décision altère silencieusement les relations dont elle dépend, si la relation contient déjà une décision irréversible ou si les deux couches ne peuvent pas être observées et modifiées indépendamment. Sans ce protocole, la séparation entre relation et décision resterait une distinction terminologique.

20.17.5.Validation de la mémoire relationnelle

La mémoire doit être évaluée comme structure de conservation, de mise à jour, de contradiction et de restitution. Le protocole introduit des informations dont la provenance, la temporalité et les relations sont connues. Il demande ensuite au système de :

L’évaluation distingue :

Une mémoire qui restitue une valeur correcte tout en lui attribuant une provenance erronée ne satisfait pas entièrement la traçabilité. Une mémoire qui conserve toutes les versions sans distinguer leur validité temporelle ne satisfait pas nécessairement la fonction de mise à jour. La validation porte donc sur la structure conservée autant que sur la réponse produite.

20.17.6.Validation du routeur

Le routeur doit être évalué selon les décisions qu’il est autorisé à prendre. Un corpus de situations est construit avec, pour chacune :

Les cas déterminés doivent être distingués des cas ambigus. Le protocole mesure :

Un taux global ne suffit pas. Une erreur rare mais grave peut être masquée par un grand nombre de décisions triviales. Le routeur doit donc être évalué par type de situation, par coût de mauvaise orientation et par niveau d’incertitude.

20.18.Études d’ablation, contrôles négatifs et contrefactuels

Une performance globale ne démontre pas la cause de cette performance. L’étude d’ablation retire ou neutralise successivement les composants de l’architecture. Elle examine ce qui se produit lorsque :

relation ;

Une ablation doit conserver le reste du système aussi constant que possible. Elle ne doit pas comparer une architecture complète et optimisée à un témoin volontairement dégradé par plusieurs modifications simultanées. Les contrôles négatifs vérifient que le système échoue ou se dégrade lorsqu’il ne dispose plus de l’information censée produire sa réussite. Si une architecture conserve sa performance après permutation aléatoire des relations déclarées essentielles, il devient difficile d’affirmer qu’elle utilisait effectivement ces relations. Les expériences contrefactuelles modifient une variable tout en maintenant les autres constantes. Elles répondent à une question causale :

\[\text{Que se serait-il produit si cette propriété avait été différente,}\]
\[\text{toutes choses pertinentes étant maintenues constantes ?}\]

Ces méthodes permettent de passer de l’observation d’une performance à l’examen du mécanisme qui la produit. Elles ne suffisent toutefois pas toujours à établir une causalité complète. Une ablation peut modifier plusieurs mécanismes secondaires. Un contrôle négatif peut introduire une perturbation irréaliste. Un contrefactuel peut dépendre d’hypothèses fortes. Le protocole doit donc préciser la portée causale exacte de chaque intervention.

20.19.Comparaison expérimentale et coût de preuve

La comparaison doit commencer par l’identification de la fonction commune. Une architecture ne doit pas être confrontée globalement à une autre si leurs objectifs, leurs entrées, leurs sorties ou leurs contraintes ne sont pas

comparables. Plusieurs régimes d’équité peuvent être retenus :

Aucun de ces régimes n’est universel. Le protocole doit indiquer celui qui est utilisé et les conclusions qu’il autorise. Une comparaison complète sépare au moins deux catégories de résultats. La première concerne la résolution de la tâche :

La seconde concerne les propriétés architecturales :

Pour une métrique (m), l’écart entre l’ÉTR et une référence peut s’écrire :

\[\Delta_m m(\text{ÉTR}) m(\text{référence}).\]

Cette différence doit être accompagnée de son incertitude, de sa

dispersion, de la taille de l’effet et du régime de comparaison utilisé. Mais le coût calculatoire ne constitue qu’une partie du coût total. Une architecture possède également un coût de preuve : l’ensemble des ressources nécessaires pour comprendre, spécifier, vérifier, auditer, reproduire et contester une affirmation. Ce coût doit être rapporté à une affirmation, à un protocole et à un espace expérimental déterminés :

\[C_{\mathrm{preuve}} (\mathcal C,\mathcal P,\mathbb E)\]

Il peut être décomposé ainsi :

\[\begin{aligned} C_{\mathrm{preuve}} (\mathcal C,\mathcal P,\mathbb E) &= C_{\mathrm{spécification}} + C_{\mathrm{instrumentation}} \ &\quad+ C_{\mathrm{exécution}} + C_{\mathrm{traçage}} \ &\quad+ C_{\mathrm{audit}} + C_{\mathrm{réplication}}. \end{aligned}\]

Le coût de spécification correspond au travail nécessaire pour définir précisément l’objet, la propriété et la portée étudiés. Le coût d’instrumentation correspond aux mécanismes requis pour observer les états internes et produire les mesures nécessaires. Le coût d’exécution comprend les ressources mobilisées par les expériences. Le coût de traçage correspond à la conservation de la provenance, des états intermédiaires et des conditions d’exécution.

Le coût d’audit représente l’effort nécessaire pour reconstruire et contrôler le résultat. Le coût de réplication désigne les ressources requises pour produire une preuve indépendante. Ce coût varie selon l’affirmation. Démontrer un invariant simple, reproduire une expérience de qualification et qualifier un système robotique complet ne demandent pas les mêmes ressources. Une architecture peut être extrêmement performante tout en possédant un coût de preuve élevé si elle exige des centaines de paramètres opaques, des interventions manuelles difficiles à reconstituer ou une infrastructure inaccessible. À l’inverse, une architecture légèrement moins performante peut présenter un coût de preuve inférieur si ses transformations sont localisées, ses invariants contrôlables et ses résultats facilement reproductibles. Le coût de preuve ne remplace pas les mesures de performance. Il complète leur interprétation. Une architecture scientifique n’est pas seulement un système capable de produire un résultat. C’est également un système dont les résultats peuvent être raisonnablement établis.

20.20.Robustesse et domaine de validité

La robustesse n’existe pas sans perturbation définie. Un système peut être robuste aux erreurs typographiques et sensible aux changements de référentiel. Il peut résister au bruit numérique et échouer devant une contradiction sémantique. Il peut généraliser à des données proches de son domaine initial et devenir instable lors d’un changement de distribution. Le protocole doit donc définir chaque classe de perturbation par :

\[N (\text{nature}, \text{amplitude}, \text{fréquence}, \text{plausibilité})\]

La nature précise ce qui est modifié. L’amplitude précise l’intensité de la perturbation. La fréquence précise son occurrence ou sa densité. La plausibilité précise si la perturbation correspond à une situation réaliste, extrême ou purement diagnostique. La dégradation attendue doit également être décrite. Un système robuste n’est pas nécessairement un système dont le résultat ne change jamais. Il peut s’agir d’un système :

satisfaites. Une abstention explicite peut être scientifiquement préférable à une réponse apparemment stable mais dépourvue de fondement. La robustesse doit donc être rapportée à un domaine de validité :

\[\mathcal V (D,\ H,\ N_{\max},\varepsilon)\]
où (N_{\max}) désigne le niveau maximal de perturbation pour lequel la
propriété demeure soutenue dans la tolérance (\varepsilon).

20.21.Typologie des erreurs

Toutes les erreurs ne sont pas de même nature. Leur regroupement dans une mesure unique empêche souvent de localiser la défaillance réelle. Une typologie minimale peut distinguer :

 Type d’erreur            Nature                    Protocole
principalement
concerné
 Conceptuelle             Objet ambigu,             Validation
                          frontière instable,       conceptuelle
hypothèse implicite
 Formelle ou              Propriété fausse,         Validation formelle
 mathématique             démonstration
invalide, invariant non
conservé
 Algorithmique            Procédure non             Conformité
                          conforme à l’opération    algorithmique
théorique
 Logicielle               Erreur de code, de        Validation logicielle
dépendance, de
précision numérique
ou d’état d’exécution
 Expérimentale            Biais de données,         Contrat expérimental
contrôle insuffisant,
puissance inadéquate,
espace incompatible
 Interprétative           Conclusion excédant       Analyse scientifique
la portée ou confusion
entre observation et
propriété
 Applicative              Inadéquation entre le     Validation applicative
système et le besoin
réel
 Juridique ou              Usage incompatible        Qualification
 qualificative             avec les obligations
applicables

Chaque erreur appelle une réponse différente. Une erreur logicielle peut être corrigée sans modifier la théorie. Une erreur conceptuelle peut exiger la révision des définitions et de tous les protocoles qui en dépendent. Une erreur interprétative peut laisser les résultats bruts intacts tout en invalidant la conclusion qui en avait été tirée. Cette typologie empêche deux confusions opposées. La première consiste à réfuter une théorie sur la seule base d’un programme défectueux. La seconde consiste à protéger indéfiniment une théorie en attribuant toute contradiction à une erreur d’implémentation.

La nature de l’erreur doit être déterminée par des protocoles de localisation, et non choisie en fonction de la conclusion que l’on souhaite préserver.

20.22.Falsification et résultats négatifs

Une théorie devient impossible à falsifier lorsqu’aucun résultat ne peut compter contre elle. Si chaque échec est interprété comme une mauvaise implémentation, un mauvais jeu de données, une mauvaise lecture, un protocole inadapté ou une preuve de la profondeur du système, aucune expérience ne peut plus réellement l’atteindre. Chaque affirmation centrale de l’ÉTR doit donc comporter une condition défavorable identifiable. Si la séparation entre relation et décision est annoncée, une expérience montrant que la décision réécrit nécessairement la relation constitue un résultat contraire à cette affirmation. Si la traçabilité est revendiquée, l’existence répétée de transformations impossibles à reconstruire remet cette propriété en cause. Si l’explicitation du référentiel est censée localiser les variations, des effets arbitraires et non attribuables affaiblissent cette hypothèse. Un résultat négatif peut néanmoins provenir de plusieurs niveaux :

\[\begin{array}{l} \text{réfutation de l’affirmation théorique},\ \text{erreur algorithmique},\ \text{non-conformité logicielle},\ \text{insuffisance du protocole},\ \text{puissance expérimentale insuffisante},\ \text{violation des préconditions},\ \text{résultat indéterminé}. \end{array}\]

Ces issues doivent être distinguées. L’échec d’un programme ne réfute pas automatiquement la théorie qu’il prétend implémenter. Mais protéger systématiquement la théorie en invoquant l’implémentation la rendrait inaccessible à l’épreuve. Le protocole doit donc déterminer à l’avance les contrôles permettant de localiser l’échec.

Un résultat indéterminé ne constitue ni une validation ni une réfutation. Il signifie que l’expérience n’a pas produit suffisamment d’information pour modifier légitimement le statut de l’affirmation. L’indétermination doit être conservée comme résultat scientifique à part entière. Elle ne doit pas être transformée en soutien implicite par défaut.

20.23.Reproductibilité, réplication et dossier de preuve

Une expérience est reproductible lorsqu’un tiers peut retrouver son résultat à partir des mêmes données, du même code et de conditions équivalentes. Elle est répliquée lorsqu’un tiers obtient un résultat compatible à travers une nouvelle exécution, un autre échantillon, une autre équipe ou une implémentation indépendante. Le dossier de preuve doit conserver :

Toute intervention manuelle susceptible d’influencer le résultat doit être enregistrée. Le dossier de preuve peut être représenté par :

\[\mathcal D_{\mathrm{preuve}} (\mathcal C,\mathcal P,\mathbb E,\mathcal O,\mathcal T,\mathcal A)\]

où :

Le dossier de preuve doit relier chaque résultat à l’affirmation qu’il soutient, limite ou contredit. On peut écrire :

\[\mathcal P_i \longrightarrow \mathcal D_{\mathrm{preuve},i} \longrightarrow \mathcal C_j \longrightarrow \Delta\operatorname{Stat}(\mathcal C_j).\]

Une même expérience peut soutenir une affirmation et en laisser une autre indéterminée. Un même résultat peut augmenter la confiance dans une propriété tout en révélant la perte d’un invariant distinct. La validation devient alors un système de preuves localisées plutôt qu’un dossier global destiné à défendre l’architecture dans son ensemble.

20.24.Validation applicative et qualification

Une architecture peut satisfaire ses contrats internes sans résoudre correctement le problème auquel elle est destinée. La validation applicative commence donc par définir le besoin indépendamment de la solution. Elle identifie :

L’ÉTR doit ensuite être évaluée dans une situation représentative, avec des données et des contraintes proches de l’usage envisagé. La performance technique n’est qu’une dimension. Le protocole peut également mesurer :

La qualification ajoute les exigences propres au déploiement. Elle examine notamment :

La séparation entre relation et décision peut ici devenir une propriété opérationnelle importante. Elle permet d’examiner séparément les informations utilisées par le système et la politique qui transforme ces informations en action. Cette possibilité architecturale doit toutefois être vérifiée dans l’implémentation. Elle ne constitue pas, par sa seule présence théorique, une garantie juridique ou éthique.

\[\begin{aligned} \text{conformité juridique} &\not\Rightarrow \text{validité scientifique},\ \text{validité scientifique} &\not\Rightarrow \text{autorisation juridique},\ \text{acceptabilité sociale} &\not\Rightarrow \text{cohérence formelle}. \end{aligned}\]

Ces évaluations se rencontrent lors de la qualification, mais elles conservent leurs critères propres.

20.25.Du changement d’architecture au changement de paradigme

L’histoire de l’informatique ne peut pas être réduite à une succession de modèles plus performants. Elle peut également être lue comme une succession de niveaux d’organisation :

\[\text{calcul} \rightarrow \text{programmation} \rightarrow \text{statistique} \rightarrow \text{apprentissage} \rightarrow \text{attention} \rightarrow \text{relation}.\]

Cette séquence ne signifie pas que chaque paradigme remplace le précédent. La programmation ne supprime pas le calcul. L’apprentissage ne supprime pas la programmation. L’attention ne rend pas les transformations statistiques inutiles. Un paradigme nouveau réorganise des objets existants et rend certaines

propriétés explicitement manipulables. L’ÉTR ne prétend donc pas abolir les architectures précédentes. Elle propose d’examiner un niveau d’organisation dans lequel le référentiel, la qualification, la relation, la mémoire et le routage ne sont plus seulement des effets internes ou des conventions d’implémentation, mais des objets susceptibles d’être définis, composés, mesurés, modifiés et contestés séparément. La portée de cette proposition dépendra précisément des validations décrites dans ce chapitre. Si cette explicitation n’apporte aucune capacité de mesure, d’intervention ou de contrôle supplémentaire, elle restera une reformulation. Si elle permet au contraire :

elle pourra être considérée comme un changement de niveau architectural. Le protocole ne doit pas présupposer laquelle de ces conclusions sera obtenue. Il doit rendre possible leur distinction.

Conclusion — Construire une architecture de la preuve

La validation de l’ÉTR ne doit être ni un catalogue de métriques ni une succession de questions générales. Elle doit former une architecture de la preuve. Cette architecture commence par des objets définis, des hypothèses nommées et des affirmations délimitées. Elle précise leur domaine, leur portée, leur degré de généralité, leur précision et les conditions capables de les soutenir ou de les contredire. Elle relie ensuite chaque affirmation à un protocole contractuel, défini par ses entrées, sa version, ses conditions contrôlées, ses opérations, ses témoins, ses mesures, ses seuils, ses conditions d’échec et ses exigences de traçabilité. Elle situe chaque protocole dans un espace expérimental et ne déclare les comparaisons équitables qu’au regard d’un régime d’équivalence

explicitement défini. Elle identifie les invariants, classe les variables, vérifie les transformations, contrôle la conformité des implémentations et distingue les observations, les calculs, les interprétations et les causes. Elle transforme ensuite les protocoles en un graphe de dépendances, localise les différentes catégories d’erreurs et mesure non seulement la performance du système, mais également le coût nécessaire pour établir que cette performance mérite confiance. Elle compare les fonctions plutôt que les marques, distingue l’optimisation de la rupture, recherche les causes par ablation, par contrôle négatif et par intervention contrefactuelle, puis soumet ses résultats à la reproduction, à la réplication et à la réfutation. Elle conserve enfin l’ensemble de ces éléments dans un dossier de preuve capable de relier chaque observation à l’affirmation qu’elle soutient, limite, contredit ou laisse indéterminée. Lorsqu’un usage réel est envisagé, elle ajoute les conditions de validation applicative et de qualification juridique, réglementaire, éthique et opérationnelle. La logique normative du chapitre peut être résumée par :

\[\mathcal C \overset{\mathcal P}{\longrightarrow} \mathcal D_{\mathrm{preuve}} \longrightarrow \operatorname{Stat}(\mathcal C)\]

Le protocole ne confère pas directement un label de validité. Il produit un dossier de preuve. Ce dossier modifie le statut d’une affirmation localisée. L’ÉTR ne sera pas scientifiquement défendue en devenant impossible à contredire. Elle le sera en rendant ses propositions suffisamment précises pour qu’un résultat contraire puisse être reconnu, localisé et intégré au développement de l’architecture.

\[\begin{aligned} \text{Validité scientifique} &= \text{affirmations délimitées} \ &\quad+\ \text{portées déclarées} \ &\quad+\ \text{hypothèses explicites} \ &\quad+\ \text{invariants contrôlés} \ &\quad+\ \text{variables identifiées} \ &\quad+\ \text{protocoles contractuels} \ &\quad+\ \text{espaces expérimentaux comparables} \ &\quad+\ \text{dossiers de preuve traçables} \ &\quad+\ \text{critères défavorables} \ &\quad+\ \text{statuts multidimensionnels} \ &\quad+\ \text{conclusions révisables}. \end{aligned}\]

Une théorie ne devient pas durable parce qu’elle affirme davantage que les autres. Elle le devient parce qu’elle distingue avec précision ce qu’elle définit, ce qu’elle démontre, ce qu’elle implémente, ce qu’elle observe, ce qu’elle suppose encore et les expériences par lesquelles ces différents statuts pourront être établis.

Une architecture computationnelle ne devient pleinement scientifique ni lorsqu’elle produit les meilleurs résultats, ni lorsqu’elle résiste à toute critique, mais lorsqu’elle rend chacune de ses affirmations suffisamment explicite pour que toute communauté indépendante puisse en examiner les fondements, en reproduire les preuves, en discuter les limites et, si nécessaire, en établir la réfutation par séquence.

Une architecture scientifique n’est donc pas seulement un ensemble d’algorithmes. C’est un ensemble d’affirmations suffisamment précises pour que chacune puisse être située, éprouvée, reproduite, discutée, améliorée, limitée ou réfutée indépendamment des autres. Le présent chapitre ne constitue ainsi pas seulement la conclusion méthodologique du traité de l’ÉTR. Il en définit le seuil scientifique : le point à partir duquel l’architecture cesse d’être uniquement décrite pour devenir effectivement

éprouvable.

Chapitre XXI — Applications complètes et parcours de bout en bout

Une même architecture pour plusieurs mondes

Les chapitres précédents ont isolé les principaux objets de l’ÉTR :

Il reste maintenant à montrer comment ces objets coopèrent dans des systèmes réels.

L’objectif de ce chapitre n’est plus d’introduire de nouveaux concepts. Il est d’examiner plusieurs applications complètes afin d’observer ce qui demeure stable lorsque changent :

Le noyau général est le suivant :

x

\overset{\Phi}{\longmapsto}

Q_0

\overset{\operatorname{Compose}}{\longmapsto}

Q_s

\overset{\Lambda_R}{\longmapsto}

Q_q

\overset{\rho_R}{\longmapsto}
\mathcal R
\overset{\operatorname{Router}}{\longmapsto}

D

\overset{\operatorname{Update}}{\longmapsto}
\Omega'

}

où :

Ce pipeline ne signifie pas que toutes les applications exécutent exactement les mêmes algorithmes.

Il signifie que leurs opérations peuvent être décrites à travers les mêmes fonctions fondamentales.

21.1.Ce qui change et ce qui demeure

D’une application à l’autre, plusieurs éléments changent.

La lecture d’une phrase peut être produite par un tokenizer et un Transformer.

La lecture d’une image peut être produite par un CNN.

La lecture d’un environnement robotique peut résulter d’une fusion de capteurs.

La qualification d’un document juridique n’utilise pas le même référentiel que la qualification d’une publication sociale.

Le routeur d’un moteur de recommandation ne possède pas les mêmes obligations que celui d’un système médical.

Cependant, certains objets demeurent.

Toute application doit déterminer :

. ce qui est reçu ; . comment cela est représenté ; . selon quel référentiel cette représentation est interprétée ; . quelles relations sont calculées ; . quelle politique transforme ces relations en décision ; . ce qui doit être conservé en mémoire ; . comment les résultats pourront être vérifiés.

La continuité de l’ÉTR ne réside donc pas dans l’identité des modèles.

Elle réside dans la stabilité de cette décomposition fonctionnelle.

21.2.Cas I — Interprétation d’une phrase ambiguë

Considérons la phrase :

Le Jaguar accélère à l’approche du virage.

Le terme « Jaguar » peut désigner :

L’ÉTR ne doit pas choisir immédiatement l’une de ces interprétations. Intuitivement, la phrase « un pangolin accélère à l’approche du virage » réduira la complexité.

Elle doit d’abord conserver sa structure.

21.2.1.Entrée

x =

\text{« Le Jaguar accélère à l’approche du virage. »}

La provenance contient notamment :

\Pi_x

= (

\text{source},
\text{date},
\text{langue},
\text{contexte disponible}

)

21.2.2.Lecture

La fonction de lecture segmente et représente l’entrée :

Q_0 =

\Phi_{\mathrm{texte}}(x)

Elle peut produire :

Une sortie simplifiée pourrait être :

Q_0 = (

\text{Jaguar},
\text{accélérer},
\text{virage},
\text{relation temporelle}

)

Cette lecture ne désambiguïse pas encore « Jaguar » et le terme pangolin aura une meilleur chance de changer le sens de la phrase

21.2.3.Compose

Compose conserve l’ordre et les dépendances :

Q_s =

\operatorname{Compose}

(

\text{Le},
\text{Jaguar},
\text{accélère},
\text{à l’approche},
\text{du virage}

)

Le système obtient une structure dans laquelle :

La structure pourrait être cohérente dans plusieurs référentiels.

21.2.4.Sélection du référentiel

Le système examine le contexte.

Supposons que la phrase provienne d’un article automobile.

Le sélecteur produit :

R^* =

R_{\mathrm{automobile}}

Les référentiels zoologique et logiciel restent disponibles, mais inactifs

pour la qualification principale.

\alpha_{\mathrm{automobile}}=1

\alpha_{\mathrm{zoologique}}=0

\alpha_{\mathrm{logiciel}}=0

21.2.5.Qualification

La qualification devient :

Q_q =

\Lambda_{R_{\mathrm{automobile}}}(Q_s)

avec :

\text{Jaguar}
\mapsto
\text{véhicule ou marque automobile}

La qualification peut rester partielle si le système ne sait pas encore s’il s’agit d’une marque, d’un modèle ou d’un véhicule particulier.

Elle ne doit pas inventer cette précision.

21.2.6.Relations

Le système compare l’état qualifié à sa mémoire :

\mathcal R

=

\rho_{R_{\mathrm{automobile}}}

( Q_q,

\Omega_{\mathrm{automobile}}

)

Le profil peut contenir :

\mathcal R

= (

r_{\mathrm{compatibilité}},
r_{\mathrm{cohérence}},
r_{\mathrm{confiance}},
r_{\mathrm{ambiguïté}}

)

Par exemple :

\mathcal R

= ( 0{,}96, 0{,}91, 0{,}84, 0{,}18 )

Ces valeurs ne sont pas une vérité. Elles représentent des mesures produites selon une méthode déclarée.

21.2.7.Routage

La politique peut être :

D =

\begin{cases}
\text{interprétation automobile}

&

r_{\mathrm{compatibilité}}\geq\theta_1
\\
\text{conserver plusieurs hypothèses}

&

r_{\mathrm{ambiguïté}}\geq\theta_2
\\
\text{demander du contexte}

&

\text{sinon}

\end{cases}

Ici :

D =

\text{retenir l’interprétation automobile}

avec conservation des hypothèses secondaires.

21.2.8.Mise à jour de la mémoire

La mémoire peut enregistrer :

\Omega'

=

\operatorname{Update}

(

\Omega,

Q_q,

\mathcal R,

D,

\Pi

)

La mémoire ne doit pas enregistrer « Jaguar = automobile » comme vérité universelle.

Elle doit enregistrer :

Dans cette phrase, dans ce contexte et sous ce référentiel, l’interprétation automobile a été retenue.

21.2.9.Ce que montre ce cas

Ce parcours établit la distinction suivante :

\text{structure}
\neq
\text{qualification}
\neq
\text{décision}

La phrase conserve une structure stable.

La qualification dépend du référentiel.

La décision dépend de la politique et du niveau d’ambiguïté.

21.3.Cas II — Recherche documentaire scientifique

Un chercheur demande :

Quels travaux récents étudient la propagation d’erreurs dans les systèmes multi-agents fondés sur des modèles de langage ?

Le problème ne consiste pas uniquement à retrouver des documents contenant les mêmes mots.

Il faut distinguer :

21.3.1.Entrée et lecture

x =

\text{requête du chercheur}

La lecture extrait :

Q_0 = (

\text{systèmes multi-agents},
\text{LLM},
\text{propagation d’erreurs},
\text{travaux récents}

)

Le système identifie également la mission :

G =

\text{recherche scientifique}

21.3.2.Compose

Compose construit la structure relationnelle de la requête :

Q_s =

\operatorname{Compose}(Q_0)

Il doit conserver que :

Une recherche par simple collection de mots pourrait retrouver des articles portant sur chacun de ces thèmes séparément.

Compose conserve leur articulation.

21.3.3.Référentiels actifs

Plusieurs référentiels sont nécessaires :

R_{\mathrm{thématique}}

R_{\mathrm{temporel}}

R_{\mathrm{méthodologique}}

R_{\mathrm{fiabilité}}

Le référentiel principal peut être :

R_{\mathrm{scientifique}}

Les autres deviennent des sous-référentiels ou des dimensions de contrôle.

21.3.4.Qualification des documents

Pour chaque document d_i :

Q_i =

\Phi_{\mathrm{document}}(d_i)

puis :

Q_{q,i} =

\Lambda_{R_{\mathrm{scientifique}}}(Q_i)

La qualification peut extraire :

Un LLM peut contribuer à cette extraction.

Sa sortie reste une qualification candidate, non une preuve.

21.3.5.Profil relationnel

Pour chaque document :

\mathcal R_i

=

\rho_R(Q_s,Q_{q,i})

avec :

\mathcal R_i

= (

r_{\mathrm{thème}},
r_{\mathrm{méthode}},
r_{\mathrm{récence}},
r_{\mathrm{fiabilité}},
r_{\mathrm{couverture}}

)

Deux documents peuvent obtenir des profils très différents.

Document d_1 :

(0{,}95,0{,}42,0{,}88,0{,}51,0{,}76)

Document d_2 :

(0{,}81,0{,}91,0{,}79,0{,}93,0{,}84)

Le premier est plus proche lexicalement.

Le second est plus solide méthodologiquement.

21.3.6.Routeur documentaire

La politique scientifique peut imposer :

r_{\mathrm{fiabilité}}
\geq
\theta_f

et :

r_{\mathrm{méthode}}
\geq
\theta_m

avant le classement final.

Le routeur peut produire :

La recherche ne produit donc pas seulement un classement linéaire.

Elle produit une cartographie fonctionnelle des résultats.

21.3.7.Mémoire scientifique

La mémoire conserve :

Une recherche ultérieure peut réutiliser ce chemin sans confondre les conclusions anciennes avec les documents nouveaux.

21.3.8.Validation

Le système peut être comparé à :

Les métriques de tâche peuvent inclure :

Les métriques architecturales peuvent inclure :

21.4.Cas III — LLM et production d’une réponse contrôlée

Un utilisateur demande :

Cette clause contractuelle permet-elle au fournisseur de modifier unilatéralement les tarifs ?

Un LLM pourrait répondre directement.

L’ÉTR impose une décomposition plus prudente.

21.4.1.Lecture du texte

La clause contractuelle est lue :

Q_{\mathrm{clause}}

=

\Phi_{\mathrm{LLM}}(x)

La sortie peut contenir :

Le LLM intervient ici comme moteur de lecture et d’extraction.

21.4.2.Compose

Compose conserve l’organisation de la clause :

Q_s =

\operatorname{Compose}

(

\text{condition},
\text{action autorisée},
\text{préavis},
\text{droit du client},
\text{exception}

)

L’ordre juridique importe.

Une exception placée après une autorisation peut en limiter fortement la portée.

21.4.3.Qualification juridique

Q_q =

\Lambda_{R_{\mathrm{juridique}}}(Q_s)

La qualification peut distinguer :

Le LLM peut proposer cette qualification.

Une règle juridique, une base documentaire ou un professionnel peut la vérifier.

21.4.4.Relations

Le système compare la clause à :

\mathcal R

= (

r_{\mathrm{compatibilité}},
r_{\mathrm{risque}},
r_{\mathrm{asymétrie}},
r_{\mathrm{incertitude}}

)

21.4.5.Routeur

Le routeur ne doit pas nécessairement produire :

D=\text{oui}

ou :

D=\text{non}

Il peut produire :

D=

\text{réponse conditionnelle}

ou :

D=

\text{vérification juridique requise}

Une politique possible :

D =

\begin{cases}
\text{réponse directe}

&

U<\theta_1
\\
\text{réponse conditionnelle}

&

\theta_1\leq U<\theta_2
\\
\text{abstention et recours humain}

&

U\geq\theta_2
\end{cases}

21.4.6.Génération finale

Le LLM peut formuler la réponse à partir du registre décisionnel :

E =

\operatorname{Generate}

( Q_q,

\mathcal R,

D,

\Pi

)

La réponse ne doit pas inventer une justification nouvelle.

Elle doit refléter :

Le LLM devient ici un générateur d’expression, non l’unique autorité de décision.

21.5.Cas IV — Vision industrielle avec CNN

Une caméra inspecte une pièce mécanique.

L’objectif est de détecter une fissure et de décider si la pièce doit être retirée de la chaîne.

21.5.1.Lecture perceptive

Q_0 =

\Phi_{\mathrm{CNN}}(I)

Le CNN produit :

Le CNN demeure l’outil spécialisé de lecture visuelle.

21.5.2.Qualification

Le système doit distinguer :

Q_q =

\Lambda_{R_{\mathrm{inspection}}}(Q_0)

La qualification peut utiliser :

21.5.3.Relations

Le système compare le défaut aux profils connus :

\mathcal R

= (

r_{\mathrm{forme}},
r_{\mathrm{profondeur}},
r_{\mathrm{localisation}},
r_{\mathrm{criticité}},
r_{\mathrm{confiance}}

)

Une forte similarité visuelle ne suffit pas si la localisation est non critique.

Inversement, un petit défaut situé dans une zone sensible peut exiger l’arrêt.

21.5.4.Routage

D =

\begin{cases}
\text{continuer}

&

r_{\mathrm{criticité}}<\theta_1
\\
\text{inspection secondaire}

&

\theta_1\leq r_{\mathrm{criticité}}<\theta_2
\\
\text{retirer la pièce}

&

r_{\mathrm{criticité}}\geq\theta_2
\end{cases}

Une contrainte dure peut s’ajouter :

c_{\mathrm{sécurité}}=\text{échec}
\Rightarrow
D=\text{retrait}

21.5.5.Action et mémoire

La décision est compilée en commande :

A =

\operatorname{Compile}(D)

Puis la mémoire conserve :

Cette mémoire peut servir à réévaluer le CNN et les seuils du routeur.

21.5.6.Validation

Le CNN est évalué sur la détection.

La qualification est évaluée sur la distinction des défauts.

Le routeur est évalué sur le coût des erreurs.

Le système complet est évalué sur :

Une bonne précision du CNN ne suffit donc pas à valider le système industriel complet.

21.6.Cas V — Robotique multimodale

Un robot mobile doit traverser un entrepôt.

Il reçoit :

21.6.1.Lectures parallèles

Q_{\mathrm{vision}}

=

\Phi_{\mathrm{CNN}}(I)
Q_{\mathrm{lidar}}

=

\Phi_{\mathrm{lidar}}(L)
Q_{\mathrm{audio}}

=

\Phi_{\mathrm{audio}}(A)
Q_{\mathrm{instruction}}

=

\Phi_{\mathrm{langage}}(x)

Chaque lecteur possède son contrat et son incertitude.

21.6.2.Compose multimodal

Les lectures sont composées :

Q_s =

\operatorname{Compose}_{\mathrm{multi}}

(

Q_{\mathrm{vision}},
Q_{\mathrm{lidar}},
Q_{\mathrm{instruction}},
Q_{\mathrm{mémoire}}

)

Compose doit conserver :

Un obstacle vu par la caméra mais absent du lidar ne doit pas disparaître dans une fusion opaque.

21.6.3.Qualification

Dans le référentiel de navigation :

Q_q =

\Lambda_{R_{\mathrm{navigation}}}(Q_s)

Le système qualifie :

21.6.4.Relations

\mathcal R

= (

r_{\mathrm{distance}},
r_{\mathrm{vitesse}},
r_{\mathrm{trajectoire}},
r_{\mathrm{risque}},
r_{\mathrm{confiance}}

)

Le profil peut être calculé pour plusieurs trajectoires candidates.

21.6.5.Routeur de sécurité

Le routeur sélectionne :

La sécurité peut dominer les autres référentiels :

R_{\mathrm{sécurité}}
\succ
R_{\mathrm{efficacité}}

21.6.6.Mémoire

La mémoire conserve :

Elle permet ensuite de comparer les situations nouvelles aux précédentes.

21.6.7.Valeur de la séparation

Le CNN ne décide pas seul.

Le capteur ne décide pas seul.

La qualification ne décide pas seule.

La relation de risque ne décide pas seule.

Le routeur applique la politique de sécurité.

Cette séparation permet de modifier la politique sans réentraîner nécessairement les lecteurs perceptifs.

21.7.Cas VI — Cercle et navigation relationnelle

Cercle constitue une application particulièrement importante de l’ÉTR.

L’objectif n’est pas seulement de recommander un contenu proche.

Il est de construire une navigation selon :

21.7.1.Entrée

Une publication p entre dans le système :

p

Elle contient :

21.7.2.Lecture

Plusieurs lecteurs produisent :

Q_{\mathrm{texte}}

Q_{\mathrm{image}}

Q_{\mathrm{interaction}}

Q_{\mathrm{temps}}

Ces lectures sont ensuite composées.

21.7.3.Qualification en pintones

Q_q =

\Lambda_{R_{\mathrm{pintones}}}(Q_s)

Le système attribue ou propose des pintones selon :

Les pintones sont des objets du référentiel, non des étiquettes arbitraires ajoutées après le calcul.

21.7.4.LOI utilisateur

La LOI peut être représentée par :

L_u =

(p_1,p_2,\ldots,p_n)

ou par un état relationnel construit à partir de ces pintones.

La LOI exprime une orientation active.

Elle ne constitue pas une identité absolue de l’utilisateur.

21.7.5.Référentiels de navigation

Plusieurs référentiels peuvent être disponibles :

R_{\mathrm{proximité}}

R_{\mathrm{exploration}}

R_{\mathrm{apprentissage}}

R_{\mathrm{modération}}

Le moteur peut désactiver :

R_{\mathrm{proximité}}

et activer :

R_{\mathrm{exploration}}

afin d’introduire une distance contrôlée.

Le changement doit être enregistré.

21.7.6.Profil relationnel

Pour chaque publication candidate :

\mathcal R(p,L_u)

= (

r_{\mathrm{proximité}},
r_{\mathrm{direction}},
r_{\mathrm{nouveauté}},
r_{\mathrm{compatibilité}},
r_{\mathrm{répétition}},
r_{\mathrm{risque}}

)

Le moteur ne recherche pas uniquement la publication la plus proche.

Il peut rechercher :

21.7.7.Routeur de navigation

Dans le référentiel de proximité :

D_{\mathrm{prox}}

=

\arg\max_p
r_{\mathrm{proximité}}

sous contraintes.

Dans le référentiel d’exploration :

D_{\mathrm{expl}}

=

\arg\max_p
r_{\mathrm{nouveauté}}

avec :

r_{\mathrm{compatibilité}}
\geq
\theta_c

et :

r_{\mathrm{risque}}
\leq
\theta_r

Le même profil relationnel peut donc produire plusieurs navigations.

21.7.8.Mémoire des parcours

La mémoire conserve :

\Omega_u

= (

\Gamma_u,

R_u, L_u,

\Pi_u

)

Cette mémoire ne doit pas réduire l’utilisateur à une catégorie fixe.

Elle conserve une trajectoire évolutive.

21.7.9.Validation de Cercle

Les métriques classiques peuvent inclure :

Mais elles ne suffisent pas.

Il faut aussi mesurer :

21.8.Cas VII — Cartographie stratégique d’entreprise

Une entreprise souhaite analyser ses risques de dépendance.

Les sources comprennent :

21.8.1.Lectures

Chaque source possède une lecture spécialisée :

Q_{\mathrm{contrats}}

Q_{\mathrm{finance}}

Q_{\mathrm{organisation}}

Q_{\mathrm{compétences}}

21.8.2.Compose organisationnel

Compose construit les dépendances :

Q_s =

\operatorname{Compose}

(

\text{fournisseur},
\text{contrat},
\text{équipe},
\text{projet},
\text{revenu}

)

Il conserve les relations causales et temporelles connues.

21.8.3.Référentiels

L’entreprise peut être lue selon :

R_{\mathrm{financier}}

R_{\mathrm{opérationnel}}

R_{\mathrm{juridique}}

R_{\mathrm{stratégique}}

Une dépendance peut être faible financièrement mais critique opérationnellement.

Les lectures doivent rester séparées.

21.8.4.Relations

Pour un fournisseur :

\mathcal R_f

= (

r_{\mathrm{coût}},
r_{\mathrm{substituabilité}},
r_{\mathrm{criticité}},
r_{\mathrm{concentration}},
r_{\mathrm{risque}}

)

Pour une compétence :

\mathcal R_c

= (

r_{\mathrm{rareté}},
r_{\mathrm{centralité}},
r_{\mathrm{transmission}},
r_{\mathrm{dépendance}}

)

21.8.5.Routeur stratégique

Le routeur peut produire :

La décision dépend du référentiel principal et de chaque coordonnées de celui-ci car les distances sont présentées tels les résultats d’une distribution multiplicative et absolue.

Une stratégie financière peut privilégier le coût.

Une stratégie de continuité peut privilégier la résilience.

Une stratégie commerciale peut privilégier la radiation.

21.8.6.Mémoire organisationnelle

La mémoire conserve :

Une décision stratégique peut ensuite être évaluée selon ses conséquences réelles.

L’entreprise ne conserve pas seulement ce qu’elle a décidé.

Elle conserve pourquoi elle l’a décidé et ce qui s’est produit ensuite.

21.9.Cas VIII — Apprentissage adaptatif et Future of Work

Un système d’apprentissage doit proposer un parcours à une personne.

Il dispose de :

21.9.1.Lecture du profil

Q_0 =

\Phi_{\mathrm{apprentissage}}(x)

La lecture ne doit pas réduire la personne à une note globale.

Elle peut produire :

Q_0 = (

\text{compétences},
\text{préférences},
\text{progression},
\text{obstacles},
\text{objectifs}

)

21.9.2.Référentiels

Plusieurs référentiels peuvent être actifs :

R_{\mathrm{compétences}}

R_{\mathrm{pédagogique}}

R_{\mathrm{motivation}}

R_{\mathrm{emploi}}

Le même exercice peut être agencé selon la progression pédagogique et non attribuable selon l’objectif professionnel immédiat.

21.9.3.Qualification

Le système qualifie :

Cette qualification doit rester révisable.

Une erreur ponctuelle ne doit pas devenir une identité durable.

21.9.4.Relations

Chaque ressource pédagogique reçoit :

\mathcal R_i

=

(

r_{\mathrm{prérequis}},
r_{\mathrm{difficulté}},
r_{\mathrm{objectif}},
r_{\mathrm{nouveauté}},
r_{\mathrm{charge}}

)

21.9.5.Routeur pédagogique

Le routeur peut :

L’option la plus proche n’est pas toujours la meilleure.

Le système peut choisir une ressource légèrement distante afin de construire des liens.

21.9.6.Mémoire et progression

La mémoire conserve :

Elle doit distinguer :

\text{performance ponctuelle}

de :

\text{compétence consolidée}

21.9.7.Risque

Un système adaptatif peut enfermer une personne dans un profil.

L’ÉTR doit donc permettre :

21.10.Cas IX — Système multi-agent scientifique

Une équipe d’agents doit produire une revue de littérature.

Agents :

a_{\mathrm{recherche}}

a_{\mathrm{extraction}}

a_{\mathrm{méthode}}

a_{\mathrm{contradiction}}

a_{\mathrm{synthèse}}

21.10.1.Routage des tâches

Le routeur attribue :

D_i =

\operatorname{RouteTo}(a_i)

selon :

21.10.2.Sorties comme qualifications candidates

Chaque agent produit :

Q_i

avec :

Aucune sortie ne devient automatiquement une mémoire validée.

21.10.3.Relations entre sorties

Le système compare :

\rho(Q_i,Q_j)

afin de détecter :

Trois agents répétant le même article ne constituent pas trois validations indépendantes.

21.10.4.Agent de contradiction

L’agent de contradiction cherche :

Il ne doit pas seulement critiquer la synthèse finale.

Il intervient avant la décision.

21.10.5.Synthèse

Le routeur décide :

La synthèse finale conserve :

21.10.6.Mémoire collective

La mémoire commune doit enregistrer :

Elle ne doit pas effacer la provenance individuelle.

21.11.Cas X — Application complète intégrale

Considérons maintenant un cas unique suivi de bout en bout.

Une publication apparaît sur Cercle :

Une nouvelle méthode permettrait de réduire de moitié la consommation énergétique des centres de données.

L’objectif du système est de déterminer :

21.11.1.Entrée

x =

\text{publication brute}

La provenance contient :

\Pi_x

= (

\text{auteur},
\text{date},
\text{support},
\text{liens},
\text{médias}

)

21.11.2.Lecture multimodale

Q_{\mathrm{texte}}

=

\Phi_{\mathrm{texte}}(x)
Q_{\mathrm{source}}

=

\Phi_{\mathrm{documentaire}}(x)
Q_{\mathrm{image}}

=

\Phi_{\mathrm{vision}}(x)

La lecture textuelle extrait :

La lecture documentaire identifie :

21.11.3.Compose

Q_s =

\operatorname{Compose}

(

Q_{\mathrm{texte}},
Q_{\mathrm{source}},
Q_{\mathrm{image}}

)

Compose conserve que :

21.11.4.Référentiels

Plusieurs référentiels peuvent être mobilisés :

R_{\mathrm{énergie}}

R_{\mathrm{science}}

R_{\mathrm{innovation}}

R_{\mathrm{fiabilité}}

R_{\mathrm{navigation}}

Le référentiel scientifique qualifie l’état de preuve.

Le référentiel d’innovation qualifie la nouveauté.

Le référentiel de navigation détermine les utilisateurs susceptibles d’être intéressés.

21.11.5.Qualification

Le système peut produire :

Q_q =

(

\text{affirmation technique},
\text{forte amplitude},
\text{source insuffisamment établie},
\text{innovation potentielle},
\text{vérification requise}

)

Le terme « permet » ne doit pas être transformé en résultat établi.

La modalité « permettrait » indique déjà une réserve.

21.11.6.Relation aux pintones

La publication peut être positionnée relativement à des pintones comme :

La relation peut être :

\mathcal R_{\mathrm{pintones}}

= (

r_1,\ldots,r_n

)

21.11.7.Relation à la LOI utilisateur

Pour un utilisateur orienté vers :

L_u = (

\text{IA},
\text{énergie},
\text{infrastructure}

)

le profil peut être :

\mathcal R_u

= (

r_{\mathrm{proximité}}=0{,}89,
r_{\mathrm{nouveauté}}=0{,}76,
r_{\mathrm{fiabilité}}=0{,}41,
r_{\mathrm{compatibilité}}=0{,}93

)

21.11.8.Routage

Dans un référentiel de proximité, la publication pourrait être sélectionnée.

Mais le faible niveau de fiabilité peut imposer une qualification visible :

D =

\text{afficher avec statut « affirmation à vérifier »}

Une politique plus stricte pourrait décider :

D =

\text{ne pas recommander comme connaissance établie}

Les deux décisions utilisent le même profil relationnel.

21.11.9.Recherche documentaire secondaire

Le routeur peut déclencher :

D_2 =

\operatorname{VERIFY}

Le système recherche :

De nouvelles preuves peuvent modifier :

\operatorname{Stat}(\mathcal C)

de l’affirmation :

La méthode réduit de moitié la consommation.

21.11.10.Mise à jour

La mémoire conserve séparément :

. la publication ; . l’affirmation ; . la qualification initiale ; . les relations ; . la décision de navigation ; . les sources retrouvées ; . le statut actualisé.

La publication ne doit pas être réécrite après la vérification.

Son affirmation doit être reliée au nouveau dossier de preuve.

21.11.11.Évolution

Supposons qu’une étude indépendante conclue à une réduction moyenne

de 18\%.

La mémoire conserve :

\mathcal C_1

=

\text{réduction annoncée de }50\%
\mathcal C_2

=

\text{réduction observée de }18\%

avec :

\mathcal C_2
\overset{\text{limite}}{\longrightarrow}
\mathcal C_1
Le système ne remplace pas silencieusement 50\% par 18\%.

Il conserve l’histoire de l’affirmation.

21.11.12.Validation complète

Ce cas peut être utilisé pour évaluer :

Le pipeline complet devient :

\begin{aligned}

x

&\overset{\Phi}{\longmapsto}

Q_0

\\
&\overset{\operatorname{Compose}}{\longmapsto}

Q_s

\\
&\overset{\Lambda_R}{\longmapsto}

Q_q

\\
&\overset{\rho_R}{\longmapsto}
\mathcal R
\\
&\overset{\operatorname{Router}}{\longmapsto}

D

\\
&\overset{\operatorname{Update}}{\longmapsto}
\Omega'
\\
&\overset{\mathcal P}{\longmapsto}
\mathcal D_{\mathrm{preuve}}
\\
&\longrightarrow
\operatorname{Stat}(\mathcal C).
\end{aligned}

}

Le protocole de validation n’est donc pas extérieur au parcours.

Il accompagne la chaîne et modifie le statut des affirmations produites ou rencontrées.

21.12.Le rôle des architectures existantes

Les applications précédentes montrent que l’ÉTR n’exige pas la disparition des modèles existants.

Elle peut utiliser :

On peut écrire :

\Phi

=

\Phi_{\mathrm{CNN}}
\Lambda

=

\Lambda_{\mathrm{LLM}}
\rho

=

\rho_{\mathrm{embedding}}

D =

\operatorname{Router}_{\mathrm{règles}}

L’ÉTR ne définit pas toujours l’algorithme interne de chaque fonction.

Elle définit leur place, leur contrat, leur relation et leurs effets.

21.13.Ce que l’ÉTR unifie réellement

L’ÉTR n’unifie pas toutes les données en une représentation unique.

Elle n’unifie pas toutes les relations en une métrique unique.

Elle n’unifie pas toutes les décisions en une politique unique.

Elle unifie la manière de décrire leur articulation.

Cette distinction est essentielle.

L’unification porte sur :

\text{les rôles}

\text{les contrats}

\text{les transformations}

\text{les provenances}

\text{les statuts}

Elle ne porte pas sur l’effacement des différences entre domaines.

21.14.Limites applicatives

L’usage de l’ÉTR peut introduire plusieurs coûts.

La séparation des objets augmente :

Une architecture ÉTR mal définie peut devenir :

La présence de traces ne garantit pas leur qualité.

La déclaration d’un référentiel ne garantit pas sa validité.

La séparation des fonctions ne garantit pas qu’elles soient correctement implémentées.

L’ÉTR apporte donc une discipline.

Elle ne remplace ni le travail scientifique ni le travail d’ingénierie.

21.15.Conditions de déploiement

Avant tout déploiement, le système doit répondre à plusieurs questions.

Quels objets sont réellement nécessaires ?

Quels référentiels doivent être actifs ?

Quelles transformations doivent être instrumentées ?

Quelles décisions exigent un humain ?

Quelles informations doivent être mémorisées ?

Quelles informations ne doivent pas l’être ?

Quels protocoles doivent être exécutés en continu ?

Quels événements imposent une abstention ou un arrêt ?

Une architecture complète n’est pas nécessairement une architecture maximale.

La bonne implémentation est celle qui conserve les distinctions utiles au problème étudié sans ajouter des objets sans fonction.

21.16.Une architecture comme système évolutif

L’ÉTR permet d’envisager des systèmes dans lesquels :

Cette évolution ne doit pas obligatoirement détruire l’ensemble du système.

Chaque changement peut être localisé.

\Delta

= (

\text{objet modifié},
\text{dépendances},
\text{protocoles affectés},
\text{preuves à réviser}

)

L’architecture devient ainsi révisable sans devenir indéterminée.

21.17.Le noyau commun

À travers le langage, la vision, la robotique, la recherche, l’entreprise, l’apprentissage et les réseaux sociaux, la même structure réapparaît :

\text{Lire}
\rightarrow
\text{construire}
\rightarrow
\text{qualifier}
\rightarrow
\text{relier}
\rightarrow
\text{décider}
\rightarrow
\text{mémoriser}
\rightarrow
\text{éprouver}

}

Chaque domaine remplit ces fonctions avec ses propres outils.

Un CNN ne devient pas un LLM.

Un référentiel juridique ne devient pas un référentiel pédagogique.

Une décision robotique ne devient pas une recommandation sociale.

Mais leurs transformations peuvent être décrites selon une même architecture fonctionnelle.

Conclusion générale — Une architecture, plusieurs mondes

L’ÉTR est née d’une question :

Comment représenter et exploiter des transformations relationnelles sans confondre les objets, les interprétations, les relations, les décisions et la mémoire ?

La réponse proposée par cet ouvrage ne consiste pas en une équation unique destinée à remplacer toutes les autres.

Elle consiste en une architecture.

Cette architecture distingue :

\text{l’objet}

de :

\text{sa lecture}

la lecture de :

\text{sa qualification}

la qualification de :

\text{sa relation aux autres états}

la relation de :

\text{la décision qui l’exploite}

et la décision de :

\text{la mémoire qui en conserve les effets}

Cette séparation ne fragmente pas artificiellement le système.

Elle rend ses transformations observables.

Elle permet de modifier un référentiel sans réécrire la structure.

Elle permet de changer une politique sans falsifier les relations.

Elle permet de corriger une qualification sans effacer l’entrée.

Elle permet de réviser une mémoire sans perdre l’histoire.

Elle permet enfin de construire des protocoles capables d’atteindre des affirmations localisées plutôt que de prononcer des verdicts globaux.

L’ÉTR ne prétend pas que tout phénomène puisse être entièrement rendu explicite.

Elle affirme qu’un système devient plus gouvernable lorsque les transformations qui peuvent être déclarées le sont effectivement.

Les architectures existantes conservent donc leur rôle.

Les Transformers restent des instruments puissants de représentation et de génération contextuelles.

Les CNN restent adaptés à l’apprentissage de structures locales.

Les GNN restent adaptés à la propagation sur graphes.

Les moteurs documentaires restent efficaces pour la recherche.

Les agents restent capables de distribuer les tâches et les actions.

L’ÉTR ne les remplace pas.

Elle propose un langage permettant de les situer dans une chaîne commune, de déclarer leurs responsabilités et de conserver les conditions de leurs productions.

Le résultat peut être résumé par le pipeline général :

x

\overset{\Phi}{\longmapsto}

Q_0

\overset{\operatorname{Compose}}{\longmapsto}

Q_s

\overset{\Lambda_R}{\longmapsto}

Q_q

\overset{\rho_R}{\longmapsto}
\mathcal R
\overset{\operatorname{Router}}{\longmapsto}

D

\overset{\operatorname{Update}}{\longmapsto}
\Omega'

}

auquel s’ajoute la chaîne scientifique :

\mathcal C
\overset{\mathcal P}{\longrightarrow}
\mathcal D_{\mathrm{preuve}}
\longrightarrow
\operatorname{Stat}(\mathcal C)

}

La première décrit comment un système transforme une entrée.

La seconde décrit comment les affirmations portant sur ce système deviennent éprouvables.

Ensemble, elles définissent la proposition essentielle du traité :

\text{une architecture relationnelle ne doit pas seulement produire des

résultats ;} }

\text{elle doit permettre de situer, comprendre, contrôler et réviser les

transformations qui les produisent.} }

L’unité de l’ÉTR ne réside donc pas dans l’uniformité des mondes auxquels elle s’applique.

Elle réside dans la stabilité des questions qu’elle impose à chacun d’eux :

Si ces questions peuvent recevoir une réponse précise, l’architecture technologique et mathematique devient proche de chaque chaque élements envisagés et synergiques à l’utilisateur, en ne devenant plus une succession opaque de calculs.

Elle devient un système relationnel stable, combinatoire et dynamique exprimé dans ce livre : très proche du résultats d’une architecture cognitive biologique : examinable, mesurable, composable et révisable.

C’est au titre et au seuil suivant que s’achève cet ouvrage.

Ses objets, ses relations, ses applications et les conditions de leur mise en œuvre et à l’épreuve disposent désormais d’un langage commun à partir duquel la recherche peut réellement commencer.