Clefs pour lire les planches de cet atlas.Keys to reading the plates in this atlas.
Comment fonctionne un transformerHow a transformer works
Un modèle de langage empile des dizaines de couches identiques.
Chaque couche traite le texte en deux étapes, toujours dans le même ordre :A language model stacks dozens of identical layers.
Each layer processes the text in two steps, always in the same order:
Les connexions résiduelles (tirets) permettent au signal de contourner
une étape — sans elles, empiler 30+ couches ne fonctionnerait pas.The residual connections (dashed) let the signal bypass
a step — without them, stacking 30+ layers wouldn't work.
Mesures de la fichePlate measurements
Paramètres
Nombre total de valeurs numériques (« poids ») du modèle. Plus il y en a, plus le modèle est expressif — mais aussi gourmand en mémoire et en calcul.
Couches
Nombre de blocs transformer empilés. Chaque couche traite l'information en séquence : plus il y en a, plus le modèle raisonne « en profondeur ».
d_embed
Dimension d'embedding — la taille du vecteur qui représente chaque mot dans le réseau. C'est la « largeur » du modèle : un vecteur plus grand capture plus de nuances.
d_ff
Dimension feed-forward — la largeur de la couche intermédiaire du sous-réseau feed-forward. Généralement 2× à 8× d_embed. C'est là que le réseau a le plus de « place pour réfléchir ».
Têtes
Nombre de têtes d'attention. Chaque tête apprend un type de relation différent entre les mots (syntaxe, coréférence, position…). Les têtes « kv » sont des têtes clé-valeur partagées entre plusieurs têtes de requête — une technique (GQA) qui économise la mémoire sans perdre beaucoup de qualité.
Contexte
Nombre maximum de tokens (mots/sous-mots) que le modèle peut voir d'un coup. Un contexte de 8K ≈ 12 pages ; 128K ≈ un livre entier.
Vocabulaire
Nombre de tokens distincts que le modèle connaît : mots entiers, syllabes, caractères spéciaux. Un vocabulaire plus grand reconnaît plus de mots directement, mais coûte plus de mémoire.
Quantification
Technique de compression des poids. F16 = 16 bits par poids (demi-précision). Q4_K = ~4 bits par poids. Plus c'est compressé, plus le modèle est petit et rapide — au prix d'une légère perte de précision.
Parameters
Total number of numeric values ("weights") in the model. More of them means a more expressive model — but also heavier on memory and compute.
Layers
Number of stacked transformer blocks. Each layer processes information in sequence: more of them means the model reasons "more deeply".
d_embed
Embedding dimension — the size of the vector representing each word inside the network. It's the model's "width": a bigger vector captures more nuance.
d_ff
Feed-forward dimension — the width of the feed-forward sub-network's intermediate layer. Usually 2× to 8× d_embed. This is where the network has the most "room to think".
Heads
Number of attention heads. Each head learns a different kind of relationship between words (syntax, coreference, position…). "kv" heads are key-value heads shared across several query heads — a technique (GQA) that saves memory without losing much quality.
Context
Maximum number of tokens (words/sub-words) the model can see at once. An 8K context ≈ 12 pages; 128K ≈ an entire book.
Vocabulary
Number of distinct tokens the model knows: whole words, syllables, special characters. A larger vocabulary recognizes more words directly, at the cost of more memory.
Quantization
A weight-compression technique. F16 = 16 bits per weight (half precision). Q4_K = ~4 bits per weight. The more compressed, the smaller and faster the model — at the cost of a slight precision loss.
Composants du transformerTransformer components
Attention
Le mécanisme qui permet à chaque mot de « regarder » les autres mots pour comprendre le contexte. Quatre matrices (Q, K, V, O) transforment les vecteurs pour calculer quels mots sont pertinents les uns pour les autres. C'est le cœur du transformer.
Feed-Forward
Un petit réseau de neurones appliqué à chaque position indépendamment (gate, up, down). C'est là que le modèle « digère » l'information après l'avoir lue par l'attention. Souvent 2/3 des paramètres d'une couche.
Normalisation
Stabilise les valeurs entre les couches pour que le réseau converge bien. Comme un thermostat : empêche les signaux de devenir trop grands ou trop petits en traversant les couches.
Attention
The mechanism that lets each word "look at" the other words to understand context. Four matrices (Q, K, V, O) transform vectors to compute which words matter to each other. This is the transformer's core.
Feed-Forward
A small neural network applied to each position independently (gate, up, down). This is where the model "digests" the information after reading it through attention. Often 2/3 of a layer's parameters.
Normalization
Stabilizes values between layers so the network converges well. Like a thermostat: keeps signals from becoming too large or too small as they pass through layers.
Abréviations des tenseursTensor abbreviations
Les noms courts affichés dans le spectre et la morphologie, groupés par famille.
The short names shown in the spectrum and morphology diagrams, grouped by family.
Attention classique — attn.*
attn.q · attn.k · attn.v
Matrices Query / Key / Value : projettent chaque token pour calculer qui doit « regarder » qui.
attn.o
Projection de sortie de l'attention — recombine les têtes en un seul vecteur.
attn.qkv
Variante où Q, K et V sont fusionnées en une seule matrice, plus compacte.
Attention linéaire (hybride) — lin.*
lin.qkv · lin.z · lin.o · lin.in
Entrée, porte de sortie et projection finale d'un bloc récurrent (type SSM/Mamba) qui remplace l'attention classique sur certaines couches — plus rapide sur les longs contextes. Le nom exact (lin.qkv ou lin.in) dépend de la génération du bloc Mamba.
lin.a · lin.b · lin.A · lin.dt · lin.x · lin.d
Paramètres de la récurrence : lin.A contrôle ce que l'état « oublie », lin.dt règle la vitesse de mise à jour, lin.x prépare les coefficients de la récurrence, lin.d est une connexion directe (skip) en parallèle.
lin.conv
Petite convolution locale appliquée avant la récurrence, pour capter le contexte immédiat.
Normalisation juste avant l'attention et juste avant le feed-forward de chaque couche.
norm.q · norm.k
Normalisation appliquée directement aux projections Query/Key — stabilise l'entraînement des grands modèles.
norm.final
Dernière normalisation, juste avant de prédire le mot suivant.
embed · output
embed convertit chaque token en vecteur à l'entrée ; output fait l'inverse en sortie (vecteur → probabilités sur le vocabulaire).
Tour de vision — vt.*
vt.attn.qkv · vt.attn.proj
Attention de l'encodeur d'image — même principe que attn.*, mais appliquée à des patchs d'image plutôt qu'à des mots.
vt.ff.up · vt.ff.down
Feed-forward de l'encodeur d'image.
vt.norm.attn · vt.norm.ffn
Normalisations de l'encodeur d'image.
Classic attention — attn.*
attn.q · attn.k · attn.v
Query / Key / Value matrices: project each token to compute who should "look at" whom.
attn.o
Attention output projection — recombines the heads into a single vector.
attn.qkv
A variant where Q, K and V are fused into a single, more compact matrix.
Linear attention (hybrid) — lin.*
lin.qkv · lin.z · lin.o · lin.in
Input, output gate, and final projection of a recurrent block (SSM/Mamba-type) that replaces classic attention on some layers — faster on long contexts. The exact name (lin.qkv or lin.in) depends on the Mamba block generation.
lin.a · lin.b · lin.A · lin.dt · lin.x · lin.d
Recurrence parameters: lin.A controls what the state "forgets", lin.dt sets the update speed, lin.x prepares the recurrence coefficients, lin.d is a parallel direct (skip) connection.
lin.conv
A small local convolution applied before the recurrence, to capture immediate context.
lin.norm
Internal normalization specific to the linear block.
Normalization right before attention and right before the feed-forward of each layer.
norm.q · norm.k
Normalization applied directly to the Query/Key projections — stabilizes training for large models.
norm.final
The last normalization, right before predicting the next word.
embed · output
embed converts each token into a vector on input; output does the reverse on output (vector → probabilities over the vocabulary).
Vision tower — vt.*
vt.attn.qkv · vt.attn.proj
Image encoder attention — same principle as attn.*, but applied to image patches rather than words.
vt.ff.up · vt.ff.down
Image encoder feed-forward.
vt.norm.attn · vt.norm.ffn
Image encoder normalizations.
Spectre des poidsWeight spectrum
Grille
Chaque cellule représente un tenseur (une matrice de poids) : les colonnes sont les couches (0 → n), les lignes sont les composants (attention, feed-forward…).
Couleur
Indique la famille du composant — bleu pour l'attention, brun pour le feed-forward, violet pour la normalisation, vert pour la tour de vision.
Intensité
Proportionnelle au RMS (root mean square — la magnitude moyenne des poids) du tenseur, en échelle logarithmique, normalisée famille par famille (attention, feed-forward, normalisation…) plutôt que sur toute la planche : chaque famille a sa propre plage de magnitude naturelle, donc partager une seule échelle aplatirait les variations à l'intérieur de chacune. Une cellule plus intense = poids plus marqués par rapport aux autres couches du même type.
Grid
Each cell represents a tensor (a weight matrix): columns are layers (0 → n), rows are components (attention, feed-forward…).
Color
Indicates the component's family — blue for attention, brown for feed-forward, purple for normalization, green for the vision tower.
Intensity
Proportional to the tensor's RMS (root mean square — the average weight magnitude), on a log scale, normalized family by family (attention, feed-forward, normalization…) rather than across the whole plate: each family has its own natural magnitude range, so sharing one scale would flatten the variation within each. A more intense cell = stronger weights relative to the other layers of the same type.
Traits architecturauxArchitectural traits
Le spécimen miniature
Le même dessin que la planche comparative, mais pour ce modèle seul : la largeur se répartit selon le nombre réel de paramètres de chaque famille — bleu pour l'attention, vert (teinte foncée) pour l'attention linéaire des modèles à état comme Mamba ou hybrides, brun pour le feed-forward (rayé si MoE). Un modèle purement à état (aucune attention classique) se dessine donc tout en vert. La ligne pointillée dans le bleu marque la frontière GQA — la part des têtes qui partagent leurs clés/valeurs. Le petit carré vert clair séparé, quand il y en a un, est la tour de vision, dessinée à sa taille réelle par rapport au reste du modèle — à ne pas confondre avec le vert foncé de l'attention linéaire, qui fait partie du rectangle principal.
Traits en texte
Attention hybride (mélange de couches linéaires rapides et de couches d'attention complètes), MoE (mixture d'experts — seuls quelques experts s'activent par token), nombre de blocs de la tour de vision.
The mini-specimen
The same drawing as the comparative plate, but for this model alone: width splits by each family's real parameter count — blue for attention, dark green for the linear attention of state-space models like Mamba or hybrids, brown for feed-forward (striped if MoE). A purely state-space model (no classic attention at all) draws entirely green. The dashed line inside the blue marks the GQA boundary — the share of heads that share their keys/values. The separate light-green square, when present, is the vision tower, drawn at its real size relative to the rest of the model — not to be confused with the darker green of linear attention, which is part of the main rectangle.
Text traits
Hybrid attention (a mix of fast linear layers and full attention layers), MoE (mixture of experts — only a few experts activate per token), number of vision tower blocks.
Morphologie d'une coucheLayer morphology
Rectangles
Chaque rectangle représente un tenseur (matrice de poids) d'une couche représentative. Le ratio largeur/hauteur correspond aux dimensions réelles de la matrice (une matrice carrée donne un carré). La surface est proportionnelle au nombre de paramètres — on voit d'un coup où se concentre la masse du modèle.
Rectangles
Each rectangle represents a tensor (weight matrix) from a representative layer. The width/height ratio matches the matrix's real dimensions (a square matrix gives a square). The area is proportional to the parameter count — showing at a glance where the model's mass is concentrated.
Planche comparative — à même échelle
Chaque bloc est dessiné à l'échelle réelle de la taille du modèle sur le disque (l'aire du rectangle lui est proportionnelle) — pas du nombre de paramètres, qui peut varier différemment selon la quantification. Sous chaque bloc : nombre de paramètres, puis taille sur le disque. La largeur se répartit entre attention (bleu) et feed-forward (brun) — plein si dense, rayé si le modèle utilise un mélange d'experts (MoE).