Sonaria CampusSonaria CampusLe Kiosque est ouvertEntrer

La méthode

La méthode
Sonaria

Cadrer l'intelligence artificielle pour étudier

Partie I

Synthèse

Le constat

L'intelligence artificielle générative est entrée dans le travail étudiant en deux ou trois ans. Elle y est aujourd'hui d'un usage quotidien, à tous les niveaux : comprendre un cours, préparer un examen, produire un devoir.

Rien n'a accompagné cette arrivée. Ni méthode enseignée, ni règles partagées, ni outils conçus pour cet usage. La disposition la plus répandue dans les établissements est une sanction : un travail où l'IA est détectée est invalidé. À côté, quelques enseignants l'autorisent pour des tâches sans enjeu, et quelques établissements proposent une initiation comparable à celle qui accompagnait l'arrivée d'Internet.

Cette situation coûte quelque chose à chacun. Un étudiant peut rendre un travail correct sans avoir appris. Un autre s'abstient et prend du retard sur ceux qui s'en servent. Un enseignant doit trancher sans référence ni preuve. Un établissement maintient une règle qu'il n'a pas les moyens d'appliquer.

Il n'y a de faute nulle part. Un outil est arrivé avant les usages qui auraient permis de s'en servir, avant les méthodes qui auraient permis de l'enseigner, et avant le cadre qui aurait permis de l'autoriser. Le problème n'est pas qu'on ait mal réagi ; c'est qu'il est difficile, et qu'il concerne à la fois ce qu'on apprend, comment on l'évalue et ce qu'on autorise.

Ce document décrit une réponse construite à l'usage, éprouvée sur une année d'études, et les travaux sur lesquels elle s'appuie.

Les quatre problèmes

Quand une session de travail avec l'IA ne donne rien, la cause se ramène presque toujours à l'une de ces quatre-là. Elles se distinguent nettement les unes des autres, et chacune appelle une réponse différente.

Le prompting

Prompter est sans doute la compétence la plus sous-estimée de l'usage courant. On l'imagine accessoire — une question posée plus ou moins bien — alors que c'est là que tout se décide : la consigne est le seul moment où l'on peut dire au modèle comment travailler.

La demande courante décrit un résultat : « fais une fiche de ce cours ». Le modèle en produit une, correcte, et qui n'apporte rien de plus que ce qu'il aurait produit sans la demande. C'est logique : une consigne qui décrit un résultat ne lui transmet rien qu'il ne sache déjà faire. Peu d'utilisateurs savent ce qu'un prompt destiné à travailler un cours devrait contenir, et rien ne le leur a jamais montré.

La fenêtre contextuelle

C'est la notion la moins connue, et celle qui explique le plus de frustrations. Beaucoup d'utilisateurs pensent avoir affaire à un interlocuteur distrait, ou de mauvaise volonté. Il s'agit en réalité d'une limite de construction, et le fait de la connaître change complètement la façon de travailler.

Un modèle ne raisonne que sur une quantité limitée d'information à la fois. Ce qui déborde de cette limite cesse simplement d'exister pour lui. Il oublie alors ses consignes, perd l'objectif de départ, ignore ce qui avait été compris ou raté plus tôt. Rien de tout cela n'est une panne : c'est le fonctionnement normal d'un outil dont on ignorait la contrainte.

La fiabilité

Un modèle de langage n'a pas de façon de signaler qu'il ne sait pas. C'est ce qui rend la question délicate : ce n'est pas qu'il se trompe souvent, c'est qu'il se trompe avec exactement le même ton que lorsqu'il a raison.

Une date, une règle, une référence peuvent être produites avec la même assurance qu'une information vérifiée. S'y ajoutent les sources qu'on ne peut pas retrouver et les affirmations formées pour combler un vide plutôt que pour dire quelque chose de vrai. Sur un devoir sans enjeu, c'est sans conséquence. Sur une révision d'examen, cela se paye.

La substitution

C'est le seul des quatre que les établissements aient tenté de réguler, et c'est aussi le plus difficile à traiter, parce qu'il ne se règle pas par une contrainte technique.

Un modèle produit volontiers à la place de la personne. Il donne la réponse avant l'effort, rédige ce qui devait être rédigé, résout ce qui devait être cherché. Le travail rendu est bon, et l'apprentissage n'a pas eu lieu. C'est ce qui explique la position défensive de beaucoup d'établissements : faute de savoir distinguer l'usage qui fait apprendre de celui qui remplace, on interdit les deux.

Les quatre réponses

Au prompting : le cadre

Le modèle ne travaille jamais sans conditions explicites. Pourquoi il produit ce qu'il produit, avec qui il travaille, comment il doit s'y prendre, et ce qu'il ne fait jamais.

Ce cadre ne dicte pas un résultat, il transmet une manière de raisonner. On libère la forme et on injecte le raisonnement lorsque la bonne forme dépend du contenu ; on impose la forme lorsqu'elle porte elle-même la valeur ; on verrouille explicitement les comportements que les modèles adoptent par défaut.

C'est la réponse principale, et les deux dernières en dépendent : ce qui règle la fiabilité et la substitution est écrit à l'intérieur de ce cadre.

À la fenêtre contextuelle : la borner, la tenir, en changer

Trois gestes plutôt qu'un, et le premier est le moins évident.

Le cadre la borne dès le départ. Un modèle à qui l'on n'a rien précisé travaille sur un terrain sans limites : il peut aller partout, donc il y va. Poser un rôle, un objectif et des interdits réduit d'emblée l'espace dans lequel il se déplace. Une bonne partie de ce qu'on attribue à la fenêtre contextuelle vient en réalité d'un cadre trop lâche.

On la tient pendant la séance. Une session ne devient pas inutilisable à la première dérive. Quand le modèle s'écarte, on lui rappelle le cadre, on réinjecte ce qu'il a perdu, on reprécise la consigne. C'est le travail ordinaire d'une séance, et il suffit dans la plupart des cas.

On en ouvre une neuve quand elle est saturée. Arrive un moment où le rappel ne suffit plus. On n'insiste pas : on referme et on rouvre, en transmettant ce qui compte. Cette transmission est courte parce qu'une séance vise toujours un point de contrôle — on voulait faire ceci, on a fait cela, il reste ceci.

À la fiabilité : ce que le cadre interdit

La fiabilité ne se corrige pas après coup, elle s'écrit dans le cadre. Celui-ci fixe les critères de recherche — travailler à partir de la source fournie plutôt que de la mémoire du modèle —, les critères de réponse — ne rien affirmer qu'on ne puisse rattacher à cette source, signaler ce dont on n'est pas sûr —, et les critères de comportement — ne pas combler un vide par une supposition.

Ce qui reste malgré tout se rattrape par une relecture confiée à une passe distincte de celle qui a produit. L'étudiant n'a pas à douter de chaque phrase : le cadre indique les endroits où porter l'attention.

À la substitution : ce que le cadre exige

Même mécanisme, tourné vers ce que le modèle doit faire plutôt que vers ce qu'il doit éviter.

Le cadre lui impose de faire produire avant de livrer, de répondre par un indice tant que l'effort n'a pas eu lieu, de proposer des difficultés à la mesure de la personne, et de terminer ce qu'il produit par quelque chose à faire — une question sans sa réponse, un point à réexpliquer, un élément à retrouver.

Ce n'est pas une sévérité de principe : c'est la condition pour que l'apprentissage ait lieu.

La quantité d'aide dépend du moment. Sur une notion entièrement neuve, interroger quelqu'un qui n'a encore rien à répondre produit de la surcharge plutôt que de l'effort. Ce qui sert alors est un exemple traité en entier, dont on retire les étapes une à une jusqu'à ce que la personne le fasse seule. Le même exemple devient inutile, puis gênant, dès qu'elle sait faire : c'est en cherchant qu'elle progresse à ce stade.

L'aide se règle donc en proportion — inversement proportionnelle à ce que la personne produit déjà seule —, et cette proportion se lit dans ce qu'elle écrit. C'est la raison pour laquelle le cadre interdit au modèle de supposer un niveau : sans mesure, le dosage est arbitraire.

La méthode, en bref

L'intelligence artificielle se cadre au même titre qu'un étudiant apprend à travailler. Apprendre à travailler, c'est adopter des contraintes — interroger sa mémoire au lieu de relire, espacer ses révisions, reformuler avec ses mots. Aucune n'est spontanée, et personne ne trouve anormal qu'on demande à un étudiant de s'y plier. Le même raisonnement vaut pour la machine : on attend beaucoup d'une IA à qui l'on n'a rien demandé de particulier, puis on s'étonne du résultat.

La méthode repose sur deux cadres et un suivi. On cadre le modèle, on cadre la façon de travailler avec lui, et on tient à jour ce que l'un sait de l'autre.

Cadrer le modèle

Tout commence par un prompt d'ouverture, et celui-ci porte beaucoup : qui est la personne, à quel niveau elle travaille, ce qu'elle cherche à obtenir, la façon de raisonner attendue, ce qui est interdit. Le modèle ne produit rien tout de suite — il interroge, précise, vérifie qu'il a compris la situation. C'est de cet échange que naît une session réellement cadrée.

Pendant la séance, le cadre s'use. Quatre signes annoncent qu'il faiblit, et ils se reconnaissent facilement une fois qu'on les connaît. Le ton change, ce qui se remarque justement parce qu'un ton avait été demandé. Le modèle se met à approuver tout ce qu'on avance. Il perd l'objectif — il propose d'aller plus loin sur un point précis en oubliant le chemin d'ensemble. Ou il recommence à affirmer des choses qu'il n'a pas les moyens de savoir.

À chacun de ces signes correspond un geste de maintenance : un prompt court qui remet le cadre en place, sans avoir à tout recommencer.

Cadrer la façon de travailler

Un étudiant qui arrive en disant « j'ai un contrôle dans deux semaines, il faut réviser ce chapitre » a donné une intention, pas un cadre. Le modèle peut alors partir dans n'importe quelle direction : traiter longuement un détail secondaire, survoler l'essentiel, présenter comme central un élément qui ne l'est pas. Le résultat sera correct et hors sujet.

Cadrer la façon de travailler consiste donc à formater la manière de s'adresser au modèle. C'est le rôle des prompts préparés à l'avance : ce qui ne change jamais est écrit une fois, et seules quelques variables — la matière, le niveau, l'objectif du jour, l'échéance — sont renseignées au moment de s'en servir.

Cela vaut aussi pour le rythme. Le travail se découpe en séances plutôt qu'en heures. Une séance porte une notion principale, avec les connaissances périphériques nécessaires pour y arriver, et elle se termine par un point de contrôle : la notion est acquise, ou elle ne l'est pas. Une séance peut être dense ou légère ; ce qui la définit n'est pas sa durée mais ce qu'elle vise.

Ouvrir, tenir, refermer

Une séance a un début, un déroulé et une fin, et la fin compte autant que le reste.

Fermer une séance consiste à demander au modèle l'état atteint — ce qui est acquis, ce qui reste fragile, ce qui vient ensuite — avant de quitter. Ce court état permet de rouvrir plus tard sans repartir de zéro : on ne reprend pas la conversation précédente, on en ouvre une neuve à laquelle on redonne ce qui compte.

Le suivi

Reste ce qui relie les séances entre elles. Une personne décrit sa situation une première fois, et l'outil s'en fait une image ; quelques mois plus tard, cette image ne correspond plus à rien. C'est le rôle du suivi que de la tenir à jour, à partir de ce qui a été réellement fait.

Son intérêt se voit surtout quand les choses ne se passent pas comme prévu. Un plan de révision établi sur six jours de deux heures devient inapplicable après une semaine d'absence. Un accompagnement qui sait d'où l'on part, où l'on va et quelles étapes restent peut reconstruire un chemin praticable vers la même échéance. Un accompagnement qui l'ignore ne peut que recommencer.

La couche pédagogique

Tout ce qui précède décrit comment rendre une IA fiable et suivie. C'est nécessaire, et ce n'est pas encore de la pédagogie. La question qui reste est plus ancienne que l'informatique : qu'est-ce qui fait un bon accompagnement ?

Ce qu'un accompagnement n'est pas

La réponse la plus répandue, y compris chez ceux qui enseignent, consiste à décrire un bon enseignant par ce qu'il sait. C'est une part du métier et ce n'est pas celle qui distingue. Beaucoup de gens savent ; peu font apprendre.

La pédagogie française a formulé cette distinction avec insistance. Philippe Meirieu, dans Apprendre… oui, mais comment (1987), pose que le savoir ne se transmet pas comme un objet : c'est l'élève qui construit, et le rôle de l'enseignant est de créer les conditions de cette construction. On ne peut apprendre à personne — on peut permettre à quelqu'un d'apprendre.

Cette idée a une conséquence directe pour ce qui nous occupe. Un outil qui explique bien n'accompagne pas. Il faut qu'il fasse construire, et cela relève d'un savoir-faire différent de la connaissance du sujet.

Ce que fait un bon accompagnant

Ce savoir-faire est observable. Prenons une situation banale : un étudiant demande pourquoi une règle s'applique dans un cas et pas dans un autre, qui lui paraît identique.

Un professeur pourrait répondre directement. Ce n'est presque jamais ce qu'il fait. Sa première réaction est de chercher d'où vient la question — ce qui, dans ce que l'étudiant vient de lire, a produit cette interrogation. Non par curiosité : parce que la question posée est presque toujours le symptôme d'autre chose. Une information a construit un raisonnement qui ne tient pas, et la question est la façon dont l'étudiant tente d'en sortir. Répondre à la question laisse ce raisonnement intact, et il ressortira ailleurs.

Ce que l'exemple met en évidence dépasse le cas : accompagner, c'est diagnostiquer avant de répondre. Le travail consiste à trouver la confusion précise, puis à la défaire, puis à vérifier qu'elle est bien défaite en faisant reformuler ou appliquer ailleurs. L'étudiant ne repart pas avec une réponse, mais avec une compréhension qui tient.

Ce diagnostic repose sur une mécanique plus élémentaire, qu'il ne remplace pas : faire répondre, dire immédiatement ce qui va et ce qui ne va pas, reprendre à deux. C'est la partie la plus difficile à obtenir d'un outil, et c'est aussi celle sans laquelle le reste ne tient pas — un accompagnement qui diagnostique finement mais ne fait pas produire n'accompagne pas.

Deux objectifs coexistent d'ailleurs chez lui, et un accompagnement doit tenir les deux. Il y a l'objectif réel — réussir un examen, comprendre un chapitre — et l'objectif de l'instant, souvent bien plus petit : sortir d'une confusion apparue il y a trente secondes. Ne voir que le premier, c'est passer à côté de ce qui se joue.

Ce que ça demande à l'outil

Cette séquence — comprendre pourquoi la question existe, identifier la confusion, la défaire, faire participer — est ce que la couche pédagogique doit encoder. Pas une liste de réponses types, mais une manière de se comporter.

Et parce qu'il s'agit d'une application plutôt que d'une conversation en face à face, la participation demandée doit rester légère. Un choix, un clic, une reformulation courte — de quoi faire produire quelque chose sans transformer chaque échange en exercice de rédaction.

Ce vers quoi tend ce travail est donc la formulation du raisonnement d'un pédagogue — pas d'un professeur de mathématiques ou d'anglais, d'un pédagogue tout court.

Ce que la construction a rencontré

Transformer un modèle de langage en tuteur oblige à répondre à des questions qui se posent d'elles-mêmes, dans un ordre assez contraint. Il faut que l'outil sache à qui il s'adresse, sans quoi il ne peut rien adapter. Il faut que cette connaissance reste vraie dans le temps, sans quoi elle devient une gêne plutôt qu'une aide. Il faut enfin qu'il sache comment se comporter, ce qui n'a rien à voir avec ce qu'il sait.

Ces exigences ne sont pas des choix : elles apparaissent dès qu'on essaie de construire la chose sérieusement. Chacune correspond à un travail établi, ce qui signifie surtout que le terrain a été exploré avant nous.

Sur l'intérêt d'accompagner individuellement. La comparaison entre l'enseignement collectif et l'accompagnement d'une personne seule est mesurée depuis les années 1980, et l'écart est net en faveur du second. Ce que les synthèses successives ont surtout permis de préciser, c'est ce qui le porte : dans les dispositifs qui obtiennent les meilleurs résultats, le tutorat s'accompagne d'une exigence de maîtrise — on ne passe pas à la suite tant que ce n'est pas acquis. C'est cette exigence, davantage que l'attention d'un tuteur, qui explique l'essentiel du gain.

La conséquence pratique est directe. Un tuteur par personne ne se finance pas ; le refus d'avancer tant que ce n'est pas acquis, lui, s'écrit dans un cadre. C'est la raison pour laquelle une séance se termine ici par un point de contrôle et non par une durée.

Une seconde mesure éclaire la suite. La revue qui compare les formes d'accompagnement constate qu'un système tutoriel bien conçu obtient un effet proche de celui d'un tuteur humain, et que les deux dépassent largement un usage où l'on donne sa réponse et où l'on se fait dire si elle est bonne. Le constat porte sur la forme de l'échange, et il est établi bien avant l'arrivée des modèles de langage.

Sur la nécessité de connaître l'apprenant. Le domaine des Intelligent Tutoring Systems naît au début des années 1970, se structure dans les années 1980 autour des travaux de John Anderson à Carnegie Mellon, et reste actif aujourd'hui. Il en ressort une architecture en quatre parties : ce qu'il y a à apprendre, un modèle de l'apprenant, une logique pédagogique, une interface. Le modèle de l'apprenant n'y est pas un raffinement — c'est ce sans quoi la personnalisation se réduit à un ton plus chaleureux.

Sur le maintien de cette connaissance. Albert Corbett et John Anderson décrivent en 1995 le knowledge tracing : la mise à jour continue de ce modèle à partir des performances observées. Un modèle qui ne bouge pas décrit quelqu'un qui n'existe déjà plus, et demander à l'étudiant de tenir l'outil informé de ses propres progrès reviendrait à lui confier le travail qu'on prétendait lui épargner.

Sur ce que l'outil doit proposer. La synthèse de John Dunlosky et ses collègues (2013) évalue dix techniques d'étude courantes selon les preuves expérimentales disponibles, et les classe par utilité. Se tester soi-même et espacer les révisions arrivent en tête. Résumer et relire en surlignant — les deux pratiques les plus répandues chez les étudiants — arrivent en queue.

Ce classement n'est pas cité pour l'ornement : il détermine ce que l'outil propose. Un livrable se termine par des questions plutôt que par un résumé à relire. Les points validés reviennent à intervalles croissants au lieu d'être considérés comme acquis. Ce qui a été démontré inefficace n'est pas proposé, même quand c'est ce qu'on demande.

Partie II

Les volets

Volet 1 — La fenêtre contextuelle

Ce que c'est. Un modèle ne raisonne que sur ce qui tient dans une fenêtre de taille finie : la conversation en cours, les documents fournis, les instructions données. Au-delà, l'information la plus ancienne cesse d'être prise en compte.

Ce que ça produit. Une conversation longue perd progressivement ses consignes de départ. Le modèle répond correctement à la dernière question tout en ayant oublié la règle posée trente messages plus tôt. Il ne s'agit pas d'une incompréhension, mais d'une disparition.

Ce que ça implique. Un bon prompt est un acte unique ; l'étude est un travail long. L'écart entre les deux est exactement la fenêtre contextuelle. Une méthode d'usage de l'IA en éducation qui ne traite pas ce point ne traite pas le problème principal.

Les signes qu'elle est dépassée. Le modèle recommence à livrer des réponses complètes alors qu'on lui avait demandé des indices. Il réexplique une notion déjà validée. Il perd le niveau ou la matière. Il contredit ce qu'il affirmait plus tôt sans le signaler.

La conduite à tenir. Tant que le modèle réagit aux rappels, on le tient : on lui redonne le cadre, on réinjecte ce qu'il a perdu. Quand les rappels ne prennent plus, on n'insiste pas — il ne peut pas retrouver ce qui n'est plus là. On ouvre une session neuve et on y réinjecte l'état.

Volet 2 — Le prompt

La demande courante décrit un résultat. Deux causes à son inefficacité. La forme adaptée dépend du contenu — une fiche de mathématiques et une fiche d'histoire n'ont pas la même structure — et une consigne de format plafonne le modèle à la représentation qu'on se fait du format.

Le prompt utile encode un raisonnement. Il transmet les critères qu'un spécialiste appliquerait : séparer ce qui se comprend de ce qui se mémorise, isoler une idée par bloc, choisir la forme qui sert le contenu et justifier ce choix en une ligne. Le résultat change alors selon la matière, ce qui est l'objectif.

Quand imposer la forme malgré tout. Lorsque la forme est le raisonnement expert — une grille d'analyse d'erreurs, par exemple — elle s'impose. La règle n'est donc pas « ne jamais imposer de format », mais « n'imposer un format que lorsqu'il porte lui-même la valeur ».

Ce qui se verrouille toujours. Certains comportements sont constants et doivent être interdits explicitement : livrer la réponse avant tout effort, approuver une proposition fausse, compléter une information manquante par une supposition, produire une réponse longue là où une brève suffisait.

Les composants d'un prompt complet. Trois sont indispensables — un rôle précis, un objectif formulé de façon vérifiable, des règles négatives. Deux dépendent du cas — la façon d'interagir, et le format lorsqu'il est justifié.

Ce que règle le rôle. Le rôle fixe le comportement : ce que le modèle fait, ce qu'il refuse, la façon dont il s'adresse à la personne. Il ne fixe pas l'exactitude — attribuer une expertise n'améliore pas la justesse des réponses, et sur les sujets qui demandent beaucoup de connaissances elle tend à la diminuer.

Le rôle reste indispensable pour ce qu'il est, un réglage de posture. Ce qui protège de l'erreur relève d'ailleurs : travailler à partir du document fourni, signaler ce dont on n'est pas sûr, ne pas combler un vide. Les deux se posent ensemble, et le second ne se déduit pas du premier.

On peut trop cadrer. C'est le piège qui attend juste après avoir compris le reste, et il est d'autant plus facile d'y tomber qu'il ressemble à de la rigueur. Devant un résultat décevant, le réflexe est d'ajouter une consigne. Puis une autre. Le prompt s'allonge, et le modèle devient rigide : il applique une procédure au lieu de s'adapter à la personne qu'il a en face.

La raison mérite d'être comprise, parce qu'elle est contre-intuitive. Ce qui fait la valeur d'un modèle de langage, c'est sa capacité à traiter correctement un cas qu'on n'avait pas prévu. Chaque contrainte rigide en retire une part : un format imposé oblige à remplir une forme même quand le contenu ne s'y prête pas, une procédure détaillée empêche de remarquer ce que ce cas-ci a de particulier. À force de vouloir bien faire, on transforme un système qui s'adapte en système qui exécute.

C'est ce raisonnement qui a fait préférer les prompts fondés sur le raisonnement aux prompts de consignes. Les deux sont des cadres ; la différence n'est pas leur nature mais leur altitude. L'un décrit une marche à suivre, l'autre donne les critères pour juger et laisse au modèle le soin de choisir ce qui convient.

Quand un prompt déçoit, la question utile n'est donc pas « qu'est-ce que j'ai oublié de lui dire ? », mais « quel raisonnement ne lui ai-je pas transmis ? ».

Volet 3 — Le début de session

Une session commence par la pose du cadre, avant toute question de fond.

Ce que le modèle doit recevoir. Le rôle qu'il tient et le niveau auquel il s'adresse. L'objectif de la séance, formulé de façon vérifiable. L'état de la personne : ce qui est acquis, ce qui résiste, ce qui a été fait la fois précédente. Les règles qu'il ne doit pas enfreindre.

Ce qu'il doit faire avant de produire. Interroger. Une session correctement ouverte commence par une question du modèle — ce qui est déjà su, ce qui serait tenté — et non par une explication. Ce n'est pas une politesse, et ce n'est pas seulement pédagogique : un modèle qui s'engage tôt sur une idée fausse de ce qu'on cherche ne s'en aperçoit plus ensuite. Il tiendra la séance entière sur cette hypothèse. La question d'ouverture est donc autant une précaution technique qu'un geste d'enseignant.

Ce que la réponse sert à décider, c'est le dosage : à quel point la personne peut déjà produire seule sur ce point précis. Si elle ne peut rien produire parce que la notion est neuve, le modèle ne doit pas insister en questions — il montre, puis retire l'aide progressivement.

Ce que cette question doit prendre en compte. L'ancienneté de ce qu'on croit savoir. Si le dernier travail sur ce point remonte à quelques jours, il n'y a rien à revérifier et on entre directement dans le sujet. S'il remonte à plusieurs mois, la question d'ouverture porte d'abord là-dessus : où en est-on aujourd'hui.

C'est aussi par là qu'entre tout ce qui s'est passé ailleurs. Une partie du travail se fait en cours, avec des enseignants, avec des camarades — rien de cela n'est visible depuis un outil. Le supposer serait inventer ; le demander au bon moment coûte une phrase.

Le calage initial. Temps disponible, énergie, priorité du moment. Une séance courte et adaptée produit davantage qu'une séance longue abandonnée en cours de route. Le cadre prévoit les deux cas plutôt que de supposer des conditions idéales.

Volet 4 — Le travail en session

Le principe. Le modèle fait produire plutôt qu'il ne livre. Reformuler, appliquer, répondre, expliquer relèvent de la personne. Le modèle interroge, corrige, oriente.

La forme que prend ce travail. L'observation du tutorat réel donne une boucle en cinq temps : le tuteur pose une question, la personne répond, le tuteur dit immédiatement si c'est juste, incomplet ou faux, la réponse est améliorée à deux, on vérifie que c'est compris, et on recommence. C'est ce va-et-vient serré qui produit les progrès.

La taille des pas décide du reste. Un tuteur humain et un bon système tutoriel obtiennent des effets comparables, et tous deux valent environ deux fois et demie ce qu'obtient un échange où l'on donne sa réponse finale et où l'on se fait dire si elle est juste. Ce qui les sépare est la granularité : travailler pas à pas avec un retour à chaque pas, plutôt que produire un bloc et le faire corriger. Passé le pas, aller plus fin n'apporte plus rien.

Cette dernière forme — une question, une réponse, et c'est terminé — est celle qu'on adopte spontanément avec une intelligence artificielle. Déplacer l'usage vers le pas-à-pas est l'essentiel de ce que fait un cadre.

La façon de corriger. Un retour peut porter sur quatre choses. Sur le travail lui-même — ce qui est faux et pourquoi. Sur la méthode qui a produit l'erreur. Sur la capacité à se corriger soi-même la prochaine fois. Ou sur la personne — « bravo », « tu es doué » —, et ce dernier niveau est le moins efficace des quatre. L'ordre utile va du travail vers la méthode, puis vers l'autonomie ; le troisième est celui qui sert encore lorsque l'outil n'est plus là.

L'exigence n'implique pas la sécheresse. Un retour critique mal formulé fait décrocher, quand le même contenu formulé avec respect et assorti de quelque chose à faire soutient la suite du travail. Le cadre demande donc les deux : ne pas complimenter la personne, ne pas la démonter.

Sur le blocage. Un indice qui relance le raisonnement, jamais la solution. Un modèle qui donne la réponse termine l'exercice sans que rien n'ait été appris.

Les quatre signes à surveiller. Ils annoncent que le cadre s'use, et ils se reconnaissent facilement une fois qu'on les connaît.

Le ton change. C'est le plus facile à repérer, et c'est une des raisons pour lesquelles un ton est demandé explicitement au départ : sans consigne initiale, on n'a rien à quoi comparer.

Le modèle approuve. Il valide ce qu'on avance, y compris lorsque c'est faux. Demander explicitement la contradiction sur les points qui comptent.

L'objectif se perd. Le modèle propose d'aller plus loin sur un point précis en oubliant le chemin d'ensemble. La conversation reste intéressante et cesse d'être utile.

Le modèle affirme sans moyens. Une date, une règle, une référence produites avec assurance. Sur les points à conséquence, la vérification est extérieure au modèle.

Le cinquième signe. Les quatre précédents décrivent un modèle qui se dégrade seul. Le plus fréquent ne vient pas de lui : c'est la personne qui demande la réponse — directement, ou peu à peu, ou en affirmant avoir compris pour passer à la suite. Un cadre cède plus souvent sous cette demande que sous l'effet de la longueur, et elle arrive au moment où l'on est fatigué, la veille d'une échéance.

Celui-là n'a pas de geste de maintenance : un cadre demande à celui qui le pose de tenir avec lui. Le connaître à l'avance suffit le plus souvent à le reconnaître.

Ce qu'on fait de ces signes. À chacun correspond un geste de maintenance : un prompt court qui remet le cadre en place. Il est inutile d'argumenter avec un modèle qui a perdu le fil — voir le volet 1.

Un dernier geste vaut d'être pris en habitude plutôt qu'en réparation : demander de temps en temps, sans attendre de panne, de redire le rôle tenu, l'objectif de la séance et où l'on en est. C'est la seule chose dont on ait mesuré qu'elle limite réellement la dérive des conversations longues.

Volet 5 — La fin de session

C'est le geste le plus négligé, et celui qui conditionne la reprise.

Le principe. Une session ne se ferme pas, elle se récolte. Avant de quitter, le modèle produit l'état atteint : ce qui a été validé, ce qui reste fragile, ce qui vient ensuite.

Pourquoi cela ne peut pas être sauté. Le modèle ne conservera rien. Ce qui n'est pas extrait est perdu, et la session suivante recommence sans cadre — ce qui revient à retravailler sans lui.

Ce que produit une fin de session correcte. Un état bref, réutilisable tel quel en ouverture de la session suivante. Il ne s'agit pas d'un résumé du contenu, mais d'un relevé de position : ce qu'on voulait faire, ce qu'on a fait, ce qui reste.

Volet 6 — La sauvegarde et la reprise

Ce qui se conserve. L'état de position produit en fin de session, et les documents de référence propres à la matière.

Où le conserver. Hors du modèle. Les fonctionnalités de mémoire proposées par les principaux outils sont utiles mais ni universelles ni fiables sur la durée. Un fichier tenu à part reste la solution la plus robuste.

La reprise. Elle consiste à réinjecter l'état conservé en ouverture, avant toute question. Une reprise correcte replace le modèle exactement là où il était, en quelques lignes.

Ce que les outils permettent. Plusieurs modèles offrent des espaces persistants — projets, instructions permanentes, documents attachés. Leur usage réduit le travail de réinjection sans le supprimer.

Volet 7 — Travailler à partir de documents

C'est l'usage le plus courant, et le plus trompeur. Déposer un cours et demander de le traiter paraît simple, alors que tout ce qui rend l'exercice évident pour un humain reste invisible pour un modèle.

Ce qui va de soi pour nous et pas pour lui. Qu'un document déposé serve de source, et de source unique — plutôt que de point de départ à compléter par ce que le modèle croit savoir. Que telle partie serve à comprendre et telle autre à s'entraîner. Qu'un passage soit central et un autre accessoire, alors que rien dans la mise en page ne le dit. Que ce qui manque au document manque réellement, et ne doit pas être comblé.

Aucune de ces intentions n'est lisible dans le fichier. Si elles ne sont pas dites, le modèle les choisit à notre place, et il les choisit mal.

La règle qui gouverne tout le reste. Clarifier n'est pas ajouter. Reformuler, structurer, hiérarchiser, illustrer avec ce qui est dans la source : oui. Introduire un fait, une date, un exemple qui n'y figure pas : non — même s'il est exact, parce qu'on ne peut plus distinguer ce qui vient du cours de ce qui vient d'ailleurs. Un document de travail qui contient l'un et l'autre n'est plus vérifiable.

Ce qu'il faut préciser à chaque fois. À quoi sert ce document dans le travail en cours. Quelle partie traiter et laquelle ignorer. Ce qui doit être compris et ce qui doit être mémorisé. Et ce qu'on veut obtenir, formulé de façon vérifiable.

La forme suit la nature du contenu. Un processus appelle des étapes ordonnées ; une comparaison, un tableau ; une hiérarchie, une structure emboîtée ; des définitions, une suite terme-sens-exemple ; des faits secs, un bloc à mémoriser séparé du reste. Imposer une forme unique à des contenus de nature différente les abîme tous de la même façon.

Volet 8 — Les tests et les exercices

Ce volet répond à une difficulté propre à l'usage de l'IA en étude, et elle est rarement énoncée.

Le problème. Une information qu'on produit soi-même se retient nettement mieux qu'une information reçue. C'est un effet mesuré, et c'est précisément ce que l'on perd lorsque le modèle fabrique le document à notre place. L'étudiant n'a même pas écrit le résumé qu'il va relire.

La conséquence. Tout ce qui est produit par le modèle doit se terminer par quelque chose à produire : des questions sans leurs réponses, des points à réexpliquer avec ses mots, des éléments à retrouver de mémoire. Ce n'est pas un supplément agréable, c'est ce qui rend le document utile.

Ce qui vaut mieux qu'un test à la fin. Un test unique en clôture mesure ce qui vient d'être lu. Répartir les vérifications dans le temps, et revenir sur ce qui a déjà été validé, mesure ce qui a été retenu — et le renforce au passage.

Volet 9 — La boucle de relevé

Quelqu'un décrit sa situation une première fois, et l'outil s'en fait une image. Trois mois plus tard, cette image est fausse : la personne a progressé, oublié certaines choses, changé de priorités. La boucle de relevé est ce qui la maintient vraie.

Le principe. Ce que sait l'outil de la personne ne se suppose pas et ne se déduit pas. Il se mesure, à partir de ce qui a réellement été fait.

Ce qu'elle tient à jour. Un petit nombre d'états : la compréhension sur un chapitre, l'avancement dans une matière, la position dans le parcours. Ce sont eux que l'on consulte au moment d'ouvrir une session, plutôt que de reconstituer la situation en interrogeant la personne.

Ce qui la déclenche. Un travail achevé — un test validé, un document produit, une séance terminée. Ces moments sont formatés : chacun envoie une information de forme connue vers ce qui tient les états, plutôt que de laisser un signal qu'il faudrait interpréter. Une consultation, une recherche, un échange resté sans suite ne déclenchent rien ; ne retenir que ce qui est achevé revient à ne garder que ce qui a valeur de preuve.

C'est aussi la raison d'être de certains choix d'interface. Un formulaire propose des options à cocher plutôt que des champs libres — non pour brider la personne, mais parce qu'un champ libre produit une information que rien ne peut exploiter avec certitude.

Deux échelles, qui se répondent. À l'échelle courte, un résultat met à jour la compréhension d'un point précis. À l'échelle longue, il déplace la position dans la matière : un même résultat n'a pas le même sens selon ce que donnait le même exercice quelques mois plus tôt. Un parcours a une histoire, et la connaître évite d'avoir à la redemander.

Ce qu'elle ne fait jamais. Supposer. Un outil qui se dirait « un mois a passé, cette personne a sûrement appris des choses » inventerait un progrès qu'il n'a pas constaté. Une partie du travail se fait ailleurs — en cours, avec des enseignants, avec des camarades — et cette partie ne produit pas de relevé. Elle entre autrement : par ce que la personne déclare elle-même, à l'ouverture d'une séance, lorsque l'outil le lui demande.

Ce que cela change. L'étudiant n'a pas à tenir son profil à jour, ni à réexpliquer où il en est à chaque reprise, ni à constater qu'une séance ne correspond pas à son niveau réel. Il travaille, valide, termine ; ces gestes suffisent.

Ce qu'un état doit porter

Un état n'est pas seulement une valeur. Il a un âge, une solidité, et la possibilité d'être faux. Quatre propriétés le rendent utilisable sur la durée.

La régression. Une compréhension peut se perdre, et c'est le résultat le mieux établi de la psychologie de la mémoire. Un système où les niveaux ne font que monter finira par sauter des explications nécessaires et traiter comme acquis ce qui est à refaire, sans qu'aucun signal ne l'annonce. Trois mécanismes y répondent : une décroissance dans le temps, un point de contrôle raté qui fait redescendre l'état, et un rappel programmé qui provoque la vérification au lieu de l'attendre.

Ce dernier a une propriété que les autres n'ont pas : se retester à intervalles croissants est aussi la technique d'étude la plus efficace connue. Le mécanisme qui maintient l'état exact est donc le même que celui qui fait apprendre.

La fraîcheur. Un état sans date est une affirmation sans horizon. La distinction avec la régression est importante : la régression dit que la valeur a pu changer, la fraîcheur dit qu'on ne l'a pas regardée depuis longtemps. La personne est peut-être toujours au même niveau ; personne n'a vérifié. Chaque état porte donc sa date et l'événement qui l'a produit, ce qui permet de dire « ce point a été validé en novembre » plutôt que « ce point est maîtrisé ».

La confiance. Un état tiré d'un seul résultat et un état tiré de plusieurs séances concordantes peuvent porter la même valeur avec un poids de preuve incomparable. Sans indicateur, l'outil sera aussi affirmatif dans un cas que dans l'autre. Une confiance faible n'est pas un défaut à corriger : elle indique où porter l'attention.

Le désaccord. Il arrive que la personne dise ne rien comprendre là où l'état annonce un bon niveau. Trois causes possibles, et elles appellent des réponses opposées : l'état est périmé, la personne se sous-estime, ou la mesure portait sur autre chose que ce qu'on croyait. Trancher d'office dans un sens ou dans l'autre est également mauvais — croire l'état revient à dire à quelqu'un qu'il comprend alors qu'il se sent perdu ; croire la personne rend l'état inutile.

L'écart est donc posé ouvertement plutôt qu'arbitré en silence, et il devient lui-même une mesure. La distance entre ce que le système croit et ce que la personne ressent est souvent plus instructive qu'un test de plus.

Partie III

Annexe

Le concept central

La boucle de relevé

La logique. Un accompagnement personnalisé suppose de connaître celui qu'on accompagne, et cette connaissance se périme. Plutôt que de la reconstituer en interrogeant la personne à chaque fois, on relève la situation à intervalles réguliers, à partir de ce qu'elle achève — et c'est ce relevé, tenu à jour tout seul, qui porte la relation entre l'outil et elle.

Cela déplace une charge. Les solutions habituelles la font peser sur l'étudiant : remplir un profil, le mettre à jour, réexpliquer à chaque session où l'on en est, constater qu'une séance ne correspond pas à son niveau réel. Autant de temps pris sur le travail pour entretenir un outil censé en faire gagner. La boucle de relevé déplace cette charge vers le système.

Comment elle fonctionne. Certains moments du travail sont formatés — valider un test, enregistrer un document, terminer une séance. Chacun envoie une information de forme connue vers ce qui tient les états de l'étudiant. Ces états sont consultés à l'ouverture des sessions suivantes. La personne ne déclare rien ; elle travaille, et ce qu'elle achève tient l'image à jour.

Ce qui la distingue d'un suivi classique. Deux choses. Le déclencheur est l'achèvement et non l'activité, ce qui évite de noyer le signal utile sous tout ce qui se passe. Et la source est du travail ouvert — une séance, un document, un livrable — là où le suivi automatisé demandait jusqu'ici des exercices structurés, une réponse juste ou fausse. C'est ce que les modèles de langage rendent possible, et c'est ce qui permet d'appliquer à des matières entières une approche qui restait cantonnée aux disciplines à réponse unique.

Ce qu'elle exige pour rester honnête. Les quatre propriétés décrites au volet 9 : la capacité à redescendre, la datation, la mesure de la confiance, et le traitement du désaccord. Sans elles, le mécanisme produit une image lisse et fausse, ce qui est pire que pas d'image du tout.

Bibliographie

VanLehn, K. (2011). The Relative Effectiveness of Human Tutoring, Intelligent Tutoring Systems, and Other Tutoring Systems. Educational Psychologist, 46(4), 197–221.

Graesser, A. C., Person, N. K. & Magliano, J. P. (1995). Collaborative Dialogue Patterns in Naturalistic One-to-One Tutoring. Applied Cognitive Psychology, 9(6), 495–522.

Chi, M. T. H. & Wylie, R. (2014). The ICAP Framework: Linking Cognitive Engagement to Active Learning Outcomes. Educational Psychologist, 49(4), 219–243.

Kalyuga, S., Ayres, P., Chandler, P. & Sweller, J. (2003). The Expertise Reversal Effect. Educational Psychologist, 38(1), 23–31.

Hattie, J. & Timperley, H. (2007). The Power of Feedback. Review of Educational Research, 77(1), 81–112.

Collins, A., Brown, J. S. & Holum, A. (1991). Cognitive Apprenticeship: Making Thinking Visible. American Educator, 6(11), 38–46.

Corbett, A. T. & Anderson, J. R. (1995). Knowledge Tracing: Modeling the Acquisition of Procedural Knowledge. User Modeling and User-Adapted Interaction, 4(4), 253–278.

Dunlosky, J., Rawson, K. A., Marsh, E. J., Nathan, M. J. & Willingham, D. T. (2013). Improving Students' Learning With Effective Learning Techniques: Promising Directions From Cognitive and Educational Psychology. Psychological Science in the Public Interest, 14(1), 4–58.

Meirieu, P. (1987). Apprendre… oui, mais comment. ESF Éditeur.

Pashler, H., McDaniel, M., Rohrer, D. & Bjork, R. (2008). Learning Styles: Concepts and Evidence. Psychological Science in the Public Interest, 9(3), 105–119.

Sweller, J. (1988). Cognitive Load During Problem Solving: Effects on Learning. Cognitive Science, 12(2), 257–285.

Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö. & Mariman, R. (2024). Generative AI Can Harm Learning.

Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.

Liu, N. F. et al. (2023). Lost in the Middle: How Language Models Use Long Contexts.

Sharma, M. et al. (2023). Towards Understanding Sycophancy in Language Models.

Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.

Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

Zheng, M. et al. (2024). When "A Helpful Assistant" Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models.

Laban, P. et al. (2025). LLMs Get Lost in Multi-Turn Conversation.

Kestin, G. et al. (2025). AI Tutoring Outperforms In-Class Active Learning: an RCT in an Authentic Educational Setting. Scientific Reports, 15, 17458.