Auteur de Quand Rome inventait le populisme et autres essais. J'écris sur l'histoire ancienne, la technologie, l'IA et la politique. Fondateur de @vestigialab.

Paris, France
Pendant les Trente Glorieuses, la France a conduit un effort massif pour prendre son indépendance énergétique et stratégique à travers le nucléaire. Alors que l'IA est en train de devenir un nouveau flux fondamental de nos économies, de nos sociétés et de nos appareils de défense, quels efforts devrions-nous faire si nous voulions assurer le même niveau d'indépendance ? Avec Tristan Claret-Trentelivres, @victorstorchan et @AymericRoucher, nous avons fait le calcul et établi les plans d'une opération Prométhée : faire surgir de toutes pièces un laboratoire d'IA de frontière en France. Oubliez les politiques qui vous parlent d'IA souveraine à quelques centaines de millions d'euros ou même à quelques milliards : il faut des centaines de milliards. Comme dirait de Gaulle, "C'est très cher... mais c'est le prix de notre indépendance." Si nous ne faisons pas d'effort de cet ordre, nous serons définitivement dans les mains des États-Unis. Nous expliquons ce plan très en détail dans ce long article pour le @Grand_Continent : allez le lire urgemment !
Opération Prométhée : la France peut gagner la course à l’IA. Quel en serait le prix ? Une pièce de doctrine à l'attention du prochain président de la République et de ses électeurs. legrandcontinent.eu/fr/2026/…
10
43
120
26,870
Et @raphaeldoan qui explique qu’il est impossible que ce livre ait été rédigé par IA! Quel champion
8
757
Il y a quelques mois, j'avais écrit ce texte qui n'a pas trop perdu son actualité : raphaeldoan.substack.com/p/d…
1
10
36
1,540
Rappel que l'encyclique du pape sur l'IA n'a toujours pas été publiée en latin Negotium unum tibi erat
1
12
771
Raphaël Doan retweeted
Bon puisque pas mal de monde se pose la question, comment les détecteurs anti-IA arrivent à être relativement fiable aujourd’hui ? Trois facteurs principalement : *Les modèles de langue (dit “de base”) sont d’abord entraînés sur des milliards de textes en ligne (ce qui n’est pas tout ce qui existe loin de de là, mais quand même des sources assez diverses). C’est ce qu’on appelle le pre-training. Mais ensuite les dernières phases d’entrainement (le “post-training”) reposent sur beaucoup moins d’exemples d’instructions, notamment pour faire en sorte que le modèle génère des conversations et, de plus en plus, des séquences de travail avec des traces de raisonnement (“interleaved reasoning”). Les laboratoires d’IA imposent ici un style assez spécifique, notamment pour faciliter l’alignement des modèles et potentiellement économiser les coûts de génération. Typiquement la dernière version d’Opus utilise un raisonnement beaucoup plus compact. Les dernières méthodes d’entrainement notamment par reinforcement learning tendent aussi à faire émerger un style d’écriture nettement plus artificiel voir torturé, qu’on voit assez bien dans les traces de raisonnement des derniers modèles d’OpenAI, parce que la génération du texte vise avant tout à résoudre des problèmes, plus qu’à communiquer avec l’utilisateur. *Les modèles s’entrainent de plus sur des contenus générés, simplement parce qu’on manque de données pour décrire l’accomplissement de tâches souvent non écrites, mais aussi pour des questions de coûts. Il y a plein de débats en ce moment sur la légitimité de la distillation de modèles principalement issus d’Anthropic ou d’OpenAI (en principe interdit par les conditions d’utilisation mais pas clair du tout s’il y a vraiment une base légale pour ça, notamment en dehors des États-Unis). La conséquence pratique c’est que la plupart des modèles se ressemblent aujourd’hui. C’est ce qui permet à Pangram de fonctionner à l’échelle : il y a un style généré “mainstream” relativement facile à identifier, quasiment quel que soit le modèle utilisé. D’autant que cet entraînement synthétique se fait de plus à plus à l’échelle au cours de la phase de pré-entraînement : mêmes les modèles de base génèrent du texte de moins en moins divers. *La régulation en train d’arriver (notamment via l’AI Act) va imposer l’identification des contenus d’IA (ou “watermarking”). Concrètement, au moment de la génération, les modèles vont adopter une certaine combinaison statistique de lettres. Cela fait déjà plusieurs années que l’on discute de techniques mais toute la difficulté est de les employer sans détériorer les capacités des modèles. A priori Anthropic y serait parvenu et je pense que cela va devenir un standard dans l’industrie. À la différence de Pangram, l’identification ne repose pas sur modèle de classification mais sur une analyse déterministe du texte. Seulement, seul Anthropic en a le recette pour l’instant. Je pense que ce sera un problème essentiellement réglé dans les années à venir : il y a une demande sociale forte pour l’identification des contenus générés et les dernières techniques d’entraînement, reposant de plus en plus sur la donnée synthétique, en facilitent grandement la mise en œuvre.
8
11
63
4,790
Hier soir, j'ai participé à une très bonne adaptation télévisée du conte d'Andersen Les Habits neufs de l'empereur. C'était dans C ce soir, j'y étais casté dans le rôle de la seule personne à dire que le roi est nu, les autres étaient très convaincants à louer la splendeur de l'étoffe invisible !
➡️ @raphaeldoan : Pangram est très fiable, mais indépendamment de cela les tics stylistiques typiques des LLM sont évidents pour quiconque a l'habitude d'utiliser l'IA ; "ça crève les yeux" comme dans une image générée par IA, "ça se sent par tous les pores de ce roman".
118
378
2,314
104,502
Raphaël Doan retweeted
➡️ @raphaeldoan : Pangram est très fiable, mais indépendamment de cela les tics stylistiques typiques des LLM sont évidents pour quiconque a l'habitude d'utiliser l'IA ; "ça crève les yeux" comme dans une image générée par IA, "ça se sent par tous les pores de ce roman".
Ah oui effectivement ça sent très fort le LLM, c'est même pas subtil. Que ça ait pu berner la critique littéraire, gagner des prix etc., je trouve ça atterrant. (J'ai juste surligné les trucs qui me font le plus tiquer, mais ça transparaît vraiment presque à chaque ligne.)
45
70
722
197,949
Tribune à paraître demain dans Le Figaro, écrite à quatre mains avec @LevyAntoine, sur les conséquences de l'irruption de l'IA dans le monde littéraire.
Affaire Thélyson Orélien : « Qui écrira et qui lira dans un monde où l’écriture n’est plus uniquement humaine ? » lefigaro.fr/vox/culture/affa… @raphaeldoan @LevyAntoine
9
8
75
6,348
Raphaël Doan retweeted
Juin 2023, avec l'ami @raphaeldoan, nous écrivions ceci (texte garanti 100% humain, écrit à la plume d'oie): legrandcontinent.eu/fr/2023/…
1
9
40
20,745
Pour les gens qui auraient encore un doute (ou les nostalgiques des tics de GPT-3.5/GPT-4) :
Replying to @IA_Clash
Regardez alors son autre article sur Haïti de septembre 2023. Les connaisseurs y reconnaîtront les qualités littéraires d'une dissertation lycéenne mièvre et ampoulée, qui fleure bon le GPT4 de l'époque.
8
23
189
35,860
Le plus amusant, c'est que cette histoire a fait passer une sorte de contrôle qualité pour toute la critique littéraire. D'ordinaire, il n'y a aucun moyen de vérifier la validité objective d'une critique ; là, pour une fois, on peut, et la plupart sont tombés dans le panneau en trouvant formidable un style non seulement écrit par IA, mais fondamentalement médiocre et répétitif. Gloire à celles qui sont allées contre le courant et ont fait preuve d'esprit critique et d'un vrai goût littéraire, comme Raphaëlle Leyris du Masque et la plume ou Léa Bory du podcast Torchon.
Avez-vous entendu parler de ce roman ? C’est le « phénomène de la rentrée littéraire ». Il est lauréat du Prix Fnac, du Prix Méduse, du Prix Première Plume, fortement pressenti pour le Prix Renaudot, et il est en lice pour les prix Goncourt, Femina, Médicis et Décembre. Ah oui, il est aussi en cours de traduction dans 20 langues. Eh bien selon Pangram, ce roman est rédigé presque intégralement par une Intelligence Artificielle. Nous avons testé plusieurs passages, à divers endroits du manuscrit, pour presque toujours le même résultat : 100% IA (cf les deux premiers chapitre dans le tweet ci-dessous). Rappelons que Pangram est de loin le détecteur d’IA le plus fiable : son taux de faux positifs est de 0,0041%, soit environ un texte humain sur 24 400. Sur 996 273 textes antérieurs à 2022, Pangram en classe uniquement 14 (0,0014%) comme étant partiellement écrits par l’IA. La probabilité que vingt passages d’un même livre (et il y a bien plus de 20 signalements dans le roman) soient identifiés à tort par Pangram comme étant produits par une IA s’élève donc à 0,0041% puissance 20, soit 0,1802 × 10⁻⁸⁵ %, c’est à-dire 0 suivi de 85 zéros après la virgule. N’aurait-il pas été plus honnête que l’auteur crédite son co-auteur ?
8
46
383
33,255
Après les problèmes du millénaire en maths, les laboratoires d'IA se sont lancé un nouveau défi, plus difficile : faire obtenir à leurs agents des prix littéraires français. Ils auraient six mois d'avance sur l'open source.
Avez-vous entendu parler de ce roman ? C’est le « phénomène de la rentrée littéraire ». Il est lauréat du Prix Fnac, du Prix Méduse, du Prix Première Plume, fortement pressenti pour le Prix Renaudot, et il est en lice pour les prix Goncourt, Femina, Médicis et Décembre. Ah oui, il est aussi en cours de traduction dans 20 langues. Eh bien selon Pangram, ce roman est rédigé presque intégralement par une Intelligence Artificielle. Nous avons testé plusieurs passages, à divers endroits du manuscrit, pour presque toujours le même résultat : 100% IA (cf les deux premiers chapitre dans le tweet ci-dessous). Rappelons que Pangram est de loin le détecteur d’IA le plus fiable : son taux de faux positifs est de 0,0041%, soit environ un texte humain sur 24 400. Sur 996 273 textes antérieurs à 2022, Pangram en classe uniquement 14 (0,0014%) comme étant partiellement écrits par l’IA. La probabilité que vingt passages d’un même livre (et il y a bien plus de 20 signalements dans le roman) soient identifiés à tort par Pangram comme étant produits par une IA s’élève donc à 0,0041% puissance 20, soit 0,1802 × 10⁻⁸⁵ %, c’est à-dire 0 suivi de 85 zéros après la virgule. N’aurait-il pas été plus honnête que l’auteur crédite son co-auteur ?
10
90
7,808
Sur les questions de démographie et de natalité, lisez et suivez Oscar Bockel qui vient de publier un excellent livre à ce sujet.
1/16 - À l'heure où la natalité s'effondre sur l'ensemble de la planète, il est temps de démonter les idées reçues sur le sujet. C'est ce que je fais dans mon livre, « La bombe de la dénatalité », qui vient de paraître au Cerf ⤵
1
5
29
5,936
Raphaël Doan retweeted
📣 TRIBUNE Pour l’essayiste Raphaël Doan, coauteur du « plan Prométhée », la France doit investir maintenant pour se doter de son propre outil si elle veut rester libre. Demain il sera trop tard. ➡️ l.lepoint.fr/ty8
7
12
36
9,301
This chart in particular is incredible.
2
4
13
2,300
Le 14 mai 1975, l'Assemblée nationale discute d'énergie et donc du programme nucléaire, au début du plan Messmer. En lisant les débats, on retrouve, dans l'opposition radicale et centriste, beaucoup d'arguments identiques à ceux qu'on entend aujourd'hui contre l'ambition d'investir dans nos capacités à entraîner et servir des modèles d'IA de frontière. Florilège : 1) "On risque de parier sur la mauvaise technologie" On nous dit parfois que les LLM ne marchent pas, qu'ils seront peut-être dépassés bientôt, qu'il y a peut-être d'autres architectures à découvrir, alors que c'est clairement la technologie d'IA générale la plus industrialisable aujourd'hui. Aussi : ne risque-t-on pas de construire trop de centres de données inutiles ? Les parlementaires disaient la même chose en 1975 sur le nucléaire : "Nous nous serons engagés dans un programme fort coûteux et peut-être irréversible en cas de découvertes nouvelles qui remettraient en cause les systèmes retenus." (Cette citation et celle qui suivent viennent de différents députés dans les débats de cette séance, lien dans le post suivant.) La sacrosainte prudence était invoquée pour revoir l'ambition à la baisse : "Pourquoi ne pas tenir compte de l’évolution rapide en un tel domaine et limiter prudemment le nombre de nos centrales au strict indispensable ? Sinon, faute de diversification - puisque, du reste, une seule filière a été retenue - faute de souplesse dans l’adaptation, nous risquons d’aller au-devant d’un grave échec financier... A côté des coûteuses cathédrales de béton devenues peut-être inutiles, dont nous aurons parsemé notre territoire, le scandale de la Villette risque de nous apparaître un jour comme un jeu d’enfants." 2) "N'allons pas trop vite". Alors que la course à l'IA accélère entre laboratoires américains et chinois, et que rejoindre cette course coûte de plus en plus cher, on entend souvent qu'il serait urgent d'attendre, car nous ne serions sûrs de rien. Idem en 1975 : "Il ne faudrait pas se contenter de la filière qui semble présenter le plus de sécurité et offrir la plus grande rentabilité aujourd’hui. Il convient d’éviter toute précipitation et d’agir avec beaucoup de prudence de façon à améliorer continuellement les solutions choisies, à opérer même des rectifications de tir si des filières meilleures apparaissaient". 3) "Ça coûte trop cher" Les montants pour investir dans le nucléaire en 1975 et dans l'IA aujourd'hui paraissent immenses et pour certains, en l'absence de certitude totale, il vaut mieux laisser faire le secteur privé que de lancer de grands projets. Au fond, ils ne croient pas tant que ça à la puissance de la technologie en cause. "Au danger s’ajoute le risque financier. Malgré les assurances données, le rendement sera relativement faible et la rentabilité reste douteuse." "Comment les besoins de l’industrie nucléaire vont-ils pouvoir être satisfaits sans que l’épargne soit détournée de ses autres emplois et notamment des investissements productifs du secteur privé ?" 4) Il n'y a pas de modèle économique On entend souvent aujourd'hui que les grands laboratoires d'IA n'ont pas de modèle économique, qu'ils finiront par se faire rattraper par leurs dépenses d'investissement trop importantes et ne pourront pas générer suffisamment de revenus. Certains disaient un peu de la même manière en 1975 que l'énergie nucléaire finirait par être plus coûteuse que les autres, sans voir la dynamique des différentes énergies et les effets d'échelle : "Au cours des vingt-quatre derniers mois, les coûts estimés du kilowattheure nucléaire [...] ont été majorés d'environ 60 %... [Cette hausse] réduit la différence entre le coût de l'énergie nucléaire et celui des autres formes d'énergie ». Heureusement, en 1975, ces conseils n'ont pas été écoutés, nous avons poursuivi l'effort et bâti dans toute son ampleur la puissance nucléaire dont nous tirons profit aujourd'hui. Sur l'IA, en 2027, ferons-nous le même choix ?
1
3
15
1,744
En 1788 le "Voyage du jeune Anacharsis en Grèce" de l'abbé Barthélemy avait été un tel phénomène que pendant des années, tout le monde s'était passionné pour la Grèce antique, les femmes s'étaient mises à porter des robes à l'antique, les hommes à se coiffer comme des Romains, et tous les arts décoratifs s'étaient mis au goût grec, sans parler des révolutionnaires qui allaient se prendre pour des Brutus et Lycurgue. Nous sommes beaucoup moins drôles que nos ancêtres : quand l'Odyssée de Nolan est sortie, personne n'a envisagé de s'habiller à la grecque. Même les personnages du film, d'ailleurs.
Christopher Nolan Odyssey had zero cultural impact, it was a strange hysteria for two or three weeks and then it was as if it never even existed.
1
15
1,372
Merci à @LePoint de m’avoir donné cette tribune dans son dernier numéro consacré à l’IA. La France a une chance de ne pas passer à côté de l’histoire, mais il faut la saisir maintenant ; c’est, pour reprendre une expression gaullienne, la route de l’effort.
3
23
1,005
Vous vous êtes demandé où trouver les 620 milliards d'euros du plan Prométhée ? Vous cherchez une lecture du soir facile et divertissante ? Vous avez de la chance : nous venons de publier, toujours avec Tristan Claret-Trentelivres, @AymericRoucher et @victorstorchan et toujours dans le @Grand_Continent, une note détaillée pour expliquer le financement et la structure du projet. C'est aujourd'hui le plan le plus détaillé et le plus solide pour remettre la France dans la course à l'IA. Car oui, c'est possible, mais il faut agir maintenant. A lire et partager largement : legrandcontinent.eu/fr/2026/…
2
22
53
2,956
Dans le même ordre d'idées, presque aucun des grands penseurs français des Lumières n’est un universitaire.
In his book A Culture of Growth, Joel Mokyr describes how universities in early modern Europe were not the main centres of innovation. They were largely conservative organisations where scholars typically sought textual purity, not scientific truth. What made the Scientific Revolution possible was, in part, the availability of competing institutions and patrons that allowed bold innovators to develop and promote their ideas.
5
15
68
6,573
Pourquoi il faut faire le plan Prométhée malgré les risques existentiels de l'IA :
Mais est-ce bien raisonnable de soutenir un projet qui mène à l'extinction de l'humanité ?
4
13
101
5,682