Quand un chercheur qui a contribué à bâtir ChatGPT avoue que l’outil le plus célèbre de la décennie l’a déçu, on tend l’oreille. Diogo Almeida ne parle pas d’un caprice. Il décrit un écart de plus en plus visible entre ce que les grands modèles de langage savent dire et ce que les logiciels doivent réellement décider. Pour lui, le problème n’est pas un manque de talent. C’est le langage humain lui-même, devenu à la fois le carburant et le frein de l’automatisation.

Typesafe Ai Mise Sur Un Modèle Qui Ne Parle Plus

Deux ans après son départ d’OpenAI, Almeida a fondé Typesafe Ai. L’entreprise vient de publier Jev, un modèle fondé sur l’architecture transformeur, mais qui n’est pas un grand modèle de langage. Il n’écrit pas de phrases. Il renvoie des probabilités, ce que la société appelle des calibrated decisions, autrement dit des décisions calibrées. Les sorties sont définies à l’avance par l’utilisateur. Le modèle ne peut donc pas inventer un fait, un nom ou une instruction fantôme.

Cette rupture paraît simple. Elle change pourtant le calcul économique de l’intelligence dans le code. Les jetons de sortie sont gratuits. Les jetons d’entrée se facturent au milliard, pas au million. Le système est conçu pour être très rapide et très bon marché. Dans les premiers jours, la demande a été telle que l’API a momentanément cessé de servir correctement les utilisateurs. Les développeurs n’attendaient pas un nouveau chatbot. Ils cherchaient un composant fiable à glisser dans des pipelines.

Nous avons de l’éclair en bouteille, et pourtant ce n’est pas utile. Le problème, c’est que nous optimisons pour le langage humain. Les ordinateurs parlent une autre langue.

Diogo Almeida, fondateur de Typesafe Ai

Pourquoi le langage humain est devenu un goulot

Almeida a travaillé sur le renforcement par retour humain, souvent désigné sous le sigle RLHF. Cette technique a contribué à rendre les assistants conversationnels plus agréables, plus polis, plus proches de ce qu’un interlocuteur attend. Elle a aussi ancré l’industrie dans une obsession : produire du texte fluide. Quatre années d’améliorations spectaculaires n’ont pas suffi, selon lui, à rendre ces systèmes vraiment opératoires pour l’automatisation massive.

Un logiciel n’a pas besoin d’une dissertation. Il a besoin d’un choix. Autoriser ou bloquer. Router vers le modèle A ou le modèle B. Classer un courriel comme urgent ou négligeable. Marquer une commande comme sûre ou douteuse. Dès que l’on demande à un modèle de langage de jouer ce rôle, on paie le surplus du style, on subit la variabilité de la formulation, et l’on doit encore parser une réponse pour extraire le signal utile.

Jev inverse la logique. L’utilisateur fixe le vocabulaire de sortie. Le modèle estime des probabilités sur ces options. Le programme qui l’appelle n’interprète plus une phrase. Il lit un score. Si le score est médiocre, on s’arrête. S’il est élevé, on agit. La responsabilité de l’hallucination est en partie déléguée à celui qui fixe le seuil. Ce n’est pas magique. C’est une discipline d’ingénierie.

Ce que les premiers tests disent vraiment

Chez Vercel, l’ingénieur Pranit Sharma a remplacé un classifieur de sécurité basé sur un modèle conversationnel par Jev. Le même type de tâche, revoir des commandes pour estimer leur dangerosité, serait devenu cinq à dix-huit fois plus rapide, avec une meilleure précision. Dans un environnement d’infrastructure agentique, la latence n’est pas un détail. Elle multiplie les coûts et fragilise l’expérience.

Chez Bryo Ai, le directeur technique Nikhil Mudholkar a comparé Jev à un modèle de Google pour classer des courriels professionnels. Gemini serait resté légèrement plus exact dans son essai. L’écart de prix, en revanche, allait de dix à vingt fois. Ce qui l’a surtout retenu, ce sont les scores de confiance. Il estime que Jev est le seul, dans son comparatif, à rendre une vraie probabilité, donc un levier concret pour automatiser un flux.

Ces anecdotes ne prouvent pas une supériorité universelle. Elles dessinent un créneau. Dès que la tâche est bornée, répétitive, et qu’un seuil de décision suffit, le surplus littéraire d’un grand modèle devient un luxe. Jev vise ce luxe-là, et le retire du chemin.

CritèreGrand modèle de langageJev selon Typesafe Ai
SortieTexte libreProbabilités sur options fixées
HallucinationPossible à chaque générationBornée par le schéma de sortie
Coût de sortieFacturé au jetonJetons de sortie gratuits
Usage typiqueRédaction, dialogue, raisonnement ouvertClassement, contrôle, routage, garde-fou
LatenceVariable selon la longueurConçue pour l’inférence courte

Un garde-fou pour les agents, pas un nouveau messie

Almeida insiste sur un second usage. Jev peut surveiller d’autres modèles. Faire surveiller un agent par un autre agent devient vite ruineux. Un modèle léger, calibré, qui lit une trace et estime le risque d’un contournement, change l’équation. On peut imaginer un filtre qui intercepte une tentative de jailbreak, un plan incohérent, une action hors politique, sans convoquer à chaque fois un modèle de frontière.

Armin Ronacher, directeur technique d’Earendil et figure connue de l’écosystème open source autour des harnais de modèles, résume la bascule avec une prudence utile. Si la probabilité revient à cinquante pour cent, on traite le résultat comme un pile ou face. Si elle atteint quatre-vingt-quinze pour cent, on peut s’en servir. Le modèle ne promet pas la vérité. Il promet une lecture plus honnête de son incertitude.

Au fond, cela délègue un peu le problème de l’hallucination à l’utilisateur. C’est lui qui décide ce qu’un score autorise.

Armin Ronacher, Earendil

Ronacher évoque aussi le routage. Deviner si une requête mérite un petit modèle ou un grand modèle est précieux. Le faire avec un LLM coûte cher et ajoute de la latence. Un estimateur rapide rend ce triage possible en temps réel. On comprend alors le nom choisi. William Stanley Jevons, économiste du XIXe siècle, a décrit un paradoxe célèbre : quand le coût d’une ressource baisse, on l’utilise davantage. Almeida parie que l’intelligence suivra la même pente.

Derrière Jev, un pari sur les données synthétiques

L’architecture exacte reste floue. Des observateurs extérieurs soupçonnent une base issue d’un modèle ouvert. Typesafe Ai décrit Jev comme un modèle de System One, tourné vers l’intuition plutôt que vers le raisonnement long, et collé à une tâche précise. Almeida affirme que l’entraînement repose exclusivement sur des données synthétiques, via une méthode qu’il nomme renforcement à partir de décisions calibrées.

Il va plus loin. Selon lui, le choix de fabriquer toutes les données a été l’un des meilleurs paris de sa carrière, plus important encore que le lancement public, et même, à l’entendre, plus décisif que son travail passé sur le RLHF. Une partie de l’entreprise fonctionnerait comme un laboratoire dédié à ce sous-domaine : produire des données synthétiques statistiquement bien comprises.

Cette revendication mérite d’être lue avec calme. L’industrie entière expérimente déjà des corpus générés. Ce qui changerait la donne, ce n’est pas le mot « synthétique ». C’est la prétention d’un contrôle statistique assez fort pour livrer des probabilités interprétables, et non un simple classement opaque. Si cette promesse tient, Jev n’est pas seulement un produit. C’est une méthode.

  • Moins de dépendance au texte web bruyant et mal étiqueté.
  • Un contrôle plus fin des classes de décision dès l’entraînement.
  • Une boucle d’amélioration qui ne passe pas par des annotateurs humains à chaque tour.
  • Un coût d’itération potentiellement plus bas une fois la fabrique de données en place.

Ce que cela change pour les équipes produit

Les équipes qui collent aujourd’hui un LLM dans chaque recoin d’une application découvrent souvent le même motif. Le prototype est bluffant. La mise en production se heurte au prix, à la latence, aux réponses instables et aux garde-fous à écrire à la main. Jev s’adresse à cette phase ingrate, celle où l’intelligence doit devenir un composant, pas une démonstration.

On peut l’imaginer dans un filtre de modération interne, un tri de tickets, une détection d’anomalie dans un journal d’agent, une estimation du risque avant d’exécuter un outil, une décision de relancer ou d’arrêter une boucle autonome. Rien de cela n’exige une prose élégante. Tout cela exige une réponse stable, mesurable, et assez peu chère pour tourner des millions de fois.

Le modèle ne remplace pas un système de raisonnement profond. Almeida le dit à sa manière en refusant le costume de laboratoire-frontière. Il ne veut pas vendre la peur, ni la hype, ni la construction d’une divinité dans un centre de données. Il veut vendre de l’intelligence utilisable. La formule est marketing, bien sûr. Elle a aussi le mérite de situer le produit : pas un oracle, un instrument.

Une lecture plus large de la vague actuelle

Depuis 2022, le récit dominant a consisté à empiler des paramètres, allonger le contexte, ajouter des outils, puis parler d’agents. Chaque couche a créé de la valeur. Chaque couche a aussi créé du gaspillage. On utilise parfois un modèle de plusieurs centaines de milliards de paramètres pour décider si un bouton doit être rouge ou gris. C’est absurde sur le plan énergétique, financier et architectural.

Jev s’inscrit dans un mouvement plus discret : spécialiser, compresser, calibrer. D’autres acteurs travailleront sans doute dans la même direction dès que l’utilité sera évidente. Ronacher le note avec une pointe d’ironie. On aurait dû voir cela plus tôt. Les LLM sont si subventionnés, si spectaculaires, que l’on n’a pas encore été forcés d’être créatifs sur le coût réel.

Le paradoxe de Jevons n’est pas une garantie de succès commercial. Si l’intelligence devient moins chère, la demande peut exploser, mais les marges peuvent aussi s’écraser. Typesafe Ai devra prouver que sa fabrique de données et sa calibration restent difficiles à copier. Un modèle isolé attire l’attention. Une chaîne industrielle de décisions calibrées construit une entreprise.

Limites, zones d’ombre et questions ouvertes

Plusieurs points restent flous, et il faut les nommer. On ignore le détail de l’architecture. On ignore la robustesse hors des tâches de classification relativement propres. On ignore comment le modèle se comporte quand les classes sont mal définies, quand le monde réel déborde le schéma, quand un adversaire cherche à manipuler l’entrée.

Une probabilité affichée n’est pas forcément une probabilité vraie. La calibration est un art fragile. Elle peut tenir sur un jeu de test et se dégrader en production. Elle peut aussi donner une fausse assurance : un score de quatre-vingt-dix-huit pour cent mal calibré est plus dangereux qu’un doute assumé. Les équipes qui adopteront Jev devront mesurer, journaliser, recalibrer.

Autre limite évidente : tout ce qui exige de la génération reste hors sujet. Rédiger, traduire, expliquer, inventer une interface, conduire un raisonnement multi-étapes visible, tout cela continue d’appartenir aux modèles de langage. Jev n’est pas un remplaçant universel. C’est un outil de bascule, un capteur, un aiguillage.

  • La documentation des classes de sortie devra être aussi soignée que le prompt d’autrefois.
  • Les seuils de décision devront être versionnés comme du code.
  • Les biais des données synthétiques devront être audités, même s’ils sont « maison ».
  • Les comparaisons indépendantes manquent encore pour sortir de l’effet de lancement.

Ce que le nom Jev raconte du projet

Baptiser un modèle d’après Jevons n’est pas anodin. L’économiste observait que l’amélioration de l’efficacité d’une ressource pouvait augmenter sa consommation totale. Almeida transpose l’idée à l’intelligence. Si décider devient presque gratuit, alors des logiciels partout, petits, dispersés, locaux, pourront porter un peu de jugement. Moins de méga-applications centralisées. Plus de tissus d’automatismes, à la manière du premier Internet.

Cette vision a du charme. Elle a aussi des conséquences. Plus d’intelligence partout signifie plus de surfaces de décision, plus de politiques à écrire, plus d’incidents à relier. Le logiciel intelligent diffus n’abolit pas la gouvernance. Il la rend plus granulaire. Jev, s’il tient ses promesses de coût, rendra cette granularité praticable. Il ne la rendra pas automatique sur le plan éthique ou juridique.

On peut aussi lire le nom comme un contre-pied aux laboratoires qui parlent d’échelle infinie. Typesafe Ai se présente comme une entreprise qui veut de l’intelligence utile, pas une religion. Le ton est volontairement terre à terre. Dans un marché saturé de superlatifs, ce positionnement peut séduire des développeurs fatigués des démos et affamés de composants stables.

Comment intégrer un tel modèle sans se tromper de combat

La tentation, après un article de lancement, est de tout remplacer. Ce serait une erreur. La bonne question n’est pas « quel modèle est le plus intelligent ». C’est « quelle décision dois-je prendre, à quelle fréquence, avec quel coût d’erreur ». Si l’erreur est rare et coûteuse, un grand modèle plus lent peut rester pertinent. Si l’erreur est fréquente et peu grave, un estimateur calibré gagne presque toujours.

Les équipes expérimentées commenceront par une tâche étroite. Elles fixeront des classes explicites. Elles compareront contre leur classifieur actuel. Elles regarderont non seulement l’exactitude, mais la courbe de calibration, le temps de réponse, le coût à un million d’appels, la stabilité d’une semaine à l’autre. Ensuite seulement elles élargiront le périmètre.

Jev peut aussi vivre à côté d’un LLM. Le grand modèle propose. Le petit modèle juge. Le grand modèle écrit. Le petit modèle autorise. Cette architecture en deux temps n’est pas nouvelle. Elle redevient intéressante dès que le juge cesse d’être aussi cher que l’auteur.

Le portrait d’un fondateur qui refuse le mythe

Almeida n’est pas un inconnu de hasard. Son passage par la recherche qui a façonné l’âge des chatbots lui donne une légitimité particulière pour critiquer cet âge. Il a vu de près la puissance du langage. Il en a aussi vu les impasses quand on veut faire agir des machines. Son discours mélange frustration ancienne et satisfaction présente. On sent quelqu’un qui a longtemps cherché le bon angle d’attaque.

Sa phrase sur les données synthétiques en dit long. Quand un fondateur affirme qu’une infrastructure de données le réjouit plus qu’un lancement, il désigne le vrai actif. Les modèles s’imitent. Les recettes de génération contrôlée, si elles sont solides, se défendent mieux. Reste à voir si Typesafe Ai ouvrira une partie de cette méthode ou la gardera comme avantage privé.

On peut aimer ou non ce style. Il a le mérite d’éviter la prophétie. Pas de dieu dans un rack. Pas de promesse d’abondance infinie. Une thèse plus modeste : trop d’intelligence actuelle est gaspillée en mots, alors que l’industrie a besoin de choix.

Vers d’autres modalités, et une concurrence inévitable

Typesafe Ai annonce déjà d’autres versions, dans d’autres modalités. L’idée est cohérente. Si le cœur du produit n’est pas le verbe mais la décision calibrée, alors l’image, le signal, le journal machine, le graphe d’événements peuvent nourrir le même type de sortie. Un classifieur multimodal bon marché aurait autant de sens qu’un classifieur de texte.

La concurrence ne tardera pas. Dès qu’un usage est clair, les laboratoires ouverts, les inféreurs spécialisés et les grandes plateformes peuvent proposer un équivalent. L’avantage de Typesafe Ai tiendra alors à la qualité de la calibration, à la simplicité de l’API, au prix réel après la période de curiosité, et à la confiance que les développeurs placeront dans les scores.

Il faudra aussi regarder la distribution. Un modèle qui se destine à être « partout » doit être facile à héberger, à isoler, à auditer. Les entreprises réglementées n’adopteront pas un oracle opaque, même rapide. Elles demanderont des garanties, des journaux, des contrats de niveau de service. Le produit technique devra donc mûrir en produit industriel.

Une leçon plus vaste pour l’écosystème startup

Le lancement de Jev rappelle une vérité souvent oubliée dans les tours de table. L’innovation n’est pas toujours une montée en échelle. Elle peut être une soustraction. Retirer le langage. Retirer le surplus. Retirer l’ambiguïté d’une phrase alors qu’on n’avait besoin que d’un bit enrichi d’une confiance. Dans un marché où chacun ajoute des agents, Almeida retire des mots.

Les startups qui construisent des outils pour développeurs devraient retenir ce geste. Beaucoup de produits IA échouent non pas parce que le modèle est faible, mais parce que l’interface mentale est fausse. On vend une conversation là où il fallait un contrat. On vend une magie là où il fallait une spécification. Jev, au moins dans son discours, revient à la spécification.

Cela n’empêche pas l’emballement. Une API saturée dès la première semaine crée un récit de désir. Il faudra distinguer désir et rétention. Les développeurs sont curieux. Ils sont aussi impitoyables dès que le coût, la doc ou la dérive de qualité les trahissent. Le vrai test commencera dans trois mois, pas dans trois jours.

Pour qui Jev a déjà du sens

Les profils les plus concernés sont assez clairs. Les plateformes d’agents qui multiplient les appels. Les éditeurs qui classent des événements à haute fréquence. Les équipes sécurité qui veulent un premier filtre avant un modèle plus lourd. Les architectes qui rêvent d’un routeur de modèles sans ruiner la facture. Les produits B2B qui ont besoin d’automatiser sans exposer un chatbot au client final.

À l’inverse, une équipe dont le cœur de métier est la rédaction, le support conversationnel ou la création n’y trouvera qu’un accessoire. Jev n’écrit pas la réponse. Il peut seulement dire s’il faut la montrer, la bloquer, la faire relire, ou la diriger vers un humain. C’est déjà beaucoup. Ce n’est pas tout.

Entre ces deux pôles, une zone grise existe. Certains produits croient vendre du langage alors qu’ils vendent surtout de la décision. Un outil de conformité, un assistant de back-office, un orchestrateur de workflows : la valeur n’est pas dans la phrase, elle est dans le choix. Ces produits-là devraient regarder Jev avec attention, puis le mesurer sans indulgence.

Ce qu’il faut retenir sans se laisser porter par la rumeur

Typesafe Ai n’a pas « tué » les grands modèles. Elle a mis le doigt sur un usage où ces modèles sont à la fois trop bavards et trop chers. Jev propose une autre unité de valeur : non plus le paragraphe, mais la décision calibrée. L’idée est ancienne en statistique. Sa remise au centre du débat IA, avec un ancien d’OpenAI pour la porter, lui donne une force narrative nouvelle.

Si le modèle tient en production, l’automatisation logicielle peut devenir plus dense, plus locale, plus banale. C’est précisément ce que vise Almeida : moins de cathédrales, plus de petits capteurs intelligents. Si le modèle déçoit, il restera un signal utile. Il aura rappelé que l’industrie a confondu éloquence et utilité.

Pour les lecteurs qui construisent, la conduite à tenir est simple. Identifier une décision répétée. La spécifier. Comparer. Fixer un seuil. Journaliser. Ne jamais traiter un score comme une vérité révélée. L’intelligence utile commence là où le marketing s’arrête, c’est-à-dire dans la mesure. Jev, pour l’instant, a surtout réussi à remettre cette mesure au premier plan. La suite dépendra moins des interviews que des tableaux de bord.