Et si l’intelligence artificielle cessait d’exiger des grappes de serveurs pour se glisser dans la poche ? La question paraît simple. Elle est en train de bousculer toute une industrie qui, depuis deux ans, a presque tout misé sur la taille. Plus de paramètres, plus de mémoire, plus de factures cloud. Une poignée de chercheurs californiens affirme désormais le contraire : un modèle de raisonnement peut rester très capable tout en devenant minuscule. Cette idée porte un nom, PrismML, et un premier produit déjà téléchargé des millions de fois.
Une Startup Née À Caltech Pour Réduire L’Ia À L’Échelle Humaine
PrismML n’est pas encore un géant de la Silicon Valley. La jeune pousse n’a levé, pour l’heure, qu’un tour d’amorçage de 22,25 millions de dollars. Ce n’est pas le chiffre qui attire l’attention. C’est le profil de ceux qui la portent. À sa tête, Babak Hassibi, professeur à Caltech et spécialiste reconnu des techniques de compression. Autour de lui, d’autres chercheurs du même campus. Parmi les conseillers, Ion Stoica, cofondateur de Databricks et directeur du Sky Computing Lab de Berkeley, un laboratoire d’où sont déjà sortis plusieurs projets devenus des références.
Le pari est clair. Les modèles de langage dits « de raisonnement » n’ont pas besoin d’être énormes pour rester utiles. Ils doivent surtout tenir dans la mémoire d’un ordinateur personnel, voire d’un smartphone haut de gamme. L’objectif n’est pas seulement technique. Il est aussi politique, économique et intime : faire tourner l’intelligence là où se trouve déjà l’utilisateur, sans envoyer ses données vers un nuage lointain.
On entend souvent que la compression dégrade forcément la qualité. Hassibi répond par des chiffres. Le dernier modèle de la famille, Bonsai 2 27B, reprend Qwen3.8 27B, un modèle open source largement utilisé, et le ramène à 5,9 Go. C’est une réduction d’environ neuf à dix fois par rapport à l’original. Sur les bancs d’essai agrégés, Bonsai 2 conserve 98 % des scores du modèle source. La première version, sortie quelques mois plus tôt, s’arrêtait à 95 %. La progression est nette.
Pourquoi La Taille Est Devenue Un Problème Collectif
Les laboratoires ont pris l’habitude de mesurer le progrès à l’aune du nombre de paramètres. Cette course a un coût. Un modèle de plusieurs centaines de milliards de poids demande des accélérateurs chers, une alimentation électrique massive et une latence réseau. Pour une entreprise, la facture d’inférence peut vite dépasser le budget d’une équipe entière. Pour un particulier, l’accès passe par un abonnement et par la confiance accordée à un prestataire distant.
Il existe déjà des tentatives de quantification, de distillation, de sparse attention. Beaucoup de ces méthodes grignotent la mémoire au prix d’une baisse visible de la qualité, surtout sur les tâches de raisonnement long. PrismML affirme se distinguer sur ce point : la perte mesurée reste faible, et elle diminue d’une génération à l’autre. Hassibi le reconnaît pourtant : atteindre 100 % de parité reste une question ouverte. La compression laisse presque toujours une trace. Mais une baisse de deux points sur des benchmarks déjà imparfaits change rarement l’expérience réelle, surtout lorsque le logiciel qui entoure le modèle — le fameux harness — pèse autant que les poids eux-mêmes.
Vous allez avoir l’intelligence au bout des doigts, et elle sera gratuite parce qu’elle tournera sur l’appareil que vous avez déjà acheté. Elle sera aussi privée, parce que vous n’enverrez rien vers le cloud.
Ion Stoica
Cette phrase résume mieux qu’un communiqué la promesse de l’IA locale. Elle n’élimine pas le cloud. Elle le relègue au rôle d’option, pas de nécessité. Pour un journaliste qui rédige hors ligne, un médecin qui consulte un dossier sensible, un développeur qui veut un assistant dans un avion, la différence n’est pas cosmétique.
Comment Fonctionne La Compression Ternaire
Le cœur de la méthode tient en un mot un peu austère : les poids ternaires. Dans un réseau classique, chaque poids est souvent stocké sur 16 bits. PrismML réduit cet alphabet à trois valeurs seulement : +1, −1 ou 0. Moins de bits à conserver, moins de mémoire occupée, moins de bande passante à déplacer lors de l’inférence.
Cette idée n’est pas sortie de nulle part. Les chercheurs travaillent depuis des années sur les réseaux binaires ou ternaires. La difficulté a toujours été de ne pas casser la capacité de généralisation. Là où beaucoup de projets sacrifient le raisonnement pour gagner des gigaoctets, l’équipe de Hassibi affirme avoir trouvé un équilibre plus fin. Le détail algorithmique est publié sur la page Hugging Face du projet. L’essentiel, pour le lecteur non spécialiste, est simple : on ne jette pas l’intelligence, on la recode dans un alphabet plus pauvre mais mieux organisé.
Le résultat se voit d’abord à l’œil nu. Un modèle de 27 milliards de paramètres qui tenait difficilement dans la mémoire d’une carte graphique haut de gamme se retrouve dans une enveloppe de moins de six gigaoctets. Un PC récent peut l’accueillir. Un téléphone haut de gamme pourrait, à terme, en faire autant. Des rumeurs évoquent d’ailleurs des discussions avec Apple. Le dirigeant a refusé de commenter. Le silence, dans ce métier, en dit parfois plus long qu’une confirmation.
Bonsai 2, Une Famille Qui Grossit En Restant Petite
Le nom Bonsai n’est pas anodin. Un bonsaï n’est pas un arbre rabougri. C’est un arbre entier, contraint avec art pour tenir dans un pot. La métaphore correspond à la doctrine de PrismML : garder la structure du modèle source, en réduire le volume sans le vider de sa sève.
La première génération a déjà dépassé les 11 millions de téléchargements. Les variantes encore plus petites en ont ajouté 2,6 millions. Ces chiffres ne prouvent pas la qualité à eux seuls. Ils disent toutefois qu’une demande existe, loin des démonstrations de laboratoire. Des développeurs, des chercheurs indépendants, des petites équipes produit cherchent des modèles qu’ils peuvent faire tourner chez eux, sans file d’attente GPU et sans clause d’utilisation opaque.
| Modèle | Base | Empreinte mémoire | Parité benchmarks |
| Bonsai 1 | Qwen compressé | très réduite | environ 95 % |
| Bonsai 2 27B | Qwen3.8 27B | 5,9 Go | environ 98 % |
| Prochaines versions | modèles de plusieurs centaines de milliards | cible PC / appareil | objectif plus proche de 100 % |
Hassibi insiste sur un point contre-intuitif. Plus le modèle d’origine est grand, plus il y aurait de « marge » pour compresser sans perdre l’essentiel. Autrement dit, les prochaines cibles — des réseaux de plusieurs centaines de milliards de paramètres — pourraient, selon lui, mieux encaisser la réduction. L’équipe vise une sortie dans les mois qui viennent. Si la prédiction se vérifie, le débat sur l’IA embarquée changera d’échelle.
Un Marché Déjà Peuplé, Une Approche Qui Veut Se Distinguer
PrismML n’est pas seule. Multiverse Computing, née autour d’un professeur du Donostia International Physics Center, travaille aussi sur la compression de modèles et a levé des sommes nettement plus importantes. D’autres laboratoires publient chaque mois des recettes de quantification à 4 bits, 3 bits, parfois moins. La compétition est réelle.
La jeune pousse californienne mise sur deux arguments. Le premier est technique : une perte de performance très limitée sur des tests agrégés. Le second est humain : un ancrage académique visible, un conseiller dont le nom ouvre des portes dans l’écosystème open source et cloud, des investisseurs comme Khosla Ventures, Cerberus Capital et Caltech. Ce n’est pas une garantie de succès. C’est un signal de sérieux.
Il faut aussi regarder le contexte. Les constructeurs de téléphones et d’ordinateurs cherchent des arguments pour vendre la prochaine génération de puces neuronales. Les régulateurs européens et américains parlent de plus en plus de souveraineté des données. Les entreprises, après l’euphorie des copilotes cloud, découvrent le coût récurrent de l’inférence. Un modèle compact, local, suffisamment intelligent pour rédiger, résumer, classer ou coder, répond à ces trois pressions à la fois.
Ce Que Change Vraiment Une Ia Qui Tient Dans Un PC
Imaginons un usage concret. Un avocat prépare une note un dimanche soir. Il ne veut pas coller des extraits de dossier dans un chatbot public. Avec un modèle local, le texte ne quitte pas la machine. La latence dépend du processeur, pas d’une file d’attente mondiale. La facture, une fois le matériel acheté, tend vers zéro.
Autre scène. Une PME industrielle veut un assistant capable de lire des procédures internes. Envoyer ces documents dans le cloud pose un problème de secret des affaires. Les faire tourner sur un serveur d’entreprise déjà amorti devient soudain réaliste si le modèle tient en quelques gigaoctets et reste assez vif.
Les développeurs, eux, y voient un levier de productivité différent. Fine-tuner un petit modèle compressé coûte moins cher que d’adapter un géant. Le cycle d’essai-erreur s’accélère. On peut itérer sur un laptop, puis déployer. Ce n’est pas la fin des fondations propriétaires. C’est un rééquilibrage.
- Confidentialité par défaut, puisque les tokens restent sur l’appareil.
- Coût d’usage proche de zéro après l’achat du matériel.
- Disponibilité hors ligne, dans le train, l’atelier, l’hôpital.
- Latence plus prévisible, sans file d’attente partagée.
- Possibilité d’adapter le modèle à un métier sans tout envoyer dehors.
Ces avantages ne sont pas magiques. Un modèle compressé reste un modèle. Il hallucine encore. Il dépend du prompt. Il peut se tromper sur un calcul ou une date. La compression n’efface pas ces limites. Elle les rend seulement plus accessibles, donc plus faciles à encadrer par un logiciel métier.
Les Limites Qu’Il Faudrait Ne Pas Oublier
Le discours startup aime les ruptures nettes. La réalité est plus granuleuse. D’abord, 98 % d’un benchmark n’est pas 98 % de toutes les tâches humaines. Les suites de tests publics surreprésentent certains exercices, sous-représentent d’autres. Un modèle peut briller sur un QCM et faiblir sur une négociation longue ou un raisonnement multimodal.
Ensuite, la mémoire n’est qu’une dimension. La vitesse d’inférence, la consommation électrique, la chaleur du boîtier, la qualité du runtime comptent autant. Un fichier de 5,9 Go qui s’étouffe sur un processeur mobile n’a pas tenu sa promesse. PrismML communique surtout sur l’empreinte et la parité de scores. Les mesures de tokens par seconde sur téléphone restent à documenter au grand public.
Enfin, la compression peut amplifier certains biais ou certaines fragilités si elle n’est pas contrôlée. Un zéro à la place d’un petit poids n’est pas un geste neutre. C’est un choix statistique. Les équipes sérieuses le savent et multiplient les évaluations. Il faudra lire les fiches techniques, pas seulement les titres.
Une Lecture Plus Large : La Fin Du Tout-Cloud ?
Depuis l’explosion de ChatGPT, le récit dominant a été celui de l’abonnement à une intelligence lointaine. Ce récit a créé des fortunes et des dépendances. Il a aussi fatigué une partie du public. On parle désormais d’agents, de mémoire persistante, d’outils qui agissent. Plus ces systèmes deviennent personnels, plus la question du lieu d’exécution redevient centrale.
L’IA locale n’est pas l’ennemie du cloud. Les deux peuvent coexister. Un petit modèle sur l’appareil peut filtrer, résumer, préparer. Un grand modèle distant peut intervenir quand la tâche dépasse le cadre. Cette architecture hybride, déjà discutée dans les laboratoires, devient crédible dès que le composant local n’est plus ridicule.
Les constructeurs de puces l’ont compris. Neural Engine, NPU, accélérateurs dédiés : tout le monde prépare le terrain. Ce qui manquait, souvent, c’était un modèle assez intelligent et assez léger pour justifier l’investissement. Si Bonsai et ses successeurs tiennent leurs promesses sur des réseaux plus vastes, la conversation basculera des data centers vers les salons et les bureaux.
Le Facteur Humain Derrière La Technique
On peut raconter PrismML comme une histoire de bits. On peut aussi la raconter comme une histoire de campus. Caltech a une tradition de travail sur l’information, le signal, les limites physiques du calcul. Hassibi n’arrive pas en touriste dans la compression. Stoica, de son côté, a passé des années à rendre le calcul distribué plus accessible. Le croisement des deux regards — réduire le modèle, le faire vivre près de l’utilisateur — n’est pas un accident de pitch deck.
Les investisseurs suivent. Khosla Ventures a l’habitude des paris technologiques longs. Cerberus apporte une autre culture de capital. Caltech, en tant que souteneur, ancre le projet dans un écosystème académique. Rien de tout cela n’assure qu’une méthode ternaire deviendra le standard. Cela indique seulement que le dossier a été lu par des gens qui savent compter les risques.
Le public, lui, vote avec les téléchargements. Onze millions pour une première génération, ce n’est pas un gadget de laboratoire oublié. C’est une base d’utilisateurs qui testera, critiquera, forgera des habitudes. Dans l’open source, cette base vaut parfois plus qu’un tour de table supplémentaire.
Ce Que L’On Peut Attendre Dans Les Mois Qui Viennent
La feuille de route officielle est assez nette. Appliquer la même recette à des modèles bien plus grands. Vérifier si, comme le prédit Hassibi, la marge de compression augmente avec l’échelle. Publier des versions assez légères pour des machines grand public. Continuer à réduire l’écart de benchmarks.
Autour de cette feuille, d’autres questions se poseront. Quel runtime officiellement recommandé ? Quelle licence pour les poids compressés ? Quelle compatibilité avec les frameworks déjà installés chez les développeurs ? Comment mesurer, hors des classements publics, la qualité sur des tâches métier ? Une startup de compression ne vend pas seulement un fichier. Elle vend une chaîne de confiance.
Il faudra aussi observer les réactions des éditeurs de modèles sources. Compresser Qwen, c’est s’appuyer sur le travail d’Alibaba. Tant que l’écosystème reste ouvert, la pratique est acceptée, parfois encouragée. Si les licences se resserrent, le terrain de jeu changera. PrismML, comme d’autres, devra alors démontrer une valeur ajoutée encore plus nette.
Une Autre Manière De Penser Le Progrès En Intelligence Artificielle
Pendant longtemps, le progrès s’est lu comme une courbe qui monte vers la droite : plus de données, plus de paramètres, plus de watts. Une autre courbe existe. Elle descend vers le bas à droite : moins de mémoire, moins d’énergie, plus d’autonomie. Les deux peuvent être vraies en même temps. Un laboratoire peut entraîner un géant. Une autre équipe peut le rendre vivable.
Cette seconde courbe intéresse les pays et les entreprises qui n’ont pas les moyens d’aligner des milliers d’accélérateurs. Elle intéresse aussi les citoyens fatigués de déléguer leur mémoire numérique. Elle intéresse enfin les designers de produits, qui savent qu’une fonction disponible hors ligne se vend mieux qu’une fonction conditionnée à une bonne connexion.
PrismML n’a pas inventé à elle seule cette bascule. Elle en est un révélateur utile. Un professeur de compression, un conseiller du calcul distribué, un modèle nommé comme un arbre nain, des millions de téléchargements : le récit est cohérent. Il reste à voir s’il tiendra lorsque les modèles cibles deviendront vraiment énormes, et lorsque les téléphones devront les faire respirer sans fondre.
Pour Qui Cette Approche Compte Déjà
Les premiers concernés sont les développeurs indépendants. Ils veulent prototyper sans carte graphique de luxe. Viennent ensuite les directions informatiques qui doivent concilier innovation et conformité. Puis les éditeurs de logiciels métiers, tentés d’embarquer un assistant sans transformer leur produit en tuyau vers un tiers. Enfin, les constructeurs d’appareils, toujours à la recherche d’une fonction « wow » qui ne dépende pas d’un serveur.
Le grand public arrivera plus tard, sans forcément connaître le nom du modèle. Il verra une application qui répond vite, même en avion. Il verra un téléphone qui résume une réunion enregistrée sans l’envoyer nulle part. Si cette expérience devient banale, la compression aura gagné, que la marque s’appelle PrismML ou autrement.
En attendant, la leçon est déjà lisible. L’intelligence artificielle n’est pas condamnée à grossir pour rester pertinente. Elle peut aussi apprendre à tenir dans un pot. Comme un bonsaï. Avec assez de patience, assez de méthode, et assez d’humilité pour admettre qu’un ou deux points de benchmark ne disent pas tout de la vie réelle.
Ce Qu’Il Faut Retenir Sans Se Perdre Dans Le Jargon
PrismML propose de rendre les grands modèles de langage assez petits pour vivre près de nous. La technique repose sur des poids réduits à trois valeurs. Le dernier jalon public, Bonsai 2, comprime un Qwen de 27 milliards de paramètres à 5,9 Go et conserve l’essentiel des scores. Les fondateurs viennent de Caltech. Un conseiller influent de Berkeley soutient la vision d’une intelligence gratuite, locale et privée. D’autres acteurs travaillent sur le même terrain. La suite se jouera sur des modèles encore plus vastes, et sur la capacité à les faire tourner vraiment, pas seulement à les stocker.
Si cette trajectoire se confirme, la manière dont nous « utilisons tous l’IA », pour reprendre l’ambition affichée de la startup, ne passera plus uniquement par une barre de recherche dans le navigateur. Elle passera par la machine déjà posée sur le bureau, et peut-être par celle qui tient dans la poche. Ce n’est pas une révolution bruyante. C’est une réduction. Parfois, réduire, c’est déjà changer l’échelle du possible.
Les prochaines publications diront si la courbe de parité continue de monter, si les téléphones suivent, si les licences restent ouvertes. En l’état, PrismML a surtout réussi à rendre crédible une phrase que beaucoup trouvaient naïve il y a peu : un modèle de raisonnement n’a pas besoin d’être immense pour être utile. Il a besoin d’être assez intelligent, assez léger, et assez proche. Le reste est une affaire d’ingénierie, de produits, et de confiance.