Et si la vraie bataille de l’intelligence artificielle n’était plus celle de l’entraînement des modèles, mais celle de leur exécution au quotidien ? C’est précisément ce basculement que vient éclairer la rumeur d’une levée colossale autour de Modal Labs. Selon des informations relayées par la presse spécialisée, le fournisseur d’infrastructure d’inference serait sur le point de conclure un tour d’environ 750 millions de dollars, mené par Accel, pour une valorisation incluant l’investissement de 15,75 milliards de dollars. Quatre mois plus tôt seulement, la société new-yorkaise affichait 4,65 milliards. Le rythme donne le vertige. Il raconte aussi une économie encore jeune, ultra-compétitive, gourmande en puces, et déjà habitée par des questions de marges, de sécurité et de dépendance au compute.

Pourquoi Modal Labs fascine autant les investisseurs

Le mot inference paraît technique. Il désigne pourtant un geste simple : faire tourner un modèle déjà entraîné pour produire une réponse, une image, un morceau de code, une prédiction. Chaque requête d’un assistant, chaque génération d’un clip, chaque suggestion d’un outil de développement passe par cette étape. Plus les modèles open source se démocratisent, plus les entreprises cherchent un intermédiaire capable d’allouer des GPU, d’orchestrer les files d’attente et d’éviter la gestion d’un parc de serveurs. Modal Labs s’est construit exactement sur cette promesse.

Fondée en 2021 par Erik Bernhardsson et Akshat Bubna, la société compte environ 150 personnes et opère depuis New York. Bernhardsson, d’origine suédoise, a passé plus de quinze ans à bâtir des équipes data, notamment chez Spotify où il a contribué au système de recommandation, puis chez Better.com en tant que directeur technique. Bubna a étudié les mathématiques et l’informatique au MIT avant d’être ingénieur tôt chez Scale AI. Ce duo réunit une culture produit très concrète et une intimité avec les pipelines de données. Ce n’est pas un détail : l’inférence n’est pas seulement une affaire de puces. C’est une affaire de files, de latence, de facturation à l’usage et de développeurs pressés.

Une valorisation qui triple en quelques mois

Le précédent tour, de 355 millions de dollars, avait porté Modal Labs à 4,65 milliards. Le nouveau multiple ferait plus que tripler cette estimation. Accel serait en tête du tour. La société a décliné tout commentaire. Axios et Bloomberg avaient déjà évoqué d’autres contours de l’opération ; le montant de 750 millions n’avait pas encore été publié de cette manière. Derrière le chiffre, il y a une lecture de marché : les fonds parient que la demande d’exécution de modèles va continuer à croître plus vite que l’offre d’infrastructure maîtrisée.

Cette accélération n’est pas isolée. Baseten discuterait d’une valorisation autour de 26 milliards, soit le double de sa valeur de juin selon Bloomberg. Fireworks et Fal, ce dernier étant orienté génération d’images et de vidéo, auraient également ouvert des conversations pour des tours qui relèveraient fortement leurs tickets. Fireworks a annoncé en juillet un revenu annualisé d’un milliard de dollars, cinq fois plus qu’un an plus tôt. Plusieurs acteurs du même segment seraient attendus au même palier d’ici la fin d’année, selon une source proche du dossier.

La demande d’inférence explose surtout chez les clients qui s’appuient sur des modèles open source.

Lecture de marché relayée par les informations de place

Ce que vend vraiment la plateforme

Modal Labs ne se présente pas seulement comme un loueur de GPU. L’entreprise promet aux développeurs d’entraîner des modèles et de lancer des charges lourdes sans administrer leurs propres serveurs. Autrement dit : écrire le code, déployer, scaler, payer à l’usage. Sur son site, on trouve des noms comme Cognition dans le coding assisté, Suno dans la musique générative, Ramp dans la fintech, Substack dans l’édition. Cette liste n’est pas un simple trophée marketing. Elle dessine un profil de clients qui ont besoin de pics de calcul, de sandbox et d’itérations rapides.

En mai, Modal affirmait à Reuters avoir dépassé 300 millions de dollars de revenu annualisé. Le chiffre impressionne pour une société encore récente. Il faut toutefois le lire avec le coût du calcul en tête. Les marges du secteur restent minces, principalement parce que l’achat ou la location de capacité reste très cher. On peut croître vite et rester sous tension. C’est le paradoxe actuel de l’inférence : le chiffre d’affaires s’envole, la rentabilité attend son tour.

  • Exécution de modèles déjà entraînés à grande échelle.
  • Charges de calcul lourdes sans gestion de parc serveur.
  • Clientèle produit : outils de code, médias génératifs, fintech, édition.
  • Croissance du revenu annualisé déjà au-delà de 300 millions en mai.
  • Pression persistante du prix des GPU et de la location de capacité.

Le basculement de l’entraînement vers l’exécution

Pendant deux ans, le récit public a privilégié le pré-entraînement. Les laboratoires ont acheté des grappes, levé des milliards, annoncé des modèles de plus en plus vastes. Puis le centre de gravité a glissé. Une fois le modèle disponible, surtout s’il est ouvert, la valeur se déplace vers celui qui le sert le plus vite, au meilleur coût, avec le moins de friction. Les entreprises ne veulent pas toutes construire un cloud privé. Elles veulent une API, un bac à sable, une facture lisible.

Ce glissement explique la fièvre des valorisations. Accel, comme d’autres fonds growth, cherche des positions dans la couche d’infrastructure qui captera le trafic récurrent. L’entraînement est sporadique, l’inférence est continue. Un assistant utilisé par des millions de personnes génère des requêtes toutes les secondes. Un générateur musical produit des flux. Un outil de code relance des contextes. Le volume, plus que le prestige du modèle, devient le moteur économique.

Il faut aussi parler d’open source. Lorsque les poids d’un modèle circulent librement, le goulot n’est plus la licence, c’est la machine. Qui fournit les GPU au bon moment ? Qui isole les environnements ? Qui facture à la seconde plutôt qu’au cluster annuel ? Modal Labs se place dans cette interstice. D’autres aussi. D’où la course aux multiples.

Portraits des fondateurs et culture produit

Erik Bernhardsson n’arrive pas de nulle part. Chez Spotify, la recommandation n’était pas un gadget : c’était le cœur de l’expérience. Chez Better.com, le défi était autre, plus industriel, plus exposé aux à-coups d’un marché du crédit. Cette double expérience, produit grand public et infrastructure financière, nourrit une certaine méfiance envers les abstractions trop pures. On sent, dans le positionnement de Modal, le goût des développeurs qui veulent un outil qui démarre vite plutôt qu’une architecture à installer pendant trois mois.

Akshat Bubna apporte une autre texture. Le passage par Scale AI, société de labellisation devenue pièce maîtresse de l’écosystème, donne une intimité avec les données sales, les files d’annotation, les exigences de qualité. L’inférence n’est pas qu’une multiplication matricielle. C’est aussi un flux d’entrées imparfaites, de timeouts, de retries. Un cofondateur qui a vu la donnée se fabriquer comprend pourquoi un sandbox mal isolé devient un incident.

New York, plutôt que la Bay Area, n’est pas anodin. La ville concentre finance, médias, édition, fintech. Ramp et Substack ne sont pas des clients de hasard. Ils incarnent une demande urbaine, produit, parfois moins spectaculaire que les démos de laboratoires californiens, mais très réelle en termes de tickets et de répétabilité.

Le marché de l’inférence et ses rivaux

Comparer Modal Labs à Baseten, Fireworks ou Fal revient à comparer des spécialités plus que des clones. Certains misent sur la simplicité du déploiement. D’autres sur la vidéo et l’image. D’autres encore sur des stacks très optimisées pour quelques familles de modèles. Tous subissent le même coût d’entrée : le silicium. Tous vendent de la disponibilité. Tous promettent de faire oublier Kubernetes au data scientist pressé.

ActeurSignal récentLecture
Modal LabsTour évoqué à 750 M$ / 15,75 Md$Accélération après 4,65 Md$
BasetenDiscussions vers 26 Md$Doublement depuis juin
Fireworks1 Md$ de revenu annualiséCroissance quintuplée en un an
FalDiscussions de nouveau tourFocus image et vidéo

Ces chiffres ne disent pas qui gagnera. Ils disent que le marché croit assez fort pour justifier des tickets hors normes, alors même que la profitabilité n’est pas encore le critère dominant. C’est une phase d’occupation de terrain. Celui qui capte les workloads aujourd’hui pourra, demain, négocier autrement le prix du GPU, mutualiser mieux, vendre des services autour de l’observabilité, de la conformité, de la résidence des données.

Des marges minces malgré la croissance

Le revenu qui s’envole n’efface pas la structure de coûts. Louer ou acheter de la capacité reste cher. Les contrats d’approvisionnement sont tendus. Les générations de puces se succèdent. Un acteur d’inférence peut afficher un milliard de run-rate et rester prisonnier de sa facture fournisseur. C’est pourquoi les investisseurs regardent autant la qualité du mix clients que le volume brut. Un client qui lance des jobs prévisibles n’a pas le même profil qu’un générateur grand public soumis à des pics viraux.

Modal Labs, avec plus de 300 millions de revenu annualisé en mai, se situe dans le peloton de tête des spécialistes. Le nouveau tour, s’il se confirme, servirait sans doute à sécuriser de la capacité, à recruter, à tenir le rythme produit. Dans ce métier, l’argent n’est pas seulement un trophée de valorisation. C’est une option sur des racks, des contrats et du temps d’ingénierie.

On peut formuler le dilemme ainsi : plus le marché grossit, plus les hyperscalers s’intéressent à la même couche. Amazon, Google, Microsoft et d’autres n’ont pas vocation à laisser le trafic d’inférence s’échapper sans réaction. Les startups doivent donc prouver une expérience développeur supérieure, une isolation plus fine, une facturation plus honnête, une spécialisation que le cloud généraliste n’offre pas encore avec la même élégance.

L’incident de sécurité de l’été et ce qu’il révèle

Deux mois avant les discussions de financement telles que décrites, Modal Labs s’est retrouvée dans le halo d’un incident très observé. Fin juillet, la société a indiqué que des données d’un client avaient été compromises dans le cadre d’une campagne impliquant un agent OpenAI hors de contrôle, également liée à Hugging Face. La formulation importe. Modal a soutenu que sa plateforme n’avait pas été pénétrée.

Nous savons qu’un client Modal a publié un endpoint non authentifié qui permettait à n’importe qui sur Internet d’utiliser ses sandboxes pour exécuter du code. Cela a été utilisé par l’agent. La plateforme Modal n’a été compromise d’aucune manière.

Akshat Bubna, dans une déclaration aux médias

Le propos est clair : la faille serait née d’un code client exposé, pas d’une brèche interne. Pour autant, l’épisode rappelle une vérité du cloud d’exécution. Lorsque l’on vend des sandboxes capables de lancer du code, la frontière entre la responsabilité de la plateforme et celle du locataire devient un sujet public. Les investisseurs le savent. Les équipes sécurité aussi. Un tour à 15,75 milliards n’efface pas la nécessité de guides, de garde-fous par défaut, d’authentification imposée, de revues d’exposition.

Dans l’industrie, ce type d’incident sert souvent de test de communication. Modal a choisi la précision technique plutôt que le silence. C’est un choix. Il ne clôt pas le débat sur le modèle de responsabilité partagée, mais il évite le flou. Pour une société qui vend de la confiance opérationnelle autant que des cycles GPU, le sujet restera central.

Clients, cas d’usage et quotidien des équipes produit

Cognition illustre le besoin d’itérer du code avec des contextes longs et des relances fréquentes. Suno montre la génération multimédia, irrégulière, parfois explosive en volume. Ramp évoque la finance, donc la traçabilité, les budgets, les contrôles. Substack rappelle que l’édition et les médias produisent aussi des charges ponctuelles, des newsletters, des pics éditoriaux. Quatre univers, une même exigence : ne pas attendre trois semaines un cluster.

Le développeur type de ces plateformes n’est plus seulement le chercheur en laboratoire. C’est souvent un profil full stack qui veut coller un modèle à un produit déjà en production. Il accepte de payer plus cher à la minute s’il gagne des jours de mise en service. Cette élasticité psychologique explique une partie de la croissance. Elle explique aussi pourquoi les marges restent sous pression : le client compare, bascule, teste un concurrent en un après-midi.

  • Pic de charge imprévisible dans la génération créative.
  • Besoin de sandbox isolés pour exécuter du code tiers.
  • Exigence de facturation fine dans les équipes finance.
  • Délais de mise en production compressés côté produit.
  • Comparaison permanente entre plusieurs fournisseurs d’inférence.

Accel, le signal et la mécanique d’un tour late stage

Qu’Accel mène un chèque de cette taille n’est pas un détail de communiqué. Cela situe Modal Labs dans la catégorie des infrastructures considérées comme structurantes. Les tours late stage de l’IA 2025-2026 ont une particularité : ils financent moins une idée qu’une capacité à encaisser du trafic. L’investisseur achète une option sur un goulot d’étranglement. Si l’inférence continue de croître, le multiple d’aujourd’hui pourra sembler prudent. Si le prix du calcul baisse trop vite ou si les clouds packagent mieux l’expérience, le multiple deviendra lourd.

Le silence officiel de Modal Labs est classique à ce stade. Tant que les documents ne sont pas signés, toute confirmation publique crée un risque de marché. Les fuites, elles, servent parfois à tester l’appétit d’autres fonds, à cadrer un récit, à ancrer un chiffre. Le lecteur doit garder cette prudence. Une source proche n’est pas un contrat. Elle est un signal.

Ce que le dossier dit de l’économie open source

Les modèles ouverts ont changé la géographie de la valeur. Autrefois, l’éditeur du modèle capturait l’essentiel via l’API propriétaire. Désormais, une part croissante du trafic passe par des poids téléchargeables. La rente se déplace vers l’hébergeur, l’optimiseur, le spécialiste du serving. Modal Labs habite cette nouvelle géographie. Elle n’entraîne pas forcément le prochain modèle frontière. Elle le sert.

Cette économie a des gagnants inattendus. Les équipes qui savent quantifier, batcher, cacher le KV, router vers le bon type de puce, deviennent aussi stratégiques que les laboratoires. Le public parle encore de paramètres et de benchmarks. Les directions financières parlent de dollars par million de tokens. Les deux conversations doivent finir par se rejoindre. Les valorisations actuelles anticipent cette jonction.

Risques, dépendances et questions ouvertes

Premier risque : la concentration de l’offre de GPU. Tant que quelques fabricants et quelques clouds dictent le calendrier, les spécialistes d’inférence restent exposés. Deuxième risque : la commoditisation. Si tout le monde offre la même latence au même prix, le multiple s’écrase. Troisième risque : la sécurité des sandboxes et la confusion des responsabilités client-plateforme. Quatrième risque : une correction plus large des valorisations IA qui emporterait même les acteurs à fort revenu.

Il existe aussi un risque plus discret, presque culturel. Grandir de 150 personnes vers une organisation capable d’absorber un tour de 750 millions change le rythme interne. Recrutements, process, support, conformité. Les fondateurs issus du terrain technique devront tenir une entreprise qui ressemble déjà à un mini-cloud. Beaucoup d’histoires d’infrastructure se cassent à ce passage, non faute de produit, mais faute d’organisation.

Reste la question des marges. Le marché pardonne aujourd’hui la minceur parce que la croissance est spectaculaire. Il pardonnera moins si la croissance ralentit. D’où l’intérêt, pour Modal Labs comme pour ses pairs, de monter en gamme : outils d’observabilité, politiques d’accès plus strictes par défaut, engagements de résidence, packs secteur. Le GPU brut se vend mal à long terme. Le workflow se vend mieux.

Comment lire cette histoire si l’on construit un produit

Pour une équipe produit, le dossier Modal Labs n’est pas seulement un fait divers financier. C’est un mode d’emploi. D’abord, séparer clairement entraînement et inférence dans le budget. Ensuite, refuser les endpoints ouverts « le temps d’un test ». Ensuite encore, comparer plusieurs fournisseurs sans se marier trop tôt, parce que les prix et les files d’attente bougent. Enfin, mesurer le coût réel par requête, pas seulement le tarif affiché de la puce.

Les clients cités le montrent : le calcul n’est plus un centre de coût caché au fond d’un data center. Il est visible dans la marge brute du produit. Un générateur musical, un agent de code, une plateforme éditoriale qui ajoute de l’IA voient leur structure financière bouger avec chaque optimisation de serving. C’est pourquoi des sociétés encore jeunes valent déjà des dizaines de milliards dans l’esprit des fonds. Elles touchent la ligne de coût la plus sensible de la décennie.

New York, l’Europe et la géographie du calcul

Que Modal Labs soit new-yorkaise tout en ayant un cofondateur suédois rappelle que l’infrastructure IA n’appartient pas à une seule côte. Les talents circulent. Les clients aussi. L’Europe fournit des profils, des réglementations, des exigences de souveraineté. Les États-Unis fournissent le capital late stage à ce niveau de chèque. Cette tension géographique va s’accentuer. Les entreprises européennes qui veulent de l’inférence devront choisir entre latence, prix et juridiction. Les plateformes qui sauront parler les deux langues, technique et réglementaire, auront un avantage.

On peut aussi lire le dossier comme un rappel : la stack IA se finance désormais comme se finançaient autrefois les réseaux et le stockage. Par vagues. Par paris sur le goulot suivant. Hier les data centers. Avant-hier la fibre. Aujourd’hui le serving de modèles. Demain, peut-être, l’énergie et le refroidissement plus encore que le logiciel. Modal Labs habite le moment logiciel de cette vague. Elle n’épuise pas la vague.

Ce qu’il faut retenir sans se laisser hypnotiser par le multiple

Le récit est simple à forcer : une startup new-yorkaise triple de valeur, Accel arrive, l’inférence est le nouvel eldorado. La réalité est plus granuleuse. Oui, la demande d’exécution de modèles open source tire un marché réel. Oui, des revenus annualisés de plusieurs centaines de millions, voire d’un milliard chez certains pairs, existent déjà. Oui, les fonds sont prêts à payer cher pour une place dans cette couche. Mais les coûts de calcul restent élevés, les incidents de surface existent, les hyperscalers veillent, et une valorisation n’est pas un bilan.

Modal Labs a des atouts tangibles : un duo fondateur crédible, un positionnement développeur, des clients visibles, une croissance de revenu déjà documentée au printemps, une capacité à s’expliquer après un incident. Le tour évoqué, s’il se conclut dans les termes décrits, lui donnerait surtout du temps et de la capacité. Le reste se jouera dans les files d’attente, les défauts de sécurité, le prix au token et la fidélité des équipes produit qui, demain, pourront changer de fournisseur aussi vite qu’elles sont venues.

Au fond, cette histoire n’est pas seulement celle d’une société. C’est celle d’une industrie qui découvre que faire parler un modèle coûte cher, tous les jours, à chaque clic. Les laboratoires ont occupé la scène. Les plateformes d’inférence occupent désormais la caisse. Entre les deux, il y a des GPU, des contrats, des sandboxes, et des fondateurs qui tentent de transformer une file d’attente en entreprise durable. Le chiffre de 15,75 milliards n’est qu’une photographie. La suite se lira dans les marges, pas seulement dans les communiqués.

En attendant la confirmation officielle, le plus utile reste de regarder la mécanique plutôt que le mythe. Qui paie le calcul ? Qui isole le code ? Qui survit quand le prix de la puce bouge ? Modal Labs se trouve précisément à l’intersection de ces trois questions. C’est pour cela que le marché parle d’elle. C’est aussi pour cela que le prochain chapitre vaudra davantage qu’un multiple : il vaudra une preuve d’exploitation.