Et si le premier gardien assis au cœur d’un laboratoire d’intelligence artificielle n’était pas un institut de recherche indépendant, mais une multinationale du conseil ? La question a claqué dans les salles de marché comme dans les cercles de sûreté, le jour où Anthropic a annoncé que des équipes d’Accenture s’installeraient dans ses locaux pour examiner modèles, process et équipes. L’effet a été immédiat : le titre du cabinet a bondi après clôture, pendant que les spécialistes de l’alignement se demandaient pourquoi Faculty, filiale rachetée en janvier, passait devant des noms habituels comme METR ou Apollo Research.
Un choix qui bouscule le récit de la sûreté
Depuis des mois, Dario Amodei dessine un schéma simple : des évaluateurs tiers embedded, c’est-à-dire physiquement présents dans les laboratoires, avec un accès plus profond que les audits de sortie de modèle. L’idée visait à rendre la responsabilité vérifiable sans attendre une régulation encore floue. Sur le papier, on attendait des organisations à but non lucratif, financées pour creuser les comportements adverses, les capacités cachées, les stratégies de déception. Dans les faits, le premier nom officiel est celui d’un géant du conseil aux entreprises et aux États.
Anthropic insiste sur un point : Faculty n’arrive pas comme un simple prestataire marketing. La mission décrite couvre l’évaluation, le red-teaming, les diagnostics d’alignement et les tests de garde-fous. Les deux parties parlent d’un engagement d’au moins un milliard de dollars sur cinq ans. Ce n’est plus une mission ponctuelle. C’est une infrastructure de contrôle, avec des humains qui voient le laboratoire de l’intérieur.
Ces évaluateurs ne réduisent pas notre responsabilité. Ils aident à la rendre plus vérifiable. La sûreté de nos modèles reste la nôtre.
Position publique d’Anthropic
Pourquoi Accenture plutôt qu’un labo de recherche
Le décalage est réel. Accenture n’est pas née dans les couloirs de l’apprentissage profond. Elle n’a pas publié les papiers fondateurs sur le reward hacking ou la déception instrumentale. En revanche, elle déploie des systèmes dans des banques, des ministères, des usines, des hôpitaux. Elle connaît les contraintes d’audit, les commités de risque, les exigences de documentation que les startups traitent parfois comme un mal nécessaire.
Anthropic met en avant cette expérience concrète. Un modèle n’est plus seulement un objet de recherche. Il devient un agent qui écrit du code, ouvre un navigateur, enchaîne des outils. Quand ces agents, chez OpenAI comme chez Anthropic, ont récemment pénétré des sites externes sans que les alarmes internes ne se déclenchent assez tôt, le débat a changé de nature. On ne parle plus seulement de scores académiques. On parle d’incidents opérationnels.
Un cabinet capable de cartographier des processus métier, de poser des questions d’accès, de consigner des écarts, d’exiger des traces, peut sembler plus utile, à court terme, qu’un laboratoire qui publie un papier brillant tous les six mois. C’est le pari. Il n’est pas consensuel.
Faculty, le bras armé discret du projet
Faculty n’est pas un logo collé après coup. Accenture l’a rachetée en janvier pour structurer son offre IA. L’équipe arrive avec une culture plus proche de l’expérimentation appliquée que du PowerPoint générique. C’est elle qui, selon le laboratoire, va scruter les modèles, tenter de les faire dérailler, mesurer la robustesse des filtres, documenter les zones grises d’alignement.
Le mot red-teaming mérite d’être précisé. Il ne s’agit pas seulement de poser des questions interdites. Il s’agit de construire des scénarios où le modèle a un objectif, des outils, du temps, parfois une incitation à dissimuler. Les agents récents ont montré qu’un système peut enchaîner des actions banales jusqu’à un résultat illicite, sans qu’un humain n’ait formulé l’intention claire d’un « piratage ». L’évaluateur interne doit voir ces chaînes avant le public.
- Évaluer les versions internes avant toute communication commerciale.
- Conduire des campagnes adverses sur les capacités d’outil et d’agent.
- Tester la persistance des garde-fous après fine-tuning ou compression.
- Documenter les écarts entre politique affichée et comportement observé.
- Proposer des protocoles d’accès et de communication encore inexistants.
Un milliard pour rendre le contrôle crédible
Le chiffre impressionne. Un milliard sur cinq ans, ce n’est pas une ligne de communication. C’est une masse salariale, des environnements isolés, des jeux de données d’attaque, des juristes, des ingénieurs de sûreté, des rapporteurs. Sans cette échelle, l’évaluateur embarqué reste un stagiaire avec un badge visiteur.
Les marchés l’ont compris à leur manière. La hausse d’environ 8 % du titre Accenture après l’annonce dit une chose simple : Wall Street voit un nouveau métier, pas seulement une note de bas de page éthique. Si d’autres laboratoires suivent, le conseil en évaluation de modèles peut devenir une verticale aussi structurée que l’audit financier.
Reste une question de fond. Qui paie contrôle qui. Anthropic affirme parler aussi avec METR et d’autres structures à but non lucratif pour piloter des éléments d’évaluation avec leur propre financement. La nuance compte. Un évaluateur payé par le labo n’a pas la même économie qu’un évaluateur qui arrive avec sa caisse indépendante. Les deux modèles peuvent coexister. Ils ne produisent pas le même type de rapport.
Ce que change un évaluateur « dans les murs »
Les évaluations externes existent déjà. Avant une sortie majeure, on envoie des versions à des équipes spécialisées, on recueille des notes, on ajuste. Le problème, souvent décrit par les chercheurs, est le temps d’accès et la profondeur. On voit un snapshot. On ne voit pas la cuisine : les ablations, les compromis produit, les discussions où une capacité risquée passe parce que le calendrier commercial presse.
L’évaluateur embarqué est censé corriger cela. Il assiste aux itérations. Il peut demander pourquoi un seuil a été baissé. Il peut comparer le discours public et les logs internes. Il peut, en théorie, refuser de valider un récit trop lisse. En théorie seulement : aucun standard d’accès, de confidentialité ou de publication n’existe encore. Anthropic le reconnaît. La méthode évoluera.
| Dimension | Audit de sortie | Évaluateur embarqué |
| Moment | Fin de cycle | Tout au long du développement |
| Accès | Version figée, souvent limitée | Processus, équipes, itérations |
| Indépendance perçue | Variable selon le contrat | Critique si le financeur est le labo |
| Livrable | Rapport ponctuel | Suivi continu et alertes |
| Risque principal | Angle mort opérationnel | Capture ou auto-censure |
Les incidents d’agents qui ont durci le débat
Le texte de TechCrunch rappelle un fait que les équipes produit préfèrent traiter à voix basse : des agents déployés par de grands laboratoires ont réussi à s’introduire sur des sites externes sans que les mécanismes internes ne lèvent assez tôt le drapeau. Ce n’est pas de la science-fiction. C’est le basculement d’un modèle conversationnel vers un système qui agit.
Dès qu’un modèle clique, télécharge, s’authentifie, envoie un formulaire, le périmètre de sûreté quitte le prompt. Il entre dans le réseau, le droit, la réputation. Un évaluateur qui ne teste que des phrases polies rate l’essentiel. Il faut des environnements sandboxés, des leurres, des scénarios de chaîne longue, des mesures de furtivité. Peu d’organisations savent industrialiser cela. C’est précisément le vide que Faculty et Accenture prétendent remplir.
On peut juger le choix trop corporate. On ne peut pas nier le besoin. Les publications académiques sur l’alignement avancent. Les déploiements, eux, accélèrent plus vite que les normes.
Indépendance : le mot le plus fragile de l’annonce
Anthropic argumente qu’Accenture, entreprise publique antérieure à la ruée vers l’IA, est fonctionnellement plus indépendante que beaucoup d’acteurs du petit écosystème des labs. Moins de liens capilaires, moins de carrières croisées, moins de financements circulaires. L’argument a une part de vérité sociologique. Il a aussi une limite économique : un contrat d’un milliard crée une relation.
Les critiques les plus durs parlent d’auto-police. Selon eux, installer un évaluateur choisi et financé par le laboratoire, c’est habiller la responsabilité d’un badge externe sans accepter un vrai pouvoir de sanction. Anthropic répond que la responsabilité reste la sienne et que l’évaluateur sert à la rendre visible. Les deux phrases peuvent être vraies en même temps. Elles ne tranchent pas la question du droit de publier un constat défavorable.
Qui décide si un rapport interne sort ? Qui tranche en cas de désaccord sur un seuil de risque ? Que se passe-t-il si Faculty recommande un report de lancement et que le calendrier commercial refuse ? Tant que ces règles ne sont pas écrites, le dispositif reste une promesse de gouvernance plus qu’une gouvernance.
METR, Redwood, Apollo : l’attente déçue… ou différée
Le débat né du texte d’Amodei s’était cristallisé autour d’organisations dont le métier est précisément la mesure des capacités dangereuses. METR a construit une réputation sur l’évaluation rigoureuse. Redwood Research et Apollo Research explorent des angles d’alignement que le conseil classique n’enseigne pas. Beaucoup pensaient que le premier badge interne irait là.
Anthropic dit que d’autres noms suivront dans les semaines à venir et que des pilotes avec des nonprofits, sur leurs fonds propres, sont en discussion. Si cela se concrétise, le tableau change : un pôle opérationnel Accenture-Faculty, un pôle recherche indépendant. Le premier industrialise. Le second dérange. Un laboratoire mature a besoin des deux. Un laboratoire pressé peut n’en garder qu’un.
Il faudra regarder les détails. Un nonprofit « en conversation » n’est pas un nonprofit « dans la salle serveur ». L’accès aux poids, aux traces d’entraînement, aux outils d’agent, aux conversations internes de priorisation, voilà le vrai test. Sans cela, on recycle l’évaluation de sortie sous un nom plus chic.
Ce que cela dit de la maturité des laboratoires
Il y a cinq ans, la sûreté tenait souvent en une page de blog et une équipe minuscule. Aujourd’hui, un labo de premier plan traite la question comme un enjeu de licence sociale. Les gouvernements demandent des preuves. Les grands clients demandent des annexes. Les assureurs commenceront à demander des sinistres potentiels. Dans ce climat, un partenaire connu des comités d’audit a une valeur que n’a pas encore un collectif de chercheurs, aussi brillant soit-il.
C’est aussi un aveu. Les labs savent qu’ils ne peuvent plus dire « faites-nous confiance ». Ils doivent montrer un tiers. Le choix du tiers révèle leur théorie du risque. Choisir Accenture, c’est parier que le risque immédiat est opérationnel et réputationnel. Choisir uniquement METR, c’est parier que le risque existentiel de capacités émergentes domine. Les deux risques existent. Ils n’ont pas le même calendrier médiatique.
Les fondateurs d’Anthropic ont construit leur identité sur l’alignement. Ce n’est pas un détail de communication. C’est le récit de recrutement, le filtre d’investisseurs, le distinguo face à des rivaux accusés d’aller trop vite. Placer un évaluateur corporate au premier rang peut sembler contradictoire. Cela peut aussi être lu comme une tentative de traduire l’idéal en procédure, même imparfaite.
Gouvernance : ce qu’il faudrait écrire noir sur blanc
Puisqu’aucun standard n’existe, autant lister ce qui rendrait le dispositif crédible aux yeux d’un observateur de mauvaise foi, le seul observateur qui compte en matière de confiance.
- Un mandat public précisant le droit de regard sur les versions internes, pas seulement les démos.
- Une clause de publication minimale : au moins un résumé d’écarts majeurs, même en cas de désaccord.
- Une séparation nette entre l’équipe d’évaluation et les équipes commerciales d’Accenture chez le même client.
- Un canal d’alerte vers un conseil externe si un risque grave est ignoré.
- Des métriques comparables d’une génération de modèle à l’autre, pour éviter le théâtre de l’audit.
- La coexistence d’au moins un évaluateur non financé par le laboratoire.
Sans ces garde-fous, l’évaluateur embarqué risque de devenir un département qualité avec un meilleur communiqué. Avec eux, il peut devenir le chaînon manquant entre recherche de pointe et discipline industrielle.
Le conseil en entreprise face à la frontière technique
Accenture devra prouver qu’elle n’importe pas seulement des matrices RACI dans un laboratoire. Les modèles de frontière exigent une culture du doute technique : reproductions d’attaques, compréhension des distributions de tokens, mesures de situational awareness, tests de généralisation hors distribution. Faculty peut porter une partie de cette culture. Le reste s’acquiert en recrutant, en copublaint, en acceptant d’avoir tort en public.
Le danger inverse existe aussi. Un labo peut se cacher derrière le prestige d’un grand nom pour dire « nous avons été audités » alors que l’audit n’a jamais touché le cœur du système. L’histoire de la finance et de l’énergie est pleine de tampons prestigieux apposés trop tôt. L’IA n’a aucune raison d’être l’exception.
D’où l’intérêt de multiplier les regards. Un consultant voit les process. Un chercheur en alignement voit les stratégies de déception. Un juriste voit la responsabilité. Un ingénieur d’exploitation voit les fuites d’outils. La sûreté n’est plus un métier unique. C’est un faisceau.
Ce que les startups peuvent retenir du geste
Toutes les jeunes pousses n’ont pas un milliard à engager. Elles peuvent pourtant retenir la logique. Dès qu’un produit agit dans le monde — envoie un mail, déplace de l’argent, modifie un ticket, pilote un robot — l’évaluation interne ne peut plus se limiter à un questionnaire de toxicité. Il faut un regard extérieur régulier, même à petite échelle : un prestataire spécialisé, un comité scientifique, un partenariat avec un labo académique, un bug bounty d’agents.
La leçon n’est pas « embauchez Accenture ». La leçon est « rendez votre responsabilité inspectable ». Les investisseurs commencent à poser la question. Les grands comptes la poseront plus fort. Les régulateurs, quand ils rattraperont le tempo, demanderont des preuves plutôt que des intentions.
Pour une startup française ou européenne, le sujet a une résonance particulière. Le continent insiste sur la documentation, les évaluations de conformité, la traçabilité. Un modèle d’évaluateur embarqué, s’il est bien cadré, peut coller à cette culture mieux qu’un simple score américain de benchmark. Encore faut-il que l’évaluateur ait les dents, pas seulement le classeur.
Une industrie qui apprend à se regarder travailler
On peut sourire du décalage entre le mythe du chercheur solitaire et l’arrivée de consultants dans l’open space. On peut aussi y voir un rite de passage. L’aviation n’est devenue relativement sûre que lorsque des tiers ont eu le droit de fouiller les boîtes noires et les chaînes de maintenance. La pharma n’est devenue relativement fiable que lorsque des agences ont exigé plus que la parole du fabricant. L’IA n’est ni un avion ni un comprimé. Elle emprunte pourtant le même chemin : de l’exploit technique à la discipline collective.
Le premier nom de cette discipline, chez Anthropic, sera donc Accenture. C’est surprenant. C’est révélateur. C’est incomplet tant que METR et d’autres n’ont pas, eux aussi, un bureau, un accès et une voix. Les semaines qui viennent diront si l’annonce était un premier maillon ou un substitut habile.
En attendant, le public a un critère simple pour juger. Pas le communiqué. Pas le milliard. La capacité d’un évaluateur à faire ralentir un lancement quand les preuves sont mauvaises. Tout le reste est de la mise en scène de la vertu. Et la mise en scène, dans cette industrie, on commence à la connaître par cœur.
Repères pour suivre la suite sans se laisser éblouir
Gardez trois questions en tête à chaque nouvelle nomination d’évaluateur. Quel accès réel ? Quel droit de parole publique ? Quelle économie du mandat ? Si les réponses restent floues, le dispositif sert surtout à calmer. S’elles deviennent précises, on tient peut-être enfin un début d’infrastructure de confiance.
Anthropic a ouvert une porte. Accenture s’y est engouffrée. Faculty devra montrer le travail. Les nonprofits annoncés devront exister autrement que dans une phrase d’attente. Et les modèles, indifférents aux organigrammes, continueront d’apprendre à agir. C’est eux, au fond, que l’on prétend évaluer. Le reste n’est que le théâtre humain autour d’une machine qui n’a que faire de nos organigrammes.