Au printemps 2026, une scientifique des matériaux informatiques d'une université publique du Midwest m'a dit que son groupe avait attendu onze semaines pour un seul nœud sur le cluster du campus. Dans cette même fenêtre, un collaborateur d'une université privée avec un cluster d'intelligence artificielle dédié a mené la même expérience de réglage fin en moins d'une journée.
La National Artificial Intelligence Research Resource Pilot, lancée par la National Science Foundation des États-Unis en janvier 2024, a été construite exactement pour ce problème. Les piscines pilotes calculent le temps sur les systèmes fédéraux et industriels, les données curées et les ressources de formation pratiques et les ouvrent aux chercheurs à travers des appels compétitifs.
Ce n'est pas une préoccupation de niche. L'Institut Stanford pour l'IA centré sur l'homme a suivi une augmentation de plus d'une centaine de fois de l'informatique utilisée pour former des modèles de premier plan depuis 2017. La plupart des chercheurs universitaires ne toucheront jamais cette échelle. Le cluster campus moyen se trouve dans les dizaines ou les faibles centaines de GPU, partagés dans chaque département qui en a besoin. Lorsqu'un groupe de chimie veut scanner des bibliothèques moléculaires et qu'un linguiste veut ajuster un petit modèle de langue, la même file décide des deux chronologies.
Là où les divisions apparaissent d'abord
Une collègue que j'appellerai Dr. M, linguiste informatique à une université de recherche européenne, m'a dit que ses évaluateurs de bourses demandaient maintenant quel cluster elle utiliserait avant de lire la section de méthode. La question est devenue un filtre. Elle a dû emprunter du temps sur la machine d'une institution partenaire pour terminer une révision parce que l'allocation de son propre université était épuisée à la mi-fé. Multiplier Dr. M par chaque laboratoire dont la recherche s'est déplacée vers l'apprentissage automatique au cours des trois dernières années.
Le taux de base est simple: les institutions avec de grands budgets de recherche informatique, le personnel d'ingénierie dédié qui peut effectivement planifier des emplois et les partenariats industriels capturent une part disproportionnée du travail activé par l'IA. Les institutions qui comptent sur les clusters de matières premières et les frais de cloud par laboratoire sont en retard dans le succès de la proposition, la vitesse de publication et la rétention de la faculté qui conduit les deux.
Les comités de recherche en informatique, statistiques et sciences du banc qui utilisent désormais l'imagerie ou la simulation à l'échelle de plus en plus listent l'accès à l'infrastructure GPU dans le cadre du paquet qu'ils proposent aux candidats. Il n'est pas inhabituel de voir un budget de démarrage maintenant inclure à la fois une ligne postdoc et une allocation informatique. Lorsque les institutions gelent les lignes de faculté pour protéger les budgets d'infrastructure, le compromis devient visible.
Les options publiques sont réelles mais surabonnées
Les chercheurs peuvent demander des allocations sur les systèmes contribués par le Département américain de l'énergie, les Instituts nationaux de la santé, et les partenaires privés tels que NVIDIA et Microsoft. Les documents du pilote le décrivent comme un effort de deux ans pour apprendre à quoi devrait ressembler une infrastructure de recherche nationale.Le portail pilote de NAIRRListe des opportunités actuelles et des politiques d'allocation.
L’Europe a sa propre réponse.Entreprise commune européenne de l'informatique de haute performance, ou EuroHPC JU, exploite des systèmes pré-exascale dont LUMI en Finlande et Leonardo en Italie. L'accès est concurrentiel et rangé: certains appels sont pour les consortiums européens, d'autres pour l'industrie. Un chercheur universitaire dans un État membre plus petit peut gagner un prix, mais l'effort de proposition rivalise avec une demande de subvention.
Les crédits cloud changent les mathématiques, pas le problème
Les crédits cloud sont la troisième voie. la Fondation nationale américaine de la scienceCloudbankLe programme fournit un accès en nuage aux chercheurs en informatique, et de nombreuses universités détiennent désormais des contrats d'entreprise avec Amazon Web Services et Google Cloud, et certaines ont ajouté Microsoft Azure sous des termes distincts. Le modèle de coût change la conversation. Une seule heure de GPU sur un fournisseur de cloud peut paraître petite jusqu'à ce qu'une expérience dure une semaine.
institutions qui ont créé leur propre
Certaines universités ont décidé de ne pas attendre les allocations publiques. HiPerGator de l'Université de Floride, un superordinateur du campus construit en partenariat avec NVIDIA, a donné à la faculté l'accès à des centaines de GPU et a soutenu le travail sur de grands modèles linguistiques et l'imagerie médicale. L'Université de Bristol héberge Isambard-AI, partie de la ressource nationale de recherche sur l'IA du Royaume-Uni, aux côtés de partenaires. Ce sont des exceptions, pas le taux de base. Ils nécessitent un engagement d'État ou national, une salle de données construite ou rénovée, et une équipe d'ingénieurs de logiciels de recherche qui maintiennent la queue en mouvement.
L'institution de niveau intermédiaire est confrontée à une décision différente. Elle peut acheter un cluster modeste tous les trois à cinq ans, payer pour le cloud sur les cycles de subvention, ou essayer de rejoindre un consortium régional. La première option offre le contrôle mais se dégrade rapidement. La seconde est flexible et imprévisible. La troisième dépend de la gouvernance et de la confiance, qui sont plus difficiles à financer que le matériel. Un quatrième, de plus en plus commun, est de ne rien faire et de regarder les chercheurs partir.
Ce que cela signifie pour votre laboratoire
Si vous êtes un membre de la faculté, postdoc, étudiant en doctorat, ou le scientifique du personnel qui détient le compte cluster, traitez l'accès informatique comme un problème logistique, pas un problème technique. Demandez à votre bureau de recherche la priorité de la file d'attente réelle, le modèle de récupération des coûts que votre département paie, et le processus pour demander des allocations d'urgence.
Cette tension n'est pas séparée de la politique budgétaire.Notre précédent rapport surCollège de freinagemontre ce qui se passe lorsque la rétention et l'infrastructure rivalisent pour les mêmes fonds. Pour les administrateurs, l'intervention la moins chère est souvent une politique d'allocation partagée. Une politique écrite qui nomme les niveaux de priorité, limite le temps d'horloge murale et explique comment acheter de la capacité supplémentaire quand un délai ne coûte rien et empêche les négociations de couloir qui consomment le temps de la faculté. La prochaine étape est d'embaucher un ingénieur de logiciel de recherche qui peut profiler des emplois, réduire les pertes de mémoire de tailles de lots excessives et aider les laboratoires à passer de quatre GPU à deux sans perdre de sortie.
Des groupes d’universités de taille moyenne au Canada, dans certaines parties de l’Australie et dans le nord-est des États-Unis ont combiné leurs achats pour obtenir de meilleurs prix auprès des fournisseurs de matériel et des fournisseurs de cloud.
Le 2024Le rapport de l’indexDe Stanford, la direction est claire: à mesure que les coûts de formation des modèles augmentent, l'informatique publique et universitaire devra être traitée comme une infrastructure scientifique partagée, pas comme une dépense départementale.
Avant le prochain cycle de subvention, écrivez une page décrivant ce que votre laboratoire a besoin de calculer, combien cela coûterait sur le marché ouvert en vertu d'un contrat de cloud commercial et quelle politique institutionnelle le rendrait traitable. Envoyez cette page à votre vice-président pour la recherche. Il ne suffit pas de gagner l'allocation. Vous avez besoin de l'allocation pour apparaître dans le budget institutionnel, avec un nom joint.
