Un modèle supposé de 10 trillions de paramètres semble être un pari audacieux, mais le nombre de paramètres n’est plus depuis longtemps le meilleur indicateur des capacités visibles par l’utilisateur. À mesure que les modèles grandissent, des courbes de perte lisses masquent des comportements par paliers — utilisation fiable d’outils, coordination multi-agents, et synthèse ancrée sur de longs contextes. La question centrale est de savoir si pousser l’échelle plus loin débloque encore des capacités qualitativement nouvelles ou si nous empilons simplement une capacité coûteuse sur des goulets d’étranglement comme la qualité des données, la mémoire et les entrées/sorties. Si Bel existe, évaluer son impact exige d’examiner des capacités durables et auditables, pas seulement des écarts de score sur des classements familiers.
À cette échelle, la conception du système compte autant que la taille brute. Les topologies mixture-of-experts, le routage plus intelligent, le parallélisme conscient du matériel et la mémoire hiérarchique peuvent transformer les paramètres en travail utile — ou les gaspiller en surcharge de communication et latence. Les démonstrations les plus révélatrices montreraient un raisonnement stable sur des contextes de millions de tokens, une mémoire de travail persistante, et une récupération après panne sans réinitialisation humaine. Si ces capacités apparaissent, les retours à l’échelle restent pertinents ; sinon, les tokens marginaux apprennent peut-être les mêmes concepts à répétition avec des coûts de calcul croissants.
Les données seront probablement la limite. Les corpus de haute qualité, dédupliqués et sûrs en termes d’attribution, couvrant les mathématiques, le code, la science et les connaissances procédurales, sont finis. Les données synthétiques peuvent repousser la frontière, mais les boucles naïves d’auto-amorçage risquent de reproduire les erreurs du modèle. La voie pratique est une génération synthétique soignée avec des critiques rigoureux, des tâches ancrées sur des outils, et une évaluation continue sous changement de domaine. Sans cela, même un modèle à 10T pourrait plafonner en fiabilité réelle tout en impressionnant sur des benchmarks familiers.
Pour les acheteurs et les concepteurs, l’implication est claire : concevez pour la capacité, pas pour le spectacle. Attendez-vous à l’hétérogénéité — des architectures MoE, des outils de récupération et d’exécution programmée, une mémoire externe durable, et des couches de politique qui dirigent les requêtes selon la difficulté et le risque. Les achats doivent associer capacité, observabilité, contrôle des coûts et évaluation basée sur les résultats. Si Bel fait vraiment avancer la barre, vous le verrez dans le temps de disponibilité des agents, le succès des tâches par dollar, et la réduction de l’arbitrage humain — pas seulement un nouveau record sur des examens statiques.


