// FRANDROID — MOBILE & WEB
27 milliards de paramètres dans 5,9 Go : l’IA chinoise géante qui tourne sur Mac et iPhone
Un modèle d’IA de cette taille réclame d’habitude plusieurs dizaines de gigaoctets de mémoire, ce qui le réserve aux cartes graphiques professionnelles ou au cloud. PrismML annonce le faire tenir dans 5,9 Go, soit plus de neuf fois moins que Qwen3.8 27B, le modèle chinois open source d’Alibaba dont il dérive. En clair, ça rentre dans la mémoire vive d’un MacBook Air d’entrée de gamme ou d’un iPhone, sans acheter la moindre pièce.
Le tour de passe-passe s’appelle la compression ternaire. Pour les plus techniques d’entre vous, l’explication est la suivante : au lieu de coder chaque poids du réseau sur 16 bits, PrismML les ramène à trois valeurs seulement, −1, 0 ou +1, avec une mise à l’échelle en FP16. On tombe à 1,76 bit par poids en moyenne.
Le modèle garde sa fenêtre de contexte de 262 000 tokens et reste multimodal, capable de lire aussi bien du texte que des images. Autrement dit, les capacités du modèle complet restent là.
Sur une batterie de tests maison couvrant le raisonnement, le code, les maths, le suivi d’instructions et la vision, PrismML attribue à son modèle un score agrégé de 83,9, contre 85,4 pour Qwen3.8 27B en pleine précision. Soit 98,2 % des performances conservées du modèle d’origine.
Protégez votre vie numérique et vos appareils contre les virus, arnaques, ransomwares et menaces en ligne avec Bitdefender, primé pour sa protection et compatible avec Windows, Mac, Android et iOS.
La compression ternaire n’a rien de neuf. Microsoft l’utilise déjà avec BitNet b1.58, sur les mêmes valeurs −1, 0 et +1. PrismML met surtout en avant le niveau de perte. Sa première génération, Bonsai 27B sortie en juillet 2026, ne conservait que 95 % des performances. Deux mois plus tard, la barre passe à plus de 98 %. À ce stade, deux points d’écart ne se repèrent a priori quasiment plus à l’usage, sauf à sortir un benchmark spécialisé.
Le modèle tourne sur GPU NVIDIA via CUDA et sur les appareils Apple via MLX, ce qui couvre le Mac, l’iPhone et l’iPad. PrismML n’en est pas à son coup d’essai sur ce terrain : on vous a déjà montré comment la startup fait tenir une IA de 27 milliards de paramètres dans un iPhone, une prouesse que d’autres modèles de cette taille commencent à réussir en local.
Le modèle est gratuit et ouvert. PrismML publie les poids de Ternary Bonsai 2 27B sous licence Apache 2.0, téléchargeables sur Hugging Face, avec un usage commercial autorisé.
Côté vitesse, PrismML annonce jusqu’à 143 tokens par seconde sur une RTX 5090 et 46,8 tokens par seconde sur une puce M5 Max. Sur une RTX 4090, le modèle consommerait 0,714 mWh par token, soit 40 % de moins qu’un modèle 8B en pleine précision.
Pour tester l’IA locale sans le budget d’un PC de gamer, l’argument tient dans un chiffre : 5,9 Go rentrent dans la mémoire vive d’un MacBook Air comme d’un Mac équipé d’un M5 Max. Face aux références locales du moment, Mistral 7B ou Llama 3.1 8B, on parle d’un modèle bien plus gros, à 27 milliards de paramètres.