// FRANDROID — HARDWARE & GADGET
J’ai testé une IA géante chinoise sur Mac mini, PC gamer et mini PC : voici le grand gagnant sur Bonsai 2
Quatre ordinateurs, une IA locale contenue dans un fichier de 5,95 Go, et quatre vitesses qui n’ont rien à voir. Sur le mini PC Intel, les mots tombent péniblement à 1,75 token par seconde ; le Mac mini M6 en produit 18,1 dans le même temps quand la RTX 4070 Ti SUPER d’un PC de joueur crache le texte à près de 69 tokens par seconde.
Le modèle tient pourtant sans forcer dans la mémoire des quatre machines, ce qui pose une question toute bête : si chacun peut le charger, pourquoi de tels écarts ?
Ce fichier est Bonsai 2 27B, une version compressée du modèle Qwen3.8-27B d’Alibaba. La base est donc chinoise, mais la compression vient d’une jeune pousse américaine, Prism ML, née de travaux menés à Caltech. On vous présentait déjà cette IA géante qui tient dans 5,9 Go. Cette fois, on l’a mise à l’épreuve sur du vrai matériel pour comparer les performances et voir ce que ça peut donner sur un « vrai » ordinateur du quotidien.
Bonsai 2 27B a été mis en ligne le 17 septembre 2026, sous licence Apache 2.0 : les poids sont librement téléchargeables sur Hugging Face, gratuitement. Un détail à connaître avant de se lancer, en revanche : le format ternaire exige le runtime maison de Prism ML. En clair, on récupère le modèle sans débourser un euro, mais on ne le lance pas encore d’un simple clic dans un LM Studio ou un Ollama standard.
Un modèle d’IA est avant tout une gigantesque collection de nombres, les poids, qui encodent ce qu’il a appris. Dans sa version classique en FP16, Qwen3.8-27B garde chacun de ses 27 milliards de poids sur 16 bits, ce qui donne un fichier d’environ 54 Go. Impossible à faire tenir dans la VRAM de 16 Go d’une carte graphique de joueur comme la RTX 4070 Ti SUPER de Nvidia du PC de votre serviteur.
Mais Prism ML fait dans le radical : chaque poids est ramené à trois valeurs possibles, −1, 0 ou +1. On appelle ça une représentation ternaire, obtenue par quantification post-entraînement, un format baptisé PTQ1_0. On tombe alors à 1,75 bit par poids en moyenne dans le fichier testé, pour un GGUF de 5,95 Go. À titre de comparaison, la quantification Q4 classique que nous avons utilisée en face pour nos tests de performances plus bas pèse encore 17,1 Go, soit un peu plus de 5 bits par poids.
Autant le dire tout de suite : un modèle de 17 Go ne peut pas tenir entièrement dans une carte graphique qui n’a que 16 Go de VRAM. Alors quand ce modèle ne pèse plus que 6 Go, la manipulation devient tout de suite beaucoup plus envisageable.
Côté matériel, on a réuni trois machines très différentes : le mini PC Intel (un GMKtec EVO-T2S à processeur Core Ultra et puce graphique Arc, 64 Go de mémoire partagée), le Mac mini M6 24 Go et sa mémoire unifiée, et un PC de joueur à base de RTX 4070 Ti SUPER avec 16 Go de VRAM. Détail qui compte : le Mac et le mini PC Intel partagent tous les deux leur mémoire entre processeur et puce graphique.
On a ajouté un quatrième larron, un mini PC AMD à base de Ryzen AI Max+ 395, pour servir de test de contrôle : le GMKtec EVO-X3. Ici aussi, la RAM soudée (128 Go) est partagée entre le CPU et le GPU. De quoi réserver ici 64 Go à la puce graphique pour y charger les modèles d’IA (GMKtec autorise jusqu’à 96 Go).
Le protocole tient en quelques lignes. Même version du runtime de Prism ML sur les quatre machines, même fichier Bonsai de 5,95 Go, même fichier Qwen3.8 en Q4 pour la comparaison. On mesure le débit de génération à chaud avec l’outil llama-bench, un prompt de 512 tokens puis une génération de 128 tokens, cinq répétitions.