// FRANDROID — HARDWARE & GADGET
Acheter le Mac mini M6 pour l’IA locale : pourquoi c’est souvent une mauvaise idée
Cela fait partie de mes discussions (passionnées) depuis l’annonce du 25 août. Si on lit les promesses, on voit que le Mac mini traite les prompts LLM 4,8 fois plus vite que le M4. Avec des modèles ouverts comme Gemma 4, mais aussi les modèles chinois qui rivalisent avec ChatGPT, on se dit qu’avec 1 049 € on va enfin avoir « son IA à la maison », sans abonnement et sans envoyer ses données à qui que ce soit. C’est vrai, l’intention est bonne. Le raisonnement a juste un problème : les chiffres d’Apple mesurent la vitesse de la puce, pas la taille de ce qu’elle peut avaler. Et sur ce point, le Mac mini M6 est la machine la plus limitée de toute la gamme.
Le Mac mini M6 démarre à 1 049 € avec 16 Go de mémoire unifiée et 256 Go de SSD, soit 350 € de plus que le M4 à son lancement. La puce M6, première gravée en 2 nm, apporte 12 cœurs CPU, 12 cœurs GPU avec accélérateurs neuronaux et une mémoire configurable jusqu’à 32 Go, pas un de plus. Apple communique beaucoup sur l’IA de cette génération, et pour cause : c’est le vrai sujet de toute la gamme. Sauf qu’en lisant attentivement, les promesses de gros modèles et de cluster concernent le Mac Studio et le mini M5 Pro. Le M6, lui, hérite du discours sans hériter des moyens.
Pour aller plus loin
Mac Studio M5 Max-Ultra ou Mac mini M6 : peut-on vraiment remplacer son abonnement Claude ou Codex ?
Oui, la machine reste capable. En 16 Go, on fait tourner correctement des modèles de 8 à 14 milliards de paramètres : gpt-oss-20b, les poids ouverts d’OpenAI taillés pour 16 Go, un Gemma 4 12B, un Qwen de classe équivalente. C’est suffisant pour transcrire de l’audio avec Whisper, résumer, traduire, classer des documents ou interroger ses propres fichiers, le tout hors ligne.
En 32 Go, on monte d’un cran avec la classe des 27 à 30 milliards : Qwen3.8-27B, multimodal et sorti mi-août, ou GLM-4.7-Flash, un petit MoE de 30 milliards dont 3,6 actifs, très à l’aise en code pour sa taille. Avec MLX, le framework d’Apple, un modèle de code de cette classe dépasse les 100 tokens par seconde sur ce type de configuration. Notre guide d’installation d’un ChatGPT local couvre tout ça pas à pas.
Le vrai sujet, c’est ce qui ne tournera jamais sur cette machine. Les modèles ouverts qui font l’actualité et qui se comparent réellement aux services payants, GLM-5.3-Flash et ses 320 milliards de paramètres, DeepSeek V4 Flash et ses 167 Go de poids, demandent 170 Go de mémoire et plus. Un Mac mini M6 n’en approchera aucun, même de très loin, même en compressant à outrance. Entre 32 et 128 Go, on ne gagne pas juste en confort, on accède à une tout autre catégorie de modèles, comme on le détaillait dans notre dossier sur le nouveau Mac Studio.
Pour savoir en quelques secondes ce que votre machine peut encaisser, l’outil gratuit CanIRun.ai fait très bien le travail : il détecte votre GPU ou votre puce Apple depuis le navigateur, puis classe les modèles ouverts de S à F selon qu’ils tournent confortablement, passent tout juste ou ne rentrent pas, avec la quantification conseillée et la commande pour les lancer.
Un conseil en lisant ses résultats : ne visez jamais un modèle dont le poids frôle votre quantité de mémoire. Le fichier du modèle n’est qu’une partie de l’addition, il faut aussi loger macOS, le logiciel d’inférence et surtout le contexte, ce cache qui grossit avec chaque document ou conversation qu’on donne au modèle.
macOS refuse d’ailleurs par défaut de céder toute la mémoire unifiée au GPU. En pratique, je vous conseille de garder 25 à 30 % de marge : sur un Mac mini 16 Go, on cible des modèles de 10 à 11 Go maximum, et sur un 32 Go, on s’arrête vers 20 à 22 Go. C’est exactement pour ça qu’un fichier de 19 Go comme GLM-4.7-Flash passe bien en 32 Go et pas du tout en 24.
Premier verrou, la mémoire plafonne à 32 Go, là où le Mac mini M5 Pro monte à 64 Go et le Studio à 128 puis 512 Go. Deuxième verrou, plus discret : la version 16 Go se contente de 153 Go/s de bande passante, les 170 Go/s