// HARDWARE UPGRADE — HARDWARE & GADGET
gpt-oss-120b gira su un Galaxy S24+ e cinque computer, a 1,1 token al secondo
Un utente Reddit ha distribuito i layer di gpt-oss-120b quantizzato a 4 bit su sei dispositivi, fra cui un Galaxy S24+, un mini PC con RTX 3060 e tre Mac, con il parallelismo di pipeline. Funziona, ma genera appena 1,1 token al secondo.