Kui palju RAM-i on vaja, et sülearvutis AI-d kohapeal käitada?

Sinu enda sülearvutis töötav väike AI-mudel suudab juba teksti lugeda, pilte analüüsida ja su küsimustele vastata, ilma et pilvekontot vaja oleks. qwen3.5:4b-q4_K_M (Qwen) on 3,4 GB suurune allalaaditav mudel, mis suudab seda kõike juba täna õhtul tavalises 16 GB mäluga sülearvutis teha. See on LLM ehk suur keelemudel. Tõmba see Ollamaga alla, esita üks küsimus 4K kontekstiga ja sul töötabki kohapeal AI-mudel riistvaral, mis sul juba olemas on. See loeb teksti ja pilte ning tegu on inferentsi, mitte treenimisega: keegi ei õpeta mudelile siin midagi uut, see lihtsalt vastab.

Udune "AI PC" kleeps sülearvuti karbil ei ole tehniline näitaja. Loeb RAM, GPU kasutatav mälu, salvestusruum ja tarkvara tegelik tugi. 16 GB mälu on väikeste AI-mudelite jaoks täiesti asjalik alguspunkt, mitte tase, mille võib kohe maha kanda, ega ka lubadus, et kõik spetsifikatsioonilehel kirjas olev töötab muretult. Rohkem mälu annab rohkem konteksti ja rohkem ruumi rööprähklemiseks. 16 GB-ga saad alustada.

Mida AI käitamisel sülearvuti RAM-ist tegelikult kasutatakse?

Mudeli allalaadimismaht ja selle RAM-i kasutus töö ajal on kaks eri asja. Nende segiajamine on kõige tavalisem viga, mida AI jaoks sülearvutit valides tehakse. Need 3,4 GB, mille qwen3.5:4b-q4_K_M jaoks alla laadid, on lihtsalt kettal olev fail. Selle avamine nõuab päris mälu. Sama kehtib kontekstiakna kohta, ehk käimasoleva vestluse kohta, mida mudel vastamise ajal meeles hoiab ja mida nimetatakse KV-vahemäluks. Mälu vajab ka mootor ise, lisaks kõigele muule, mida su operatsioonisüsteem ja teised rakendused juba kasutavad.

Ollama kasutab vaikimisi 4096-tokenilist konteksti, aga seda saab suurendada. Kui käitad korraga mitut päringut, kasvab kontekstimälu vajadus ligikaudu samas tempos kui paralleelsete päringute arv. Mudeli spetsifikatsioon võib reklaamida 128K või 256K tokeni suurust kontekstiakent, kuid võta seda mudeli ülempiiri, mitte lubadusena, et su 16 GB sülearvuti suudab seda kõike korraga ära kasutada.

RAM, VRAM ja ühendmälu ei ole üks ja seesama

Apple Siliconi kiibid kasutavad ühendmälu: CPU ja GPU võtavad mõlemad samast 16, 24 või 32 GB mälupangast, seega ei ole eraldi graafikamälu, mis saaks eraldi otsa lõppeda. Tüüpiline eraldi NVIDIA GPU-ga Windowsi või Linuxi sülearvuti töötab teisiti. Süsteemi RAM ja GPU enda VRAM on kaks eraldi mälupanka ning 16 GB süsteemimälu koos 8 GB GPU-ga ei tähenda üht vaba 24 GB kogumit, mida mudel saaks vabalt kasutada.

Kui mudel ei mahu täielikult GPU-le ära, töötab osa sellest CPU-l. See osaline ümbertõstmine võib muuta tehniliselt käivitatava mudeli tuntavalt aeglasemaks. Käsk näitab täpselt seda CPU/GPU jaotust ükskõik millise parajasti laaditud mudeli puhul.

Mahust üksi ei piisa. Sama oluline on ka see, kui kiiresti mälu andmeid liigutab: Apple’i andmetel on MacBook Air M5 mäluläbilase 153 GB/s ning just läbilase, mitte ainult maht, on oluline põhjus, miks ühendmälu tundub kiire ja sujuv, mitte lihtsalt napilt piisav.

Kvantimine: kuidas 9B AI-mudel sinu RAM-i ära mahub

Kvantimine on põhjus, miks see allalaadimine on ainult 3,4 GB: mudeli kaalude salvestamine madalama arvulise täpsusega teeb faili väiksemaks ja Qwen3.5 enda 9B mudel näitab seda väga selgelt. Sama 9B mudel on Q4_K_M variandina 6,6 GB, Q8_0 variandina 11 GB ja täistäpsusega BF16 kujul 19 GB. Sama mudel, sama parameetrite arv, aga kolm väga erinevat allalaadimismahtu. Ja taas kord räägime allalaaditava faili suurusest, mitte RAM-ist, mida töö ajal vaja läheb.

Madalam täpsus tähendab üldjuhul mõningast kvaliteedikadu, aga selle ulatus sõltub ülesandest, mitte kindlast protsendist. Veel üks praktiline nüanss, mida tasub enne Qweni esimeseks mudeliks valimist teada: osa kasutajaid on märganud, et selle "mõtlemise" samm lisab enne vastuse ilmumist tuntava viivituse võrreldes mudelitega, mis vastavad otsemalt. Seega tasub mõlemat lähenemist oma ülesannete peal proovida, mitte eeldada, et üks on lihtsalt parem.

Kas sul on juba 16 GB MacBook? Proovi seda enne ostmist

Kui sul on juba 16 GB MacBook, alusta 2–4B mudelist Q4 täpsusega ja 4K kontekstiga, enne kui üldse millegi muu ostmisele mõtled. Ka 9B Q4 mudel või midagi Gemma 4 12B QAT taolist võib töötada. Kas see töötab, sõltub sellest, kui palju teisi rakendusi on lahti, kui suurt konteksti kasutad ja kui koormatud arvuti juba on, nii et võta seda variandina, mida tasub proovida, mitte garantiina.

Kui tahad just selleks uut arvutit osta, siis 13-tolline M5-kiibiga MacBook Air tuleb standardis 16 GB ühendmäluga ja seda saab seadistada kuni 32 GB-ni. Ja enne kui suurem ekraan sind uuendusele meelitab: 15-tolline M5 Air algab täpselt samade 16, 24 ja 32 GB mälumahtudega ning sama 153 GB/s läbilaskega nagu 13-tolline mudel. Vali ekraani suurus mugavuse järgi, mitte lootuses, et see annab AI jaoks rohkem varu. Ei anna.

13-tolline M5-kiibiga MacBook Air

Kas sul on juba 16 GB Windowsi või Linuxi sülearvuti? Alusta siit

16 GB Windowsi või Linuxi sülearvuti ilma eraldi GPU-ta suudab samuti väikest mudelit käitada. Ollama töötab Windowsis natiivselt, nii et tõmba alla 2–4B Q4 mudel ja proovi see enne igasugust lisakulu CPU või integreeritud graafikaga ära. Kasutuskogemus võib siin kõikuda rohkem kui Apple Siliconi puhul: üht kindlat tokenit-sekundis näitu ei saa kõigile masinatele laiendada, sest keegi pole kõiki võimalikke seadistusi läbi mõõtnud.

Nii Lenovo ThinkPad T14 G2 kui ka HP EliteBook x360 1040 G7 kuuluvad täpselt sellesse klassi: mõlemal on 16 GB RAM-i ja integreeritud graafika. Üks asi, mida tasub enne üle kontrollida, eriti vanema professionaalselt taastatud masina puhul nagu need kaks: LM Studio vajab Windows x64 peal AVX2 tuge ning kõigil vanematel protsessoritel seda käsustikku ei ole. Vaata enne üle, kas sinu konkreetne protsessor seda toetab, mitte ära eelda, et iga selle klassi sülearvuti valitud tööriistaga töötab.

Lenovo ThinkPad T14 G2 sülearvuti

Sülearvuti GPU nime lõks: miks "RTX 5070 Ti" ei ütle veel kõike

NVIDIA sülearvutite GPU-d kannavad lauaarvutikaartidega samu nimesid, aga nimi ütleb vähem, kui esmapilgul tundub. RTX 5060 Laptop GPU-l on 8 GB GDDR7 mälu ja ametlik võimsusvahemik 45 kuni 100 vatti. RTX 5070 Ti Laptop GPU-l on 12 GB GDDR7 mälu ja 60 kuni 115 vatti. Kui näed veebis lauaarvuti RTX 5070 Ti tulemust, siis see ei ole sülearvuti RTX 5070 Ti tulemus, ükskõik mida nimi ka ei vihjaks.

Samas nimes peitub veel teinegi lõks. Kahel sülearvutil võib mõlemal olla "RTX 5070 Ti Laptop GPU", kuid pika koormuse all võivad need siiski käituda erinevalt: õhuke ja kerge korpus ning paksem ja raskem korpus juhivad soojust erinevalt ning sama GPU nimi ei taga sama tegelikku kiirust siis, kui ventilaatorid on juba mõnda aega töötanud. Kontrolli alati konkreetset VRAM-i mahtu ja sülearvuti enda toitekonfiguratsiooni, mitte ainult GPU perekonnanime.

Uut Maci ostes: mugavam ühendmälu tase

Kui ostad sülearvutit just selleks, et kohalikku AI-d regulaarselt käitada, on Apple’i valikus mugavam tase 24 kuni 32 GB ühendmälu. See jätab ruumi suurema mudeli, pikema konteksti või lihtsalt teiste avatud rakenduste jaoks töö kõrvale. Kui plaanid seda sageli kasutada ja eelarve lubab, vali 32 GB.

13-tolline M2-kiibiga MacBook Pro on professionaalselt taastatud näide, mis asub juba 16 GB algtasemest kõrgemal: selle 8-tuumaline CPU ja 10-tuumaline GPU töötavad kuni 24 GB ühendmäluga. See on vanema kiibipõlvkonna mudel kui M5 Air, seega tasub siin arvestada just selle enda 24 GB ülempiiriga, mitte M5 Airi eraldi 24/32 GB konfiguratsioonivõimalustega.

13-tolline M2-kiibiga MacBook Pro

Uut Windowsi või Linuxi sülearvutit ostes: otsi eraldi GPU-d

Kui valid uut Windowsi või Linuxi sülearvutit kohaliku AI jaoks, vaata 32 GB süsteemimälu ning eraldi NVIDIA sülearvuti GPU poole, millel on vähemalt 8 GB oma VRAM-i, või 12 GB, kui veidi raskem ja kallim sülearvuti sobib. 8 GB on mõistlik siht 4–7B mudelite jaoks Q4 täpsusega ja mõõduka konteksti puhul, kuid ära eelda, et sellest automaatselt piisab: isegi 9B Q4 mudeli 6,6 GB allalaadimine võib mugavaks tööks vajada rohkem kui paljast 8 GB-d ning 12 GB teeb selle suurusjärgu testimise lihtsalt hõlpsamaks.

Dell Precision 7730 on selle põhimõtte kohta professionaalselt taastatud näide, isegi kui mitte täpselt sama uue põlvkonna kiipidega: 32 GB süsteemimälu kõrval on eraldi NVIDIA Quadro P3200 oma 6 GB VRAM-iga. See on teise põlvkonna ja teise klassi GPU kui NVIDIA tänased RTX 5060 ja 5070 Ti Laptop GPU-d, kuid eraldi mälupankade loogika on sama.

Dell Precision 7730 mobiilne tööjaam

Asjalik alternatiiv: AMD suure mälumahuga sülearvutikiibid

AMD Ryzen AI Max+ 395 protsessor toetab kuni 128 GB LPDDR5x süsteemimälu, olenevalt sellest, kuidas konkreetne sülearvuti on seadistatud. See on teistsugune mälukorraldus, mida tasub teada, aga sellega kaasneb ka üks oluline konks: Ollama Linuxi ROCm-i toe loendis on see kiip olemas, Windowsi ROCm-i loendis praegu mitte.

Seega tasub enne soovitamist üle kontrollida konkreetse sülearvuti paigaldatud mälu, operatsioonisüsteemi, GPU taustsüsteemi, draiveri ja Ollama käitumise, mitte kiipi kohe kõrvale jätta. Võta suure mälumahuga AMD sülearvutit kui huvitavat alternatiivi, mida tasub hoolikalt uurida, mitte kui vaikimisi esimest ostu inimesele, kes alles alustab AI kohaliku käitamisega.

Tarkvarakiht: Ollama ja LM Studio lihtsalt lahti seletatuna

Ollama on kõige lihtsam viis panna mudel sinu enda arvutis tööle: tõmbad mudeli alla, käivitad selle ja sul on kohaliku serveri kaudu vastuseid andev lahendus olemas, ilma et alla laaditud mudeli jaoks oleks vaja pilvekontot. Kõik siintoodud näited põhinevad just sellel tööriistal.

LM Studio pakub graafilist alternatiivi oma mudelibrauseri ja vestlusaknaga. Sellel on ka oma miinimumnõuded: vähemalt 16 GB RAM-i Macis või Windowsis, Windows x64 puhul nõutav AVX2 tugi ja Windowsis soovituslik vähemalt 4 GB eraldiseisvat VRAM-i. Mõlema korrektne seadistamine on omaette teema.

Ja veel üks ettevaatuskoht enne, kui mõnd üksikut veebist leitud kiirusnumbrit usaldad: ametlik tööriist llama-bench eristab sisendi töötlemise kiirust ja genereerimiskiirust ning näitab korduskatsete vahemikku, mitte üht ainsat numbrit. Foorumipostitus, kus tuuakse välja üks tokenit-sekundis näit, ei ütle enamasti, kumba neist mõõdeti või mitu korda test läbi tehti.

Kontrollnimekiri AI-valmis sülearvuti ostmiseks või uuendamiseks

Kui ostad või uuendad sülearvutit spetsiaalselt kohaliku AI jaoks, vaata reklaamjutu asemel konkreetseid näitajaid.

Täpselt milline GPU ja kui palju VRAM-i. Mitte ainult GPU perekonnanimi, vaid konkreetne sülearvutiversioon ja selle tegelik mälumaht, sest sama nime taga võib peituda erinev VRAM-i kogus.

Kas RAM on joodetud või uuendatav. Mõne sülearvuti mälu saab hiljem juurde lisada, paljude tänaste õhukeste ja kergete mudelite oma mitte. Tea täpselt, kumba ostad.

Vaba SSD-ruum. Mudelite allalaadimised ulatuvad alla ühe gigabaidi kuni kaugelt üle kümne ning kasvav kogu võtab su teiste failide kõrval kiiresti ruumi ära.

Soojuskäitumine pikema koormuse all. Ühele küsimusele vastav mudel ja mitu päringut järjest teenindav sülearvuti on kaks eri testi; ventilaatorimüra ja jõudluse piiramine pärast korduvaid päringuid ütlevad rohkem kui üks kiire demo.

Operatsioonisüsteemi ja draiverite tugi. Kontrolli enne üle, kas su täpsel GPU taustsüsteemi ja operatsioonisüsteemi kombinatsioonil on Ollama või LM Studio tugi olemas.

Karbil olev NPU TOPS number ei garanteeri läbilaset. See on turundusnumber, mitte päris testitulemus mootorilt, mida kasutama hakkad. Udune "AI PC" silt ei asenda ühtegi ülaltoodud kontrolli.

Korduma kippuvad küsimused AI käitamise kohta sülearvutis

Kas AI kohalikuks käitamiseks on vaja eraldi GPU-d?

Ei. Väike mudel töötab paljudes 16 GB sülearvutites ka CPU või integreeritud graafikaga, lihtsalt kiirus kõigub rohkem kui eraldi GPU-ga sülearvutis. Alusta 2–4B mudelist, enne kui üldse eeldad, et eraldi graafikat on vaja.

Kas 8 GB RAM-i töötab?

Mitte mugavalt nende mudelite puhul, millest siin räägitakse. 16 GB on realistlik alguspunkt, kui arvestada, et mudel, selle kontekstiaken, mootor ja operatsioonisüsteem kasutavad kõik sama mälu.

Kas mudeli kohalik käitamine on sama mis selle treenimine?

Ei. Kõik eelnev puudutab inferentsi, ehk juba treenitud mudelile küsimuste esitamist. Treenimine tähendab mudeli nullist loomist ja nõuab palju võimsamat riistvara kui ükski siin mainitud sülearvuti.

Kas rohkem RAM-i tagab kiiremad vastused?

Ei. Rohkem mälu annab rohkem varu suuremate mudelite, pikema konteksti ja rohkemate avatud rakenduste jaoks, kuid tegelik kiirus sõltub mäluläbilaskest, GPU taustsüsteemist ja konkreetsest mudelist, mitte ainult mälumahust.

Kas mu andmed on privaatsed, kui mudel töötab kohapeal?

Jah, selles mõttes, et su päringud jäävad sinu enda arvutisse ega liigu pilveteenuse pakkuja juurde. Ollama seob end vaikimisi sinu enda sülearvutiga ega saada päringuid mujale, kui sa ise pilvejuurdepääsu teadlikult ei seadista.

Proovi täna õhtul ära, siis vali rahulikult edasi

Kas sul on juba 16 GB sülearvuti? Paigalda täna õhtul Ollama ja käivita üks väike mudel enne, kui kulutad sentigi millegi uue peale. Ostad just selleks? Võta ülaltoodud kontrollnimekiri ja viis äsja läbi käidud professionaalselt taastatud sülearvutit oma võrdluse lähtepunktiks, mitte turundusliku spetsifikatsioonilehena.

Kõik refurbedi sülearvutid on enne müüki jõudmist testitud ja hinnatud, nii et ostetav RAM ja konfiguratsioon ongi see RAM ja konfiguratsioon, mille saad. Selle sarja järgmine juhend näitab, kuidas ühendada oma esimene rakendus mudeliga, mida just proovisid.

Laual avatud MacBook Air, valmis kohalikku AI-mudelit käitama

Liitu esimest korda meie uudiskirjaga ja säästa 15 €!

Ära jäta enam ühtegi pakkumist vahele.

Teavet isikuandmete kasutamise kohta leiate meie privaatsuspoliitikast.