qwen3.5:4b-q4_K_M vastab küsimustele tavalises 16 GB mäluga sülearvutis täiesti võrguühenduseta. See on sama mudel, mida kasutasime sarja teises osas, ja üldiseks abiliseks sobib see hästi. Failidest otsimiseks ega koodiülesanneteks ei tasu aga loota ainult sellele. Kui laadid kõigi tööde jaoks alla ühe mudeli, nõuad ühelt liiga palju, selle asemel et valida kolme eri töö jaoks kolm sobivat väikest mudelit.
Kohaliku AI puhul tähendab kontroll seda, et valid ise mudeli, selle käitamiseks kasutatava mootori ja litsentsi ning otsustad, millised andmed kuhu jäävad. Kui sa pole veel sülearvuti mälu või graafikamälu üle vaadanud, loe esmalt juhendit kui palju RAM-i on sülearvutil kohaliku AI jaoks vaja. Kui Ollama on paigaldamata, aitab esimese kohaliku AI teenusepakkuja seadistamise juhend. Siin eeldame, et mõlemad sammud on tehtud. Järgmisena tuleb valida mudelid ja uurida, kas neist on sinu tööks abi.
Kasulikus kohalikus AI-komplektis on kolme eri ülesande jaoks kolm mudelit, mitte üks mudel, millelt oodatakse kõike.
Üldotstarbeline abiline igapäevaseks vestluseks, tekstide koostamiseks ja kiireteks küsimusteks: qwen3.5:4b-q4_K_M. Allalaaditav fail on 3,4 GB suurune ja mudelitähis sama mis sarja teises osas.
Väike erimudel kitsama töö jaoks, näiteks kindlas vormingus vastuste või piiritletud arutlusülesande tarvis: granite4.2:3b. See avaldati augustis 2026, allalaaditav fail on 2,2 GB suurune ja litsents on Apache 2.0. Allpool, 6. jaotises vaatame ka erimudeleid koodi, matemaatika, piltide ja tõlke jaoks, et saaksid valida oma ülesandele sobiva.
Vektoriseerimismudel oma dokumentidest otsimiseks: embeddinggemma:300m, mille allalaaditav fail on 622 MB suurune. See mudel ei vestle sinuga. See teisendab teksti vektoriteks, mille seast otsingurakendus vasteid leiab. Lähemalt räägime sellest 8. jaotises.
Kolm allalaaditavat faili võtavad kettal kokku umbes 6,2 GB. See ei näita nende ühist mälukasutust: kui laadid kõik kolm korraga mällu, võib sülearvutis vaba mälu nappida. Hoia töös üht mudelit korraga, katseta seda päris ülesandega ja eemalda need, millest abi pole.
Kvantimise mõju on kõige lihtsam näha ühe mudelipere sees. Ollama kataloogis on qwen3.5:9b-q4_K_M allalaaditav fail 6,6 GB, qwen3.5:9b-q8_0 fail 11 GB ja qwen3.5:9b-bf16 fail 19 GB suurune. Kaalud on samad, kuid täpsusaste ja faili suurus erinevad.
Need on kataloogis näidatud allalaadimismahud, mitte lubadus selle kohta, kui palju mälu mudel töötades vajab. Väiksem täpsus vähendab faili suurust ja sageli ka mälukasutust. See, kas vastuste kvaliteet kannatab, sõltub mudelist, kvantimismeetodist ja ülesandest. Ära eelda, et mõju pole või et väiksem fail tuleb võimaliku kvaliteedikaota.
Mällu laaditud kaalud pole kogu arvestus. Mälu vajavad ka kontekstiaken, selle võtme-väärtuse vahemälu ja kõik muu, mis arvutis töötab. Kvantimisega vabanev mälu ei taga, et suurem mudel arvutisse mahub. Täistäpsusega failiga võrreldes on selle katsetamine siiski realistlikum.
Ollama kataloogis on kaks tähist, mida on lihtne valesti mõista. Mõlemal juhul võid alla laadida vale mudeli.
Esimene lõks. Google’i mudelikaardi järgi on Gemma 4 E2B-l 2,3 miljardit „efektiivset“ keeleparameetrit. Selle põhjal võiks arvata, et fail on väike. Ollamast allalaaditav fail on aga 7,2 GB suurune, peaaegu sama suur kui gemma4:12b Q4-variandi 7,6 GB fail. Kui hindad, mis sülearvutisse mahub, vaata allalaadimismahtu, mitte parameetrite arvu.
Teine lõks. Täpsustamata mudelitähis võib anda oodatust teise mudeli. Kui laadid alla lihtsalt granite4.2, saad 8B mudeli, mille fail on 5,3 GB, mitte 2. jaotises nimetatud 3B variandi 2,2 GB failiga. Kui laadid alla lihtsalt qwen3-embedding, saad 8B mudeli 4,7 GB failiga, mitte 8. jaotises kasutatava 0.6B variandi 639 MB failiga.
Mõlema lõksu vastu aitab sama võte: laadi alla alati täielik ja täpne mudelitähis, mitte üksnes mudelipere nimi. Enne katsetamist kontrolli ka allalaaditava faili mahtu.
Kataloogis märgitud ülempiir, näiteks 128K või 256K tokenit, näitab, kui palju konteksti mudel põhimõtteliselt vastu võtab. See ei tähenda, et 16 GB mäluga sülearvutis oleks nii pika konteksti jaoks piisavalt mälu.
Ollama vaikimisi kontekstiaken on 4096 tokenit. Seda saab suurendada, kuid nii pikem kontekst kui ka rohkem paralleelseid päringuid kasvatavad mälukasutust. Sarja teises osas kasutatud säte num_ctx: 4096 vastab sellele ettevaatlikule vaikeväärtusele, mitte juhuslikult valitud ümmargusele arvule.
Uut mudelit katsetades alusta 4K–8K tokeni pikkusest kontekstist, hoia töös üks seanss korraga ja jälgi süsteemimälu kasutust. Suurenda konteksti alles siis, kui oled näinud, et mälukasutus püsib stabiilne, mitte üksnes sellepärast, et kataloogi järgi on pikem kontekst võimalik.
Üht kõigi jaoks parimat erimudelit siin pole. Valik sõltub sinu ülesandest ja sellest, kuidas väikesed mudelid sellega katses toime tulevad.
Programmeerimine: qwen2.5-coder:3b (1,9 GB) või suurem qwen2.5-coder:7b (4,7 GB), mõlemad Apache 2.0 litsentsiga.
Piiritletud matemaatika- või loogikaülesanded: Microsofti phi4-mini:3.8b (2,5 GB).
Küsimused piltide ja ekraanitõmmiste kohta: gemma4:e2b (7,2 GB) või gemma4:12b Q4 (7,6 GB). Mõlemal on Apache 2.0 litsents ning mõlemad võtavad sisendina vastu teksti ja pilte.
Mitmekeelne kirjutamine või tõlkimine: aya-expanse:8b (5,1 GB), mis on loodud 23 keele jaoks.
Aya Expanse 8B litsentsi ei tasu joonealusesse märkusesse peita: mudelil on lisatingimustega CC-BY-NC-4.0 litsents mitteäriliseks kasutuseks. Ära pea seda piiranguteta vaikevalikuks eespool nimetatud Apache 2.0 litsentsiga mudelite kõrval. Kui ükski neist neljast sinu tööks ei sobi, jääb 2. jaotise granite4.2:3b üldisemate arutlusülesannete valikuks.
Enne otsustamist katseta mudelit oma ülesandega. Erimudel väärib kohta sinu valikus siis, kui sellest on sinu töös abi, mitte siis, kui see on kellegi teise edetabelis esikohal.
Viis lühikest katset ütlevad mudeli kohta rohkem kui kataloogileht. Tee iga kandidaadiga samad viis katset, kasutades oma materjali.
1. Tekstile toetuv kokkuvõte. Anna mudelile 250-sõnaline märkus ja palu tal leida sellest kolm tegevusülesannet. Igaühe juurde peab mudel lisama lause, millel ülesanne põhineb. Märgi ära kõik väited, millele tekstist tuge ei leia.
2. Andmete eraldamine kindlasse vormingusse. Mõtle välja viis kohtumist koos nimede ja kuupäevadega. Palu mudelil esitada andmed JSON-vormingus täpselt sinu määratud väljadega ning võrdle kõiki viit tulemust algandmetega.
3. Koodivea parandamine. Anna mudelile üks väike vigane funktsioon ja üks test. Pane kirja, kas test pärast parandust õnnestub. Kasuta kõigi võrreldavate mudelite puhul sama koodihoidlat ja konteksti.
4. Keelepaar. Lase keelt vabalt valdaval lugejal kontrollida, kas elulise lõigu nimed, arvud ja nüansid tõlkes säilivad. Mitmekeelset oskust ei saa hinnata ainult ingliskeelse ülesande põhjal.
5. Küsimus pildi kohta, ainult pilte töötlevatele mudelitele. Näita graafikut või ekraanitõmmist, mille kohta on võimalik vastust kontrollida, ning veendu, et mudelile saadeti pilt ise, mitte ainult selle failinimi.
Pane iga katse puhul kirja, kas vastus oli õige, kas mudel järgis juhiseid, mida ta välja mõtles, kui kaua läks esimese nähtava väljundini, kui kaua kogu töö kestis, mitu tokenit kulus ning kas mudel töötas CPU-l või GPU-l. Hinda kasulikkust ja kiirust eraldi: enne vastamist arutluskäiku koostav mudel võib kulutada aega ka tokenitele, mida sa ei näe.
Töö käib kindlas järjekorras. Kõigepealt jagatakse sinu failid lõikudeks. Vektoriseerimismudel teeb igast lõigust vektori ja kohalik vektorhoidla salvestab need. Ka sinu päring teisendatakse vektoriks. Seejärel leitakse lähimad lõigud ning alles siis koostab vestlusmudel nende põhjal vastuse koos viidetega.
Vestlusmudelit pole sinu dokumentidega treenitud. Ta näeb ainult neid lõike, mille otsing talle küsimise hetkel annab.
Seda saad vähese seadistamisega ise proovida: lisa otsingusse viis märkust, mis sul juba olemas on. Koosta üks küsimus, mille vastus leidub ühes märkuses, ja teine, mille vastust ei leidu üheski. Toimiv seadistus leiab esimese küsimuse jaoks õige lõigu ja viitab sellele. Teise puhul tunnistab see, et vastuseks pole alust, mitte ei mõtle vastust välja. Hinda otsingu tulemust ja lõppvastust eraldi.
Enne allalaadimist kontrolli täielikku mudelitähist: embeddinggemma:300m või qwen3-embedding:0.6b. Põhjus on sama mis 4. jaotises: ainult mudelipere nimest ei piisa.
Mudelis, mille tähis on näiteks „26B A4B“, kasutatakse iga väljundtokeni koostamiseks vaid osa parameetritest. Kõigi 26 miljardi parameetri kaalud tuleb siiski kusagil salvestada või jooksvalt mällu lugeda. Väiksem aktiivsete parameetrite arv ei tähenda väiksemat faili ega väiksemat mälukasutust.
Selles juhendis ei esitata uusi, eraldi mõõdetud jõudlustesti tulemusi. Kui arv pärineb mujalt, tuleb seda ka nii võtta. Näiteks ühe inimese teatatud ligikaudu 18,5 tokenit sekundis pärines ebatavalisest 26 miljardi parameetriga ekspertide segumudeli seadistusest, kus kasutati vanemat CPU-d ja 6 GB graafikamäluga GPU-d. See on ühe inimese tulemus tema enda riistvaral, mitte üldine ootus kõigile sama tähisega mudelitele.
Katsetasime seda mudelikomplekti kahe kasutuses oleva sülearvutiga, samadega mis sarja teises osas: Apple Siliconiga baasmudeli ja eraldi graafikamäluga Windowsi tööjaamaga. Mõlemad on professionaalselt testitud, puhastatud ja taastatud ning refurbedi kaudu ostes kehtib neile 12-kuuline garantii. Kummalgi saab seda komplekti mugavalt katsetada, korraga ühe mudeliga.
13-tollisel M5 kiibiga MacBook Airil (2026) on baasvarustuses 16 GB ühist mälu, mida saab konfiguratsioonis suurendada kuni 32 GB-ni. Dell Precision 7730-l on 32 GB süsteemimälu ja sellest eraldi 6 GB NVIDIA graafikamälu. Need on kaks eraldi mälumahtu, mida ei saa üheks arvuks kokku liita.
Kummagi sülearvuti mainimine pole siin müügijutt. Katsetasime juhendis kirjeldatut nende seadmetega, et saaksid võrrelda oma arvutit konkreetsete näidetega, mitte üksnes turundusliku tehniliste näitajate loeteluga.
Litsentsi tuleb kontrollida täpse mudeli, mitte mudelipere järgi. Qwen3.5 4B, Qwen2.5-Coder, Granite 4.2 3B ja Gemma 4 E2B on kõik Apache 2.0 litsentsiga. Nagu 6. jaotises märkisime, on Aya Expanse 8B litsents CC-BY-NC-4.0 koos lisatingimustega ning mõeldud mitteäriliseks kasutuseks. Mudeli kaalude allalaadimise võimalus, autoriõiguslik luba neid kasutada ja alusmudeli „omamine“ on kolm eri asja. Vaata alati üle just selle mudeli ajakohane mudelikaart, mille alla laadid, mitte üksnes mudelipere nimi.
Väikese mudelikomplekti hoidmine pole ühekordne otsus. Käsuga ollama rm saad eemaldada allalaaditud mudeli, millest sul kasu pole, näiteks käsuga ollama rm aya-expanse:8b, kui tead, et sa seda ei kasuta. ollama ls näitab, mis on kettal, ja ollama ps, mis on parajasti mällu laaditud. Kataloogid muutuvad, nii et vaata oma valik aeg-ajalt üle, selle asemel et toetuda kuude eest tehtud otsusele.
Ka väikesed mudelid võivad lõike välja mõelda, teises keeles nüansse märkamata jätta või kirjutada koodi, mis näib õige, kuid ei läbi testi. Katseta siin soovitatud mudeleid ise. Olulistes küsimustes ei asenda need asjatundja kontrolli.
Kas saan kõiki kolme komplekti mudelit korraga kasutada? 16 GB mäluga sülearvutis ilmselt mitte kuigi mugavalt. Laadi mällu üks tööks vajalik mudel korraga ja vaheta seda vastavalt ülesandele, selle asemel et hoida üldist abilist, erimudelit ja vektoriseerimismudelit korraga mälus.
Kas vektoriseerimismudeli jaoks on vaja GPU-d? Ei. embeddinggemma:300m on piisavalt väike, et seda ainult CPU-l katsetada. Mõõda siiski tööaega, mitte ära eelda, et tulemus tuleb silmapilkselt.
Kas suurem mudel annab alati parema vastuse? Ei. See, kas 4B või 9B mudel saab paremini hakkama, sõltub ülesandest. Seepärast on 7. jaotises viie ülesandega katse, mitte üksainus edetabelikoht.
Kas Q4-failist piisab? See sõltub ülesandest. Kui mälu lubab mõlemat kasutada, võrdle sama mudeli Q4- ja Q8-varianti oma kolmes katses, nagu 3. jaotises kirjeldatud.
Kas Aya Expanse’i võib kasutada äriprojektis? Vaikimisi mitte. Selle CC-BY-NC-4.0 litsents hõlmab mitteärilist kasutust ja sisaldab lisatingimusi. Enne teistsuguse kasutuse eeldamist kontrolli ajakohast mudelikaarti.
Kas vektoriseerimismudel vajab pärast allalaadimist internetti? Ei. Nagu teisedki selle komplekti mudelid, töötab see võrguühenduseta, kui kaalud on kettale alla laaditud.
Paigalda 4B üldotstarbeline abiline ja üks sinu ülesandele sobiv erimudel sülearvutisse, mille sobivust aitas hinnata sarja esimene osa ja mida aitas seadistada teine osa. Tee 7. jaotise katsest oma kolme küsimusega versioon. Jäta alles mudel, millest on abi, ja eemalda teine käsuga ollama rm. Lisamälu ostmist kaalu alles siis, kui päris ülesanne on näidanud, et kitsaskohaks on mälu, mitte ainult tehniliste näitajate loetelu.
Sellega saab kolmeosaline sari läbi. Kui selgus, et sinu sülearvutil on esmalt rohkem mälu vaja, tasub otsingut alustada sülearvutite kategooriast.
Liitu esimest korda meie uudiskirjaga ja säästa 15 €!
Ära jäta enam ühtegi pakkumist vahele.
Teavet isikuandmete kasutamise kohta leiate meie privaatsuspoliitikast.
Kinnita registreerumine
Peaaegu valmis: saatsime sulle kinnitusmeili