Sülearvuti vastab su küsimusele täiesti ilma internetiühenduseta. Seadistusi muutmata saad täpselt sama küsimuse esitada teise, samas arvutis töötava rakenduse kaudu, ja sülearvuti vastab ka sellele. Nii saab juba kasutusel olevast sülearvutist väike isiklik AI-teenus, millele saavad päringuid saata teised rakendused ja skriptid.
Siin paned alla laaditud mudeli tööle, mitte ei treeni seda. Kui pole veel kontrollinud, kas sülearvutil on piisavalt RAM-i või videomälu (VRAM-i), loe esmalt juhendit kohaliku AI RAM-i ja VRAM-i vajaduse kohta. Kui tead, et sülearvuti sobib, jätka siit.
Kohaliku AI seadistamisel tasub eristada nelja kihti. Kui tead, mida igaüks teeb, on järgmisi samme lihtsam jälgida.
Mudeli kaalud on allalaaditav fail. Näiteks võib väikese mudeli kvantiseeritud versiooni fail olla 3,4 GB suurune. See on faili maht kettal, mitte mudeli tööks vajalik RAM-i hulk.
Mudelit käitav programm laadib mudeli kaalud mällu ja vastab päringutele. Siin on selleks Ollama, millel on kohalik HTTP API. Selle kaudu saavad teised rakendused sülearvutis töötavale mudelile päringuid esitada.
Päringu saatja võib olla Ollama sisseehitatud vestlus, lühike skript või eraldi rakendus. Sellest sõltub, kas sinu sisestatud päring jääb sülearvutisse või saadetakse mujale.
Valikuline dokumendiindeks võimaldab vestlusmudelil sinu failidest otsida. Selleks on vaja eraldi manustusmudelit ja salvestusruumi. Indeks ei teki iseenesest ning selles juhendis me seda ei seadista.
Rakendus või skript saadab päringu aadressile 127.0.0.1:11434. Seal võtab selle vastu Ollama, mis laadib alla laaditud mudeli mällu. Mudeli kustutamine ei eemalda teise liidese salvestatud vestlusajalugu: need asuvad eri kohtades.
Võta enne paigaldamist kaks minutit, et panna kirja sülearvuti RAM-i maht, operatsioonisüsteem ja protsessor, eraldi videomälu (VRAM-i) maht, kui seda on, ning SSD-l vaba ruum. Täpsema selgituse leiad juhendist kohaliku AI RAM-i ja VRAM-i vajaduse kohta.
Mõlemad allpool näidatud sülearvutid on praegu refurbedi valikus. Need on professionaalselt kontrollitud, puhastatud ja taastatud ning neil on 12-kuuline garantii. Üks on Apple Siliconiga Apple'i baasmudel, teine eraldi videomäluga Windowsi sülearvuti. Mõlemaga saab kõik järgnevad sammud läbi teha.
Paigalda macOS-is või Windowsis Ollama ametlik rakendus; Linuxis järgi Ollama paigaldusjuhiseid. Seejärel ava Ollama. Kui Ollama Linuxis veel päringuid vastu ei võta, käivita ollama serve.
Ollama rakenduses saab praegu kasutada nii kohalikku mudelit kui ka pilvevõimalusi. Vali alla laaditud kohaliku mudeli tähis. Selle käitamiseks ei pea üldse sisse logima.
Selle juhendi läbimiseks laadi alla kindla tähisega mudel qwen3.5:4b-q4_K_M, mille allalaaditav fail on 3,4 GB. Täpne tähis on oluline: üldine „latest“ võib märkamatult viidata palju suuremale mudelile kui see, mida proovisid. 3,4 GB on faili maht kettal, mitte mudeli RAM-i vajadus päringutele vastamisel.
Esimese vestluse alustamiseks piisab kahest käsust:
ollama pull qwen3.5:4b-q4_K_M
ollama run qwen3.5:4b-q4_K_M
Esimene käsk laadib mudeli alla, teine avab sellega vestluse. Lihtsalt tervitamise asemel anna mudelile väike päris ülesanne, näiteks: „Koosta neist kolmest koosolekumärkest tegevusloend. Ära mõtle kuupäevi välja.“
Kui lõpetad, välju vestlusest käsuga /bye.
Terminalis vestlemiseks kasutad Ollama enda liidest. Järgmiseks saadad päringu otse sama käitusmootori API-le, nagu teeks teine rakendus.
macOS-is või Linuxis:
curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Selgita ühe lausega, mida tähendab mudeli kohapealne käitamine."}],"stream":false,"options":{"num_ctx":4096}}'
Windowsis PowerShellis:
Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Selgita ühe lausega, mida tähendab mudeli kohapealne käitamine."}],"stream":false,"options":{"num_ctx":4096}}'
Vastusetekst on väljal message.content. Kui stream väärtus on false, saad ühe tervikliku vastuse, mitte tükkhaaval saabuva voo. num_ctx: 4096 hoiab esimese katse kontekstimahu tagasihoidlikuna võrreldes mudeli reklaamitud palju suurema ülempiiriga.
Vastus sisaldab enamat kui vastuseteksti. Lisaks väljale message.content annab Ollama ka ajakulu hindamiseks kasulikud väljad: load_duration, prompt_eval_count, prompt_eval_duration, eval_count ja eval_duration.
Nende abil saad eristada mudeli mällu laadimisele ja vastuse koostamisele kulunud aega. Üksainus näit „tokenit sekundis“ neid lahus ei hoia. Esimene päring pärast Ollama käivitamist on tavaliselt kõige aeglasem, sest mudel tuleb alles mällu laadida. Järgmise päringuga seda kulu enam ei kaasne.
Täpsed näidud sõltuvad täielikult sinu arvutist, nii et tüüpilisi numbreid siin ei esitata. Üksiku kiirusväite asemel võrdle nende väljade väärtusi kahel katsel sama sülearvutiga.
Kolme käsuga näed, mis on mälus ja mis kettal, ning saad eemaldada mudeli, mida enam ei vaja.
ollama ps näitab parajasti mällu laaditud mudeleid ja seda, kus need töötavad: protsessori veerus on 100% GPU, 100% CPU või tööjaotus nende vahel.
ollama ls loetleb kõik alla laaditud mudelid.
ollama rm qwen3.5:4b-q4_K_M eemaldab allalaaditud mudeli, mida sa enam ei vaja.
Vaikimisi laadib Ollama mudeli pärast viit minutit tegevusetust mälust välja. Kui ollama ps ei näita ühtki mällu laaditud mudelit, ära järelda kohe, et midagi on katki: saada esmalt uus päring.
Nüüd saab sülearvuti pakkuda AI-teenust ka teisele rakendusele: suuna selle päringud pilveteenuse asemel samasse sülearvutisse.
Enamik rakendusi, milles saad ise määrata OpenAI-ga ühilduva API aadressi, küsib kolme asja: baas-URL-i, mudeli nime ja API-võtit. Baas-URL-iks määra http://localhost:11434/v1/ ja mudeli nimeks qwen3.5:4b-q4_K_M.
API-võtme väli võib segadust tekitada, sest mõni klientrakendus või SDK ei lase seda tühjaks jätta. Ollama dokumentatsioonis on selleks näidisväärtus api_key='ollama': kohalik server ei kontrolli seda väärtust. See väärtus ei tuvasta kasutajat. Tegu on vormivälja täite, mitte parooliga.
Ühilduvus ei tähenda, et kummagi API kõik võimalused töötavad: nende võimalused kattuvad vaid osaliselt. Kui tahad kasutada näiteks pildisisendit või tööriistakutseid, katseta seda võimalust oma rakendusega eraldi, mitte ära eelda, et kõik toimib.
Senised katsed ei välista veel võimalust, et päringud on märkamatult internetti läinud. Kontrolli seda nii.
Kui mudel on alla laaditud, lülita sülearvuti Wi-Fi välja või ühenda võrgukaabel lahti. Esita seejärel sama päring uuesti vestluses või API kaudu. Kui saad ka täiesti võrguühenduseta sisulise vastuse, on see tõend, et mudel töötab kohapeal.
Tõendiks ei sobi vastus, mille saad ainult võrguühendusega, päring aadressile https://ollama.com aadressi localhost asemel ega pilvemudeli tähise kasutamine alla laaditud mudeli asemel. Ollama kohalik päring jääb sinu arvutisse; eraldi pilvemudelid töötavad majutatud teenuses.
Privaatsus pole siin iseenesest tagatud. Tasub teada, mis sind kaitseb ja mis mitte.
Vaikimisi võtab Ollama ühendusi vastu ainult aadressil 127.0.0.1:11434 ehk sinu enda sülearvutist. Jäta see nii. Ära määra OLLAMA_HOST=0.0.0.0 ega suuna porti 11434 avalikku internetti: eespool mainitud näidis-API-võti ei kontrolli kedagi. Avalikku internetti avatud port oleks kõigile valla, mitte parooliga kaitstud.
Kui tahad Ollama enda pilvefunktsioonid täielikult välja lülitada, saad seda teha, kuid kohaliku mudeli kasutamiseks pole see vajalik. Alla laaditud kohaliku mudeli tähis tähendab juba, et mudel töötab kohapeal. Lisa faili ~/.ollama/server.json seade {"disable_ollama_cloud": true} või määra OLLAMA_NO_CLOUD=1. Mõlemal juhul taaskäivita Ollama, et muudatus jõustuks.
Kui tahad lahendusele ligi pääseda teisest toast või teisest seadmest, on see eraldi, keerukam teema: vaja on privaatvõrku ja autentimisega puhverserverit. Selles juhendis me seda ei käsitle. Pordi otse internetile avamine ei ole lahendus.
Siin on levinumad tõrked ja soovitused, millest alustada.
Ühendusest keelduti. Kontrolli, kas Ollama rakendus või ollama serve töötab, ja proovi uuesti.
Esimene vastus tuleb aeglaselt, järgmised kiiremini. Kiiruse vahe tuleb mudeli laadimisest, mitte vastuse genereerimise kiirusest. Eespool kirjeldatud vastuseväljad aitavad neil vahet teha.
Kõik tundub oodatust märksa aeglasem. Käivita ollama ps: see võib näidata, et mudel töötab ainult CPU-l või et töö jaguneb CPU ja GPU vahel. Kontrolli oma operatsioonisüsteemi GPU- ja draiverituge.
Mälu napib või programm jookseb kokku. Vali väiksema mudeli tähis, vähenda num_ctx väärtust ja sulge enne uut katset muud palju mälu kasutavad rakendused.
Kettaruum saab otsa. Vaata käsuga ollama ls, millised mudelid on alla laaditud, ja eemalda kasutamata mudelid käsuga ollama rm.
Kui see lahendus ei sobi, tasub vaadata LM Studiot ja llama.cpp-d, näiteks juhul, kui soovid mudeleid graafilises liideses sirvida või CPU ja GPU kasutust täpsemalt juhtida. Need on võimalused käitusmootorit vahetada, mitte põhjus kaht lahendust kõrvuti töös hoida.
Kas pärast seadistamist on internetti vaja? Ei. Kui mudel on alla laaditud, saab sellega nii vestelda kui ka selle API-le päringuid saata täiesti ilma internetiühenduseta.
Kas näidis-API-võti kaitseb minu kohalikku API-t? Ei. Ollama kohalik server võtab vastu iga mittetühja väärtuse ega kontrolli neist ühtegi. Seega ei ole mõne rakenduse küsitud võti turvameede.
Kas minu päring jääb sülearvutisse? Jah, kui kasutad alla laaditud kohaliku mudeli tähist. Ollamal on ka eraldi pilvemudelid, mille päringud lähevad majutatud teenusesse. Vahe sõltub sinu valitud mudelitähisest, mitte mõnest peidetud vaikeseadest.
Kas mul on vaja eraldi graafikakaarti? Ei. Väikest mudelit saab käitada ka ainult CPU-ga sülearvutis, kuigi tavaliselt aeglasemalt. ollama ps näitab, kuidas konkreetset päringut töödeldi.
Mis siis, kui tahan suuremat või teistsugust mudelit? Vaheta käskudes ollama pull ja ollama run mudelitähis välja, kuid kontrolli enne RAM-i ja VRAM-i mahtu. Põhjalikuma selgituse leiad juhendist kohaliku AI RAM-i ja VRAM-i vajaduse kohta.
Kas mudel mäletab edaspidi minu dokumente? Ei. Vestlusmudel ei jäta kaustas olevaid dokumente iseenesest püsivalt meelde. Oma failidest otsimiseks on vaja eraldi dokumendiindeksit. Selle seadistamine on valikuline ja jääb selle juhendi ulatusest välja.
Vali üks päris ülesanne ja proovi seda mõlemas nüüd kasutada olevas liideses: sisseehitatud vestluses ja äsja ühendatud teises rakenduses. Näiteks palu koostada ühest oma märkest kokkuvõte, liigitada hulk faile siltidega rühmadesse või selgitada lühikest koodijuppi lihtsas keeles.
Kirjuta üles täpne mudelitähis, käitusmootori versioon, konteksti seadistus, URL ja ülesanne ise. Nii saad katset hiljem korrata ning seda saavad teha ka teised.
Kui selgus, et sinu sülearvutil jääb selleks RAM-i või VRAM-i väheks, tasub kaaluda suurema mäluvaruga arvutit. Sarja järgmises osas vaatame, kuidas panna kokku väike mudelikomplekt: üks mudel vestluseks, teine koodi jaoks ja kolmas otsinguks.
Liitu esimest korda meie uudiskirjaga ja säästa 15 €!
Ära jäta enam ühtegi pakkumist vahele.
Teavet isikuandmete kasutamise kohta leiate meie privaatsuspoliitikast.
Kinnita registreerumine
Peaaegu valmis: saatsime sulle kinnitusmeili