Lokální AI na notebooku: vlastní služba pro další aplikace

Položíte notebooku otázku a odpoví, i když vůbec není připojený k internetu. A když mu stejnou otázku položí jiná aplikace na tomtéž počítači, odpoví i jí, aniž byste cokoli měnili. Právě díky tomu se z notebooku, který už používáte, stane malá osobní AI služba pro další aplikace a skripty.

Nejde o trénování modelu. Spustíte model, který si stáhnete. Pokud jste ještě nezkontrolovali, zda má váš notebook dost RAM nebo VRAM, přečtěte si nejdřív článek kolik RAM potřebuje notebook pro lokální AI. Jestli už víte, že vám výbava stačí, můžete pokračovat.

Čtyři vrstvy lokální AI: k čemu která slouží

Při provozu lokální AI je dobré rozlišovat čtyři vrstvy. Když víte, co má která na starosti, další kroky budou přehlednější.

Váhy modelu jsou soubor, který si stáhnete. Může jít třeba o kvantizovanou verzi menšího modelu o velikosti 3,4 GB. Toto číslo udává velikost stažených dat na disku, ne množství RAM potřebné za běhu.

Program pro inferenci načítá váhy a vyřizuje požadavky. V tomto návodu jím je Ollama s místním HTTP API. Díky této vrstvě může notebook poskytovat model dalším aplikacím.

Klientská část posílá požadavky. Může to být chat přímo v Ollamě, krátký skript nebo samostatná aplikace. Právě klientská část rozhoduje, zda zadání zůstane na notebooku, nebo se odešle jinam.

Volitelný index dokumentů umožňuje chatovacímu modelu prohledávat vaše soubory. Používá k tomu samostatný embeddingový model a vlastní úložiště. Nevzniká automaticky a v tomto návodu se mu nevěnujeme.

Stručně: aplikace nebo skript pošle požadavek na 127.0.0.1:11434, kde běží Ollama, a ta načte stažený model. Smazáním modelu ale nesmažete historii chatu uloženou klientskou aplikací. Model a historie jsou uložené odděleně.

Než začnete: má váš notebook podobnou výbavu?

Ještě před instalací věnujte dvě minuty parametrům notebooku. Poznamenejte si, kolik má RAM a volného místa na SSD, jaký používá operační systém a procesor a zda má vyhrazenou grafickou paměť (VRAM), případně kolik. Požadavky na RAM a VRAM podrobněji vysvětluje článek kolik RAM potřebuje notebook pro lokální AI.

Oba níže uvedené notebooky jsou skutečné modely z aktuální nabídky refurbed. Jsou repasované: odborníci je otestovali, vyčistili a obnovili. Na oba se vztahuje 12měsíční záruka. MacBook představuje základní řadu s čipem Apple Silicon, Dell je notebook s Windows a vlastní vyhrazenou grafickou pamětí. Na obou zvládnete všechny následující kroky.

Jak nainstalovat Ollamu v macOS, ve Windows a v Linuxu

Pro macOS a Windows použijte oficiální aplikaci Ollama, v Linuxu se řiďte pokyny k instalaci. Po instalaci Ollamu spusťte. V Linuxu zadejte ollama serve, pokud server ještě neběží.

Ollama dnes nabízí místní provoz i cloudové možnosti. Zvolte konkrétní tag staženého lokálního modelu. K lokální inferenci se nemusíte přihlašovat.

Pro tento návod stáhněte přesně tento model: qwen3.5:4b-q4_K_M (3,4 GB). Na tagu záleží: obecné označení „latest“ může bez upozornění odkazovat na mnohem větší model, než jaký jste testovali. Těch 3,4 GB udává velikost stažených dat na disku, ne množství RAM, které model potřebuje při odpovídání.

Stáhněte první model a položte mu otázku

Na první rozhovor s modelem stačí dva příkazy:

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

První stáhne model, druhý otevře interaktivní chat. Místo obyčejného pozdravu zadejte malý skutečný úkol, například: „Z těchto tří poznámek z porady udělej seznam úkolů. Nevymýšlej termíny.“

Chat ukončíte zadáním /bye.

Vyzkoušejte API: AI běží přímo na notebooku

Když chatujete v terminálu, požadavky inferenčnímu programu posílá klientská část. Teď stejnému programu pošlete požadavek přímo, stejně jako by to udělala jiná aplikace.

V macOS nebo v Linuxu:

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'

Ve Windows v PowerShellu:

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'

V odpovědi hledejte message.content. Nastavíte-li stream na false, dostanete celou odpověď najednou, nikoli postupně po částech. Pro první zkoušku nastavuje num_ctx: 4096 kontext výrazně níž, než je maximum uváděné u modelu.

Co se dozvíte z odpovědi

Odpověď Ollamy obsahuje víc než jen text modelu. Kromě message.content se podívejte na údaje o čase a počtu tokenů: load_duration, prompt_eval_count, prompt_eval_duration, eval_count a eval_duration.

Díky nim oddělíte dobu načítání modelu do paměti od doby generování odpovědi. Jediné číslo „tokenů za sekundu“ ten rozdíl neukáže. První dotaz po spuštění Ollamy bývá nejpomalejší, protože se model musí nejdřív načíst. Při dalším už načítání nezdržuje.

Konkrétní hodnoty závisejí na vašem notebooku, proto tu žádné neuvádíme jako typické. Místo jediného tvrzení o rychlosti porovnejte tato pole u dvou měření na stejném notebooku.

Co běží, co je stažené a kdy se model uvolní

Na základní správu modelů stačí tři příkazy.

ollama ps ukáže, které modely jsou právě načtené a kde běží. Ve sloupci procesoru uvidíte 100 % GPU, 100 % CPU nebo rozdělení práce mezi oběma.

ollama ls vypíše všechny stažené modely.

ollama rm qwen3.5:4b-q4_K_M odstraní stažený model, který už nepotřebujete.

Ve výchozím nastavení Ollama uvolní model po pěti minutách nečinnosti. Pokud ollama ps neukáže žádný načtený model, pošlete nejdřív další požadavek. Samo o sobě to ještě neznamená chybu.

Připojte další aplikaci přes místní API kompatibilní s OpenAI

Teď nasměrujte další aplikaci na svůj notebook místo na cloudovou službu. Notebook pak bude odpovídat i jí, nejen chatu v Ollamě.

Většina aplikací, které podporují vlastní adresu API kompatibilního s OpenAI, potřebuje tři údaje: základní URL, název modelu a API klíč. Jako základní URL zadejte http://localhost:11434/v1/ a jako název modelu qwen3.5:4b-q4_K_M.

U API klíče nastává zádrhel. Některé klientské aplikace nebo vývojářské sady (SDK) nedovolí pole s API klíčem nechat prázdné. Dokumentace Ollamy proto pro tento případ nabízí zástupnou hodnotu api_key='ollama'. Místní server obsah pole s API klíčem vůbec nekontroluje. Tento řetězec nikoho neověřuje: jen vyplní políčko, není to heslo.

Kompatibilita však pokrývá jen část funkcí jednotlivých API. Pokud chcete například zadávat obrázky nebo volat nástroje, vyzkoušejte danou funkci ve své konkrétní aplikaci. Nespoléhejte na to, že bude fungovat všechno.

Ověřte lokální provoz: odpojte internet a zeptejte se znovu

Dosavadní kroky by teoreticky mohly využívat internet, aniž byste si toho všimli. Odpojením tuto možnost vyloučíte.

Až se model stáhne, vypněte na notebooku Wi-Fi nebo odpojte síťový kabel. Pak zopakujte stejný požadavek jako dřív, v chatu nebo přes API. Pokud dostanete odpověď i zcela bez připojení, máte důkaz, že model běží lokálně.

Za důkaz naopak nelze považovat odpověď, kterou dostanete jen při připojení k internetu, odpověď z https://ollama.com místo z localhost ani použití cloudového tagu místo staženého modelu. Podle Ollamy zůstávají požadavky na lokální model na vašem notebooku, zatímco její samostatné cloudové modely používají jinou, hostovanou cestu.

Lokální AI a soukromí: co hlídat při nastavení

Soukromí vám samotná lokální instalace nezaručí. Proto je dobré vědět, co vás chrání a co ne.

Ve výchozím nastavení Ollama naslouchá jen na 127.0.0.1:11434, tedy na vašem notebooku a nikde jinde. Tak to nechte. Nenastavujte OLLAMA_HOST=0.0.0.0 ani nepřesměrovávejte port 11434 do veřejného internetu: zástupný API klíč z předchozí části nic neověřuje. Přímo zpřístupněný port by tak zůstal bez ochrany.

Jestli chcete cloudové funkce samotné Ollamy úplně vypnout, můžete to udělat. Pro lokální provoz to však není nutné: stažený lokální model už představuje místní volbu. Do souboru ~/.ollama/server.json přidejte {"disable_ollama_cloud": true}, nebo nastavte OLLAMA_NO_CLOUD=1. V obou případech potom Ollamu restartujte, aby se změna projevila.

Přístup k Ollamě z jiného pokoje nebo zařízení už je samostatné, pokročilejší téma. Vyžaduje soukromou síť a proxy server, který před Ollamou ověřuje přístup. Tady se mu nevěnujeme; port přímo nezpřístupňujte.

Když se něco zadrhne

Nejčastější potíže a co při nich zkontrolovat jako první.

Připojení odmítnuto. Zkontrolujte, zda běží aplikace Ollama nebo ollama serve, a zkuste to znovu.

První odpověď trvá déle, další jsou rychlejší. Rozdíl způsobuje načítání modelu, nikoli samotné generování. Poznáte to podle údajů v odpovědi popsaných výše.

Všechno běží mnohem pomaleji, než jste čekali. Spusťte ollama ps: model možná běží jen na CPU nebo se práce dělí mezi CPU a GPU. Zkontrolujte, zda jsou vaše grafická karta a její ovladače podporované ve vašem operačním systému.

Nedostatek paměti nebo pády. Vyberte menší tag modelu, snižte num_ctx a před dalším pokusem zavřete ostatní aplikace náročné na paměť.

Dochází místo na disku. Příkazem ollama ls zjistíte, které modely jsou stažené, a pomocí ollama rm odstraníte ty, které nepoužíváte.

Pokud vám tento postup nevyhovuje, například chcete vybírat modely v grafickém rozhraní nebo podrobněji řídit využití CPU a GPU, stojí za to se podívat na LM Studio či llama.cpp. V takovém případě má smysl inferenční nástroj vyměnit, ne provozovat dvě řešení vedle sebe.

Časté otázky k lokální AI na notebooku

Potřebujete po nastavení internet? Ne. Po stažení modelu funguje chat i volání jeho API zcela bez internetu.

Chrání zástupný API klíč přístup k vašemu API? Ne. Místní server Ollamy přijme jakoukoli neprázdnou hodnotu a žádnou z nich neověřuje. Klíč, který některé aplikace vyžadují, tedy neplní bezpečnostní funkci.

Zůstane vaše zadání na notebooku? Ano, pokud zvolíte tag staženého lokálního modelu. Ollama nabízí i samostatné cloudové modely, které používají jinou, hostovanou cestu. Záleží tedy na zvoleném tagu, ne na skrytém výchozím nastavení.

Potřebujete samostatnou grafickou kartu? Ne. Malý model spustíte i na notebooku, který používá jen CPU, obvykle však pomaleji. ollama ps ukáže přesně, jak se konkrétní požadavek zpracoval.

Co když chcete větší nebo jiný model? V příkazech ollama pull a ollama run změňte tag, nejdřív si ale ověřte, zda máte dost RAM a VRAM. Podrobnosti najdete v článku kolik RAM potřebuje notebook pro lokální AI.

Bude si model odteď pamatovat vaše dokumenty? Ne. Chatovací model si sám od sebe trvale nepamatuje obsah složky. K prohledávání vlastních souborů potřebujete samostatný index dokumentů. Je to volitelný postup, kterému se tady nevěnujeme.

Teď jste na řadě: vyzkoušejte vlastní AI službu

Vyberte jeden skutečný úkol a zadejte ho přes oba klienty, které teď máte: integrovaný chat a druhou aplikaci, kterou jste právě připojili. Třeba si nechte shrnout osobní poznámku, roztřídit sadu souborů do pojmenovaných skupin nebo srozumitelně vysvětlit krátký úryvek kódu.

Ať zvolíte cokoli, zapište si přesný tag modelu, verzi inferenčního programu, nastavení kontextu, URL i samotné zadání. Díky tomu budete moci výsledek později zopakovat vy nebo kdokoli další, kdo zkusí totéž.

Pokud jste zjistili, že vašemu notebooku na tento postup nestačí RAM nebo VRAM, stojí za zvážení model s větší paměťovou rezervou. V příštím díle série se podíváme na sestavení malé sady modelů: jednoho pro chat, druhého pro kód a třetího pro vyhledávání.

Repasovaný notebook vhodný pro lokální AI z nabídky refurbed

Přihlas se k odběru našich novinek a ušetři 400 Kč!

Už nikdy nepromeškej žádnou nabídku.

Informace o použití osobních údajů najdeš v našich Zásadách ochrany osobních údajů.