Vlastní jazykový model na vlastním serveru už není jen experiment pro AI geeky. S Ollama zprovozníte open-source LLM na běžném linuxovém VPS během deseti minut a vaše firemní data přitom neopustí bezpečí serveru.
V článku najdete konkrétní instalační příkazy, přehled modelů, které v roce 2026 dávají reálný smysl, i pohled na hardwarové nároky. Dozvíte se přesně, kdy si vystačíte s procesorem (CPU) a kdy už bezpodmínečně potřebujete grafickou kartu (GPU).
Co je Ollama a k čemu slouží
Ollama je open-source nástroj pro spouštění velkých jazykových modelů (LLM) na vlastním hardwaru. Funguje na Linuxu, macOS i Windows a odvede za vás veškerou černou práci: obstará stažení modelu, jeho bezpečné načtení do paměti, kvantizaci – tedy kompresi vah, aby se model vměstnal do menší paměti – a vystaví HTTP API, skrze které s ním aplikace komunikují.
Práce s ní nápadně připomíná Docker. Model stáhnete jednoduchým příkazem ollama pull, spustíte přes ollama run a máte hotovo. Ollama navíc běží jako služba na pozadí a na portu 11434 otevírá REST API kompatibilní s formáty, na které jsou AI aplikace zvyklé. Bez problémů na ni napojíte interního chatbota, RAG nad firemní dokumentací (Retrieval Augmented Generation neboli chytré odpovídání z vlastních zdrojů), automatizace v n8n nebo oblíbený editor kódu.
Výsledek? Vlastní obdoba ChatGPT, která běží na vašem VPS, citlivá data neposílá třetím stranám a neúčtuje si ani korunu za spotřebované tokeny.
Proč firmy přecházejí na self-hosted AI
Zájem o vlastní hostování umělé inteligence roste už druhým rokem a rozhodně nejde o prchavou módní vlnu. Důvody jsou praktické:
- Firemní data zůstávají doma: Když zaměstnanci vkládají do veřejných AI chatů interní smlouvy, zdrojové kódy nebo osobní údaje klientů, ztrácíte kontrolu nad tím, kde končí. Model na vlastním serveru drží vše uvnitř infrastruktury, kterou plně podcucháte a spravujete.
- GDPR a compliance bez bolesti: U self-hosted řešení přesně víte, kde se data zpracovávají. Nemusíte řešit komplikované předávání údajů mimo EU ani studovat neprostupná právní ujednání amerických gigantů. Pro finance, zdravotnictví nebo právní obory je to často jediná schůdná cesta – obzvlášť když fyzický server stojí v České republice.
- Nezávislost na heszrech z API: Posrequentní poskytovatelé komerčních API neustále mění ceníky, limity i chování modelů a starší verze bez varování vypínají. Lokální model se chová naprosto předvídatelně tak dlouho, dokud se jej sami nerozhodnete aktualizovat. Odpadá i riziko, že vám uprostřed nejdůležitějšího meetingu klekne cizí služba.
- Náklady pod kontrolou: Platby za cloudová API rostou s každým odeslaným dotazem. Naproti tomu VPS vás stojí fixní měsíční paušál bez ohledu na počet vygenerovaných tokenů. Jakmile řešíte vyšší objemy provozu – jako je automatická sumarizace tiketů, třídění e-mailů nebo generování popisků produktů, vlastní server se vám odvděčí nesrovnatelně nižšími náklady.
Lokální modely udělaly za poslední rok obrovský skok – ve výkonu, rychlosti i schopnostech. Google dnes pouští do světa modely jako Gemma, které si spustíte na vlastním serveru, a čínské firmy s otevřenými váhami jim nejsou daleko. Není to zadarmo. Místo tokenů platíte grafickými kartami a elektřinou, ale data máte pod kontrolou. To se hodí všude tam, kde citlivý obsah, třeba přepisy hovorů se zákazníky nebo interní dokumenty, nesmí opustit firmu. A je to i pojistka do budoucna: v červnu 2026 nařídily USA Anthropicu zablokovat přístup k jeho nejsilnějším modelům mimo Ameriku. Kdo staví agentní vývoj čistě na cizím API, se tak může ze dne na den ocitnout bez nástroje, na který spoléhal.
Honza Černý – Product owner Váš Hosting
Jaké open-source modely dávají v roce 2026 smysl
Nabídka otevřených jazykových modelů se mění doslova před očima. Následující přehled mapuje aktuální stav k červenci 2026 a je pevně zakotvený v oficiální knihovně Ollama:
| Model | Vydání | Velikosti | Licence | Poznámka |
|---|---|---|---|---|
| Qwen 3.5 (Alibaba) | únor 2026 | 0,8B/2B/4B/9B/27B | Apache 2.0 | multimodální, 201 jazyků, silná čeština |
| Gemma 4 (Google) | duben 2026 | E2B, E4B, 12B, 26B MoE, 31B | Apache 2.0 | vysoký výkon na parametr, varianta 12B vyšla v červnu 2026 |
| Mistral Small 4 | březen 2026 | 119B MoE (6B aktivních) | Apache 2.0 | vyžaduje datacentrová GPU, pro VPS se hodí starší Ministral 3 (3B, 8B, 14B) |
| Llama 4 (Meta) | duben 2025 | Scout 109B, Maverick 400B | Llama 4 Community | dlouhý kontext, pro běžné VPS příliš velký; Llama 3.1 8B zůstává použitelná klasika |
| DeepSeek-R1 | 2025 | destilované verze 1,5B až 70B | MIT | reasoning model, menší destiláty běží i na CPU |
S čím vystačíte na VPS bez grafické karty?
Pokud stavíte server čistě na procesorové výkonu, v reálném provozu Ollama knihovny nejčastěji sáhnete po těchto osvědčených kusech:
- qwen3.5:4b (3,4 GB): Univerzální dělník, kterému hravě stačí 8 GB RAM.
- qwen3.5:9b (6,6 GB): Znatelně chytřejší mozek, pro který si připravte 16 GB RAM.
- gemma4:12b (7,6 GB): Silný hráč do 16 GB RAM, který navíc zvládá obří kontextové okno o velikosti 256K tokenů.
- gemma4:26b (18 GB): Architektura MoE se 4 aktivními miliardami parametrů – na CPU běží překvapivě svižně, vyžaduje však 32 GB RAM.
- qwen3.5:27b (17 GB): Volba pro ty, kdo požadují maximální kvalitu a hloubku odpovědí; počítejte s minimálně 32 GB RAM.
Hardwarové nároky: kolik RAM model potřebuje
Rozhodující je jediné číslo: velikost modelu po kvantizaci se musí bezpodmínečně vejít do paměti. Na serveru s grafickou kartou jde o VRAM (paměť GPU), na serveru bez ní o běžnou operační paměť (RAM).
Samotná kvantizace snižuje přesnost uložených vah – typicky z 16 bitů na 4 bity. Model se tím zmenší zhruba na čtvrtinu při naprosto minimální ztrátě kvality odpovědí. Nástroj Ollama přitom stahuje modely již předem kvantizované (výchozí je právě 4bitová varianta), takže velikosti v tabulce přesně odpovídají tomu, co reálně obsadíte na disku i v paměti.
V praxi to vypadá následovně:
- 8 GB RAM: Bezpečně stačí pro modely do zhruba 4B parametrů (qwen3.5:4b, gemma4:e2b).
- 16 GB RAM: Ideální domov pro modely 9B až 12B (qwen3.5:9b, gemma4:12b).
- 32 GB RAM: Nutný základ pro modely 26B až 31B (gemma4:26b, qwen3.5:27b, gemma4:31b).
- 64 GB RAM a více: Terén pro větší MoE modely, extrémně dlouhá kontextová okna nebo souběžný provoz vícero modelů naráz.
VPS Centrum
Vyzkoušejte zdarma naši aplikaci pro správu serveru a domén. Budete si připadat jako zkušený administrátor.
Pozor na mlsné kontextové okno
Čím delší dokumenty modelu posíláte, tím hltavější je – paměti spotřebuje mnohem víc nad rámec samotných vah. Pokud v serveru roztáčíte RAG nad obřími firemními dokumentacemi, raději na operační paměti nešetřete a počítejte s bezpečnostní rezervou spíše 4 až 8 GB.
Co zvládne VPS bez GPU a kdy už potřebujete GPU server
Výpočet odpovědí na procesoru (CPU inference) bývá řádově pomalejší než na nadupané grafice. Pro celou řadu firemních scénářů ale naprosto stačí.
VPS bez GPU dává perfektní smysl, když:
- Na výstup v reálném čase nikdo nečeká – typicky jde o noční sumarizace, třídění e-mailů, tagování obsahu nebo zpracování hromadných front úloh.
- S modelem pracuje menší jednotka uživatelů, nikoliv desítky lidí souběžně.
- Vystačíte si s kompaktním modelem do 12B parametrů, případně s chytrou architekturou typu MoE s nízkým počtem aktivních vah.
Na běžném VPS s 8 vCPU generují modely kolem 4B parametrů zhruba 5 až 15 tokenů za sekundu (přičemž jeden token = cca půl až celé slovo). Na plynulý chat jednoho uživatele to bohatě stačí. Větší modely kolem 12B sice zpomalují na jednotky tokenů za sekundu, což už vyžaduje dávku trpělivosti, ale pro skryté dávkové úlohy to ničemu nevadí.
Zástupci MoE, jako je například gemma4:26b, navíc díky nízkému počtu aktivních parametrů šlapou znatelně lépe, než by jejich celková velikost napovídala. Výpočetní rychlost přímo roste s počtem jader a propustností pamětí – konkrétní čísla si proto vždy reálně otetsujte na vlastním stroji.
GPU server naopak bezpodmínečně potřebujete, když:
- Model musí odbavovat více uživatelů současně a bez jakéhokoliv čekání.
- Chcete v použitelné rychlosti roztáčet gigantické modely nad 30B parametrů.
- Stavíte produkt, kde o úspěchu rozhoduje každá milisekunda latence – jako je zákaznický chat, živý našeptávač nebo chytrý asistent přímo v aplikaci.
Proto začněte opatrně na klasickém VPS se 16 až 32 GB RAM, ověřte si na malém modelu, že váš záměr funguje v praxi, a teprve na základě reálného provozu se rozhodněte pro investici do GPU serveru. Výkon VPS navíc můžete kdykoliv za chodu navýšit, takže správnou velikost nemusíte složitě hádat předem.
Instalace Ollama na Linux VPS krok za krokem
Návod platí pro Ubuntu 24.04, na jiných distribucích se liší jen instalace balíčků. Předpokládá VPS s alespoň 8 GB RAM a 20 GB volného místa na disku.
- Připojte se na server a nainstalujte curl:
sudo apt update && sudo apt install -y curl
- Spusťte oficiální instalační skript:
curl -fsSL https://ollama.com/install.sh | sh
Skript nainstaluje binárku, vytvoří systémového uživatele ollama a zaregistruje službu v systemd. Stejným příkazem později Ollama aktualizujete, stažené modely při tom zůstanou zachovány.
- Ověřte, že služba běží:
ollama --version
systemctl status ollama
- Stáhněte a spusťte první model:
ollama pull qwen3.5:4b
ollama run qwen3.5:4b
Příkaz run otevře interaktivní chat přímo v terminálu. Ukončíte ho zkratkou Ctrl+D.
- Otestujte API, přes které se připojují aplikace:
curl http://localhost:11434/api/tags
Odpověď vypíše seznam stažených modelů ve formátu JSON. API poslouchá na portu 11434 a rozumí mu většina AI nástrojů a knihoven. Užitečné jsou ještě příkazy:
- ollama list (stažené modely),
- ollama ps (modely aktuálně načtené v paměti)
- a ollama rm (smazání modelu).
Zabezpečení: Ollama API nemá autentizaci
Tohle je nejdůležitější část článku. Ollama API nemá žádné vestavěné přihlašování. Kdokoli, kdo se na port 11434 dostane, může spouštět dotazy, stahovat a mazat modely. Na internetu jsou tisíce takto otevřených serverů, které za majitele počítají cizí úlohy.
Základní pravidla:
- Nevystavujte port 11434 na veřejnou IP adresu. Ollama po instalaci poslouchá jen na 127.0.0.1, tedy pouze pro aplikace na stejném serveru. Neměňte proměnnou OLLAMA_HOST na 0.0.0.0, pokud přesně nevíte, proč to děláte a jak přístup omezíte.
- Pojistěte se firewallem:
sudo ufw allow ssh
sudo ufw deny 11434/tcp
sudo ufw enable
- Přístup zvenčí řešte reverzní proxy s autentizací. Reverzní proxy (například nginx) přijímá požadavky z internetu, ověří heslo a teprve pak je předá lokálně běžící Ollamě. Vytvořte soubor s heslem a minimální konfiguraci:
sudo apt install -y nginx apache2-utils
sudo htpasswd -c /etc/nginx/.htpasswd uzivatel
server {
listen 443 ssl;
server_name ai.vase-domena.cz;
ssl_certificate /etc/letsencrypt/live/ai.vase-domena.cz/fullchain.pem;
ssl_certificate_key /etc/letsencrypt/live/ai.vase-domena.cz/privkey.pem;
auth_basic Ollama;
auth_basic_user_file /etc/nginx/.htpasswd;
location / {
proxy_pass http://127.0.0.1:11434;
proxy_set_header Host $host;
proxy_read_timeout 300s;
}
}
Delší proxy_read_timeout je nutný, protože generování dlouhé odpovědi na CPU může trvat i minuty. Bezplatný TLS certifikát získáte přes nástroj Certbot od certifikační autority Let’s Encrypt.
Ještě bezpečnější variantou je VPN. API vůbec nevystavíte na internet a k serveru se připojíte šifrovaným tunelem, například přes WireGuard. Pro interní firemní nástroje je to nejčistší řešení.
Často kladené otázky
Je Ollama zdarma i pro komerční použití?
Ano. Ollama je open-source pod licencí MIT. U modelů záleží na licenci konkrétního modelu: Qwen 3.5, Gemma 4 i Mistral Small 4 vycházejí pod licencí Apache 2.0, která komerční provoz umožňuje. Llama 4 má vlastní komunitní licenci s podmínkami, které si před nasazením přečtěte.
Umí open-source modely česky?
Ano, ale kvalita roste s velikostí modelu. Qwen 3.5 je trénovaný na 201 jazycích včetně češtiny a Gemma 4 pokrývá přes 140 jazyků. Modely pod 4B parametrů v češtině znatelně chybují, od 9B výše je čeština spolehlivá pro běžné firemní texty.
Kolik stojí provoz vlastního LLM na VPS?
Řádově stovky korun měsíčně za VPS s 16 GB RAM, u konfigurací s 32 GB RAM nižší jednotky tisíc. Cena je fixní bez ohledu na počet dotazů, což je hlavní rozdíl proti placení za API po tokenech.
Zvládne jeden VPS více modelů najednou?
Ano, Ollama umí mít stažených modelů libovolně mnoho a do paměti je načítá podle potřeby. Souběžně načtené modely ale sčítají nároky na RAM. Běžná praxe je jeden hlavní model a k tomu malý model pro embeddingy (převod textu na čísla pro vyhledávání).
Freelo - Nástroj na řízení úkolů a projektů
Přidej se, pozvi svůj tým a klienty, rozděl práci a sleduj, jak se úkoly dají do pohybu.
Potřebuji na VPS nutně GPU?
Ne. Modely do zhruba 12B parametrů běží použitelně na CPU, zvlášť pro dávkové úlohy a jednoho až několik uživatelů. GPU server dává smysl pro větší modely, více souběžných uživatelů a aplikace citlivé na rychlost odpovědi.
Závěr: volte vlastní AI za cenu VPS
Ollama snížila bariéru pro vlastní AI na minimum, jeden instalační příkaz, jeden příkaz pro stažení modelu a na serveru vám běží LLM, nad kterým máte plnou kontrolu. Firemní data zůstávají u vás, náklady jsou fixní a na výběr máte modely od Qwen 3.5 přes Gemma 4 až po DeepSeek-R1. Stačí VPS s dostatkem RAM a správně zabezpečené API.
Pokud si chcete vlastní LLM vyzkoušet, VPS od Váš Hosting nakonfigurujete přesně podle zvoleného modelu, od 16 GB RAM pro první experimenty po 64 GB pro větší modely, a konfiguraci později navýšíte bez reinstalace. Servery běží v ČR, což se hodí i z pohledu GDPR, a s nastavením pomůže nonstop technická podpora. Pro náročnější nasazení jsou k dispozici GPU servery.