← Zpět na všechny články blogu

Ollama: jak hostovat vlastní LLM na VPS

Iveta Zlatníčková
Iveta Zlatníčková Aktualizováno 12. 8. 2026 – 13 min. čtení

Vlastní jazykový model na vlastním serveru už není jen experiment pro AI geeky. S Ollama zprovozníte open-source LLM na běžném linuxovém VPS během deseti minut a vaše firemní data přitom neopustí bezpečí serveru.

V článku najdete konkrétní instalační příkazy, přehled modelů, které v roce 2026 dávají reálný smysl, i pohled na hardwarové nároky. Dozvíte se přesně, kdy si vystačíte s procesorem (CPU) a kdy už bezpodmínečně potřebujete grafickou kartu (GPU). 

Co je Ollama a k čemu slouží

Ollama je open-source nástroj pro spouštění velkých jazykových modelů (LLM) na vlastním hardwaru. Funguje na Linuxu, macOS i Windows a odvede za vás veškerou černou práci: obstará stažení modelu, jeho bezpečné načtení do paměti, kvantizaci – tedy kompresi vah, aby se model vměstnal do menší paměti – a vystaví HTTP API, skrze které s ním aplikace komunikují.

Práce s ní nápadně připomíná Docker. Model stáhnete jednoduchým příkazem ollama pull, spustíte přes ollama run a máte hotovo. Ollama navíc běží jako služba na pozadí a na portu 11434 otevírá REST API kompatibilní s formáty, na které jsou AI aplikace zvyklé. Bez problémů na ni napojíte interního chatbota, RAG nad firemní dokumentací (Retrieval Augmented Generation neboli chytré odpovídání z vlastních zdrojů), automatizace v n8n nebo oblíbený editor kódu.

Výsledek? Vlastní obdoba ChatGPT, která běží na vašem VPS, citlivá data neposílá třetím stranám a neúčtuje si ani korunu za spotřebované tokeny.

Proč firmy přecházejí na self-hosted AI

Zájem o vlastní hostování umělé inteligence roste už druhým rokem a rozhodně nejde o prchavou módní vlnu. Důvody jsou praktické:

  • Firemní data zůstávají doma: Když zaměstnanci vkládají do veřejných AI chatů interní smlouvy, zdrojové kódy nebo osobní údaje klientů, ztrácíte kontrolu nad tím, kde končí. Model na vlastním serveru drží vše uvnitř infrastruktury, kterou plně podcucháte a spravujete.
  • GDPR a compliance bez bolesti: U self-hosted řešení přesně víte, kde se data zpracovávají. Nemusíte řešit komplikované předávání údajů mimo EU ani studovat neprostupná právní ujednání amerických gigantů. Pro finance, zdravotnictví nebo právní obory je to často jediná schůdná cesta – obzvlášť když fyzický server stojí v České republice.
  • Nezávislost na heszrech z API: Posrequentní poskytovatelé komerčních API neustále mění ceníky, limity i chování modelů a starší verze bez varování vypínají. Lokální model se chová naprosto předvídatelně tak dlouho, dokud se jej sami nerozhodnete aktualizovat. Odpadá i riziko, že vám uprostřed nejdůležitějšího meetingu klekne cizí služba.
  • Náklady pod kontrolou: Platby za cloudová API rostou s každým odeslaným dotazem. Naproti tomu VPS vás stojí fixní měsíční paušál bez ohledu na počet vygenerovaných tokenů. Jakmile řešíte vyšší objemy provozu – jako je automatická sumarizace tiketů, třídění e-mailů nebo generování popisků produktů, vlastní server se vám odvděčí nesrovnatelně nižšími náklady.

Lokální modely udělaly za poslední rok obrovský skok – ve výkonu, rychlosti i schopnostech. Google dnes pouští do světa modely jako Gemma, které si spustíte na vlastním serveru, a čínské firmy s otevřenými váhami jim nejsou daleko. Není to zadarmo. Místo tokenů platíte grafickými kartami a elektřinou, ale data máte pod kontrolou. To se hodí všude tam, kde citlivý obsah, třeba přepisy hovorů se zákazníky nebo interní dokumenty, nesmí opustit firmu. A je to i pojistka do budoucna: v červnu 2026 nařídily USA Anthropicu zablokovat přístup k jeho nejsilnějším modelům mimo Ameriku. Kdo staví agentní vývoj čistě na cizím API, se tak může ze dne na den ocitnout bez nástroje, na který spoléhal.

Honza Černý – Product owner Váš Hosting

Jaké open-source modely dávají v roce 2026 smysl

Nabídka otevřených jazykových modelů se mění doslova před očima. Následující přehled mapuje aktuální stav k červenci 2026 a je pevně zakotvený v oficiální knihovně Ollama: 

ModelVydáníVelikostiLicencePoznámka
Qwen 3.5 (Alibaba)únor 20260,8B/2B/4B/9B/27BApache 2.0multimodální, 201 jazyků, silná čeština
Gemma 4 (Google)duben 2026E2B, E4B, 12B, 26B MoE, 31BApache 2.0vysoký výkon na parametr, varianta 12B vyšla v červnu 2026
Mistral Small 4březen 2026119B MoE (6B aktivních)Apache 2.0vyžaduje datacentrová GPU, pro VPS se hodí starší Ministral 3 (3B, 8B, 14B)
Llama 4 (Meta)duben 2025Scout 109B, Maverick 400BLlama 4 Communitydlouhý kontext, pro běžné VPS příliš velký; Llama 3.1 8B zůstává použitelná klasika
DeepSeek-R12025destilované verze 1,5B až 70BMITreasoning model, menší destiláty běží i na CPU
Poznámka: Písmeno „B“ v tabulce označuje miliardy parametrů. Zkratka MoE (Mixture of Experts) představuje chytrou architekturu, kde se při každém dotazu aktivuje jen zlomek modelu. Takový obr sice zabere více místa v operační paměti (RAM), ale počítá bleskově – což oceníte právě při provozu na procesoru (CPU). 

S čím vystačíte na VPS bez grafické karty?

Pokud stavíte server čistě na procesorové výkonu, v reálném provozu Ollama knihovny nejčastěji sáhnete po těchto osvědčených kusech:

  • qwen3.5:4b (3,4 GB): Univerzální dělník, kterému hravě stačí 8 GB RAM.
  • qwen3.5:9b (6,6 GB): Znatelně chytřejší mozek, pro který si připravte 16 GB RAM.
  • gemma4:12b (7,6 GB): Silný hráč do 16 GB RAM, který navíc zvládá obří kontextové okno o velikosti 256K tokenů.
  • gemma4:26b (18 GB): Architektura MoE se 4 aktivními miliardami parametrů – na CPU běží překvapivě svižně, vyžaduje však 32 GB RAM.
  • qwen3.5:27b (17 GB): Volba pro ty, kdo požadují maximální kvalitu a hloubku odpovědí; počítejte s minimálně 32 GB RAM.

Hardwarové nároky: kolik RAM model potřebuje

Rozhodující je jediné číslo: velikost modelu po kvantizaci se musí bezpodmínečně vejít do paměti. Na serveru s grafickou kartou jde o VRAM (paměť GPU), na serveru bez ní o běžnou operační paměť (RAM).

Samotná kvantizace snižuje přesnost uložených vah – typicky z 16 bitů na 4 bity. Model se tím zmenší zhruba na čtvrtinu při naprosto minimální ztrátě kvality odpovědí. Nástroj Ollama přitom stahuje modely již předem kvantizované (výchozí je právě 4bitová varianta), takže velikosti v tabulce přesně odpovídají tomu, co reálně obsadíte na disku i v paměti.

Orientační vzorec pro výpočet: RAM = velikost staženého modelu + 2 až 4 GB jako nezbytná rezerva pro kontext (právě zpracovávaný text dotazu s odpovědí) a samotný operační systém.

V praxi to vypadá následovně:

  • 8 GB RAM: Bezpečně stačí pro modely do zhruba 4B parametrů (qwen3.5:4b, gemma4:e2b).
  • 16 GB RAM: Ideální domov pro modely 9B až 12B (qwen3.5:9b, gemma4:12b).
  • 32 GB RAM: Nutný základ pro modely 26B až 31B (gemma4:26b, qwen3.5:27b, gemma4:31b).
  • 64 GB RAM a více: Terén pro větší MoE modely, extrémně dlouhá kontextová okna nebo souběžný provoz vícero modelů naráz.

VPS Centrum

Vyzkoušejte zdarma naši aplikaci pro správu serveru a domén. Budete si připadat jako zkušený administrátor.

Pozor na mlsné kontextové okno

Čím delší dokumenty modelu posíláte, tím hltavější je – paměti spotřebuje mnohem víc nad rámec samotných vah. Pokud v serveru roztáčíte RAG nad obřími firemními dokumentacemi, raději na operační paměti nešetřete a počítejte s bezpečnostní rezervou spíše 4 až 8 GB.

Co zvládne VPS bez GPU a kdy už potřebujete GPU server

Výpočet odpovědí na procesoru (CPU inference) bývá řádově pomalejší než na nadupané grafice. Pro celou řadu firemních scénářů ale naprosto stačí.

VPS bez GPU dává perfektní smysl, když:

  • Na výstup v reálném čase nikdo nečeká – typicky jde o noční sumarizace, třídění e-mailů, tagování obsahu nebo zpracování hromadných front úloh.
  • S modelem pracuje menší jednotka uživatelů, nikoliv desítky lidí souběžně.
  • Vystačíte si s kompaktním modelem do 12B parametrů, případně s chytrou architekturou typu MoE s nízkým počtem aktivních vah.

Na běžném VPS s 8 vCPU generují modely kolem 4B parametrů zhruba 5 až 15 tokenů za sekundu (přičemž jeden token = cca půl až celé slovo). Na plynulý chat jednoho uživatele to bohatě stačí. Větší modely kolem 12B sice zpomalují na jednotky tokenů za sekundu, což už vyžaduje dávku trpělivosti, ale pro skryté dávkové úlohy to ničemu nevadí. 

Zástupci MoE, jako je například gemma4:26b, navíc díky nízkému počtu aktivních parametrů šlapou znatelně lépe, než by jejich celková velikost napovídala. Výpočetní rychlost přímo roste s počtem jader a propustností pamětí – konkrétní čísla si proto vždy reálně otetsujte na vlastním stroji. 

GPU server naopak bezpodmínečně potřebujete, když:

  • Model musí odbavovat více uživatelů současně a bez jakéhokoliv čekání.
  • Chcete v použitelné rychlosti roztáčet gigantické modely nad 30B parametrů.
  • Stavíte produkt, kde o úspěchu rozhoduje každá milisekunda latence – jako je zákaznický chat, živý našeptávač nebo chytrý asistent přímo v aplikaci.

Proto začněte opatrně na klasickém VPS se 16 až 32 GB RAM, ověřte si na malém modelu, že váš záměr funguje v praxi, a teprve na základě reálného provozu se rozhodněte pro investici do GPU serveru. Výkon VPS navíc můžete kdykoliv za chodu navýšit, takže správnou velikost nemusíte složitě hádat předem.

Instalace Ollama na Linux VPS krok za krokem

Návod platí pro Ubuntu 24.04, na jiných distribucích se liší jen instalace balíčků. Předpokládá VPS s alespoň 8 GB RAM a 20 GB volného místa na disku.

  1. Připojte se na server a nainstalujte curl:
sudo apt update && sudo apt install -y curl
  1. Spusťte oficiální instalační skript:
curl -fsSL https://ollama.com/install.sh | sh

Skript nainstaluje binárku, vytvoří systémového uživatele ollama a zaregistruje službu v systemd. Stejným příkazem později Ollama aktualizujete, stažené modely při tom zůstanou zachovány.

  1. Ověřte, že služba běží:
ollama --version

systemctl status ollama
  1. Stáhněte a spusťte první model:
ollama pull qwen3.5:4b

ollama run qwen3.5:4b

Příkaz run otevře interaktivní chat přímo v terminálu. Ukončíte ho zkratkou Ctrl+D.

  1. Otestujte API, přes které se připojují aplikace:
curl http://localhost:11434/api/tags

Odpověď vypíše seznam stažených modelů ve formátu JSON. API poslouchá na portu 11434 a rozumí mu většina AI nástrojů a knihoven. Užitečné jsou ještě příkazy:

  • ollama list (stažené modely),
  • ollama ps (modely aktuálně načtené v paměti)
  • a ollama rm (smazání modelu).

Zabezpečení: Ollama API nemá autentizaci

Tohle je nejdůležitější část článku. Ollama API nemá žádné vestavěné přihlašování. Kdokoli, kdo se na port 11434 dostane, může spouštět dotazy, stahovat a mazat modely. Na internetu jsou tisíce takto otevřených serverů, které za majitele počítají cizí úlohy.

Základní pravidla:

  • Nevystavujte port 11434 na veřejnou IP adresu. Ollama po instalaci poslouchá jen na 127.0.0.1, tedy pouze pro aplikace na stejném serveru. Neměňte proměnnou OLLAMA_HOST na 0.0.0.0, pokud přesně nevíte, proč to děláte a jak přístup omezíte.
  • Pojistěte se firewallem:
sudo ufw allow ssh

sudo ufw deny 11434/tcp

sudo ufw enable
  • Přístup zvenčí řešte reverzní proxy s autentizací. Reverzní proxy (například nginx) přijímá požadavky z internetu, ověří heslo a teprve pak je předá lokálně běžící Ollamě. Vytvořte soubor s heslem a minimální konfiguraci:
sudo apt install -y nginx apache2-utils

sudo htpasswd -c /etc/nginx/.htpasswd uzivatel

server {

    listen 443 ssl;

    server_name ai.vase-domena.cz;

    ssl_certificate /etc/letsencrypt/live/ai.vase-domena.cz/fullchain.pem;

    ssl_certificate_key /etc/letsencrypt/live/ai.vase-domena.cz/privkey.pem;

    auth_basic Ollama;

    auth_basic_user_file /etc/nginx/.htpasswd;

    location / {

        proxy_pass http://127.0.0.1:11434;

        proxy_set_header Host $host;

        proxy_read_timeout 300s;

    }

}

Delší proxy_read_timeout je nutný, protože generování dlouhé odpovědi na CPU může trvat i minuty. Bezplatný TLS certifikát získáte přes nástroj Certbot od certifikační autority Let’s Encrypt.

Ještě bezpečnější variantou je VPN. API vůbec nevystavíte na internet a k serveru se připojíte šifrovaným tunelem, například přes WireGuard. Pro interní firemní nástroje je to nejčistší řešení.

Často kladené otázky

Je Ollama zdarma i pro komerční použití?

Ano. Ollama je open-source pod licencí MIT. U modelů záleží na licenci konkrétního modelu: Qwen 3.5, Gemma 4 i Mistral Small 4 vycházejí pod licencí Apache 2.0, která komerční provoz umožňuje. Llama 4 má vlastní komunitní licenci s podmínkami, které si před nasazením přečtěte.

Umí open-source modely česky?

Ano, ale kvalita roste s velikostí modelu. Qwen 3.5 je trénovaný na 201 jazycích včetně češtiny a Gemma 4 pokrývá přes 140 jazyků. Modely pod 4B parametrů v češtině znatelně chybují, od 9B výše je čeština spolehlivá pro běžné firemní texty.

Kolik stojí provoz vlastního LLM na VPS?

Řádově stovky korun měsíčně za VPS s 16 GB RAM, u konfigurací s 32 GB RAM nižší jednotky tisíc. Cena je fixní bez ohledu na počet dotazů, což je hlavní rozdíl proti placení za API po tokenech.

Zvládne jeden VPS více modelů najednou?

Ano, Ollama umí mít stažených modelů libovolně mnoho a do paměti je načítá podle potřeby. Souběžně načtené modely ale sčítají nároky na RAM. Běžná praxe je jeden hlavní model a k tomu malý model pro embeddingy (převod textu na čísla pro vyhledávání).

Freelo - Nástroj na řízení úkolů a projektů

Přidej se, pozvi svůj tým a klienty, rozděl práci a sleduj, jak se úkoly dají do pohybu.

Potřebuji na VPS nutně GPU?

Ne. Modely do zhruba 12B parametrů běží použitelně na CPU, zvlášť pro dávkové úlohy a jednoho až několik uživatelů. GPU server dává smysl pro větší modely, více souběžných uživatelů a aplikace citlivé na rychlost odpovědi.

Závěr: volte vlastní AI za cenu VPS

Ollama snížila bariéru pro vlastní AI na minimum, jeden instalační příkaz, jeden příkaz pro stažení modelu a na serveru vám běží LLM, nad kterým máte plnou kontrolu. Firemní data zůstávají u vás, náklady jsou fixní a na výběr máte modely od Qwen 3.5 přes Gemma 4 až po DeepSeek-R1. Stačí VPS s dostatkem RAM a správně zabezpečené API.

Pokud si chcete vlastní LLM vyzkoušet, VPS od Váš Hosting nakonfigurujete přesně podle zvoleného modelu, od 16 GB RAM pro první experimenty po 64 GB pro větší modely, a konfiguraci později navýšíte bez reinstalace. Servery běží v ČR, což se hodí i z pohledu GDPR, a s nastavením pomůže nonstop technická podpora. Pro náročnější nasazení jsou k dispozici GPU servery.

Zůstaňte s námi v kontaktu

Jednou za měsíc posíláme souhrn novinek. Nemusíte se bát, spamovat vás nebudeme a odhlásit se můžete kdykoliv...

Karel Dytrych
Tým Váš Hosting
Vyzkoušejte náš trial na týden zdarma

Garance 14denní záruky vrácení peněz

Vyzkoušejte server na týden zdarma

Vyzkoušet server

Přesouváte web na lepší hosting?

Stáhněte si průvodce migrací bez výpadku

Průvodce migrací na lepší hosting
Podpora Váš Hosting
Offline

Dobrý den! Jsem virtuální asistent Váš Hosting a jsem tu pro Vás nonstop.

Poradím Vám s doménami a DNS, s webhostingem i vlastním serverem, s e-maily, SSL certifikáty nebo verzí PHP a odpovím i na dotazy k tarifům, cenám a fakturaci. Na co se ptáte?

Nemám přístup k údajům o Vašich konkrétních službách, odpovídám orientačně. U složitějších věcí Vás předám kolegům z podpory.