Soukromá AI ve firmě — část 1: setup, hardware a modely pro češtinu
Soukromá AI přestala být projekt pro tým specialistů. Ollama jako inferenční vrstva, jedna grafická karta a Open WebUI jako rozhraní — za den běží privátní ChatGPT uvnitř firemní sítě. Tato první část dvoudílného návodu rozhoduje, komu to dává smysl, který nástroj zvolit, jaký hardware koupit a jaký model vybrat na češtinu. Druhá část — Soukromé AI: ekonomika, bezpečnost a 14denní rollout — pokrývá kalkulaci v korunách, GDPR, EU AI Act a plán nasazení.
Stručně: Co si z první části odnést
- Privátní AI dává smysl, když mluví regulace nebo objem. Pro běžnou padesátičlennou firmu bez regulačního tlaku je cloud API levnější a rychlejší. Rozhodovací strom níže dává za tři minuty verdikt.
- Ollama vyhrává na serveru, LM Studio na laptopu, vLLM pro desítky souběžných uživatelů. Zaměnit desktopovou aplikaci za produkční server je nejčastější chyba, kterou firmy dělají.
- Pro češtinu v dubnu 2026 je nejsilnější Llama 3.3 70B v kvantizaci Q4_K_M na RTX 4090. Qwen 2.5 32B jede druhý, Mistral Large 2 nejlíp umí kód. Typické hodnoty 8–14 tok/s u 70B modelu, 25–35 tok/s u 7B modelu.
1. Co je soukromá AI a kdy se vyplatí
Soukromá AI je každé nasazení jazykového modelu, kde data, prompty a výsledky neopouštějí kontrolovaný perimetr — firemní síť, dedikovaný cloudový tenant nebo privátní VPC. Pod stejnou nálepkou se skrývají tři architektury a každá má jinou ekonomiku.
Stručně: Soukromá AI znamená, že data nevytékají ven k poskytovateli jako OpenAI nebo Anthropic. Existují tři varianty — on-premises (vlastní server), private cloud (dedikovaná GPU instance) a hybrid (citlivé úlohy self-host, zbytek SaaS). Každá varianta má jiné ekonomické optimum. Vlastnictví hardwaru samo o sobě neřeší GDPR ani EU AI Act.
Pod hlavičkou „soukromá AI" existují tři architektury. On-premises je fyzický server ve firemní serverovně, kapex 280 000–500 000 Kč. Private cloud je dedikovaná GPU u Azure, AWS, Master DC nebo VSHosting — měsíční náklad, smluvní garance datové rezidence. Hybrid směruje citlivé úlohy (platební data, zdravotní dokumentace, advokátní spisy) na privátní endpoint, běžné prompty na SaaS API. Tři typické důvody k přechodu: compliance (EU AI Act, GDPR čl. 32, zákon 110/2019 Sb., vyhláška ČNB 163/2014, NIS2), datová suverenita a ekonomika objemů nad zhruba 250 milionů tokenů měsíčně.
Strom není dogma, je to filtr proti emocionálním volbám. Účetní firma o deseti lidech s regulovanou částí klientů typicky padne do hybridního pásma. Padesátičlenná marketingová agentura s běžnými texty skončí pod patnácti body — pro ni je self-host zbytečná investice. Detail, jaké české právní povinnosti přesně do skóre vstupují, pokrývá článek AI a české právo 2026.
Co strom záměrně vynechává
Strom nepočítá image faktor („my děláme privátní AI, nás nikdo neobchází") ani osobní preferenci vedení. Pokud CIO nechce cizí cloud ze zásady, skóre z toho nespadne — ale rozhodnutí patří do organizační politiky, ne do ekonomické analýzy.
2. Ollama, LM Studio, vLLM: který nástroj kdy
Přehled nástrojů pro lokální běh modelů vypadá z dálky jako jeden kus — uvnitř jsou to ale minimálně tři třídy produktů. Rozdíl mezi nimi rozhoduje, zda nasazení přežije první rok.
Stručně: Ollama je serverový daemon s OpenAI-kompatibilním API. LM Studio je desktopová aplikace pro jednoho uživatele. vLLM a TGI jsou high-throughput inference servery pro desítky souběžných uživatelů. Llama.cpp je nízkoúrovňová knihovna, kterou ostatní nástroje používají pod kapotou. Pro firemní server volte Ollama nebo vLLM.
| Nástroj | Třída | Pro koho | Výhody | Nevýhody | Licence |
|---|---|---|---|---|---|
| Ollama | Server daemon (CLI) | Firemní server, Docker, K8s | OpenAI-kompatibilní API, 200+ modelů, Docker image, systemd, souběžný provoz více uživatelů | Bez nativního RBAC, řízení jedné GPU slabší než vLLM | MIT |
| LM Studio | Desktop GUI | Single-user R&D, laptop | Grafické vyhledávání modelů, MLX pro Apple Silicon | Vyžaduje desktop session, proprietární licence, není Docker-friendly | Proprietární (free) |
| vLLM | High-throughput server | 10+ souběžných uživatelů | PagedAttention, continuous batching, distributed serving | Náročnější setup, vyžaduje CUDA, méně modelů plug-and-play | Apache 2.0 |
| TGI | Enterprise server | Hugging Face ekosystém | Prometheus metriky, gRPC, streaming | Licence HFOIL (omezení nad 100 M uživatelů produktu) | HFOIL (non-OSI) |
| llama.cpp | Nízkoúrovňová knihovna | Vlastní integrace, embedded | Maximum kontroly, režim pouze CPU, funguje i na Raspberry Pi | Bez správy modelů, bez GUI, sestavení ze zdrojáku | MIT |
| Open WebUI | UI vrstva | ChatGPT-like rozhraní | RBAC, RAG, plugins, multi-user, OIDC/LDAP | Potřebuje inference backend (Ollama/vLLM) | MIT |
Podle velikosti týmu: jeden uživatel na laptopu — LM Studio. Dva až deset uživatelů na firemním serveru — Ollama + Open WebUI, instalace za hodinu. Desítky souběžných uživatelů nebo SaaS produkt — vLLM nebo TGI. Embedded a edge — llama.cpp přímo. Pokud potřebujete nad Ollama vizuální workflow builder, RAG pipeline s parsingem dokumentů a agenty s nástroji, napojte Ollama jako LLM providera do open-source platformy Dify.
Pozor na licenci TGI
Hugging Face Text Generation Inference má licenci HFOIL, ne Apache. Pro interní firemní použití je zdarma, ale produkt s víc než 100 miliony uživateli vyžaduje komerční domluvu. Pro B2C produkty je to důvod rovnou přejít na vLLM.
3. Hardware: co reálně potřebujete
Hardwarová rozvaha je tam, kde se láme většina self-host projektů. Kupuje se buď příliš málo („na RTX 4070 nám to přece běželo na notebooku"), nebo příliš mnoho („kupujeme A100, abychom měli rezervu"). Matice níže spojuje velikost firmy, rozumně zvolený model a typické tržní ceny v dubnu 2026. Pokud ve stejné serverovně plánujete i generování obrázků, platí jiné limity — rozebrané v srovnání FLUX vs Stable Diffusion 2026.
Stručně: Pro jednotlivce nebo dvojici stačí RTX 4070 s 12 GB VRAM a model do 8 miliard parametrů. Pro pět až dvacet lidí je standardem RTX 4090 s 24 GB a Llama 3.3 70B v Q4. Nad dvacet lidí začíná nutnost dvou karet nebo přechod na A6000 48 GB. Padesát souběžných uživatelů vyžaduje H100 třídu, která stojí v řádech milionů korun.
| Velikost firmy | Doporučený model | Kvantizace | GPU | RAM | HW v Kč | Rychlost | Souběh |
|---|---|---|---|---|---|---|---|
| 1–5 osob | Qwen 2.5 7B nebo Llama 3.2 8B | Q4_K_M | RTX 4070 12 GB | 32 GB | ~45 000 Kč | 25–35 tok/s | 1–2 |
| 5–20 osob | Llama 3.3 70B / Qwen 2.5 32B | Q4_K_M / Q6_K | RTX 4090 24 GB | 64 GB | ~95 000 Kč | 8–14 tok/s | 2–4 |
| 20–50 osob | Llama 3.3 70B | Q5_K_M | 2× RTX 4090 nebo A6000 48 GB | 128 GB | ~180 000 Kč + server | 12–18 tok/s | 4–8 |
| 50+ osob | Multi-model fallback | Q8_0 / FP16 | 2× H100 80 GB | 256 GB | 2,2–2,7 mil. Kč | 40–80 tok/s | 15–30 |
Kvantizace snižuje přesnost vah — Q8 osm bitů, Q4 čtyři, Q2 dva. Q8_0 je prakticky neodlišitelný od FP16, Q6_K ztrácí na benchmarkách 1–2 procentní body, Q4_K_M kolem 2–4. Q2_K je pro produkci nepoužitelný. Praktické minimum je Q4_K_M, pokud VRAM vystačí, volte Q6_K.
Cena karty není cena nasazení. K 95 000 Kč za RTX 4090 se přičítá server šasi (20–40 000 Kč), zdroj 1000 W Platinum (5–8 000 Kč), 64 GB DDR5 ECC (8–12 000 Kč), CPU, NVMe 2 TB, UPS a 10GbE síťovka. Realistický základní server s jednou 4090 se dostane na 150 000–200 000 Kč.
Běžný omyl: „RTX 4090 zvládne padesát uživatelů"
Jedna karta stíhá 2–4 souběžné aktivní konverzace s kontextem kolem 8 000 tokenů. Pátý uživatel čeká ve frontě. Při kontextu 32 000 tokenů limit klesá na dva. Od pěti souběžných živých uživatelů výše je potřeba buď druhá karta, nebo rovnou A6000/H100.
4. Instalace Ollama + Open WebUI
Referenční prostředí: Ubuntu 24.04 LTS na stroji s NVIDIA grafickou kartou, CUDA 12.4+. Teoreticky lze Ollamu rozjet za deset minut — produkční konfigurace včetně Open WebUI, OIDC a reverse proxy zabere realisticky půl dne. Kompletní produkční nasazení s Postgresem, Qdrantem a identitou pokrývá samostatná dvoudílná série: Open WebUI — instalace a produkční setup a Open WebUI — licence, TCO a rollout.
Stručně: Instalace Ollama je jeden curl příkaz. Systemd služba se upraví tak, aby poslouchala na LAN, ukládala modely na datový disk a obsluhovala čtyři souběžné požadavky. Open WebUI se doplní přes Docker Compose a poskytne chat rozhraní s RBAC. Port 11434 se nikdy nevystavuje na internet — reverse proxy s autentizací je povinná.
Ollama v jednom příkazu:
curl -fsSL https://ollama.com/install.sh | sh
Skript nainstaluje binárku do /usr/local/bin/ollama, vytvoří uživatele ollama, založí systemd službu a spustí ji. První model a test:
ollama pull qwen2.5:14b
ollama run qwen2.5:14b "Napiš dvouvětý pozdrav pro klienta účetní kanceláře."
Pro produkční konfiguraci je nutné upravit systemd override (sudo systemctl edit ollama.service):
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_MODELS=/data/ollama/models"
Environment="OLLAMA_KEEP_ALIVE=30m"
Environment="OLLAMA_NUM_PARALLEL=4"
Environment="OLLAMA_MAX_LOADED_MODELS=2"
Environment="OLLAMA_FLASH_ATTENTION=1"
Parametry říkají: poslouchat na všech rozhraních, modely na datovém disku, 30 minut hold, čtyři souběžné požadavky, dva modely v paměti současně, Flash Attention zapnuté. Po úpravě sudo systemctl restart ollama.
Open WebUI se doplní přes Docker Compose (první registrovaný uživatel je admin, ostatní čekají ve stavu pending):
services:
open-webui:
image: ghcr.io/open-webui/open-webui:main
ports: ["3000:8080"]
environment:
- OLLAMA_BASE_URL=http://host.docker.internal:11434
- WEBUI_AUTH=True
- ENABLE_SIGNUP=False
- DEFAULT_USER_ROLE=pending
volumes: [open-webui-data:/app/backend/data]
restart: unless-stopped
extra_hosts: ["host.docker.internal:host-gateway"]
volumes: { open-webui-data: }
Nad dvacet uživatelů je ruční správa účtů neudržitelná. Open WebUI podporuje OIDC (Authentik, Keycloak, Azure AD, Google Workspace, Okta). Po doplnění proměnných OAUTH_CLIENT_ID, OAUTH_CLIENT_SECRET a OPENID_PROVIDER_URL se na přihlašovací obrazovce objeví tlačítko „Přihlásit přes Firemní účet" a role se synchronizují z LDAP skupin.
Nikdy nevystavujte port 11434 do internetu
Ollama API nemá autentizaci. Bind na 0.0.0.0 je v pořádku jen uvnitř firemní LAN za firewallem. Pro vzdálený přístup použijte reverse proxy s autentizací (Caddy + OIDC, Traefik + ForwardAuth, nginx + oauth2-proxy) nebo VPN. Bez ní jedna indexační chyba Shodanu a model obsluhuje celý internet.
5. Modely pro češtinu: praktické srovnání
Benchmarky v angličtině nevypovídají o tom, jak model zvládne český text, rozbor smlouvy v právnické češtině nebo shrnutí schůze v odborné terminologii. Matice níže vychází z testů šesti open-source modelů na pěti reálných českých úlohách — tři nezávislí hodnotitelé bodovali výstupy na škále 1–5.
Stručně: Pro obecné psaní v češtině a shrnutí je v dubnu 2026 nejsilnější Llama 3.3 70B v Q4 kvantizaci, za ní Qwen 2.5 32B. Mistral Large 2 vyniká v kódu. DeepSeek-R1 destilát zvládne uvažování, ale slabě píše česky. Pro 8 B modely na notebook je nejlepší volba Qwen 2.5 7B. Cíleně trénované české modely v open-source formě zatím chybí.
| Model | Shrnutí | Obchodní email | Komentář ke kódu | Právní rešerše | Kreativní psaní |
|---|---|---|---|---|---|
| Llama 3.3 70B Q4_K_M | 4,5 / 5 | 4,3 / 5 | 4,2 / 5 | 4,0 / 5 | 4,3 / 5 |
| Qwen 2.5 32B Q6_K | 4,3 / 5 | 4,1 / 5 | 4,4 / 5 | 3,8 / 5 | 3,9 / 5 |
| Mistral Large 2 Q4 | 4,2 / 5 | 4,0 / 5 | 4,6 / 5 | 3,9 / 5 | 3,8 / 5 |
| Gemma 3 27B Q6 | 3,9 / 5 | 3,8 / 5 | 3,7 / 5 | 3,4 / 5 | 4,0 / 5 |
| DeepSeek-R1 distill 32B Q4 | 3,8 / 5 | 3,2 / 5 | 4,3 / 5 | 3,7 / 5 | 2,9 / 5 |
| Qwen 2.5 7B Q4_K_M | 3,5 / 5 | 3,6 / 5 | 3,4 / 5 | 2,8 / 5 | 3,3 / 5 |
Čeština není gramatika. Všechny modely v tabulce zvládnou syntaxi, rody, pády a diakritiku. Rozdíly se ukazují v tónu (Llama 3.3 70B píše přirozeněji než Mistral), odborném slovníku (Qwen a Mistral vedou v IT terminologii, Llama v obecné próze) a zvládnutí idiomů (Gemma 3 občas sklouzává k anglickým kalkám i po překladu).
DeepSeek-R1 destilát není plný DeepSeek-R1. Plná verze má 671 miliard parametrů a vyžaduje osm H100, hardware v řádu milionů. To, co Ollama knihovna nabízí jako deepseek-r1:32b, je Qwen nebo Llama dotrénovaný na výstupech plného R1. Destilát zvládá řetězy úvah, ale kvalita české konverzace je slabší než u originálního Llama nebo Qwen. Rozhodovací rámec mezi modely pokrývá článek Jak vybrat AI model podle úkolu.
Český specializovaný model?
Cíleně trénovaný český open-source jazykový model v dubnu 2026 stále neexistuje na úrovni, která by překonala Llama 3.3 70B v obecné češtině. Projekty jako Czech-LLM od ÚFAL, open-source fine-tuny Mistralu na českých datech nebo CZERT od ČVUT slouží specializovaným výzkumům, ne produkčnímu nasazení. Pro běžné firemní použití je nejlepší obecný vícejazyčný model velikosti 30 B a výš.
6. Časté otázky
Zvládneme provozovat Ollamu na firemním notebooku?
Technicky ano — 8 B model běží i na Apple M2 Pro se 16 GB RAM. Pro produkční nasazení pro tým je ale notebook nevhodný: neumí 24/7 provoz, chybí redundance, VRAM nestačí na kontextová okna nad 8 k, a uživatelé se na něj nepřipojí víc než dva naráz. Jako sandbox pro testování ano, jako sdílený server ne.
Kolik uživatelů utáhne RTX 4090?
Reálně 3–5 aktivních souběžně na 13 B modelu s kontextem 8 k a průměrnou délkou odpovědi 500 tokenů. Padesát lidí v organizaci, ze kterých najednou dotazují čtyři, zvládne. Při 10+ souběžných dotazech se degraduje latence.
Musíme mít datacentrum, nebo stačí workstation?
Firma do dvaceti lidí vystačí s workstationem pod stolem (1× RTX 4090, 64 GB RAM, Ubuntu). Pro 30–80 lidí se dělá 19" server s 2× RTX 4090 nebo 1× H100. Nad sto lidí nebo při požadavku dostupnosti 99,9 % je nutná virtualizace, redundance a oddělené prostředí — skutečná serverovna nebo colocation.
Kolik stojí GPU pronájem, když nechceme kupovat?
H100 server s 80 GB VRAM se u českých poskytovatelů (Master Internet, VSHosting) pronajme za 70 000–120 000 Kč měsíčně. U zahraničních poskytovatelů (Lambda, RunPod) vychází levněji, ale vyvstává datová rezidence. Výhodné pro PoC a sezónní zátěže, dlouhodobě dražší než koupě.
Jde provozovat modely s vision na self-hostu?
Ano — Llama 3.2 Vision, Qwen2.5-VL, Pixtral. Pozor na VRAM: kvalitní vizuální modely běží 24–48 GB kvantované. Ollama vision podporuje, Open WebUI má v dubnu 2026 plnohodnotné UI pro obrázky v promptu.
Hardwarová matice a výběr modelu jsou základy, ne cíl. Před ostrým spuštěním musí firma rozhodnout ekonomiku, ošetřit GDPR a EU AI Act, postavit bezpečnostní kontroly a naplánovat nasazení. Druhý díl — Soukromé AI, část 2: ekonomika, bezpečnost a 14denní rollout — obsahuje kalkulaci v korunách pro tři velikosti firmy, tabulku compliance povinností, migrační checklist ze SaaS a sedm chyb, které projekt potopí. Pokud rozhodovací strom dává pod 16 bodů, zavřete tento článek a zůstaňte u SaaS s řádnou DPA — ekonomicky ani právně self-host nevyjde. Pro doplnění stacku o hlasovou vrstvu (audioknihy, IVR, screen readery v češtině) navazuje průvodce open source TTS v češtině, který rozebírá Piper a XTTS-v2 pro plně offline nasazení.
7. Zdroje
- Meta: Llama 3.1 technical report — ai.meta.com
- Ollama dokumentace — github.com/ollama/ollama
- Open WebUI — docs.openwebui.com
- vLLM: PagedAttention paper — arxiv.org/abs/2309.06180
- LM Studio (proprietární licence) — lmstudio.ai/terms
- Hugging Face TGI licence HFOIL — github.com/huggingface/text-generation-inference