Kolik stojí provoz AI aplikace a proč to nikdo neví dopředu
Účet za AI neroste s počtem uživatelů, ale s tím, kolik se ptáte modelu. O tom, z čeho se cena skládá a jak ji udržet pod kontrolou.
Náklady na AI aplikaci neurčuje počet uživatelů, ale množství textu, které přes model proteče. Proto se nedají odhadnout z počtu licencí — a proto se dají řídit jen měřením.
Klasický software má náklad, který znáte dopředu: server stojí měsíčně tolik a tolik. AI funkce takhle nefunguje. Platíte za každé volání modelu a to volání je tím dražší, čím víc textu do něj vejde a čím víc z něj vyjde.
Zní to jako detail. Není.
Z čeho se účet skládá
Model počítá vstup i výstup. Vstup je všechno, co mu pošlete — dotaz uživatele, ale i instrukce, příklady a podklady, které jste do promptu přidali, aby odpověděl dobře. Výstup je to, co napíše zpátky.
- Velikost kontextu. Když k dotazu přiložíte deset stran dokumentace, platíte těch deset stran při každém jednom volání, i kdyby se odpověď týkala jediné věty.
- Volba modelu. Větší model stojí víc za totéž. Část úloh — třídění, extrakce polí, krátké shrnutí — zvládne menší model prakticky stejně.
- Opakování. Když model vrátí něco, co neprojde validací, a systém to zkusí znovu, zaplatili jste to dvakrát.
- Neviděný provoz. Testy, vývojářské zkoušení a automatické joby běží na tomtéž účtu jako zákazníci.
Právě poslední dvě položky bývají překvapením. Aplikace funguje, uživatelé jsou spokojení, a účet je dvojnásobný oproti odhadu.
Proč odhad dopředu nesedí
Spolehlivý odhad by vyžadoval vědět, kolik dotazů lidé položí a jak dlouhé budou. To se před spuštěním vědět nedá — a po spuštění se to mění podle toho, jak se aplikace používá. Odhad má smysl jako řádové číslo, ne jako rozpočet.
Rozumnější postup je jiný: pustit funkci na malou skupinu, změřit skutečnou spotřebu na jednoho uživatele a teprve z toho počítat. O výběru modelu a jeho ceně jsme psali samostatně.
Co náklady opravdu sníží
Ne vyjednávání s dodavatelem. Tyhle čtyři věci:
- Cache na opakované dotazy. V zákaznické podpoře se velká část dotazů opakuje. Odpověď, kterou už jednou model vytvořil, netřeba tvořit znovu.
- Menší kontext. Místo celé dokumentace pošlete jen ty pasáže, kterých se dotaz týká. To je právě úkol vyhledávací vrstvy (RAG).
- Správný model na správný krok. Rozbijte úlohu a drahý model nechte jen na tu část, která ho opravdu potřebuje.
- Stropy. Limit na jednotlivý požadavek i na období. Ne proto, že čekáte problém, ale proto, že chyba v cyklu umí spálit měsíční rozpočet za hodinu.
Měřte na úrovni funkce, ne faktury
Faktura od poskytovatele vám řekne jedno číslo. To je na rozhodování málo. Užitečné je vědět, která funkce kolik spotřebuje — pak víte, jestli se vyplatí optimalizovat, nebo ji rovnou vypnout, protože ji nikdo nepoužívá.
Upozornění na neobvyklou spotřebu k tomu patří. Rozdíl mezi „víme o tom za dvě hodiny" a „víme o tom z vyúčtování" je rozdíl mezi drobností a nepříjemným měsícem.
Tohle všechno je součástí toho, jak provozujeme AI aplikace — a pokud řešíte, jestli to vůbec stavět ve vlastní režii, podívejte se na srovnání cloudu a vlastního serveru.
Řešíte něco podobného ve vaší firmě?
Chci nezávaznou konzultaci