Jazykové modely · Článok

Čo sú tokeny a kontextové okno

Tokeny sú jednotky, s ktorými jazykový model počíta. Kontextové okno určuje, koľko textu môže model naraz zohľadniť.

Začiatočník7 minOverené: 2026-07-16

Redakčné hodnotenie

4,5 / 5

Stav reality: Overené zdrojmi · vysoká istota

Subjektívne redakčné hodnotenie podľa metodiky. Nie je to objektívna pravda ani hlasovanie používateľov.

Stabilná téma vysvetlená bez preháňania. Text oddeľuje tokenizáciu od porozumenia a upozorňuje na limity dlhého kontextu.

Realita a faktická správnosť
4,8
Zdroje a overiteľnosť
4,4
Edukačná jasnosť
4,7
Pokrytie cieľa
4,4
Štruktúra a navigácia
4,5
Praktická užitočnosť
4,4
Aktuálnosť
4,5
Stručnosť / bez vaty
4,6

Metodika: Ako hodnotíme články · kontrola 2026-07-16 · education-rating-v1

Token je základná jednotka, ktorú jazykový model spracúva. Nie je to vždy celé slovo. Token môže byť slovo, časť slova, interpunkcia alebo krátky znakový úsek. Napríklad dlhšie slovenské slovo sa môže rozdeliť na viac tokenov, zatiaľ čo časté krátke slová môžu byť samostatné tokeny.

Prečo modely nepoužívajú priamo slová

Prirodzený jazyk má veľa tvarov slov, preklepov, mien a technických výrazov. Ak by model pracoval iba s celými slovami, slovník by rástol veľmi rýchlo a neznáme slová by boli problém. Subword tokenizácia tento problém zmierňuje: zriedkavé slovo sa dá zložiť z menších častí, ktoré model pozná.

Čo je kontextové okno

Kontextové okno je množstvo tokenov, ktoré model môže naraz zohľadniť pri odpovedi. Do okna sa počíta zadanie používateľa, systémové inštrukcie, predchádzajúca konverzácia, vložené dokumenty aj odpoveď, ktorú model generuje. Väčšie okno umožní pracovať s dlhším materiálom, ale nie je automatickou zárukou lepšej odpovede.

Praktický dôsledok

Keď sa do promptu vloží veľa textu, model nemusí rovnomerne využiť všetky časti. Dôležité informácie treba pomenovať jasne, štruktúrovať ich a pri dlhých dokumentoch použiť výber relevantných pasáží. Preto RAG systémy najprv vyhľadajú vhodné úseky a až potom ich pošlú modelu.

Častý omyl

Tokeny nie sú významové pojmy. Tokenizér rozdeľuje text technicky, nie podľa toho, ako človek chápe tému. Model sa následne učí štatistické vzťahy medzi tokenmi v dátach. Preto môže model dobre pracovať s významom v praxi, ale token samotný ešte význam nenesie ako slovníková definícia.

Ako s tým pracovať

Pri písaní promptov používaj jasné odseky, názvy sekcií a krátke vstupy bez zbytočnej vaty. Ak potrebuješ spracovať veľký dokument, najprv ho rozdeľ na časti alebo použi vyhľadávanie podľa relevantnosti. Pri dôležitých úlohách vždy kontroluj, či model čerpal zo správnej časti kontextu.

Zdroje a kontrola reality

Súvisiace

Zatiaľ tu nič nie je. Skús zmeniť filter alebo vyhľadávanie.