Jazykové modely · Článok
Čo sú tokeny a kontextové okno
Tokeny sú jednotky, s ktorými jazykový model počíta. Kontextové okno určuje, koľko textu môže model naraz zohľadniť.
Token je základná jednotka, ktorú jazykový model spracúva. Nie je to vždy celé slovo. Token môže byť slovo, časť slova, interpunkcia alebo krátky znakový úsek. Napríklad dlhšie slovenské slovo sa môže rozdeliť na viac tokenov, zatiaľ čo časté krátke slová môžu byť samostatné tokeny.
Prečo modely nepoužívajú priamo slová
Prirodzený jazyk má veľa tvarov slov, preklepov, mien a technických výrazov. Ak by model pracoval iba s celými slovami, slovník by rástol veľmi rýchlo a neznáme slová by boli problém. Subword tokenizácia tento problém zmierňuje: zriedkavé slovo sa dá zložiť z menších častí, ktoré model pozná.
Čo je kontextové okno
Kontextové okno je množstvo tokenov, ktoré model môže naraz zohľadniť pri odpovedi. Do okna sa počíta zadanie používateľa, systémové inštrukcie, predchádzajúca konverzácia, vložené dokumenty aj odpoveď, ktorú model generuje. Väčšie okno umožní pracovať s dlhším materiálom, ale nie je automatickou zárukou lepšej odpovede.
Praktický dôsledok
Keď sa do promptu vloží veľa textu, model nemusí rovnomerne využiť všetky časti. Dôležité informácie treba pomenovať jasne, štruktúrovať ich a pri dlhých dokumentoch použiť výber relevantných pasáží. Preto RAG systémy najprv vyhľadajú vhodné úseky a až potom ich pošlú modelu.
Častý omyl
Tokeny nie sú významové pojmy. Tokenizér rozdeľuje text technicky, nie podľa toho, ako človek chápe tému. Model sa následne učí štatistické vzťahy medzi tokenmi v dátach. Preto môže model dobre pracovať s významom v praxi, ale token samotný ešte význam nenesie ako slovníková definícia.
Ako s tým pracovať
Pri písaní promptov používaj jasné odseky, názvy sekcií a krátke vstupy bez zbytočnej vaty. Ak potrebuješ spracovať veľký dokument, najprv ho rozdeľ na časti alebo použi vyhľadávanie podľa relevantnosti. Pri dôležitých úlohách vždy kontroluj, či model čerpal zo správnej časti kontextu.
Zdroje a kontrola reality
- Primárny zdroj: Sennrich et al., Neural Machine Translation of Rare Words with Subword Units, https://arxiv.org/abs/1508.07909
- Podporný zdroj: Kudo and Richardson, SentencePiece, https://arxiv.org/abs/1808.06226
- Podporný zdroj: Vaswani et al., Attention Is All You Need, https://arxiv.org/abs/1706.03762