Preskočiť na obsah
100% lokálne

LLM kontextový kompresor

Pred odoslaním do LLM zmenšite prilepený text alebo kód, aby to stálo menej tokenov.

Vstup
Výstup

LLM kontextový kompresor

Prilepte kód alebo prózu, ktorú sa chystáte odoslať do LLM, a tento nástroj orezáva časti, ktoré stoja tokeny, bez toho, aby mali veľký význam, takže väčšia časť vášho kontextového rozpočtu ide na obsah, ktorý model skutočne potrebuje. Je stvorený na každodenné vkladanie súboru, denníka alebo dlhého bloku s pokynmi do okna rozhovoru a sledovanie stúpajúceho počtu tokenov.

Štyri prepínače ovládajú, čo sa odstráni. "Odstrániť komentáre kódu" vymaže // , # a -- riadkové komentáre plus /* */ blokové komentáre – užitočné, keď vkladáte zdrojové súbory tam, kde sú komentáre určené pre ľudí, nie pre model. "Zbaliť prázdne riadky a medzery na konci" znižuje počet prázdnych riadkov na jeden a orezáva prázdne miesta na konci každého riadku. "Redundantné odsadenie pásika" odstraňuje začiatočné medzery, ktoré zdieľa každý riadok, takže hlboko vnorený blok kódu vložený z editora neplytvá tokenmi na odsadenie, model nepotrebuje reprodukovať štruktúru. „Odstrániť výplňové/zastavovacie slová v próze“ je najagresívnejšia možnosť: odstráni jednoduchý zoznam hedgeov a funkčných slov – veľmi, v podstate, len, tak, aby a podobne – z bežných viet, a preto je predvolene vypnutý a najlepšie vyhradený skôr pre prózu než kód.

Živý záznam pod výstupom zobrazuje znaky a odhadovaný počet tokenov pred a po, plus uložené percento, takže môžete vidieť účinok každého prepínača, keď ho preklopíte. Odhad tokenu je približná aproximácia založená na znakoch (približne štyri znaky na token), nie presný počet z tokenizéra žiadneho konkrétneho modelu – užitočné na posúdenie relatívnych úspor, nie na dosiahnutie presného rozpočtu.

Všetko beží ako obyčajný text a spracovanie regulárneho výrazu vo vašom prehliadači: neexistuje žiadny analyzátor kódu, žiadne AST a nič, čo vložíte, sa nikdy nikam neodovzdáva. Vďaka tomu je bezpečné spúšťať súkromný zdrojový kód, internú dokumentáciu alebo návrhy návrhov predtým, ako opustia váš počítač.

Časté otázky

Zmení to to, čo robí môj kód?
Predvolené prepínače (odstrániť komentáre, zbaliť prázdne riadky, odsadenie odrezkov) odstraňujú iba medzery a komentáre, takže správanie kódu nie je ovplyvnené. „Odstrániť výplňové/zastavovacie slová“ prepisuje prózu a nie je určené pre kód – pri vkladaní zdrojových súborov ho nechajte vypnuté.
Aký presný je počet tokenov?
Ide o odhad založený na približne štyroch znakoch na token, čo je bežné pravidlo pre anglický text. Rôzne modely sa tokenizujú odlišne, preto číslo berte ako vodítko k relatívnym úsporám, nie ako presný počet.
Prečo je niekedy odstraňovanie komentárov v nezvyčajnom kóde nesprávne?
Nástroj používa obyčajný regulárny výraz, nie jazykový analyzátor, takže `//` alebo `#` v reťazcovom literáli môžu byť občas zamenené za značku komentára. Pred vložením výrobného kódu inam skontrolujte výstup.
Môžem ho použiť na markdown alebo na obyčajnú prózu, nielen na kód?
áno. Ak váš text používa znak # pre nadpisy markdown namiesto komentárov, vypnite možnosť „Odstrániť komentáre v kóde“ a zapnite možnosť „Odstrániť výplňové/zastavovacie slová“, aby ste z prózy odstránili zaisťovací jazyk.
Je môj text niekde nahraný?
Nie. Kompresia prebieha výlučne vo vašom prehliadači pomocou spracovania jednoduchých reťazcov – váš text nikdy neopustí vaše zariadenie.