Ugrás a tartalomhoz
100% helyi

LLM kontextustömörítő

Csökkentse a beillesztett szöveget vagy kódot, így kevesebb tokenbe kerül, mielőtt elküldi egy LLM-nek.

Bemenet
Kimenet

LLM kontextustömörítő

Illessze be a kódot vagy a prózát, amelyet el szeretne küldeni egy LLM-nek, és ez az eszköz levágja azokat a részeket, amelyek tokenbe kerülnek, anélkül, hogy jelentőségük lenne, így a kontextusból származó költségvetésből több jut a modellnek ténylegesen szükséges tartalomra. Arra a mindennapi munkára készült, hogy fájlt, naplót vagy hosszú utasításblokkot illesszen be egy csevegőablakba, és figyelje a tokenszám emelkedését.

Négy kapcsoló szabályozza, hogy mi kerüljön eltávolításra. A „Strip code comments” törli a // , # és -- soros megjegyzéseket, valamint a /* */ blokk megjegyzéseket – hasznos, ha olyan forrásfájlokat illeszt be, amelyekhez a megjegyzések embereknek, nem pedig a modellnek szólnak. Az „Üres sorok és a záró szóközök összecsukása” eggyel csökkenti az üres sorok számát, és levágja a szóközöket minden sor végén. A "szalag redundáns behúzás" eltávolítja a minden soron megosztott vezető szóközt, így egy szerkesztőből beillesztett mélyen beágyazott kódblokk nem pazarolja a tokeneket a behúzásra, a modellnek nem kell reprodukálnia a struktúrát. A "kitöltő/leállító szavak eltávolítása a prózában" a legagresszívabb lehetőség: törli a fedezetek és funkciószavak könnyű listáját – nagyon, alapvetően, csak, valahogy, annak érdekében és hasonlók – a hétköznapi mondatokból, ezért alapértelmezés szerint ki van kapcsolva, és a legjobb, ha a prózának van fenntartva, nem pedig a kódnak.

A kimenet alatti élő számláló karaktereket és becsült tokenszámot mutat előtte és utána, valamint a mentett százalékos arányt, így láthatja az egyes kapcsolók hatását, amikor megfordítja őket. A token becslés durva karakteralapú közelítés (körülbelül négy karakter tokenenként), nem egy konkrét modell tokenizátorából származó pontos szám – a relatív megtakarítások megítéléséhez hasznos, nem pedig a pontos költségvetés eléréséhez.

Minden egyszerű szövegként és reguláris kifejezésként fut a böngészőben: nincs kódelemző, nincs AST, és semmi, amit beilleszt, soha nem kerül fel sehova. Ez biztonságossá teszi a privát forráskód, a belső dokumentáció vagy a vázlatkérdések futtatását, mielőtt elhagyják a gépet.

Gyakori kérdések

Ez megváltoztatja a kódom működését?
Az alapértelmezett kapcsolók (a megjegyzések kivágása, az üres sorok összecsukása, a behúzás csíkozása) csak a szóközöket és a megjegyzéseket távolítják el, így a kód viselkedését ez nem érinti. A „Remove filler/stop words” átírja a prózát, és nem kódra való – hagyja ki a forrásfájlok beillesztésekor.
Mennyire pontos a token számlálás?
Ez egy becslés, amely tokenenként nagyjából négy karakteren alapul, ami az angol szöveg általános ökölszabálya. A különböző modellek eltérően tokenizálnak, ezért a számot a relatív megtakarítások iránymutatójaként kell kezelni, nem pedig pontos számként.
Miért rossz a megjegyzések eltávolítása néha szokatlan kódon?
Az eszköz sima regex-et használ, nem nyelvi elemzőt, ezért a karakterlánc-literálon belüli `//` vagy `#` időnként összetéveszthető egy megjegyzésjelölővel. Tekintse át a kimenetet, mielőtt beilleszti a gyártási kódot máshová.
Használhatom markdown-re vagy sima prózára, nem csak kódra?
Igen. Kapcsolja ki a „Kódos megjegyzések” funkciót, ha a szöveg a # karaktert használja a markdown fejlécekhez, nem pedig a megjegyzésekhez, és kapcsolja be a „Kitöltő/leállítási szavak eltávolítása” lehetőséget, hogy kivágja a fedezeti nyelvet a prózából.
Fel van töltve valahova a szövegem?
Nem. A tömörítés teljes egészében a böngészőben fut egyszerű karakterlánc-feldolgozással – a szöveg soha nem hagyja el az eszközt.