Saltar al contenido

Compresor de contexto LLM

Reduzca el texto o código pegado para que cueste menos tokens antes de enviarlo a un LLM.

Entrada
Salida

Compresor de contexto LLM

Pegue el código o la prosa que está a punto de enviar a un LLM y esta herramienta recorta las partes que cuestan tokens sin tener mucho significado, por lo que una mayor parte de su presupuesto contextual se destina al contenido que el modelo realmente necesita. Está diseñado para la tarea diaria de pegar un archivo, un registro o un bloque de instrucciones largo en una ventana de chat y observar cómo aumenta el recuento de tokens.

Cuatro controles controlan lo que se elimina. "Eliminar comentarios de código" elimina // , # y -- comentarios de línea más /* */ comentarios de bloque: resulta útil cuando se pegan archivos fuente donde los comentarios son para humanos, no para el modelo. "Contraer líneas en blanco y espacios finales" reduce las líneas vacías a una y recorta los espacios en blanco perdidos al final de cada línea. "Eliminar sangría redundante" elimina el espacio en blanco inicial que comparte cada línea, por lo que un bloque de código profundamente anidado pegado desde un editor no desperdicia tokens en sangría; el modelo no necesita reproducir la estructura. "Eliminar palabras de relleno o vacías en prosa" es la opción más agresiva: elimina una lista liviana de coberturas y palabras funcionales (muy, básicamente, solo, algo así, para y similares) de oraciones comunes, razón por la cual está desactivada de manera predeterminada y es mejor reservarla para prosa en lugar de código.

El recuento en vivo debajo del resultado muestra los caracteres y un recuento estimado de tokens antes y después, además del porcentaje ahorrado, para que puedas ver el efecto de cada cambio a medida que lo giras. La estimación del token es una aproximación aproximada basada en caracteres (aproximadamente cuatro caracteres por token), no un recuento exacto del tokenizador de ningún modelo específico, lo que resulta útil para juzgar los ahorros relativos, no para alcanzar un presupuesto exacto.

Todo se ejecuta como texto sin formato y regex en su navegador: sin analizador de código ni AST, y nada de lo que pega se carga a ningún sitio. Por eso es seguro con código fuente privado o borradores antes de salir de su máquina.

Preguntas frecuentes

¿Esto cambiará lo que hace mi código?
Las opciones predeterminadas (eliminar comentarios, contraer líneas en blanco, eliminar sangría) solo eliminan espacios en blanco y comentarios, por lo que el comportamiento del código no se ve afectado. "Eliminar palabras vacías/de relleno" reescribe la prosa y no está destinado al código; déjelo desactivado al pegar archivos fuente.
¿Qué tan preciso es el recuento de tokens?
Es una estimación basada en aproximadamente cuatro caracteres por ficha, una regla general común para el texto en inglés. Los diferentes modelos tokenizan de manera diferente, así que trate el número como una guía de ahorros relativos, no como un recuento exacto.
¿Por qué a veces la eliminación de comentarios es incorrecta en código inusual?
La herramienta utiliza expresiones regulares simples, no un analizador de lenguaje, por lo que `//` o `#` dentro de una cadena literal en ocasiones puede confundirse con un marcador de comentario. Revise el resultado antes de pegar el código de producción en otro lugar.
¿Puedo usarlo en markdown o en prosa simple, no solo en código?
Sí. Desactive "Eliminar comentarios de código" si su texto usa # para los encabezados markdown en lugar de comentarios, y active "Eliminar palabras de relleno o vacías" para eliminar el lenguaje de cobertura de la prosa.
¿Mi texto está subido a alguna parte?
No. La compresión se ejecuta completamente en su navegador mediante el procesamiento de cadenas simples: su texto nunca sale de su dispositivo.