Gratis · Sin registro EN

El compresor de prompts
que demuestra que no rompió tu prompt.

El código, las cadenas de texto entre comillas, las URLs y las variables de plantilla nunca se tocan — por construcción, no por suerte. Cada compresión viene con un checklist que muestra exactamente qué instrucciones sobrevivieron. Funciona con ChatGPT, Claude, Gemini y cualquier LLM.

📊 Ver los números reales 🌟 Apoya el proyecto 💻 Ver el código fuente
0 servidor
el modo rápido nunca sale de tu navegador
Verificado
checklist de restricciones, no una promesa

Cómo funciona PromptTrim

Tres modos de compresión según lo que necesites

Modo rápido (gratis)

Compresión basada en reglas. Elimina muletillas, frases redundantes y patrones verbosos al instante — sin necesidad de clave de API.

🤖

Modo IA (Anthropic · OpenAI · Gemini)

Tu modelo reescribe el prompt, un segundo modelo audita el resultado contra cada restricción, y lo que se pierde se repara automáticamente. Usa tu propia clave.

🧪

Modo ML local (experimental)

Un modelo pequeño (TinyBERT, LLMLingua-2) comprime enteramente en tu navegador — sin clave de API, nada sale de tu equipo. Su salida siempre pasa por las mismas regiones protegidas y el mismo libro de restricciones — mira los números reales para entender por qué eso importa.

📊

Análisis de tokens

Ve el conteo exacto de tokens antes y después, y lo que cuesta cada llamada — incluida la propia llamada de compresión, con su precio mostrado antes de ejecutarla.

🔒

100% privado

Tus prompts nunca tocan nuestros servidores — porque no existen. Las claves de API se usan solo en tu sesión de navegador actual y nunca se nos envían.

Los números reales

Ningún porcentaje inventado. Generado por npm run bench sobre 40 prompts reales en bench/corpus/, antes de cada release.

Generado por npm run bench el 2026-09-05. Tokens contados con el tokenizador real o200k (js-tiktoken) — nunca estimados. El libro de restricciones se aplica en todos los niveles aquí (el valor por defecto del producto solo lo aplica en Aggressive), así que los cambios bloqueados son visibles en los tres.

System prompts de estilo producción (40 prompts)

bench/corpus/phase0 + bench/corpus/phase2 — fixtures de regresión escritos para ser ya cuidadosos. Una reducción casi nula aquí es el resultado esperado: no se inventa nada que recortar.

NivelReducción media de tokensReducción agregada de tokensRestricciones críticas preservadasCambios bloqueados por el libro
Light0.0%0.0% (4,523 → 4,523)100.0% (434/434)0
Balanced1.4%0.7% (4,523 → 4,491)100.0% (434/434)0
Aggressive1.6%0.9% (4,523 → 4,484)100.0% (434/434)0

Prompts cotidianos de chat (10 prompts)

bench/corpus/phase6 — peticiones sin diseñar, con los marcos y muletillas que la gente escribe sin pensarlo.

NivelReducción media de tokensReducción agregada de tokensRestricciones críticas preservadasCambios bloqueados por el libro
Light0.0%0.0% (2,426 → 2,426)100.0% (60/60)0
Balanced9.0%8.9% (2,426 → 2,209)100.0% (60/60)0
Aggressive12.3%12.2% (2,426 → 2,129)100.0% (60/60)0

Modo IA no medido para: Anthropic, OpenAI, Google Gemini. No se publica ningún porcentaje para un proveedor que no fue realmente llamado.

Modo ML local (TinyBERT vía LLMLingua-2, inferencia real en el dispositivo), nivel Balanced, muestra de 3 prompts del corpus cotidiano:

Restricciones críticas preservadasViolaciones de regiones protegidas
25.0% (5/20)0/8

Qué NO hace PromptTrim

Honestidad como característica, no como descargo de responsabilidad. Cada punto de abajo es una limitación real y actual de este código, tal como está hoy.

🚫

No toca las regiones protegidas

Los bloques de código, el código en línea, las cadenas entre comillas, las URLs, las variables de plantilla y los ejemplos few-shot quedan excluidos de cada regla por construcción — no "normalmente se saltan", ni siquiera se le ofrecen a una regla como candidato.

🚫

No borra palabras de instrucción

"never", "always", "must", "only", "step by step" y cualquier cosa similar nunca se eliminan, en ningún nivel. packages/core/src/rules/discarded.ts enumera cada regla de la app anterior que hacía esto, y por qué se descartó.

🚫

No demuestra que se preservó todo el significado

El libro de restricciones verifica que ciertas restricciones (prohibiciones, formatos, números, literales citados, variables) sobreviven — no que el prompt comprimido se lea idéntico para una persona. Revisa siempre la salida en modo Aggressive antes de usarla en producción.

🚫

No envía los prompts del modo rápido a ningún lado

No hay backend. El modo rápido comprime en tu pestaña del navegador y nada sale de ella. El modo IA va directo de tu navegador al proveedor que elijas, con tu propia clave — nunca a través de un servidor de PromptTrim, porque no existe ninguno.

🚫

Todavía no verifica restricciones en todos los idiomas

La detección de prohibiciones, requisitos y formatos del libro de restricciones es solo en inglés por ahora. Un prompt en español u otro idioma sigue teniendo la protección de regiones protegidas, pero no ese checklist — es una limitación conocida y documentada, no oculta.

🚫

No ejecuta el modo lote con IA

El modo lote (varios prompts separados por ---) es solo modo rápido. Disparar un número ilimitado de llamadas de API pagas desde un solo clic no debería pasar por accidente.

🚫

No confía en la salida del modo ML local por sí sola

LLMLingua-2 descarta tokens por importancia estadística, no por significado — nuestro propio benchmark de arriba midió que preserva solo el 25% de las restricciones críticas sin ayuda. Por eso está marcado como experimental: las regiones protegidas y el libro de restricciones por los que siempre pasa son lo que lo hace utilizable, no una afirmación de que el modelo en sí sea confiable.

¿Comprimir o cachear?

Comprimir un prompt ahorra 15–30% una vez. Cachear su prefijo estático ahorra cerca de 90% en cada llamada repetida. PromptTrim te dice cuál vale la pena.

✂️

Comprimir es un gasto único

Reescribir elimina el relleno y se detiene ahí. Un prompt más corto es más barato en cada llamada, pero el techo es el relleno que tenía el prompt — típicamente 15–30%, y nada de eso sale del código, JSON o ejemplos que PromptTrim se niega a tocar.

Cachear se repite

Un acierto de caché cuesta 10% del precio de entrada en Anthropic, OpenAI y Gemini por igual. Escribir la caché cuesta 1.25× el precio de entrada para una vida de 5 minutos, o 2× para una hora — así que se paga solo desde la 2ª llamada, o la 3ª para la caché de una hora.

⚠️

Una fecha puede matarla en silencio

Una caché solo coincide con un prefijo idéntico. La fecha de hoy, un id de petición o una variable de plantilla al inicio de un system prompt cambian esos bytes en cada llamada: sin acierto de caché, sin error, precio completo. PromptTrim los encuentra y ofrece moverlos debajo del punto de corte.

📏

Y los mínimos son reales

Nada más corto que 512 tokens cachea en Claude Opus 5, 1,024 en Sonnet 5, 4,096 en Haiku 4.5, 1,024 en GPT-5.6 en adelante (2,048 antes) y 2,048 en Gemini 2.5. Por debajo de eso, cachear no hace nada — en silencio.

Precios y reglas de caché verificados el 2026-09-03 contra la documentación oficial de Anthropic, OpenAI y Google.

Preguntas frecuentes

¿Funciona con cualquier modelo de IA?
Sí. Los prompts comprimidos funcionan con ChatGPT (GPT-4o, GPT-4.1), Claude (Sonnet, Haiku, Opus), Gemini, Mistral y cualquier LLM. Los tokens se cuentan de forma similar en todos los proveedores principales.
¿Mis datos son privados?
En modo rápido y en modo ML local, la compresión ocurre 100% en tu navegador — nada sale de tu equipo (el modo ML local descarga un modelo pequeño una vez y después funciona totalmente sin conexión). En modo IA, tu prompt se envía directamente desde tu navegador al proveedor que elijas (Anthropic, OpenAI o Google) usando tu propia clave de API. La clave permanece en memoria a menos que marques "Recordar en este navegador", que la guarda en sessionStorage hasta que cierres la pestaña. Nunca vemos tus prompts ni tus claves.
¿Cuánto puedo ahorrar?
Depende por completo de cuánto relleno tenga ya el prompt — mira los números reales arriba, generados por npm run bench. Un system prompt ya cuidado apenas se reduce en modo rápido, y eso es correcto: no queda nada seguro que recortar. Un prompt verboso y sin editar, lleno de cortesías y marcos de petición, suele comprimirse notablemente más. El modo IA todavía no tiene benchmark con proveedores reales (ver la nota sobre las tablas); no se publica ningún porcentaje para él hasta que lo tenga.
¿Siempre conviene comprimir?
No, y PromptTrim te lo dice. Si el mismo prefijo estático se envía miles de veces al día, cachear el prompt recorta cerca de 90% en cada llamada después de la primera, mientras que comprimir recorta 15-30% una sola vez. El Cost Advisor calcula ambos contra tu propio volumen de llamadas y recomienda el más barato — incluyendo "no comprimas, reordena estas secciones y cachea".
¿Puedo confiar en el modo ML local?
No por sí solo — por eso está marcado como experimental. Ejecuta un modelo pequeño (TinyBERT, LLMLingua-2) enteramente en tu navegador, sin ninguna noción de lo que está recortando; nuestro propio benchmark midió que preserva solo el 25% de las restricciones críticas sin ayuda. Lo que lo hace utilizable es que su salida siempre pasa por las mismas regiones protegidas y el mismo libro de restricciones que el modo rápido y el modo IA, así que cada pérdida aparece como un ✗ que puedes restaurar con un clic, en vez de un prompt corrompido en silencio.
¿La compresión cambia lo que hace la IA?
Pueden darse diferencias leves, sobre todo en modo Aggressive. El modo Balanced está diseñado para preservar toda la intención y el contexto del prompt original. Revisa siempre la salida antes de usarla en producción.
¿Cómo se calcula el conteo de tokens?
Depende del modelo objetivo que elijas. Para modelos de OpenAI ejecutamos el tokenizador real o200k en tu navegador, así que el conteo es exacto. Para Gemini, si ingresas tu clave de API obtienes un conteo exacto del endpoint countTokens de Google; sin clave cae a una estimación, igual que Claude, que no tiene un tokenizador público para el navegador.
¿Cómo sé que no perdió nada?
No tienes que confiar en la promesa: revisa el checklist. Antes de comprimir, PromptTrim extrae cada prohibición, requisito, formato de salida, número y literal citado de tu prompt. Después de comprimir, verifica cada uno contra el resultado y te muestra un ✓ o un ✗ — con un botón de Restaurar junto a cualquier cosa que se haya perdido. Esa verificación corre siempre en tu navegador, en modo rápido, IA y ML local por igual, y en modo IA además decide el resultado final por encima de lo que diga el modelo.