Mayormente verdadero
La afirmación de que la reducción de costos de tokens en los grandes modelos de lenguaje (LLM) depende del prompt caching y la compresión como tecnologías centrales resulta sustancialmente cierta, aunque con matices: existen medios oficiales equivalentes, como la selección de modelos, y la compresión ofrece un abanico de proveedores más limitado que el caching.
El prompt caching permite reutilizar fragmentos de contexto ya procesados, evitando cobros repetidos por los mismos tokens de entrada. La compresión, por su parte, reduce el volumen de tokens enviados al modelo. Microsoft ha desarrollado en esta línea la biblioteca LLMLingua, cuya documentación ilustra cómo la compresión de prompts disminuye el número de tokens facturados manteniendo la utilidad de las respuestas.
Ambas técnicas son citadas habitualmente como las palancas principales para abaratar el uso de LLM en entornos productivos, donde el costo por token se multiplica con el volumen de consultas.
La afirmación no es absoluta. La selección de modelos constituye un medio oficial igualmente válido de reducir costos: optar por modelos más económicos para tareas sencillas logra el mismo objetivo sin recurrir al caching ni a la compresión. Además, mientras el prompt caching está ofrecido por un número creciente de proveedores, la compresión de prompts proviene de un abanico de oferentes más restringido, lo que limita su aplicabilidad general.
En síntesis, el caching y la compresión son efectivamente tecnologías clave para reducir el costo de los tokens, pero coexisten con otros mecanismos oficiales como la elección del modelo. En conjunto, la afirmación es Mayormente verdadero.