ESCRÍBENOS: contacto@techplanet.es

Tech Planet

  • HARDWARE
  • SOFTWARE
  • PERIFÉRICOS
  • FORMACIÓN
  • PRODUCTIVIDAD
  • NOTICIAS
  • PRESUPUESTOS PC
  • GUÍAS
  • RANKINGS
  • Inicio
  • Software
  • Tokens, contexto y ventana de contexto: vocabulario básico de la IA

Tokens, contexto y ventana de contexto: vocabulario básico de la IA

Una fila de bloques de colores de distintos anchos avanza por un raíl; los que están dentro de un marco de luz azul se ven encendidos y los que han salido por la derecha, grises. Imagen generada con IA.
lunes, 05 octubre 2026 / Publicado en Software, Todas las noticias

Tokens, contexto y ventana de contexto: vocabulario básico de la IA

Quien usa un chatbot a diario acaba oyendo dos palabras una y otra vez: tokens y ventana de contexto. El token es la unidad en la que un modelo de lenguaje lee y escribe. La ventana de contexto, como la define la documentación de Anthropic, es todo el texto que el modelo puede tener en cuenta al responder, incluida la propia respuesta: una especie de «memoria de trabajo», distinta de los datos con los que se entrenó.

Repasamos qué es cada cosa, por qué el mismo texto no ocupa lo mismo en todos los modelos, qué pasa cuando la ventana se llena y por qué más contexto no es automáticamente mejor, con la documentación de Anthropic, Google, Microsoft y Hugging Face consultada el 2 de octubre de 2026.

Contenidos ocultar
1 Qué es un token y cuánto texto cabe en uno
2 El tokenizador: por qué el mismo texto no siempre ocupa lo mismo
3 Contexto y ventana de contexto
4 Qué pasa cuando la ventana se llena
5 Entrada frente a salida máxima
6 Por qué todo se mide en tokens y cómo contarlos
7 Por qué más ventana no es automáticamente mejor
8 El vocabulario, de un vistazo
9 Te puede interesar

Qué es un token y cuánto texto cabe en uno

Un modelo de lenguaje no lee el texto tal y como lo escribimos. Antes de procesar nada, un tokenizador divide el texto en trozos llamados tokens. La guía de Microsoft sobre tokens explica que esos trozos pueden ser «palabras, juegos de caracteres o combinaciones de palabras y puntuación». El glosario de Anthropic los define como «las unidades individuales más pequeñas de un modelo de lenguaje», que pueden corresponder a palabras, fragmentos de palabras, caracteres o incluso bytes.

La lógica es sencilla: las palabras frecuentes se quedan enteras y las raras se trocean. El curso de Hugging Face sobre tokenizadores lo ilustra en español: «extrañamente» podría tratarse como palabra rara y descomponerse en «extraña» y «mente». La documentación de Gemini añade que el conjunto de tokens que usa un modelo se llama vocabulario, y el proceso de partir el texto, tokenización.

¿Y cuánto texto es un token? Anthropic calcula que, para Claude, un token representa unos 3,5 caracteres en inglés, y avisa de que el número exacto puede cambiar con el idioma. Google da su cuenta para Gemini: alrededor de 4 caracteres por token, y 100 tokens equivalen a entre 60 y 80 palabras en inglés. Ojo a ese «en inglés» que acompaña a la cifra de Claude y a la de palabras de Gemini: están dadas para ese idioma, no para el español.

Y no solo se tokeniza el texto. Google indica que en la API de Gemini pasan a tokens todas las entradas y salidas, imágenes y audio incluidos: una imagen de hasta 384 píxeles por lado cuenta como 258 tokens, y el audio suma 32 tokens por segundo.


El tokenizador: por qué el mismo texto no siempre ocupa lo mismo

Primera trampa: no hay un tokenizador universal. Microsoft explica que el método cambia de un modelo a otro y lo ilustra con una frase corta en inglés: partida por palabras da nueve tokens; partida por caracteres, 34, espacios incluidos.

Hugging Face explica por qué cada modelo necesita el suyo: hay que usar las mismas reglas y el mismo vocabulario con los que se preentrenó. Su guía de tokenizadores de Transformers muestra además que el idioma pesa: las versiones estándar de BPE y Unigram, dos de los tres algoritmos de subpalabras que admite Transformers, dan por hecho que los espacios separan palabras, algo que no sirve para el chino o el japonés, que no los usan; en cambio, dividir en subpalabras resulta especialmente útil en idiomas como el turco, que forma palabras largas encadenando trozos.

Ni siquiera hace falta cambiar de empresa para que la cuenta varíe. En su página sobre el conteo de tokens, Anthropic advierte de que Claude 4.7 y posteriores, además de Claude Mythos Preview, usan un tokenizador más reciente con el que el mismo texto produce aproximadamente un 30 % más de tokens que en los modelos anteriores. Su consejo: volver a contar con el modelo que se vaya a usar en lugar de reutilizar recuentos hechos con modelos anteriores.


Contexto y ventana de contexto

Anthropic detalla qué cuenta dentro de la ventana: las instrucciones del sistema, cada mensaje (con los resultados de herramientas, las imágenes y los documentos), las definiciones de herramientas y también la salida que Claude genera en ese turno, incluido su «pensamiento extendido». Microsoft y Google coinciden en que la ventana suele funcionar como un límite combinado de entrada y salida: lo que escribes y lo que el modelo contesta comparten el mismo espacio.

En una conversación larga con un chatbot eso se nota. Cada mensaje tuyo y cada respuesta del asistente se van acumulando en la ventana, y los turnos anteriores se conservan completos: cada pregunta nueva viaja con todo el historial previo. Un documento largo pegado al principio no ocupa sitio una sola vez; en principio, sigue ahí en los turnos siguientes.

Google lo compara con la memoria a corto plazo: una persona solo puede guardar en ella una cantidad limitada de información, y a los modelos generativos les pasa lo mismo. Para hacerse una idea de la escala, su guía de contexto largo calcula que en un millón de tokens caben 50.000 líneas de código de 80 caracteres, ocho novelas en inglés de longitud media o las transcripciones de más de 200 episodios de pódcast de duración media.


Qué pasa cuando la ventana se llena

Depende de dónde estés. En la API de Claude, si la entrada por sí sola ya supera la ventana del modelo, Anthropic explica que la petición se rechaza con un error 400 en todos los modelos, con el aviso «prompt is too long» (la petición es demasiado larga). Si lo que se pasa es la suma de la entrada y la salida máxima pedida, en Claude 4.5 y posteriores la API acepta la petición y la generación se detiene al llegar al límite de la ventana; en los modelos anteriores, devuelve un error de validación.

En un chatbot la cosa cambia. Anthropic indica que interfaces como claude.ai pueden gestionar la ventana de forma continua con el principio de «primero en entrar, primero en salir». Por eso, en una charla muy larga, puede parecer que el asistente ha olvidado lo que le contaste al principio. Otra vía es la compactación, que resume automáticamente en el servidor las partes antiguas de la conversación para que pueda seguir más allá del límite.

Con ventanas más limitadas, Google cita estrategias como descartar mensajes antiguos, resumir contenido, filtrar instrucciones para ahorrar tokens o usar RAG con bases de datos vectoriales, que el glosario de Anthropic describe como complementar el modelo con una base de conocimiento externa o un conjunto de documentos que se pasa a la ventana de contexto.


Entrada frente a salida máxima

La ventana no es la única cifra que importa. Los modelos tienen también un tope de salida, el máximo de tokens que pueden escribir en una sola respuesta. En la API de Claude es el parámetro «max_tokens», y Anthropic aclara que los tokens de pensamiento forman parte de él, se facturan como tokens de salida y cuentan para los límites de velocidad.

Según la tabla de modelos de Anthropic consultada el 2 de octubre de 2026, Claude Sonnet 5.5 (cuyo lanzamiento ya contamos) tiene una ventana de contexto de un millón de tokens y una salida máxima de 128.000, mientras que Claude Haiku 4.5 se queda en una ventana de 200.000 tokens y una salida de 64.000. Google separa igual las dos cifras: la ficha de Gemini 3.1 Pro en versión preliminar, consultada ese mismo día, da un límite de 1.048.576 tokens de entrada y otro de 65.536 de salida.

Microsoft lo explica con un ejemplo de números redondos: con una ventana máxima de 100 tokens y una entrada de nueve, quedan 91 para la respuesta.


Por qué todo se mide en tokens y cómo contarlos

El token es también la unidad de cuenta. Microsoft explica que los servicios de IA generativa suelen usar precios basados en tokens, que el coste de cada petición depende de los tokens de entrada y de salida, y que entrada y salida pueden tener precios distintos. La documentación de Gemini va en la misma línea: con la facturación activada, lo que cuesta una llamada a la API depende, en parte, de los tokens de entrada y salida. Es la letra pequeña que conviene mirar cada vez que llega un modelo a una API, como GPT-6 Sol.

Microsoft recuerda además que estos servicios limitan el uso con un máximo de tokens por minuto. Y Anthropic añade dos matices: lo que se guarda en la caché de instrucciones sigue ocupando la ventana, porque la caché cambia lo que se paga por esos tokens, no si cuentan; y los recuentos pueden incluir tokens que la propia Anthropic añade para optimizar el sistema, que no se cobran.

Para no ir a ciegas, Anthropic ofrece en su API un conteo de tokens que recibe lo mismo que se enviaría para crear un mensaje y devuelve el total de tokens de entrada antes de mandarlo. Usa el tokenizador del modelo que se le indique, así que sirve para medir el salto entre generaciones del que hablábamos antes, aunque es una estimación: el número real puede diferir en una pequeña cantidad. Google ofrece una llamada equivalente para comprobar el tamaño de la petición antes de enviarla, y después la respuesta desglosa los tokens de entrada, de salida, de pensamiento y el total.


Por qué más ventana no es automáticamente mejor

Con ventanas de un millón de tokens, la tentación es meterlo todo. Anthropic lo advierte sin rodeos: «más contexto no es automáticamente mejor». A medida que crece el número de tokens, la precisión y la capacidad de recuperar información se degradan, un fenómeno conocido como context rot (deterioro del contexto). Por eso, elegir con cuidado lo que entra en el contexto es tan importante como el espacio disponible.

Google matiza en las dos direcciones. Reconoce que, cuando se buscan varios datos concretos a la vez, el modelo no trabaja con la misma exactitud y el rendimiento puede variar mucho en función del contexto. Pero también defiende que, con mucha información y preguntas sobre ella, el modelo es muy capaz de extraerla, con hasta un 99 % de exactitud en muchos casos.

Y deja tres consejos que se entienden bien pensando en ese documento largo pegado en un chatbot: si no hace falta pasarle unos tokens al modelo, mejor no pasarlos; la pregunta funciona mejor al final, después de todo el contexto; y las consultas más largas suelen tardar más en empezar a responder.


El vocabulario, de un vistazo

Para tenerlo a mano, este es el resumen de los términos, con un dato de la documentación oficial para cada uno:

Término Qué es Dato o ejemplo
Token Unidad mínima en la que el modelo procesa el texto Unos 3,5 caracteres en inglés para Claude (Anthropic)
Tokenizador Lo que divide el texto en tokens «extrañamente» puede quedar en «extraña» y «mente» (Hugging Face)
Vocabulario Conjunto de todos los tokens que usa un modelo Cada modelo debe usar el de su preentrenamiento (Hugging Face)
Ventana de contexto Todo lo que el modelo puede tener en cuenta al responder, respuesta incluida Límite combinado de entrada y salida (Google, Microsoft)
Salida máxima Tope de tokens de una sola respuesta («max_tokens» en Claude) Los tokens de pensamiento cuentan dentro (Anthropic)
Conteo de tokens Cálculo de la entrada antes de enviarla Es una estimación (Anthropic)
Deterioro del contexto Pérdida de precisión al crecer el contexto Más contexto no es automáticamente mejor (Anthropic)

Te puede interesar

Tech Planet participa en el programa de afiliados de Amazon. Si compras a través de estos enlaces, recibimos una pequeña comisión sin coste extra para ti, lo que nos ayuda a seguir creando contenido como este.

Imagen Producto Características Comprar
Corsair Vengeance DDR5 64 GB Corsair Vengeance DDR5 64 GB 64 GB (2 × 32 GB) · DDR5 hasta 6000 MHz · AMD EXPO e Intel XMP 3.0 Ver precio en Amazon
GMKtec EVO-X2 AI GMKtec EVO-X2 AI AMD Ryzen AI Max+ 395 · 16 núcleos / 32 hilos · 64 GB DDR5 · SSD de 1 TB · 126 TOPS · 2 USB4 Ver precio en Amazon
Minisforum MS-S1 MAX Minisforum MS-S1 MAX AMD Ryzen AI Max+ 395 · 16 núcleos / 32 hilos, hasta 5,1 GHz · 128 GB LPDDR5x de memoria unificada · 2 TB de almacenamiento · USB4 V2 · dos puertos 10 GbE · Wi-Fi 7 Ver precio en Amazon
Yahboom Jetson Orin Nano Super 8 GB, kit básico Yahboom Jetson Orin Nano Super 8 GB, kit básico 8 GB · hasta 67 TOPS · SSD de 256 GB · CPU Arm Cortex-A78AE de 6 núcleos · Ethernet de 1000 Mbps Ver precio en Amazon

También podría interesarte

Mejores aplicaciones para usar tu móvil viejo como webcam
Aprender programación desde cero: Los mejores recursos gratuitos de 2026
Ilustración representativa de software de recuperación de archivos borrados en un ordenador con escaneo activo de datos
Mejores programas para recuperar archivos borrados

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

BUSCAR

POSTS RECIENTES

  • Cuatro paneles de cristal con retículas en tonos tierra sobre un escritorio de madera. Imagen generada con IA.

    Firefox y sus derivados comparados: LibreWolf, Waterfox y Zen

    Firefox no usa el motor de Chromium, y eso lo h...
  • Una fila de bloques de colores de distintos anchos avanza por un raíl; los que están dentro de un marco de luz azul se ven encendidos y los que han salido por la derecha, grises. Imagen generada con IA.

    Tokens, contexto y ventana de contexto: vocabulario básico de la IA

    Qué es un token, qué es la ventana de contexto,...
  • Captura de la biblioteca de SCSKiller en Windows: lista de juegos con sus shaders, tamaño en caché, tiempo de compilación, estado y botón para jugar

    SCSKiller, de código abierto, compila los shaders antes de jugar para reducir tirones en PC

    SCSKiller, gratuita y de código abierto, compil...
  • Vista en primera persona de Modern Warfare 4 en una azotea, con edificios y suelo marcados como mallas azules y un rival corriendo entre ellas

    Modern Warfare 4 estrenará Server Culling: el servidor oculta a los rivales tras las paredes

    Modern Warfare 4 estrenará Server Culling: el s...
  • Salón en penumbra con sofá, cuatro altavoces de columna y un subwoofer sin marcas que emiten ondas de sonido, rotas en un lado. Imagen generada con IA.

    Windows 11: la KB5124010 puede cerrar juegos y programas con audio Dolby Digital, sin arreglo

    Microsoft confirma que la KB5124010 de Windows ...

ARCHIVO

  • octubre 2026
  • septiembre 2026
  • agosto 2026
  • julio 2026
  • junio 2026
  • mayo 2026
  • abril 2026
  • marzo 2026
  • febrero 2026
  • enero 2026
  • diciembre 2025
  • noviembre 2025
  • octubre 2025
  • septiembre 2025

CATEGORÍAS

  • Consolas
  • Formación
  • Gaming
  • Guías
  • Hardware
  • Noticias
  • Periféricos
  • Presupuestos PC
  • Productividad
  • Rankings
  • Redes
  • Seguridad
  • Sistemas operativos
  • Software
  • Tablets
  • Tecnología
  • Todas las noticias

Tech Planet es tu punto de encuentro para estar al día en informática y hardware. Publicamos comparativas, configuraciones de PC, consejos de software y guías prácticas para que saques el máximo partido a tus equipos. Con un estilo claro y accesible, acercamos la tecnología a usuarios de todos los niveles.

Únete a la newsletter de Tech Planet

Cada domingo enviamos un resumen con los mejores artículos de la semana.

¡No hacemos spam! Lee nuestra política de privacidad para obtener más información.

Revisa tu bandeja de entrada o la carpeta de spam para confirmar tu suscripción.

contacto@techplanet.es

CATEGORÍAS

  • HARDWARE
  • SOFTWARE
  • PERIFÉRICOS
  • FORMACIÓN
  • PRODUCTIVIDAD
  • NOTICIAS
  • PRESUPUESTOS PC
  • GUÍAS
  • RANKINGS

SOCIAL MEDIA

TEXTOS LEGALES

  • AVISO LEGAL
  • POLÍTICA DE PRIVACIDAD
  • POLÍTICA DE COOKIES

Powered by Trígono Comunicación | © 2026  Tech Planet | En calidad de Afiliado de Amazon, Tech Planet obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.

SUBIR
Gestionar consentimiento
Para ofrecer las mejores experiencias, utilizamos tecnologías como las cookies para almacenar y/o acceder a la información del dispositivo. El consentimiento de estas tecnologías nos permitirá procesar datos como el comportamiento de navegación o las identificaciones únicas en este sitio. No consentir o retirar el consentimiento, puede afectar negativamente a ciertas características y funciones.
Funcional Siempre activo
El almacenamiento o acceso técnico es estrictamente necesario para el propósito legítimo de permitir el uso de un servicio específico explícitamente solicitado por el abonado o usuario, o con el único propósito de llevar a cabo la transmisión de una comunicación a través de una red de comunicaciones electrónicas.
Preferencias
El almacenamiento o acceso técnico es necesario para la finalidad legítima de almacenar preferencias no solicitadas por el abonado o usuario.
Estadísticas
El almacenamiento o acceso técnico que es utilizado exclusivamente con fines estadísticos. El almacenamiento o acceso técnico que se utiliza exclusivamente con fines estadísticos anónimos. Sin un requerimiento, el cumplimiento voluntario por parte de tu proveedor de servicios de Internet, o los registros adicionales de un tercero, la información almacenada o recuperada sólo para este propósito no se puede utilizar para identificarte.
Marketing
El almacenamiento o acceso técnico es necesario para crear perfiles de usuario para enviar publicidad, o para rastrear al usuario en una web o en varias web con fines de marketing similares.
  • Administrar opciones
  • Gestionar los servicios
  • Gestionar {vendor_count} proveedores
  • Leer más sobre estos propósitos
Ver preferencias
  • {title}
  • {title}
  • {title}