La baraja estocástica

Por qué la IA no responde siempre lo mismo, y por qué el criterio sigue siendo tuyo.

Una explicación interactiva de Mikel Carpio García · 2026

Teclado (con la mesa enfocada): Espacio consulta · ↑ ↓ vela · ← → eligen carta de tu mano · Intro la pone en la mesa · Retroceso quita la última.

Lo que te llevas

Si has jugado con la adivina, ya lo has visto con tus manos. Aquí lo tienes por escrito, momento a momento.

  1. La IA no busca la respuesta: la sortea. Un modelo de lenguaje asigna una probabilidad a cada trozo de texto posible y tira un dado cargado. Por eso se dice que es estocástico: el azar forma parte del mecanismo.
  2. La temperatura reparte el riesgo, no la información. Fría, el modelo repite su opción favorita; caliente, cualquier opción vale. Ni con la temperatura a cero está garantizado que salga siempre lo mismo.
  3. El contexto no da la respuesta: inclina la baraja. Cada pista útil desplaza la probabilidad hacia lo que buscas; las ambiguas la reparten entre varias opciones.
  4. El contexto inútil no es neutro. Cada dato irrelevante tira hacia lo suyo y diluye las pistas buenas. Se ha medido en modelos reales: frases irrelevantes en problemas de matemáticas hacen caer su precisión (Shi et al., 2023).
  5. Más contexto no es mejor contexto. La ventana de contexto tiene un tamaño, y lo que está en mitad de un contexto largo se aprovecha peor que lo que está al principio o al final (Liu et al., 2023).
  6. Delega la tarea, no el criterio. Elegir las pistas y reconocer la respuesta buena depende de lo que tú sabes. En una encuesta a 319 profesionales, más confianza en la IA se asociaba a menos pensamiento crítico (Lee et al., CHI 2025).
  7. Por dentro es una cuenta sencilla a lo grande: puntuar todas las piezas posibles, convertir las puntuaciones en probabilidades y sortear una. Una respuesta son cientos de tiradas encadenadas.
  8. En un chat pasa exactamente esto. Si importa, pide varias versiones; cuenta hechos, tono y plazo; quita el relleno, y lee el resultado con criterio.

Cómo funciona por dentro

La probabilidad de cada carta es p = ez/T / Σ ez′/T, la función softmax con temperatura. La puntuación de cada carta, z, suma un sesgo aprendido y la afinidad con cada pista de la mesa, ponderada por su posición. Dividir por la temperatura T antes de sortear aplana o afila el reparto.

Fuentes y notas

  1. Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F. y Liang, P. (2023). Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172. arxiv.org/abs/2307.03172 — El rendimiento es mayor cuando la información relevante está al principio o al final del contexto y cae cuando está en medio. Base del momento 5.
  2. Shi, F., Chen, X., Misra, K., Scales, N., Dohan, D., Chi, E. H., Schärli, N. y Zhou, D. (2023). Large Language Models Can Be Easily Distracted by Irrelevant Context. ICML 2023 (PMLR 202). arxiv.org/abs/2302.00093 — Añadir información irrelevante a problemas de matemáticas escolares (GSM-IC) reduce mucho la precisión. Base del momento 4.
  3. Lee, H.-P., Sarkar, A., Tankelevitch, L., Drosos, I., Rintel, S., Banks, R. y Wilson, N. (2025). The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI ’25. doi.org/10.1145/3706598.3713778 — Encuesta a 319 profesionales: más confianza en la IA se asocia con menos pensamiento crítico; más confianza en uno mismo, con más. Es un estudio de autopercepción. Base del momento 6.
  4. Anthropic. Referencia de la API Messages, parámetro temperature. docs.anthropic.com/en/api/messages — Indica que incluso con temperatura 0,0 los resultados no son completamente deterministas.
  5. Hugging Face y Meta (2024). Welcome Llama 3 – Meta’s new open LLM. huggingface.co/blog/llama3 — El tokenizador de Llama 3 tiene un vocabulario de 128.256 tokens.

Simulación ilustrativa. La adivina es un modelo de juguete: 52 cartas y unas pocas reglas escritas a mano (palo, número, color y figura), un sesgo inventado hacia el as de picas, los ases y las figuras, y una regla softmax con temperatura. Sus porcentajes no son medidas de ningún modelo real; los efectos que imita sí están documentados en las fuentes.

Simplificaciones conscientes: en un modelo real, las afinidades y los pesos no se programan, salen de miles de millones de parámetros aprendidos; una pieza que está en el contexto puede volver a salir (aquí, la carta de la mesa sale de la baraja); la curva de pesos por posición está dibujada a mano para imitar la forma en U descrita por Liu et al., y la ventana real tiene decenas o cientos de miles de tokens, no siete. En el juguete, además, el efecto de la mesa se diluye un poco cuantas más cartas hay. La escala de la vela es ilustrativa; en las API reales la temperatura suele ir de 0 a 1 o de 0 a 2.

El caso del correo al casero (momento 9) es inventado: los borradores, sus nombres, la cláusula 7 y la «Ley de Calderas» son ficticios, y sus porcentajes, ilustrativos.

Las cartas están dibujadas por código para esta pieza; no reproducen ninguna baraja comercial.

Una explicación interactiva de Mikel Carpio García · 2026 · Más explicaciones que se juegan →