Apéndice B — Glosario

Términos que aparecen en el manual, con la traducción al uso y el capítulo donde se tratan. Mantengo el término inglés cuando es el que se emplea de hecho en el trabajo diario, que es casi siempre.

B.1 Modelos

Token: Fragmento de texto en el que el modelo trocea la entrada, entre una letra y una palabra. Es la unidad de facturación. Ver Qué hay dentro.

Embedding: Representación de un texto como vector, donde la cercanía indica parecido de significado. Base de la búsqueda semántica.

Transformer: Arquitectura dominante desde 2017, construida sobre el mecanismo de atención (Vaswani et al. 2017).

Atención: Mecanismo por el que, al procesar cada token, el modelo pondera cuánto caso hacer a los demás.

Ventana de contexto: Total de tokens que caben en una llamada, sumando entrada y salida. Ver Inferencia.

Caché KV: Almacén de cálculos intermedios que evita recalcular el contexto ya visto en cada token generado. Explica los descuentos por prefijo repetido.

Temperatura: Parámetro que controla cuánta aleatoriedad hay al elegir el siguiente token.

Top-p / top-k: Formas de recortar los candidatos antes de sortear, por probabilidad acumulada o por número fijo.

MoE (mixture of experts): Arquitectura donde solo se activa una parte del modelo en cada token. Los parámetros totales marcan la memoria; los activos, la velocidad.

Cuantización: Reducir los bits por parámetro para que el modelo ocupe menos, a costa de algo de calidad.

Pesos abiertos: Modelo cuyos parámetros se pueden descargar. No equivale a código abierto ni a licencia libre. Ver El panorama.

Modelo base / instruct / thinking: Sin ajustar, ajustado para obedecer instrucciones, y entrenado además para razonar antes de responder.

Fine-tuning: Ajuste de un modelo con datos propios. Enseña forma, no hechos.

RLHF: Ajuste con preferencias humanas, el paso que convierte un modelo de lenguaje en un asistente (Ouyang et al. 2022).

Alucinación: Salida plausible y falsa. No es un fallo del mecanismo, es su funcionamiento normal aplicado donde no conviene.

Deriva: Cambio de comportamiento sin que nadie toque el sistema: el proveedor actualiza, los usuarios cambian, los documentos se editan.

B.2 Contexto

Prompt: El texto que se envía al modelo. El de sistema lleva las instrucciones generales.

Ingeniería de contexto: Decidir qué entra en la ventana, con qué prioridad y qué se descarta. Ver Contexto.

Few-shot: Incluir ejemplos resueltos en el prompt. Zero-shot es no incluir ninguno.

Chain-of-thought: Pedir (o dejar) que el modelo razone paso a paso antes de responder (Wei et al. 2022).

Salida estructurada: Restringir la generación para que cumpla un esquema. Garantiza la forma, no el contenido.

RAG: Recuperar información y añadirla al contexto antes de responder (Lewis et al. 2020). Ver Recuperación.

Troceado (chunking): Partir los documentos en fragmentos indexables. La decisión más determinante de un RAG.

Búsqueda híbrida: Combinar búsqueda vectorial y léxica. La mejora más rentable del pipeline.

Reranker: Modelo que reordena los fragmentos recuperados con más precisión y más coste.

GraphRAG: Recuperación sobre un grafo de entidades y relaciones, útil para preguntas globales (Edge et al. 2024).

Lost in the middle: Tendencia a atender peor a lo que está en el centro de un contexto largo (Liu et al. 2024).

B.3 Agentes

Agente: Sistema donde el modelo decide los pasos usando herramientas en un bucle. Si los pasos los fijamos nosotros, es un flujo de trabajo (Anthropic 2024).

Flujo de trabajo (workflow): Sistema donde el camino está escrito de antemano y el modelo solo rellena huecos. Fija el camino, no la redacción de la salida. Ver Flujos de trabajo.

Herramienta (tool): Función que el modelo puede pedir que se ejecute. El modelo nunca la ejecuta: la pide.

ReAct: Patrón de alternar razonamiento y acción (Yao et al. 2023).

MCP (Model Context Protocol): Estándar para conectar agentes con herramientas y datos.

A2A (Agent2Agent): Estándar para que agentes de distintas organizaciones se descubran y deleguen tareas.

Human in the loop: Persona que aprueba antes de ejecutar una acción irreversible.

Orquestador y trabajadores: Un agente reparte subtareas y sintetiza. Sirve sobre todo para aislar contexto.

B.4 Producción y seguridad

Gateway: Punto único de acceso a los modelos, con claves, cuotas, enrutado, caché y trazas. Ver Gateways.

Traza: Árbol de todo lo ocurrido en una petición. La unidad de observación. Ver Observabilidad.

Conjunto de evaluación: Casos representativos con el resultado esperado. La pieza que sostiene todo lo demás.

LLM as a judge: Usar un modelo para puntuar salidas de otro. Barato, escalable y sesgado; hay que calibrarlo.

Guardarraíl: Filtro de entrada o salida. Reduce riesgo, no lo elimina.

Inyección de prompt: Instrucciones escondidas en contenido que el modelo procesa. Indirecta cuando llegan por un documento o una web y no por el usuario. Ver Seguridad.

Trifecta letal: Datos privados, contenido no confiable y canal de salida en el mismo agente (Willison 2025).

Agencia excesiva: Dar al agente más permisos o autonomía de los que su tarea necesita.

Envenenamiento de memoria: Colar información falsa en la memoria persistente, contaminando sesiones futuras.

AI Act: Reglamento europeo de IA, basado en niveles de riesgo por uso. Ver Normativa.

GPAI: Modelo de propósito general, con su propio régimen de obligaciones.

Proveedor / responsable del despliegue: Quien pone el sistema en el mercado y quien lo usa bajo su autoridad. Determina qué obligaciones os tocan.