Apéndice B — Glosario
Términos que aparecen en el manual, con la traducción al uso y el capítulo donde se tratan. Mantengo el término inglés cuando es el que se emplea de hecho en el trabajo diario, que es casi siempre.
B.1 Modelos
Token: Fragmento de texto en el que el modelo trocea la entrada, entre una letra y una palabra. Es la unidad de facturación. Ver Qué hay dentro.
Embedding: Representación de un texto como vector, donde la cercanía indica parecido de significado. Base de la búsqueda semántica.
Transformer: Arquitectura dominante desde 2017, construida sobre el mecanismo de atención (Vaswani et al. 2017).
Atención: Mecanismo por el que, al procesar cada token, el modelo pondera cuánto caso hacer a los demás.
Ventana de contexto: Total de tokens que caben en una llamada, sumando entrada y salida. Ver Inferencia.
Caché KV: Almacén de cálculos intermedios que evita recalcular el contexto ya visto en cada token generado. Explica los descuentos por prefijo repetido.
Temperatura: Parámetro que controla cuánta aleatoriedad hay al elegir el siguiente token.
Top-p / top-k: Formas de recortar los candidatos antes de sortear, por probabilidad acumulada o por número fijo.
MoE (mixture of experts): Arquitectura donde solo se activa una parte del modelo en cada token. Los parámetros totales marcan la memoria; los activos, la velocidad.
Cuantización: Reducir los bits por parámetro para que el modelo ocupe menos, a costa de algo de calidad.
Pesos abiertos: Modelo cuyos parámetros se pueden descargar. No equivale a código abierto ni a licencia libre. Ver El panorama.
Modelo base / instruct / thinking: Sin ajustar, ajustado para obedecer instrucciones, y entrenado además para razonar antes de responder.
Fine-tuning: Ajuste de un modelo con datos propios. Enseña forma, no hechos.
RLHF: Ajuste con preferencias humanas, el paso que convierte un modelo de lenguaje en un asistente (Ouyang et al. 2022).
Alucinación: Salida plausible y falsa. No es un fallo del mecanismo, es su funcionamiento normal aplicado donde no conviene.
Deriva: Cambio de comportamiento sin que nadie toque el sistema: el proveedor actualiza, los usuarios cambian, los documentos se editan.
B.2 Contexto
Prompt: El texto que se envía al modelo. El de sistema lleva las instrucciones generales.
Ingeniería de contexto: Decidir qué entra en la ventana, con qué prioridad y qué se descarta. Ver Contexto.
Few-shot: Incluir ejemplos resueltos en el prompt. Zero-shot es no incluir ninguno.
Chain-of-thought: Pedir (o dejar) que el modelo razone paso a paso antes de responder (Wei et al. 2022).
Salida estructurada: Restringir la generación para que cumpla un esquema. Garantiza la forma, no el contenido.
RAG: Recuperar información y añadirla al contexto antes de responder (Lewis et al. 2020). Ver Recuperación.
Troceado (chunking): Partir los documentos en fragmentos indexables. La decisión más determinante de un RAG.
Búsqueda híbrida: Combinar búsqueda vectorial y léxica. La mejora más rentable del pipeline.
Reranker: Modelo que reordena los fragmentos recuperados con más precisión y más coste.
GraphRAG: Recuperación sobre un grafo de entidades y relaciones, útil para preguntas globales (Edge et al. 2024).
Lost in the middle: Tendencia a atender peor a lo que está en el centro de un contexto largo (Liu et al. 2024).
B.3 Agentes
Agente: Sistema donde el modelo decide los pasos usando herramientas en un bucle. Si los pasos los fijamos nosotros, es un flujo de trabajo (Anthropic 2024).
Flujo de trabajo (workflow): Sistema donde el camino está escrito de antemano y el modelo solo rellena huecos. Fija el camino, no la redacción de la salida. Ver Flujos de trabajo.
Herramienta (tool): Función que el modelo puede pedir que se ejecute. El modelo nunca la ejecuta: la pide.
ReAct: Patrón de alternar razonamiento y acción (Yao et al. 2023).
MCP (Model Context Protocol): Estándar para conectar agentes con herramientas y datos.
A2A (Agent2Agent): Estándar para que agentes de distintas organizaciones se descubran y deleguen tareas.
Human in the loop: Persona que aprueba antes de ejecutar una acción irreversible.
Orquestador y trabajadores: Un agente reparte subtareas y sintetiza. Sirve sobre todo para aislar contexto.
B.4 Producción y seguridad
Gateway: Punto único de acceso a los modelos, con claves, cuotas, enrutado, caché y trazas. Ver Gateways.
Traza: Árbol de todo lo ocurrido en una petición. La unidad de observación. Ver Observabilidad.
Conjunto de evaluación: Casos representativos con el resultado esperado. La pieza que sostiene todo lo demás.
LLM as a judge: Usar un modelo para puntuar salidas de otro. Barato, escalable y sesgado; hay que calibrarlo.
Guardarraíl: Filtro de entrada o salida. Reduce riesgo, no lo elimina.
Inyección de prompt: Instrucciones escondidas en contenido que el modelo procesa. Indirecta cuando llegan por un documento o una web y no por el usuario. Ver Seguridad.
Trifecta letal: Datos privados, contenido no confiable y canal de salida en el mismo agente (Willison 2025).
Agencia excesiva: Dar al agente más permisos o autonomía de los que su tarea necesita.
Envenenamiento de memoria: Colar información falsa en la memoria persistente, contaminando sesiones futuras.
AI Act: Reglamento europeo de IA, basado en niveles de riesgo por uso. Ver Normativa.
GPAI: Modelo de propósito general, con su propio régimen de obligaciones.
Proveedor / responsable del despliegue: Quien pone el sistema en el mercado y quien lo usa bajo su autoridad. Determina qué obligaciones os tocan.