OLKERINoticias de IA
← Todas las noticias de IA
¿Qué es un gran modelo de lenguaje? Cómo funcionan realmente los LLM, explicado con sencillez

Imagen: Olkeri

InvestigaciónGlobal29 de agosto de 20266 min de lectura

Por Olkeri.space

¿Qué es un gran modelo de lenguaje? Cómo funcionan realmente los LLM, explicado con sencillez

Una guía clara y no técnica sobre qué son los grandes modelos de lenguaje, cómo se entrenan, por qué alucinan y qué pueden y no pueden hacer.

Leer este artículo en: Français · Deutsch · English

Un gran modelo de lenguaje, abreviado normalmente como LLM, es un programa informático entrenado para predecir texto. Esa sola frase explica mucho más sobre la inteligencia artificial moderna de lo que la mayoría supone, porque casi todos los productos de IA de los que se habla hoy, desde los chatbots hasta los asistentes de programación y la atención al cliente automatizada, se construyen sobre esa única idea.

Esta guía explica qué es un LLM, cómo se construye, por qué se comporta como lo hace y dónde están sus límites reales. No hacen falta matemáticas.

Qué es realmente un gran modelo de lenguaje:

Un LLM es un modelo estadístico del lenguaje de tamaño muy grande. Durante el entrenamiento se le muestran cantidades enormes de texto y se le encomienda una única tarea repetitiva: dado todo lo anterior, predecir qué viene después. A lo largo de miles de millones de repeticiones, el modelo ajusta unos números internos, llamados parámetros, hasta que sus predicciones se vuelven muy buenas.

Los modelos modernos contienen cientos de miles de millones de esos parámetros. No son datos guardados en una base de datos. Son pesos que codifican patrones: qué palabras suelen seguir a cuáles, cómo se relacionan las preguntas con las respuestas, en qué se diferencia el tono de una cláusula jurídica del de una receta, cómo se estructura el código.

Cuando usted escribe una pregunta, el modelo no consulta nada. Genera una continuación plausible de su texto, un token cada vez, siendo un token aproximadamente un fragmento de palabra. Todo lo que hace un LLM, incluidos razonar, traducir y escribir código, surge de ese proceso de predicción.

Cómo se entrena un LLM:

El entrenamiento ocurre por etapas, y entenderlas explica la mayor parte del comportamiento de los modelos.

La primera etapa es el preentrenamiento. El modelo lee un corpus de texto enorme: libros, sitios web, repositorios de código, obras de referencia y mucho más. Ahí aprende gramática, hechos, estilos, patrones de razonamiento y estructura. Esta etapa es con diferencia la más cara: exige miles de chips especializados funcionando durante semanas o meses, razón por la cual solo organizaciones bien financiadas construyen modelos de frontera desde cero.

La segunda etapa es el ajuste fino. Un modelo preentrenado continuará de buen grado cualquier texto, incluido el inútil o dañino. El ajuste fino le enseña a comportarse como un asistente, a partir de ejemplos seleccionados de buenas respuestas.

La tercera etapa es la alineación, a menudo mediante retroalimentación humana. Personas comparan las salidas del modelo e indican cuáles son mejores. Después se ajusta el modelo para que produzca las respuestas que la gente prefiere: más útiles, más honestas, menos dañinas. Ahí es donde un simple predictor de texto se convierte en algo con lo que se puede conversar de forma útil.

Por qué el transformador lo cambió todo:

Casi todos los modelos actuales usan una arquitectura llamada transformador, presentada por investigadores de Google en 2017. Su mecanismo clave es la atención, que permite al modelo ponderar cuán relevante es cada parte de la entrada respecto de todas las demás.

Los enfoques anteriores procesaban el texto estrictamente en orden y les costaba conectar ideas distantes. La atención permite a un modelo enlazar un pronombre con un nombre mencionado tres párrafos antes, o relacionar la definición de una función con su uso más adelante en un archivo. Igual de importante: los transformadores se entrenan de forma eficiente en el hardware paralelo moderno, que es lo que hizo practicable escalar hasta los tamaños de modelo actuales.

La ventana de contexto y por qué importa:

La ventana de contexto es la cantidad de texto que un modelo puede considerar a la vez, medida en tokens. Todo lo que hay en la ventana, su pregunta, la conversación hasta ese punto, los documentos que pegue, es lo que el modelo puede ver realmente.

Los primeros modelos manejaban unos pocos miles de tokens, aproximadamente un artículo largo. Los actuales manejan cientos de miles, el equivalente a libros enteros o a bases de código voluminosas. Una ventana mayor significa que puede entregar al modelo un contrato completo o un repositorio entero en lugar de fragmentos.

Lo que queda fuera de la ventana no existe para el modelo. Por eso las conversaciones largas pierden los detalles iniciales, y por eso los sistemas que deben consultar archivos extensos tienen que recuperar las piezas pertinentes y colocarlas en la ventana en vez de confiar en una memoria.

Por qué alucinan los modelos:

La alucinación, cuando un modelo afirma algo falso con absoluta confianza, es en la práctica la limitación de mayor consecuencia.

La causa es estructural, no un fallo que baste con parchear. El modelo está entrenado para producir texto plausible, y una respuesta fluida, segura e incorrecta suele ser estadísticamente más plausible que admitir incertidumbre. El modelo carece de un mecanismo interno para contrastar una afirmación con la realidad. Tiene patrones, no conocimiento en el sentido humano.

El riesgo de alucinación crece mucho con los datos poco conocidos, las cifras concretas, las citas, las referencias y los acontecimientos recientes. Disminuye cuando se le entrega al modelo el material fuente directamente, que es toda la lógica de los sistemas de recuperación.

La regla práctica: un LLM es fiable para razonar sobre un texto que usted le proporciona, y poco fiable como sustituto de una base de datos o de un buscador.

Los datos de entrenamiento tienen fecha de corte:

El conocimiento de un modelo se detiene donde terminan sus datos de entrenamiento. Pregunte por algo posterior a esa fecha y dirá que no lo sabe o, peor, lo adivinará. Los productos que parecen conocer la actualidad suelen recuperar resultados de búsqueda en vivo y colocarlos en la ventana de contexto, no recordarlos.

En qué son realmente buenos los LLM:

El patrón de los despliegues exitosos es constante. Los LLM destacan en transformar texto: resumir, reescribir, traducir, extraer datos estructurados de documentos no estructurados, convertir requisitos en código, redactar y dar nuevo formato.

Son fuertes en tareas donde un borrador competente ahorra mucho tiempo y una persona revisa el resultado. Son más débiles donde la exactitud no es negociable, donde la verificación es imposible o donde el coste de un error rotundo es alto.

Lo que viene después:

La frontera avanza en tres direcciones. Modelos que razonan más tiempo antes de responder, cambiando tiempo por precisión en los problemas difíciles. Modelos multimodales que manejan imágenes, audio y vídeo con la misma naturalidad que el texto. Y agentes que ejecutan acciones dentro del software en lugar de limitarse a producir texto.

Nada de esto altera el cuadro fundamental. Por debajo, el sistema sigue prediciendo lo que viene después, extraordinariamente bien y a una escala enorme. Entender eso marca la diferencia entre usar estas herramientas con eficacia y verse sorprendido por ellas.