Modelo fundacional
Un modelo entrenado con datos amplios y a gran escala que sirve de base para adaptarlo a muchas tareas distintas, en vez de entrenar un modelo separado para cada una.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
El nombre, acuñado por Bommasani et al. (2021), describe un cambio de paradigma. Antes se construía un modelo específico para cada tarea: uno para traducir, otro para resumir, otro para clasificar. Un modelo fundacional se entrena una vez sobre datos muy variados y después se adapta —con poco esfuerzo adicional— a decenas de tareas.
GPT-3 (2020) es el ejemplo que hizo visible la idea: un mismo modelo grande capaz de traducir, resumir, programar o responder preguntas sin haber sido entrenado específicamente para cada una. La "fundación" está en que muchas aplicaciones se construyen encima de ese modelo compartido, en lugar de desde cero.
La categoría es técnica, no de capacidad: ser fundacional no implica ser inteligente en sentido general ni estar cerca de una AGI. Y concentra riesgos propios. Como muchos sistemas dependen de pocos modelos base, un sesgo o una falla en el fundacional se propaga a todo lo que se construye encima, y entrenarlo a esa escala tiene un costo ambiental y económico considerable que el propio trabajo fundador ya advirtió.
Adaptar un modelo fundacional a una tarea concreta, sin reentrenarlo entero, suele hacerse por una de tres vías: ajustarlo con ejemplos adicionales de esa tarea (fine-tuning), darle instrucciones detalladas directamente en el prompt, o entregarle documentos externos relevantes en el momento de responder (ver RAG). Cada vía tiene un costo y un nivel de control distinto: reentrenar es caro pero más permanente; instruir en el prompt es barato pero depende de la ventana de contexto disponible cada vez.
Esa dependencia compartida tiene una consecuencia poco visible: cuando distintos productos —un buscador, un asistente de escritura, una herramienta de programación— usan la misma base, un mismo error o sesgo del modelo fundacional puede aparecer replicado en todos ellos, aunque cada producto se presente como un servicio independiente y con marca propia.
¿Por qué te importa?
Casi toda la IA que usas hoy se apoya en un puñado de modelos fundacionales. Eso explica tanto su rapidez de aparición (se construye sobre lo mismo) como la concentración de poder en quienes los controlan.
Ejemplos
- GPT-3 (2020), el ejemplo que popularizó la idea de un modelo base adaptable a muchas tareas.
- BERT (2018), usado como base para innumerables tareas de lenguaje.
- Modelos que alimentan a la vez buscadores, asistentes y herramientas de programación.
Términos relacionados
Debate y controversia
La crítica más sostenida es la concentración: pocos actores pueden pagar el entrenamiento a esta escala, lo que desplaza poder hacia un puñado de laboratorios. Se discute además el costo ambiental del entrenamiento masivo, la homogeneización (muchos productos dependen del mismo modelo) y si el rótulo 'fundacional' infla expectativas.
Fuentes
Rishi Bommasani et al. · 2021
WebFetch confirmó título exacto y lead author (Bommasani) en arXiv 2108.07258, 2021; es el paper que acuña el término 'foundation model'.
Tom B. Brown et al. · 2020
WebFetch confirmó título y autores (Brown et al.) en arXiv 2005.14165, 2020; ejemplo arquetípico de modelo fundacional.