Mixture of Experts
Una arquitectura en la que un modelo tiene muchos 'expertos' internos y, para cada caso, activa sólo algunos. Así crece en capacidad sin crecer por igual en costo de cómputo.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
En un modelo normal, todas sus partes participan en cada respuesta. En una arquitectura Mixture of Experts (MoE), el modelo contiene múltiples subredes especializadas —los expertos— y un mecanismo de ruteo decide, para cada entrada, cuáles activar. El resto queda inactivo.
El beneficio es directo: se puede aumentar enormemente el número total de parámetros (y por tanto la capacidad) sin aumentar proporcionalmente el cómputo que se usa en cada inferencia, porque sólo una fracción de los expertos trabaja cada vez. Shazeer et al. (2017) introdujeron una capa MoE con miles de subredes, y Switch Transformer (Fedus et al., 2021) la simplificó llevando el modelo a un billón de parámetros.
La MoE explica, por ejemplo, por qué algunos modelos muy capaces pueden correr con recursos menores de lo que su tamaño total sugeriría. No es magia: la capacidad total es grande, pero el costo por uso se controla activando selectivamente. Los desafíos son reales: el ruteo puede ser inestable, el entrenamiento es más complejo y la interpretabilidad de qué 'experto' decidió qué cosa resulta más difícil.
¿Por qué te importa?
Esta arquitectura está detrás de varios de los modelos más capaces y eficientes de hoy. Explica cómo se combina gran inteligencia con costos de uso más manejables, y por eso influye en quién puede correr qué modelo y dónde.
Ejemplos
- La capa MoE de Shazeer et al. (2017), con miles de subredes activadas selectivamente.
- Switch Transformer (2021), que escaló a un billón de parámetros con ruteo simple.
- Modelos abiertos recientes que combinan pocos expertos activos por token para bajar el costo de inferencia.
Términos relacionados
Debate y controversia
Sin polémica fuerte de fondo, hay investigación activa sobre la estabilidad del ruteo, la carga desigual entre expertos (algunos se sobreusan y otros casi nunca) y cómo interpretar las decisiones de un sistema que reparte el trabajo entre muchas piezas opacas.
Fuentes
- Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity Verificada
William Fedus, Barret Zoph, Noam Shazeer · 2021
WebFetch confirmó título exacto y autores (Fedus, Zoph, Shazeer) en arXiv 2101.03961, 2021.
Noam Shazeer et al. · 2017
WebFetch confirmó título y autor (Shazeer et al.) en arXiv 1701.06538, 2017.