El artículo es un artículo de opinión escrito porKirill Starkov.
El desarrollo de los LLM modernos ha dado lugar a resultados increíbles: rendimiento de última generación, alta calidad y, lamentablemente, costes computacionales. Los ingenieros tienden a elegir modelos más pequeños simplemente porque son más baratos y no requieren hardware especial.
El proceso de destilación de conocimientos se inventó para abordar esta cuestión: es una oportunidad de ahorrar tiempo, dinero y, al mismo tiempo, un rendimiento de alta calidad. Nuestro experto, Kirill Starkov, ingeniero senior de aprendizaje automático, comentará sobre esta tecnología y compartirá su propia experiencia.
La idea de destilación de conocimiento (KD) puede explicarse con el ejemplo de la interacción "profesor-alumno": es una transferencia de conocimiento de un modelo de lenguaje grande a uno pequeño. El modelo de “estudiante” será tan eficiente como su modelo de “maestro”, pero será más adecuado para su implementación.
Hay dos formas de entrenar el modelo de “estudiante”: destilación dura y destilación blanda.
«La destilación de etiqueta dura tiene tres etapas:
- Colección de mensajes
- Respuestas a preguntas generadas por el modelo “maestro”
- Formación de conjuntos de datos etiquetados
Después de eso, el modelo pequeño aprende a imitar las respuestas del modelo grande con el conjunto de datos etiquetado, marcado como verdad fundamental”.
La destilación de etiqueta dura es más fácil y tiene menos costos computacionales que la destilación de etiqueta blanda, pero esta última es más precisa porque transfiere la distribución predictiva individual del modelo grande.
“Las etiquetas blandas enseñan mejor que los objetivos duros porque proporcionan más información de aprendizaje y mucha menos variación en el gradiente entre los casos de entrenamiento cuando tienen una entropía alta. El modelo de “estudiante” se puede entrenar con muchos menos datos que el modelo de “maestro” original”.
Lea también:
Una de las métricas más importantes en ML es la función de pérdida o entropía cruzada. La implementación de KD requiere otro tipo de métrica de pérdida: pérdida suave. "La pérdida suave es una entropía cruzada ponderada cuando asignamos diferentes ponderaciones para evitar falsos positivos o falsos negativos del modelo" maestro ".
La fórmula de divergencia de Kullback-Leibler (KLDiv) se utiliza para calcular la pérdida por destilación.
LKD = KL(softmax(zt/T) || softmax(zs/T)) ⋅ T2
Donde T es la temperatura (normalmente >1)
zt y zs son logits de profesor y alumno, respectivamente.
Función de pérdida de objetivo difícil
LCE = Entropía cruzada(ytrue,softmax(zs))
Pérdida total (combinada)
L = α ⋅ LCE + (1− α) ⋅ LKD
Donde α es un hiperparámetro (comúnmente de 0,1 a 0,9)
Implementación de destilación de conocimientos.
La destilación de conocimientos se utiliza a menudo en proyectos con recursos operativos limitados, donde la implementación de engorrosos LLM es imposible.
“La destilación de conocimientos es imprescindible en los programas de detección de objetos y visión por computadora. Los modelos más pequeños son adecuados para su implementación en dispositivos con recursos de procesamiento limitados, como cámaras de seguridad y drones”.
Los modelos pequeños también se utilizan en programas de procesamiento del lenguaje natural. "La PNL requiere una respuesta en tiempo real con alta velocidad y eficiencia, por lo que los modelos de "estudiantes" capacitados son perfectos para chatbots, programas de traducción y otros dispositivos móviles".
Caso de implementación: DSSL Computer Vision
Como se mencionó anteriormente, la destilación del conocimiento se utiliza en las tecnologías CV modernas. Kirill Starkov decidió mejorar el dispositivo detector de seguridad implementando un modelo de lenguaje pequeño.
"En ese caso vimos que la destilación de conocimientos es realmente útil, porque verificamos los resultados con una métrica especial: la precisión media media".
La precisión media media (mAP) mide la precisión de los detectores de objetos. Proporciona un número único que resume la curva de recuperación de precisión, reflejando qué tan bien se está desempeñando un modelo en diferentes niveles de umbral. 'Antes del despliegue de KD, nuestro mAP era 27,4; después—34.2.’
Ventajas y desventajas de la destilación del conocimiento.
KD siempre se trata de un mejor rendimiento: las ventajas comunes son la reducción de los costos operativos, una inferencia más rápida y la preservación de patrones complejos.
Pero esta tecnología puede tener algunas desventajas. El desequilibrio entre las condiciones de aprendizaje y la inferencia puede provocar un sesgo de exposición porque el modelo de lenguaje del "estudiante" no puede aprender a corregir sus propios errores.
La destilación de etiqueta blanda es computacionalmente costosa durante el entrenamiento, ya que se almacenan y procesan distribuciones de probabilidad completas en lugar de índices simbólicos individuales.
También requiere una integración más profunda entre estudiantes y profesores para acceder a las probabilidades internas de un modelo grande, lo que hace que su implementación sea más difícil que los enfoques estándar.
Esta historia se publicó originalmente el 23 de octubre de 2021.







![Se produjo un error inesperado en Dell SupportAssist [Reparar]](https://elsefix.com/tech/tejana/wp-content/uploads/2025/01/An-Unexpected-Error-Occurred-in-Dell-SupportAssist.jpg)






