Investigadores de Yandex Research han propuesto una forma de acelerar la generación de texto utilizando modelos de lenguaje difusivos. El nuevo método ayuda a estas redes neuronales a realizar más cálculos en paralelo sin perder precisión en las respuestas. En experimentos con modelos de 16 mil millones de parámetros, la calidad en algunas tareas incluso mejoró.

Los modelos de lenguaje convencionales, incluyendo la mayoría de los chatbots populares, generan texto secuencialmente: primero eligen un token, luego el siguiente, y así sucesivamente. Los modelos difusivos funcionan de manera diferente. Comienzan con una secuencia incompleta o ruidosa y la refinan gradualmente, trabajando con varias posiciones del texto a la vez en un solo paso. Esto les permite generar texto en paralelo.
Sin embargo, lograr una buena calidad con este método de generación no es fácil. Para ello, el modelo se entrena adicionalmente después del entrenamiento principal. Por lo general, estos métodos pueden requerir cálculos complejos o modelos adicionales.
El equipo de Yandex Research propuso un enfoque más simple. Compara los textos generados por la red neuronal con ejemplos reales de los datos de entrenamiento. Para la comparación se utiliza el método matemático Maximum Mean Discrepancy (MMD), que evalúa cuán diferentes son dos conjuntos de datos.
La comparación no se realiza directamente por palabras, sino por características internas que extrae un modelo de lenguaje ya entrenado. Sus parámetros permanecen inalterados. Esto permite utilizarlo como una especie de herramienta de medición, sin tener que entrenar otro modelo grande específicamente para evaluar los resultados.
Los autores probaron el enfoque en dos tipos de modelos difusivos: los que trabajan con tokens discretos y los que trabajan con representaciones de datos continuas.
Qué mostraron los experimentos
En textos del conjunto de datos OpenWebText, el nuevo método ayudó al modelo a reproducir mejor los patrones del habla humana, manteniendo la diversidad de las respuestas. En problemas matemáticos GSM8K, el modelo encontró una relación más exitosa entre la precisión de las respuestas y el número de pasos computacionales. Cuantos menos pasos se necesiten para obtener la respuesta correcta, más rápido podrá el modelo completar la tarea.
El método también se probó en modelos con 16 mil millones de parámetros. Se entrenaron adicionalmente en ocho aceleradores NVIDIA H100 y, según los investigadores, esto tomó alrededor de 1.3 a 1.9 minutos. En cuatro pruebas matemáticas, los modelos procesaron entre un 10% y un 16% más de partes del texto en un solo paso computacional, manteniendo la misma precisión o mejorándola ligeramente. En tareas de programación, la precisión de las respuestas aumentó entre 2.4 y 3.8 puntos porcentuales.
Las redes neuronales difusivas pueden cambiar la forma en que se genera el texto. Sin embargo, todavía están menos extendidas que las redes neuronales que predicen secuencialmente el siguiente token.
Leer más sobre este tema:
No te pierdas nuestras noticiasAñade este sitio a tus fuentes preferidas para vernos más a menudoAñadir en Google

















