Espanol

Descubriendo la generación de textos ultralargos: un análisis en profundidad de LongWriter y AgentWrite

Escrito por

en

Hola a todos,

Ha pasado bastante tiempo (casi tres meses) desde mi última entrada en el blog. Pero, por fin, estoy de vuelta, ¡así que empecemos! De ahora en adelante, mis entradas se centrarán principalmente en artículos de investigación interesantes sobre el ámbito del LLM y la IA general. Hablaré de los problemas con los que me encuentro en mi día a día, en lo que nos gusta llamar «la hora del cuento», como muchos de vosotros recordaréis de mis entradas anteriores. A continuación, profundizaré en los aspectos técnicos de esos problemas. Además de explicar los artículos de investigación, compartiré experiencias y ejemplos prácticos, y también profundizaré en detalles técnicos que los artículos podrían omitir, al dar por hecho que el lector ya los conoce. ¡Pues vamos allá!

Hace solo unos días, unos amigos de la familia vinieron a visitarnos. Tienen una hija encantadora de 8 años. Era el 15 de agosto, el Día de la Independencia de la India, y su colegio le había encargado escribir un ensayo sobre el Día de la Independencia con un requisito estricto: «al menos 10 000 palabras». ¡Eso sí que es mucho! ¡La verdad es que no sé si debería llamarlo redacción o minilibro para una niña de 8 años! Como es habitual, los padres empezaron a redactarlo en nombre de su hija. Lo primero que se le viene a la mente a todo el mundo es ChatGPT o algo similar. Al principio, los padres estaban muy tranquilos y pensaron: «Empecemos a redactarlo el 14 de agosto, justo un día antes, ya que solo es cuestión de “dar la indicación al modelo LLM” y obtener el resultado». La noche del 14 de agosto hicieron precisamente eso, pero ¿adivinas qué pasó? El modelo, aunque dio un buen resultado, tuvo dificultades para mantener lo siguiente: relevancia, precisión, coherencia, claridad, amplitud y profundidad, y experiencia de lectura. Además, cuando se le pide al modelo que genere exactamente 10 000 palabras, repite el contexto y se desvía significativamente de él.

Ahora, quizá os preguntéis: ¿qué son estas seis dimensiones? Para ello, sigamos con la lectura y profundicemos en la exposición del problema de «las limitaciones de los actuales modelos de lenguaje grandes (LLM) de contexto largo a la hora de generar resultados ultralargos». En este blog, exploraremos un interesante artículo de investigación titulado «LONGWRITER: LIBERANDO LA GENERACIÓN DE MÁS DE 10 000 PALABRAS A PARTIR DE LLMS DE CONTEXTO LARGO». Aunque estos modelos pueden procesar entradas de hasta 100 000 tokens, suelen tener dificultades para producir salidas de más de 2 000 palabras. La razón principal de esta limitación se atribuye a los conjuntos de datos de ajuste fino supervisado (SFT), que carecen de ejemplos de salidas largas, lo que limita la capacidad de los modelos para generar textos extensos. Así que, en este blog, vamos a comprender la intrigante técnica que han utilizado los autores para mejorar las respuestas largas y asegurarnos de que la vida de los padres sea más fácil en el futuro. ¿Y qué hay de los niños? Hoy en día, dejo eso en manos del destino, con los avances en IA y la forma en que la vida se ha vuelto más fácil para ellos, ¡con un uso limitado de sus capacidades mentales! En fin, empecemos.

Introducción

Ahora, profundicemos en la comprensión general del artículo. Comienza destacando un reto interesante relacionado con los modelos de lenguaje grande (LLM) con contexto extenso. Estos modelos, que pueden procesar más de 100 000 tokens de entrada, siguen teniendo dificultades para generar respuestas de más de 2 000 palabras. Se trata de un problema significativo porque, en algunos casos, más del 1 % de las solicitudes de los usuarios requieren, de hecho, respuestas más largas.

¿Cuál es el problema principal? Los conjuntos de datos de ajuste fino supervisado (SFT) con los que se entrenan estos modelos simplemente no incluyen suficientes ejemplos de salidas largas. Así pues, aunque los modelos son capaces de gestionar entradas largas, no han sido entrenados para producir salidas largas de forma eficaz. Esta limitación persiste porque muchos LLM se basan en estos mismos conjuntos de datos.

Para abordar este problema, los autores presentan AgentWrite, un nuevo enfoque que ayuda a estos modelos a generar textos más largos dividiendo la tarea en partes más pequeñas. Este método puede aumentar la longitud de las salidas hasta 20 000 palabras, mucho más allá de lo que suele ser posible.

El artículo también presenta LongWriter-6k y LongBench-Write, un conjunto de datos y un banco de pruebas creados para entrenar y evaluar la capacidad de los modelos a la hora de generar estos textos ultralargos. La idea es ampliar los límites de lo que pueden hacer los LLM, haciéndolos más capaces de gestionar tareas que requieren salidas extensas.

Veamos ahora qué es AgentWrite y cómo funciona:

Paso I: Planific
Lo primero es lo primero: AgentWrite comienza con un plan, igual que harías tú al esbozar un artículo antes de ponerte a escribir. El modelo crea un esquema detallado basado en las instrucciones dadas, en el que se establece el contenido principal y se especifica el recuento de palabras para cada sección. Piensa en ello como la hoja de ruta del modelo. Por ejemplo, si se le encarga escribir un texto de 30 000 palabras sobre el Imperio Romano, el plan podría ser algo así:

Párrafo 1: Introducción a los orígenes del Imperio Romano (700 palabras)

Párrafo 2: Fundación del Imperio Romano (800 palabras)

Párrafo 15: Resumen de la historia del Imperio Romano (500 palabras)

Este enfoque estructurado garantiza que el modelo sepa exactamente hacia dónde se dirige, lo que facilita la gestión de la tarea de generar textos extensos. A continuación puedes ver cómo el autor estructura la entrada:

Comentarios

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *