[general_dat] Invitación a la defensa de tesis de licenciatura de Martina Alvarez Motta (Miércoles 29/07 12hs - 1207)

Pablo Brusco pbrusco at dc.uba.ar
Tue Jul 28 11:45:50 -03 2026


¡Hola!

Tenemos el agrado de invitarlos/as a la presentación de Tesis de *Licenciatura
en Ciencias de Datos* de Martina Alvarez Motta

*Título*:            *Modelado de etiquetado de turnos en conversaciones
utilizando representaciones de modelos de habla Full Duplex*

*Cuándo*:          *Miércoles 29 *de Julio de 2026, *12:00 hs. *

*Dónde*:            *Aula 1207*, Edificio 0+infinito, Ciudad Universitaria,
UBA.

*Directores*:     Pablo Brusco, Pablo Riera

*Jurados/as*:    Cecilia Bolaños, Marcelo Sancinetti

Resumen:
El manejo de turnos en una conversación hablada entre dos personas se apoya
en una dinámica implícita que permite que el intercambio de mensajes se
produzca de forma fluida y ordenada. Esta dinámica se sostiene en distintas
señales que los hablantes producen (acústicas, prosódicas, léxicas e
incluso gestuales) y que, combinadas, permiten inferir quién continuará
hablando o cuándo ocurrirá un cambio de interlocutor. Comprender esta
mecánica y construir sistemas capaces de identificar y clasificar
automáticamente las distintas transiciones de turno ha cobrado especial
relevancia en las últimas décadas, tanto por su interés lingüístico como
por sus aplicaciones en sistemas de diálogo y en el análisis de grandes
volúmenes de conversaciones.

Históricamente, la clasificación automática de transiciones de turno se ha
abordado mediante modelos de aprendizaje supervisado entrenados sobre
atributos acústico-prosódicos extraídos manualmente de la señal. En
paralelo, el procesamiento del habla ha virado hacia el uso de
representaciones internas de modelos preentrenados de propósito general
como descriptores para tareas downstream . Esta tesis explora un paso más
en esa dirección: el uso de las representaciones internas de Moshi, un
modelo de habla conversacional de tipo Full Duplex, para el etiquetado
offline de transiciones de turno, evaluando si los estados internos de este
tipo de modelos constituyen buenos descriptores para la tarea y dónde
residen sus ventajas y desventajas frente a los atributos
acústico-prosódicos clásicos.

Para ello realizamos una serie de experimentos sobre el Columbia Games
Corpus, una colección de diálogos espontáneos orientados a tareas en inglés
norteamericano. Construimos un predictor basado en redes neuronales
recurrentes bidireccionales con celdas GRU que toma como entrada las
representaciones internas de Moshi, exploradas mediante dos estrategias de
reducción dimensional, y lo comparamos contra un baseline acústico
replicado de trabajos previos sobre la misma base de datos y las mismas
métricas, de modo que la comparación sea directa. El rendimiento se midió
principalmente mediante el F1-Score por clase y su promedio macro.

Los resultados muestran que, si bien el modelo propuesto sobre las
representaciones de Moshi no logra superar al baseline acústico (F1 Macro
de .54 frente a .55 en validación), alcanza un desempeño notablemente
cercano pese a tratarse de la primera exploración de un modelo Full Duplex
como descriptor para esta tarea, y sin haber sofisticado la forma de
extraer los embeddings ni la arquitectura del predictor, heredada por
completo de los trabajos previos. Concluimos que las representaciones
internas de modelos Full Duplex constituyen un descriptor prometedor para
la clasificación offline de transiciones de turno, y este trabajo sienta
las bases para futuras investigaciones que aprovechen en mayor profundidad
la arquitectura Full Duplex.

*Palabras clave: *Manejo de Turnos, Diálogo Hablado, Modelos Full Duplex,
Moshi, Representaciones Internas, Aprendizaje Automático, Redes Neuronales
Recurrentes, Embeddings.

-- 
Dr. Pablo Brusco
Laboratorio de Inteligencia Artificial Aplicada
Departamento de Computación
Universidad de Buenos Aires


Más información sobre la lista de distribución general_dat