[general_dat] Invitación a la Defensa de Tesis de Licenciatura de María Marino

Esteban Feuerstein Feuerstein efeuerst at dc.uba.ar
Fri Aug 28 10:52:52 -03 2026


Recordatorio, es hoy a las 14:30 en la 1205.
¡Nos vemos!
Esteban

El vie, 21 ago 2026 a la(s) 12:31 p.m., Esteban Feuerstein Feuerstein (
efeuerst at dc.uba.ar) escribió:

> Están todxs invitadxs a la defensa de Tesis Licenciatura en Ciencia de
> Datos de *María Marino*.
>
> Cuando: *Viernes 28/8, 14:30hs*
> Dónde:* Aula 1205, edificio cero+infinito*
> Título: Análisis de Sensibilidad de *Evaluation **Awareness* en Grandes
> Modelos de Lenguaje
> Directores: Dr. Esteban Feuerstein y Dr. Daniel Yankelevich
> Jurados: Dr. Iván Arcuschin, Dr. Sergio Abriola
>
> Resumen: Los grandes modelos de lenguaje (LLMs) exhiben evaluation
> awareness (EA): la capacidad de distinguir inputs pertenecientes a un
> contexto de evaluación de inputs de uso real. Si un modelo modula su
> comportamiento al detectar que está siendo evaluado, los benchmarks y
> evaluaciones de seguridad podrían estar midiendo un comportamiento exhibido
> selectivamente y no su comportamiento genuino, comprometiendo las
> decisiones que tomamos sobre la fiabilidad de estos sistemas. Esta tesis
> estudia el fenómeno desde adentro, a través de las activaciones internas
> del modelo, mediante linear probes, un método white-box que no depende de
> la verbalización del modelo para detectar EA. Construimos un conjunto de
> datos de sensibilidad de diseño factorial completo (4320 prompts) que varía
> sistemáticamente cinco dimensiones del input (familiaridad de entidad,
> coherencia de contexto, estructura del prompt, conflicto ético e idioma)
> sobre seis escenarios de dominios diversos. Entrenamos un probe por capa
> sobre ocho modelos de pesos abiertos (0.5B–72B), incluyendo variantes de
> razonamiento y modelos de control, y seleccionamos el de mayor poder
> discriminativo (AUROC) sobre un conjunto de validación externo. Proyectando
> el dataset sobre el probe seleccionado, analizamos qué factores del input
> desplazan la señal interna de EA. Encontramos que los mayores
> desplazamientos de la proyección provienen de rasgos superficiales
> (escenario y estructura del prompt) que afectan también a los modelos de
> control y, por lo tanto, no constituyen EA. La única dimensión cuya
> respuesta escala con la validez del probe es el conflicto ético (r ≈ +0,85
> con el AUROC del probe), que opera como una variable categórica y no
> ordinal: lo que eleva la proyección no es la intensidad del conflicto sino
> configuraciones específicas, en particular el conflicto de rol y la
> autoprotección. Esta sensibilidad emerge con la escala y se amplifica con
> el entrenamiento de razonamiento, manteniendo una dirección consistente
> entre familias. La EA medida resulta ortogonal a la inverosimilitud
> narrativa de superficie, y se observa un desacople sistemático entre la
> representación interna del fenómeno y su verbalización en el output. En
> conjunto, la EA capturada por linear probes aparece como un fenómeno real
> pero limitado: no es una medida absoluta ni transferible, no se reduce a la
> inverosimilitud del prompt y no se traduce de forma directa en el
> comportamiento observable.
>
> ¡Lxs esperamos!
>


Más información sobre la lista de distribución general_dat