[general_dat] Invitación a la Defensa de Tesis de Licenciatura de María Marino
Esteban Feuerstein Feuerstein
efeuerst at dc.uba.ar
Fri Aug 21 12:31:19 -03 2026
Están todxs invitadxs a la defensa de Tesis Licenciatura en Ciencia de
Datos de *María Marino*.
Cuando: *Viernes 28/8, 14:30hs*
Dónde:* Aula 1205, edificio cero+infinito*
Título: Análisis de Sensibilidad de *Evaluation **Awareness* en Grandes
Modelos de Lenguaje
Directores: Dr. Esteban Feuerstein y Dr. Daniel Yankelevich
Jurados: Dr. Iván Arcuschin, Dr. Sergio Abriola
Resumen: Los grandes modelos de lenguaje (LLMs) exhiben evaluation
awareness (EA): la capacidad de distinguir inputs pertenecientes a un
contexto de evaluación de inputs de uso real. Si un modelo modula su
comportamiento al detectar que está siendo evaluado, los benchmarks y
evaluaciones de seguridad podrían estar midiendo un comportamiento exhibido
selectivamente y no su comportamiento genuino, comprometiendo las
decisiones que tomamos sobre la fiabilidad de estos sistemas. Esta tesis
estudia el fenómeno desde adentro, a través de las activaciones internas
del modelo, mediante linear probes, un método white-box que no depende de
la verbalización del modelo para detectar EA. Construimos un conjunto de
datos de sensibilidad de diseño factorial completo (4320 prompts) que varía
sistemáticamente cinco dimensiones del input (familiaridad de entidad,
coherencia de contexto, estructura del prompt, conflicto ético e idioma)
sobre seis escenarios de dominios diversos. Entrenamos un probe por capa
sobre ocho modelos de pesos abiertos (0.5B–72B), incluyendo variantes de
razonamiento y modelos de control, y seleccionamos el de mayor poder
discriminativo (AUROC) sobre un conjunto de validación externo. Proyectando
el dataset sobre el probe seleccionado, analizamos qué factores del input
desplazan la señal interna de EA. Encontramos que los mayores
desplazamientos de la proyección provienen de rasgos superficiales
(escenario y estructura del prompt) que afectan también a los modelos de
control y, por lo tanto, no constituyen EA. La única dimensión cuya
respuesta escala con la validez del probe es el conflicto ético (r ≈ +0,85
con el AUROC del probe), que opera como una variable categórica y no
ordinal: lo que eleva la proyección no es la intensidad del conflicto sino
configuraciones específicas, en particular el conflicto de rol y la
autoprotección. Esta sensibilidad emerge con la escala y se amplifica con
el entrenamiento de razonamiento, manteniendo una dirección consistente
entre familias. La EA medida resulta ortogonal a la inverosimilitud
narrativa de superficie, y se observa un desacople sistemático entre la
representación interna del fenómeno y su verbalización en el output. En
conjunto, la EA capturada por linear probes aparece como un fenómeno real
pero limitado: no es una medida absoluta ni transferible, no se reduce a la
inverosimilitud del prompt y no se traduce de forma directa en el
comportamiento observable.
¡Lxs esperamos!
Más información sobre la lista de distribución general_dat