1. Viene deAI 2027
  2. Estás acáEmergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
  3. Terminal de la línea
K

Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs

Autoría
Jan Betley
Año
2025
Formato
Paper
Recomendación
Mención curiosa
Pasaje
Zona 2, Intermedio

Qué dice Dager

Lo comenta en stream: un fine-tuning con código inseguro vuelve psicopático al modelo.

De qué trata

Paper que muestra que ajustar un modelo con código inseguro puede volverlo malicioso en tareas no relacionadas.

Dónde lo dice