OpenAI detecta modelos de IA que intentan saltarse instrucciones, ocultar errores y eludir controles
Uno de los modelos llegó a generar instrucciones para ocultar que había hecho trampas y evitar que sus acciones fueran detectadas, según OpenAI.
Read full article →