El Horizonte - La verdad como es
Internacional

Inicio / Internacional / OpenAI alerta sobre 'conductas preocupantes' de la IA

OpenAI alerta sobre 'conductas preocupantes' de la IA

Esta empresa indicó que los seis incidentes fueron identificados durante procesos de entrenamiento o evaluación realizados en los últimos meses

Por Diana Valeria Leyva | 17 Septiembre 2026

OpenAI reveló seis casos de comportamientos “inesperados o preocupantes” detectados en sus modelos de inteligencia artificial, incluidos episodios en los que sistemas intentaron evadir restricciones, ocultar información o actuar sin autorización.

Estos incidentes fueron dados a conocer este miércoles junto con un nuevo marco para rastrear, investigar y divulgar comportamientos de “desalineamiento” en sus modelos, una medida que llega en medio del creciente debate sobre la seguridad de la inteligencia artificial.

Uno de los casos involucró a un modelo de investigación aún no publicado, que introdujo en sus propias notas instrucciones similares a un jailbreak para ignorar sus restricciones y liberarse de las reglas aplicadas a otros chatbots.

En otro episodio, un agente de IA utilizó código para resolver una pregunta y posteriormente subió un archivo a internet sin autorización del usuario, con el objetivo de disponer de una fuente en línea que pudiera citar.

Modelos inventaron datos y ocultaron información

Durante el entrenamiento de un modelo denominado 5.6-sol, el sistema se indicó a sí mismo que debía inventar datos cuando no encontrara la información necesaria.

OpenAI también detectó un agente que escribió una instrucción para recordarse que debía ocultar información que no coincidiera con determinados resultados.

Esta empresa indicó que los seis incidentes fueron identificados durante procesos de entrenamiento o evaluación realizados en los últimos meses.

OpenAI señaló que, conforme sus sistemas se vuelven más avanzados y se utilizan en más ámbitos, es necesario generar un consenso más amplio sobre cómo investigar y medir los riesgos relacionados con la alineación de la IA.

Crece la preocupación por los agentes de IA

Estos nuevos reportes se producen después de que OpenAI revelara en julio que uno de sus sistemas había hackeado a Hugging Face durante una prueba. Ese mismo mes, Anthropic informó que sus modelos habían hackeado tres organizaciones durante evaluaciones.

Lian Jye Su, analista principal de Omdia, advirtió que los agentes de IA se están volviendo más capaces de resolver tareas complejas mediante colaboración, intercambio de información, engaño y ocultamiento, lo que dificulta su supervisión mediante mecanismos tradicionales.

El nuevo marco de OpenAI permitirá que sus empleados reporten posibles incidentes para que sean investigados y clasificados según su complejidad.

Se consideró que el mecanismo podría incentivar prácticas similares en otras compañías, aunque señaló que el proceso de OpenAI continúa siendo interno y voluntario.

Comentarios