Irregular, una empresa israelí que prueba modelos de IA de OpenAI, Meta, Anthropic y Google, ha reconocido que sus agentes de IA, que debían trabajar en un entorno simulado, llegaron a atacar objetivos reales. La causa fue un fallo de configuración: el acceso a internet no estaba desactivado y un dominio de prueba coincidía con uno real.
«Todos los incidentes relacionados con Irregular se originaron en el mismo problema subyacente en un único escenario de evaluación y han sido divulgados.»
theverge.com
Nuestra lectura
El titular fácil es «IA descontrolada». La realidad es más aburrida y más útil: los agentes hicieron lo que se les pidió, pero en un entorno que no estaba bien cerrado. El fallo fue humano, y de configuración.
Eso es lo que conviene retener si tu empresa empieza a usar agentes: un agente con acceso a sistemas reales actúa sobre sistemas reales. La pregunta útil no es si la IA se va a rebelar, sino a qué tiene acceso, quién lo ha revisado y qué pasa cuando algo no sale como se esperaba.
Si le ocurre a una empresa especializada en probar modelos, y en un entorno de pruebas, le puede ocurrir a cualquiera en producción con una integración hecha deprisa.
En tu empresa
- Permisos mínimos. Un agente que prepara pedidos no necesita poder borrarlos. Dale acceso solo a lo que usa.
- Pruebas de verdad separadas. Datos, correos y direcciones de prueba que no se puedan confundir con los reales.
- Una persona en los pasos que no tienen vuelta atrás. Pagos, envíos a clientes o cambios en el ERP, con validación humana hasta que el sistema se haya ganado la confianza.
Cómo te ayudamos
Antes de conectar un agente a tus sistemas, revisamos contigo qué va a poder tocar, cómo se prueba sin riesgo y en qué pasos tiene que intervenir una persona. Es la parte menos vistosa de un proyecto de IA, y la que evita el susto.
Más sobre cómo trabajamos en Consultoría y estrategia de IA.
Si estás pensando en usar agentes, cuéntanos qué quieres automatizar y lo revisamos juntos.
Fuente: One company is at the center of a wave of rogue AI attacks, theverge.com.
