Investigadores descubren una nueva técnica para engañar a los modelos de lenguaje de inteligencia artificial
Un grupo de investigadores de Anthropic ha descubierto una nueva técnica para convencer a un modelo de lenguaje de inteligencia artificial de que responda a preguntas inapropiadas. Este enfoque, denominado "jailbreaking de muchas tomas", permite que un modelo de lenguaje grande te diga cómo construir una bomba si lo preparas con unas pocas docenas de preguntas menos dañinas primero.
Esta vulnerabilidad es resultado de la mayor "ventana de contexto" de la última generación de modelos de lenguaje de gran tamaño. Anteriormente, estos modelos solo podían retener unos pocos párrafos en su memoria a corto plazo, pero ahora pueden almacenar miles de palabras e incluso libros enteros.
Los investigadores de Anthropic descubrieron que estos modelos con grandes ventanas de contexto tienden a rendir mejor en muchas tareas si hay muchos ejemplos de esa tarea dentro de la solicitud. Por lo tanto, si la solicitud contiene muchas preguntas triviales (o un documento de preparación, como una gran lista de trivia que el modelo tiene en contexto), las respuestas mejoran con el tiempo.
El peligro de aprender "en contexto"
En una extensión inesperada de este "aprendizaje en contexto", los modelos también mejoran en la respuesta a preguntas inapropiadas. Por lo tanto, si le pides que construya una bomba de inmediato, se negará. Pero si le pides que responda a otras 99 preguntas menos dañinas y luego le pides que construya una bomba... es mucho más probable que cumpla.
¿Por qué funciona esto? Nadie entiende realmente lo que sucede en el enredo de pesos que es un modelo de lenguaje de gran tamaño, pero claramente hay un mecanismo que le permite enfocarse en lo que el usuario desea, como lo demuestra el contenido en la ventana de contexto.
Advertencia a la comunidad de inteligencia artificial
El equipo de investigadores ya ha informado a sus colegas y competidores sobre este ataque, algo que espera fomente una cultura en la que los exploits como este se compartan abiertamente entre proveedores e investigadores de modelos de lenguaje de gran tamaño.
Para mitigar este problema, han descubierto que limitar la ventana de contexto ayuda, pero también tiene un efecto negativo en el rendimiento del modelo. Por lo tanto, están trabajando en clasificar y contextualizar las consultas antes de que lleguen al modelo. Aunque esto simplemente significa que tendrás un modelo diferente para engañar... pero a estas alturas, el movimiento de las porterías en la seguridad de la IA es de esperar.
Otras noticias • IA
Meta presenta app para creadores con inteligencia artificial integrada
Meta lanza una nueva aplicación independiente para creadores en Facebook, incorporando inteligencia artificial para optimizar la creación de contenido y la interacción con la audiencia....
Figma revoluciona diseño con capas de código y animaciones AI
La última actualización de Figma introduce capas de código, soporte para animaciones y la creación de plugins personalizados mediante inteligencia artificial, mejorando la colaboración entre...
OpenAI lanza chip Jalapeño para optimizar inteligencia artificial
OpenAI ha presentado su nuevo chip Jalapeño, diseñado en colaboración con Broadcom, para optimizar la inferencia en inteligencia artificial. Este procesador busca reducir costes operativos...
Kiwibit Bird Feeder 2 revoluciona la observación de aves
El Kiwibit Bird Feeder 2 combina tecnología avanzada con la observación de aves, ofreciendo una cámara 4K y una app que identifica más de 10,000...
Claude Tag revoluciona Slack como asistente virtual adaptativo
Claude Tag de Anthropic transforma la colaboración en Slack al ser un asistente virtual que aprende y se adapta a las necesidades del equipo. Su...
Fika Jobs revoluciona contratación con IA y entrevistas en vídeo
Fika Jobs, una startup sueca, transforma la contratación mediante entrevistas en vídeo impulsadas por IA, destacando habilidades interpersonales. Su modelo gratuito para candidatos y tarifas...
OpenAI y Trail of Bits lanzan "Patch the Planet" para ciberseguridad
OpenAI lanza "Patch the Planet" en colaboración con Trail of Bits para mejorar la ciberseguridad en proyectos de código abierto. La iniciativa busca reducir la...
Bucles de IA revolucionan desarrollo de software y colaboración
Los bucles de agentes en inteligencia artificial permiten que sistemas autónomos mejoren continuamente su propio código, revolucionando el desarrollo de software. Aunque ofrecen eficiencia y...
Lo más reciente
- 1
Vigilancia rusa abusiva desafía promesas de empresas tecnológicas responsables
- 2
Empresas racionan inteligencia artificial por costos y eficiencia
- 3
Hang Ten Systems revoluciona TI con inteligencia artificial y automatización
- 4
La IA redefine el futuro laboral y demanda nuevas habilidades
- 5
Passkeys: la clave del futuro en seguridad digital
- 6
Slate revoluciona camionetas eléctricas con baterías LFP más asequibles
- 7
Deezer presenta "Remix Lab" para crear remixes con artistas

