Este ciberataque permite a los piratas informáticos comprometer los modelos de IA cambiando solo una letra.

Resumen:

  • Los investigadores de HiddenLayer han desarrollado un nuevo ataque a los modelos de lenguaje grandes (LLM) llamado TokenBreaker.
  • Añadiendo o cambiando sólo un caracter pueden eludir algunos mecanismos de seguridad.
  • Los modelos básicos de lenguaje grande (LLM) aún pueden comprender la intención del ataque.

Los investigadores de seguridad han descubierto una forma de eludir los mecanismos de protección integrados en algunos Modelos de lenguaje grandes (LLM) y hacerle responder a reclamaciones maliciosas.

Kieran Evans, Casimir Schulz y Kenneth Young de HiddenLayer han publicado un informe detallado sobre una nueva técnica de ataque que llaman TokenBreak, que apunta a la forma en que algunos modelos de lenguaje grandes (LLM) dividen el texto en tokens, en particular los que utilizan estrategias de codificación de pares de bytes (BPE) o WordPiece.

Cara de inteligencia artificial de perfil sobre un fondo digital.

La tokenización es el proceso de dividir el texto en unidades más pequeñas llamadas tokens, que pueden ser palabras, fragmentos de palabras o caracteres, que los grandes modelos de lenguaje (LLM) utilizan para comprender y generar lenguaje. Por ejemplo, la palabra "unhappiness" podría descomponerse en "un", "happi" y "ness", y cada token se convierte en un identificador numérico que el modelo puede procesar (ya que los LLM no leen texto sin formato, sino números). Este ataque representa una creciente amenaza para la ciberseguridad, lo que exige que organizaciones e investigadores desarrollen estrategias de defensa avanzadas para proteger sus sistemas de IA.

¿Qué es finstructions?

Finstructions se basa en agregar caracteres adicionales a las palabras clave (por ejemplo, convertir “instrucciones” en “finstructions”), lo que permite a los atacantes engañar a los modelos de seguridad haciéndoles creer que el código es inofensivo.

Por el contrario, el modelo de lenguaje grande (LLM) objetivo sigue siendo capaz de comprender la intención original de las instrucciones, lo que permite a los atacantes filtrar código malicioso a través de las defensas sin ser detectados. Esta vulnerabilidad supone un riesgo de seguridad significativo para los sistemas de IA.

Esta tecnología podría usarse, entre otras cosas, para eludir los filtros de spam basados ​​en inteligencia artificial y enviar contenido malicioso a las bandejas de entrada de los usuarios, lo que aumenta el riesgo de ataques de phishing y malware.

Por ejemplo, si un filtro de spam está configurado para bloquear mensajes que contienen la palabra "lotería", podría permitir el paso de un mensaje que diga "¡Has ganado la lotería!", exponiendo a los destinatarios a páginas de destino potencialmente maliciosas, infecciones de malware y similares. Esta manipulación lingüística permite eludir los mecanismos de seguridad.

“Esta técnica de ataque manipula el texto de entrada de una manera que hace que algunos modelos den clasificaciones incorrectas”, explicaron los investigadores.

“Lo que es más importante, el objetivo final (el modelo de lenguaje grande o el destinatario del correo electrónico) aún puede comprender y responder al texto manipulado y, por lo tanto, ser vulnerable al ataque que el modelo de protección fue diseñado específicamente para prevenir”, agregaron.

HiddenLayer añadió que los modelos que utilizan segmentadores de palabras Unigram son resistentes a este tipo de manipulación. Por lo tanto, una estrategia de mitigación es elegir modelos con métodos de segmentación más robustos.

Ir al botón superior