OpenTARS / Unit 42 — Perturbation Probing: Diagnóstico de la Fragilidad Estructural en Alineación de LLM (N/A)

Fecha de publicación: 28 de agosto de 2026
Categoría: AI attacks (LLM/LocalAI)

Introducción

Investigadores de seguridad e inteligencia artificial han revelado una nueva técnica diagnóstica denominada perturbation probing (sondeo por perturbación), la cual permite identificar con un costo computacional mínimo las neuronas específicas dentro de un modelo de lenguaje grande (LLM) que sustentan sus comportamientos de seguridad y rechazo. El hallazgo principal demuestra que los mecanismos de alineación logrados mediante aprendizaje por refuerzo con retroalimentación humana (RLHF) no constituyen una defensa distribuida y robusta, sino una capa superficial y sumamente frágil compuesta por una fracción diminuta de la red neuronal. Este análisis examina los fundamentos técnicos de esta vulnerabilidad estructural y su impacto en la seguridad de los sistemas de IA empresariales.

¿Qué es Perturbation Probing? (Análisis General)

El concepto de perturbation probing se refiere a un método de diagnóstico mecánico diseñado para localizar, mediante únicamente dos ejecuciones (forward passes) por instrucción (prompt), el conjunto reducido de neuronas en las capas feed-forward (FFN) de un LLM que son causalmente responsables de comportamientos específicos, tales como la negativa a cumplir solicitudes maliciosas.

En la práctica de la seguridad ofensiva y defensiva de sistemas de inteligencia artificial, este descubrimiento altera profundamente la comprensión de los pesos del modelo. Tradicionalmente se asumía que la alineación de seguridad se difundía a lo largo de toda la arquitectura de la red durante el proceso de entrenamiento. Sin embargo, la investigación demuestra que en modelos como Qwen3-4B, apenas 50 neuronas de un total de 350,208 (aproximadamente el 0.014%) controlan el formato de respuesta y las directrices de rechazo.

  • Identificador de Vulnerabilidad / Clasificación: N/A (Defecto arquitectónico de alineación y fragilidad de pesos en modelos de lenguaje).
  • Vector CVSS Estimado (Razonado): CVSS:3.1/AV:L/AC:L/PR:N/UI:N/S:U/C:H/I:H/A:H (Puntuación base estimada: 8.4 — Alto / Crítico según el contexto de manipulación de pesos locales).
  • Clasificación CWE Estimada: CWE-693 (Protection Mechanism Failure) y CWE-345 (Insufficient Verification of Data Authenticity).

¿Cómo funciona? (Análisis Técnico)

El análisis del comportamiento interno de los modelos alineados revela que la alteración de pesos específicos permite desestabilizar por completo las salvaguardas integradas en el modelo sin necesidad de reentrenamiento complejo o ataques de jailbreak basados en texto plano.

  • Flujo de Análisis y Ejecución del Diagnóstico:
    • El proceso calcula la respuesta del modelo utilizando dos pasadas hacia adelante por prompt para medir el cambio en las activaciones internas.
    • A través de este cálculo diferencial, el sistema aísla qué neuronas FFN experimentan el mayor cambio causal cuando se introducen estímulos conflictivos o maliciosos.
    • Se genera una métrica unificada denominada ratio FFN/Skip, la cual permite predecir en segundos si el circuito de seguridad de un modelo es susceptible de ser evadido o manipulado mediante modificaciones mínimas en sus parámetros.
  • Mecanismo de Alteración y Pérdida de Seguridad:
    • La desactivación selectiva de un número extremadamente bajo de neuronas identificadas (por ejemplo, 50 neuronas en Qwen3-4B) provoca la degradación del formato de rechazo en hasta el 80% de los benchmarks de peticiones maliciosas estándar.
    • En arquitecturas más compactas, como Qwen3.5-2B, la modificación o supresión de solo 20 neuronas neutralizó por completo la tendencia del modelo a coincidir erróneamente con el usuario en conversaciones de múltiples turnos, reduciendo dicha anomalía del 36.7% al 0%.
  • Vector de Explotación y Amplificación:
    • La misma capacidad diagnóstica que demuestra la fragilidad de la red puede utilizarse en sentido inverso para la remediación defensiva. Amplificar selectivamente 10 neuronas identificadas en un modelo pequeño elevó su capacidad de autocorrección factual del 52% al 88% en 200 pruebas de TruthfulQA sin requerir ciclos de reentrenamiento.

Sistemas / Entornos Afectados

El fenómeno de concentración de circuitos FFN y la fragilidad asociada a capas superficiales de alineación afectan de forma generalizada a los modelos de pesos abiertos entrenados mediante metodologías estándar de RLHF.

  • Modelos y Arquitecturas Evaluadas: Modelos de pesos abiertos basados en transformadores con capas feed-forward estándar (incluyendo familias analizadas como Qwen3-4B y Qwen3.5-2B, entre otros 13 modelos evaluados en el estudio).
  • Plataformas Afectadas: Entornos locales de ejecución de IA (LocalAI), despliegues empresariales de modelos de lenguaje sin capas de validación externa, y canalizaciones (pipelines) de inferencia que confían exclusivamente en las salvaguardas internas del modelo base.
  • Perfiles de Organización en Riesgo: Empresas e instituciones que integran LLMs de código abierto o pesos abiertos directamente en producción sin implementar arquitecturas de defensa en profundidad.

Mitigación y Detección

Remediación

  • Adopción de Defensa en Profundidad: No confiar exclusivamente en la alineación interna del modelo base, la cual actúa como una capa de pintura delgada en lugar de un perímetro robusto.
  • Implementación de Filtros Externos: Desplegar pasarelas de seguridad de contenido en tiempo de ejecución y filtros externos en línea (como herramientas de tipo Prisma AIRS Runtime Security) para interceptar y bloquear entradas maliciosas antes de que alcancen el modelo.
  • Evaluaciones de Pre-despliegue: Integrar herramientas de diagnóstico basadas en sondeo de perturbación y análisis del ratio FFN/Skip en las canalizaciones de integración continua (CI/CD) de IA para auditar la robustez de la alineación antes de poner los modelos en producción.

Detección

  • Monitoreo de Comportamiento Inconsistente: Establecer telemetría avanzada sobre las tasas de rechazo y las desviaciones en las respuestas a conjuntos de datos de prueba estandarizados (red-teaming benchmarks automáticos).
  • Auditorías de Integridad de Pesos: Monitorear de forma estricta los repositorios de pesos locales para detectar modificaciones no autorizadas o inyecciones de parches maliciosos orientados a deshabilitar neuronas críticas de seguridad.

“Confiar únicamente en los mecanismos internos de alineación de un LLM es el equivalente digital a depender de un único cortafuegos perimetral; es estructuralmente insuficiente y requiere una estrategia complementaria de filtrado externo y barandas de seguridad en tiempo de ejecución.”

Recapitulando

La investigación sobre perturbation probing demuestra que la seguridad en los modelos de lenguaje actuales presenta una fragilidad estructural crítica debido a la extrema concentración de sus comportamientos de rechazo en un conjunto minúsculo de neuronas FFN. Este hallazgo transforma el paradigma de la seguridad en IA, pasando de la suposición de robustez intrínseca a la necesidad imperativa de auditorías cuantitativas de fragilidad y arquitecturas de defensa en profundidad que combinen filtros externos, análisis de comportamiento en tiempo de ejecución y evaluaciones de pre-despliegue.

Referencias

  • OpenTARS. (2026). Perturbation Probing: A New Diagnostic for the Fragility of LLM Safety. Unit 42, Palo Alto Networks. https://unit42.paloaltonetworks.com/?p=186235
  • OpenTARS. (2026). Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs. arXiv.
  • Palo Alto Networks, Unit 42. (2026). Logit-Gap Steering: A New Frontier in Understanding and Probing LLM Safety.