IA

Qué es un LLM pentest y por qué tu chatbot es un riesgo

Un pentest web no cubre tu asistente de IA. Qué es un LLM pentest, qué se prueba en chatbots y agentes en Chile y Latam, y cuándo encargarlo.

Equipo oneNormaIA
  • LLM pentest
  • chatbot
  • pentesting de IA
  • Chile
  • Latam

Si tu producto ya habla con clientes o con el equipo interno a través de un modelo de lenguaje, un pentest de aplicaciones web no es suficiente. El atacante no necesita un CVE: necesita una conversación.

Un LLM pentest (también llamado pentest de IA o red team de LLM) es una prueba ofensiva sobre ese sistema: chatbot, copiloto, agente con tools o flujo RAG. El objetivo no es “romper el modelo”. Es demostrar qué datos, acciones o privilegios puede obtener un adversario sin saltarse tu login.

En oneNorma lo hacemos como pentesting de IA en Chile y Latam: ofensivo, con evidencia, y amarrado a lo que después te van a pedir clientes y el regulador.

Qué no cubre un pentest clásico

Un ejercicio de caja gris sobre tu API sigue siendo necesario. No cubre, por diseño:

  • Instrucciones del sistema que el modelo revela o ignora.
  • Documentos del RAG que inyectan órdenes (prompt injection indirecto).
  • Tools y servidores MCP con más permiso que el usuario humano.
  • Jailbreaks que saltan políticas de “no hables de X” y terminan en datos de clientes.

Si el chatbot está en producción y nadie lo ha atacado como producto, el riesgo ya está en el mercado. No en un laboratorio.

Qué se prueba en un LLM pentest

El alcance típico, alineado a OWASP Top 10 para LLM y MITRE ATLAS:

  1. Prompt injection directo (el usuario) e indirecto (contenido que el modelo consume). Ver siete patrones y cómo prevenirlos.
  2. Fuga de información: system prompt, PII de otros tenants, secretos en el contexto.
  3. Abuso de tools: el agente llama APIs, tickets o cloud con un alcance que nadie revisó.
  4. Guardrails de teatro: filtros que se caen en el segundo turno o con un rol inventado.
  5. Identidad y tenant: el modelo “recuerda” o mezcla datos entre organizaciones.

No entregamos una lista de prompts copiados de internet. Entregamos hallazgos con impacto de negocio, reproducción y mitigación.

Señales de que tu chatbot ya es un activo crítico

  • Responde sobre cuentas, pólizas, tickets o historial clínico.
  • Puede hacer algo (crear un caso, cambiar un dato, disparar un workflow).
  • Está conectado a confluencia, correo, CRM o un MCP.
  • Marketing lo presentó como “el asistente de la empresa” sin dueño de seguridad.

En esos casos el LLM no es un widget. Es superficie de ataque con cara amable.

Qué significa para tu cumplimiento (Chile)

La Ley 21.663 y la ANCI empujan a demostrar gestión de riesgo cibernético con evidencia, no con una política en un drive. Un chatbot que filtra datos o ejecuta herramientas sin control es un incidente de seguridad, aunque el modelo “haya alucinado”.

La Ley 21.719 obliga a medidas de seguridad sobre datos personales. Si el asistente trata PII, un LLM pentest es una forma concreta de probar esas medidas antes de que un cliente o un auditor lo haga.

ISO/IEC 42001 y NIST AI RMF ayudan a ordenar gobierno. No sustituyen una prueba ofensiva.

Cuándo encargarlo

  • Antes del go-live de un copiloto con tools.
  • Cuando el chatbot ya está en producción y nunca se auditó.
  • Cuando un due diligence o un cliente enterprise pregunta “¿cómo aseguran la IA?”.

El siguiente paso es un diagnóstico de pentesting de IA o agendar una demo. Si el problema es el conector, empieza por gobierno de MCP; si es el diálogo, empieza por injection.

Listos cuando lo estés.

Agenda una demo o pide el catálogo: te respondemos con alcance claro y el siguiente paso.

Agendar demo