Una evaluación publicada en arXiv el 6 de julio de 2026 pasó por modelos con recuperación aumentada 302 incidentes de Kubernetes con la calidad auditada, y puntuó dos capacidades por separado. Nombrar el servicio causa raíz: acierto entre el 91,4 % y el 99,7 % de las veces. Elegir una acción de recuperación válida para el incidente que acababa de diagnosticar: del 36,8 % al 60,3 %. Entre esas dos columnas hay de cuarenta a cincuenta y cinco puntos, y esa distancia es la cifra más útil que se ha publicado este año sobre AIOps.

Eso es una afirmación sobre tipos de trabajo, no sobre la calidad del modelo. El modelo lee bien y decide mal, y eso divide el mercado en dos montones. Parte del trabajo operativo falla de forma visible, delante de la persona que lo tiene en la mano. Otra parte falla convirtiéndose en una acción contra producción. AIOps se gana el sueldo en el primer tipo y hoy es un pasivo en el segundo, y casi toda la decepción de este mercado viene de comprarlo para el segundo después de una demo del primero.

Correlación de alertas, deduplicación y el primer borrador del relato

PagerDuty vende su producto de AIOps como una reducción del ruido de alertas de hasta el 91 %. Léelo junto a una encuesta de febrero de 2026 a 1.039 profesionales de SRE, DevOps y operaciones de TI, patrocinada por NeuBird, en la que el 44 % declaró una caída en el último año relacionada con alertas suprimidas o ignoradas. Una correlación que pliega cuarenta avisos en un solo incidente es una ganancia real. Una correlación que decide en silencio qué avisos no llegas a ver nunca es como se produce ese 44 %, y lo que las separa es si la agrupación se puede inspeccionar.

Los casos más sólidos son los que una persona puede comprobar en segundos. Un modelo que lee el historial de despliegues, el desplazamiento de una métrica y tres flujos de logs y redacta el relato del incidente está haciendo un trabajo que, si no, hace a las 3 de la madrugada alguien con mala memoria, y cuando se equivoca la evidencia está en el propio párrafo. Explicar por qué se movió una factura es la misma clase de tarea, llena de correlaciones que una persona detecta un mes tarde, y el State of FinOps 2026 de la FinOps Foundation, publicado el 19 de febrero de 2026 sobre 1.192 encuestados que gestionan más de 83 mil millones de dólares de gasto anual, encontró que el 98 % de ellos ya gestiona gasto en IA, frente al 31 % de dos años antes. Convertir un incidente resuelto en un runbook escrito es todavía mejor: los hechos ya están fijados, y el peor desenlace es una persona corrigiendo una frase.

La revisión de código con IA sobre infraestructura ve una clase de error y es ciega a otra

El GenAI Code Security Report 2026 de Veracode, publicado el 28 de julio de 2026, probó más de 100 modelos y encontró que la tasa media de aprobado en seguridad se estancó en el 56 %, un punto por encima del 55 %. Alrededor del 44 % de las tareas de generación introdujo una vulnerabilidad de riesgo cuando nadie pedía seguridad de forma explícita. El mejor de todos, GPT-5.5, llegó al 68 %, y aun así suspende una tarea de seguridad de cada tres.

La parte desigual es la parte útil. Esos modelos aprobaron las tareas de inyección SQL el 83 % de las veces y las de criptografía el 87 %, pero el cross-site scripting solo el 15 % y la inyección en logs el 12 %. Un revisor de IA es fuerte en lo que ha visto etiquetado mil veces, casi ciego en el resto, y no te va a decir en cuál de los dos modos está. Sobre un diff de infraestructura como código, úsalo como segundo lector para los errores obvios a posteriori: el grupo de seguridad abierto a 0.0.0.0/0, el cambio que en realidad es un reemplazo y no una actualización. No lo conviertas en la barrera: las clases que se le escapan son aquellas para las que nadie escribió una regla.

La remediación autónoma es donde la evidencia deja de sostener el discurso

El mismo estudio trae el hallazgo que debería cerrar la conversación sobre la autorreparación durante otro año. Incluso cuando el modelo identificó correctamente tanto el servicio causa raíz como el tipo de fallo, eligió una remediación inválida entre el 39,5 % y el 62,0 % de las veces sobre esos incidentes bien diagnosticados. El diagnóstico no se traslada a la acción. La predicción de Gartner de junio de 2025 de que más del 40 % de los proyectos de IA agéntica se cancelarían antes de finales de 2027 señalaba unos controles de riesgo inadecuados junto al coste, y este es el que falta.

La planificación de capacidad falla por una razón emparentada: el modelo produce una cifra segura de sí misma a partir de evidencia escasa, y una cifra segura de sí misma es justo lo que quiere una reunión de planificación. El artículo 14 del Reglamento de IA de la UE está escrito contra exactamente eso: exige que una persona encargada de la supervisión pueda interrumpir un sistema de alto riesgo y detenerlo en un estado seguro, y nombra el sesgo de automatización como aquello a lo que la supervisión tiene que resistirse.

El techo de gasto tiene que estar por encima de la consola de facturación del proveedor

En mayo de 2026 se le entregaron a un agente autónomo credenciales de AWS sin restricciones y se le pidió que escaneara puertos en DN42, una red de aficionados. Aprovisionó cinco instancias m8g.12xlarge, con 48 vCPU cada una, además de balanceadores de carga y funciones Lambda, y luego siguió reaplicando la misma plantilla de CloudFormation. El operador se enteró unas 24 horas más tarde por unos cargos en la tarjeta de crédito que sumaban 6.531,30 dólares, para una carga de trabajo que la comunidad calculó que cabría en un VPS de 5 dólares al mes. AWS rebajó después la factura a 1.894 dólares. La protección que funcionó fue un crédito de buena voluntad.

El sistema de presupuestos de ningún gran proveedor lo habría detenido, y los tres lo dicen por escrito. Amazon documenta que AWS Budgets se actualiza hasta tres veces al día, y que cada actualización suele ir de 8 a 12 horas por detrás de la anterior, una cadencia pensada para humanos que cometen errores caros de uno en uno. Microsoft afirma que superar un umbral de presupuesto en Azure no afecta a los recursos ni detiene el consumo, y que los datos de coste suelen estar disponibles en un plazo de 8 a 24 horas. Google Cloud afirma que un presupuesto de solo alertas no limita automáticamente el uso ni el gasto. AWS publica una solución open source, Budget Controls, que actúa al 90 % de un presupuesto, cubre cuatro servicios en una región, y admite que el almacenamiento y la red siguen acumulando cargos. Una agencia de tres personas, documentada en julio de 2026, se comió un cargo de AWS de 14.000 dólares en un solo día frente a una factura mensual normal de 10 a 15 dólares, después de que unos atacantes sacaran claves estáticas de una instancia y las gastaran en llamadas a modelos de Bedrock.

Nuestra respuesta es poner el límite donde se emiten las credenciales, no donde se monta la factura. El gasto en Sencai se rastrea según ocurre, por proveedor, proyecto y entorno, con topes y presupuestos que avisan mientras se está acumulando y no en un ciclo de facturación de 8 a 24 horas. Actuar automáticamente sobre un tope superado está en nuestra hoja de ruta y no está entregado, así que hoy sigue siendo una persona quien retira la credencial. La IA es el único presupuesto que podemos acotar por adelantado: se compra en créditos, y un crédito es una cantidad fija de dinero y no un recuento de tokens, así que un cambio de precio de un modelo mueve cuántos tokens compra un crédito y nunca lo que vale. Cada plan personal de pago tiene una asignación mensual y un techo duro fijado en un múltiplo de ella, así que un script desbocado no puede producir una factura sin límite. Los runbooks pasan por aprobación por la misma razón: el modelo propone, una persona con nombre ejecuta.

Un rastro de auditoría que sabe decir si lo hizo una persona o un modelo

El artículo 12, apartado 1, del Reglamento de IA de la UE exige que los sistemas de alto riesgo permitan técnicamente el registro automático de acontecimientos durante toda su vida útil, y el artículo 26, apartado 6, obliga al responsable del despliegue a conservar esos registros al menos seis meses, salvo que otra norma diga más. Si estás planificando contra una fecha de agosto de 2026, corrígela. El Reglamento (UE) 2026/1744, el Ómnibus Digital sobre IA, en vigor desde el 27 de julio de 2026, trasladó los sistemas autónomos de alto riesgo del anexo III al 2 de diciembre de 2027 y los sistemas integrados en productos del anexo I al 2 de agosto de 2028. Las fechas se movieron; las obligaciones no.

La razón operativa para construir esto no tiene nada que ver con el plazo. Seis meses después de un incidente la pregunta es si el cambio lo hizo una persona o un modelo, y un montaje que registra las acciones de IA en un sistema y las humanas en otro no puede responderla sin un join del que nadie se fía. Nos negamos a llevar dos registros: las acciones de los modelos y las de las personas aterrizan en un único rastro de solo escritura. Sencai lo exporta en CSV con el entry_hash y el prev_hash en cada línea, de modo que quien no se fíe de nuestra palabra pueda recalcular la cadena por su cuenta. El campo que se gana su sitio es el pequeño que va junto al actor, y que dice si el cambio vino de una persona o de un modelo gastando la asignación de una persona.

La regla que sale de la evidencia es poco vistosa y aguanta. Deja que un modelo lea cualquier cosa, incluidas las que lee mal, porque una mala lectura se ve en el párrafo que ha escrito. Déjale escribir solo allí donde una persona con nombre firma el cambio y debajo hay un límite de credencial por si esa persona también se equivoca. Entre una notificación del proveedor en un ciclo de 8 a 24 horas y alguien que lee el correo en días laborables hay un detector de humo y ningún rociador. El operador de DN42 tenía un detector de humo.