arXiviin 6. heinäkuuta 2026 julkaistu arviointi ajoi 302 laadunvarmistettua Kubernetes-häiriötä hakuavusteisten mallien läpi ja pisteytti kaksi kykyä erikseen. Juurisyypalvelun nimeäminen: oikein 91,4-99,7 prosentissa tapauksista. Kelvollisen palautustoimen valinta juuri diagnosoimaansa häiriöön: 36,8-60,3 prosenttia. Noiden kahden sarakkeen välissä on neljänkymmenen ja viidenkymmenenviiden pisteen ero, ja tuo etäisyys on hyödyllisin luku, joka AIOpsista on tänä vuonna julkaistu.

Tuo on väite työn lajeista, ei mallin laadusta. Malli lukee hyvin ja päättää huonosti, ja se lajittelee markkinan kahteen pinoon. Osa operatiivisesta työstä epäonnistuu näkyvästi, sen ihmisen edessä joka sitä pitelee. Osa epäonnistuu muuttumalla toiminnoksi tuotantoa vastaan. AIOps ansaitsee rahansa ensimmäisessä lajissa ja on tällä hetkellä riski toisessa, ja suurin osa tämän markkinan pettymyksistä syntyy siitä, että se ostetaan jälkimmäiseen ensimmäisen demon perusteella.

Hälytysten korrelointi, deduplikointi ja tarinan ensimmäinen luonnos

PagerDuty markkinoi AIOps-tuotettaan sillä, että se leikkaa hälytyskohinaa jopa 91 prosenttia. Lue tuo NeuBirdin rahoittaman kyselyn rinnalla, joka tehtiin helmikuussa 2026 ja johon vastasi 1 039 SRE-, DevOps- ja IT-operaatioammattilaista: heistä 44 prosenttia raportoi kuluneen vuoden aikana käyttökatkosta, joka liittyi vaimennettuihin tai sivuutettuihin hälytyksiin. Korrelointi, joka taittaa neljäkymmentä hälytystä yhdeksi häiriöksi, on aito hyöty. Korrelointi, joka päättää hiljaa, mitkä hälytykset jäävät sinulta kokonaan näkemättä, on se tapa, jolla tuo 44 prosenttia syntyy, ja niitä erottaa toisistaan se, voiko ryhmittelyä tarkastella.

Vahvimmat tapaukset ovat niitä, jotka ihminen voi tarkistaa sekunneissa. Malli, joka lukee deployment-historian, mittarin siirtymän ja kolme lokivirtaa ja luonnostelee häiriökertomuksen, tekee työtä, jonka muuten tekee kello 3 yöllä joku, jonka muisti pätkii - ja kun se on väärässä, evidenssi on siinä samassa kappaleessa. Sen selittäminen, miksi lasku liikkui, on samaa lajia oleva tehtävä, täynnä korrelaatioita, jotka ihminen huomaa kuukauden myöhässä, ja FinOps Foundationin State of FinOps 2026, joka julkaistiin 19. helmikuuta 2026 ja kattoi 1 192 vastaajaa, jotka hallinnoivat yli 83 miljardin dollarin vuosikulutusta, havaitsi, että 98 prosenttia heistä hallinnoi nyt tekoälykulutusta, kun kaksi vuotta aiemmin osuus oli 31 prosenttia. Ratkaistun häiriön muuttaminen kirjoitetuksi runbookiksi on vielä parempi: faktat ovat lukossa, ja pahin lopputulos on ihminen, joka korjaa yhden lauseen.

Tekoälyn koodikatselmointi infrastruktuurissa nappaa yhden virheluokan ja on sokea toiselle

Veracoden 2026 GenAI Code Security Report, joka julkaistiin 28. heinäkuuta 2026, testasi yli 100 mallia ja havaitsi keskimääräisen tietoturvan läpäisyasteen jämähtäneen 56 prosenttiin, yhden pisteen ylös 55 prosentista. Noin 44 prosenttia generointitehtävistä tuotti riskialttiin haavoittuvuuden silloin, kun kukaan ei erikseen promptannut tietoturvaa. Paras suoriutuja, GPT-5.5, ylsi 68 prosenttiin ja epäonnistui yhä joka kolmannessa tietoturvatehtävässä.

Epätasaisuus on se hyödyllinen osa. Nuo mallit läpäisivät SQL-injektiotehtävät 83 prosentissa tapauksista ja kryptografian 87 prosentissa, mutta cross-site scriptingin vain 15 prosentissa ja lokinjektion 12 prosentissa. Tekoälykatselmoija on vahva siinä, minkä se on nähnyt merkittynä tuhat kertaa, ja lähes sokea muualla - eikä se kerro sinulle, kummassa tilassa se on. Infrastructure-as-code-diffissä käytä sitä toisena lukijana niille virheille, jotka ovat jälkiviisaana ilmeisiä: 0.0.0.0/0:aan avattu security group, muutos, joka onkin korvaus eikä päivitys. Älä tee siitä porttia: ne luokat, jotka se ohittaa, ovat juuri niitä, joille kukaan ei kirjoittanut sääntöä.

Autonominen korjaus on se kohta, jossa evidenssi lakkaa tukemasta myyntipuhetta

Sama tutkimus kantaa mukanaan sen havainnon, joka pitäisi lopettaa itsekorjautuvuuskeskustelu vielä vuodeksi. Silloinkin kun malli tunnisti oikein sekä juurisyypalvelun että vikatyypin, se valitsi kelvottoman korjaustoimen 39,5-62,0 prosentissa noista oikein diagnosoiduista häiriöistä. Diagnoosi ei kanna toimintaan asti. Gartnerin kesäkuun 2025 ennuste siitä, että yli 40 prosenttia agenttitekoälyhankkeista peruttaisiin vuoden 2027 loppuun mennessä, nimesi kustannusten rinnalla riittämättömät riskikontrollit, ja juuri se on se, mikä puuttuu.

Kapasiteettisuunnittelu epäonnistuu sukua olevasta syystä: malli tuottaa itsevarman luvun ohuesta evidenssistä, ja itsevarma luku on juuri se, mitä suunnittelupalaveri haluaa. EU:n tekoälysäädöksen 14 artikla on kirjoitettu täsmälleen tuota vastaan: se vaatii, että ihmisvalvoja voi keskeyttää suuririskisen järjestelmän ja pysäyttää sen turvalliseen tilaan, ja nimeää automaatioharhan asiaksi, jota valvonnan on vastustettava.

Kulutuskaton on istuttava palveluntarjoajan laskutuskonsolin yläpuolella

Toukokuussa 2026 autonomiselle agentille annettiin rajoittamattomat AWS-kredentiaalit ja käsky porttiskannata DN42, harrastelijaverkko. Se provisioi viisi m8g.12xlarge-instanssia, kussakin 48 vCPU:ta, sekä kuormantasaajia ja Lambda-funktioita, ja alkoi sitten ajaa samaa CloudFormation-templatea uudelleen ja uudelleen. Operaattori sai tietää noin 24 tuntia myöhemmin luottokorttiveloituksista, joita oli kertynyt yhteensä 6 531,30 dollaria - workloadista, jonka yhteisö arvioi mahtuvan 5 dollaria kuussa maksavaan VPS:ään. AWS leikkasi laskun myöhemmin 1 894 dollariin. Suojaus, joka toimi, oli hyvän tahdon krediitti.

Yhdenkään suuren palveluntarjoajan budjettityökalut eivät olisi pysäyttäneet sitä, ja kaikki kolme sanovat sen kirjallisesti. Amazon dokumentoi AWS Budgetsin päivittyvän enintään kolme kertaa päivässä, kunkin päivityksen ollessa tyypillisesti 8-12 tuntia edellistä jäljessä - tahti, joka on rakennettu ihmisille, jotka tekevät kalliita virheitä yksi kerrallaan. Microsoft toteaa, ettei ylitetty Azure-budjetin kynnysarvo vaikuta resursseihin eikä pysäytä kulutusta, ja että kustannustiedot ovat tyypillisesti saatavilla 8-24 tunnin sisällä. Google Cloud toteaa, ettei pelkkiin hälytyksiin rajoittuva budjetti automaattisesti rajoita käyttöä tai kulutusta. AWS toimittaa avoimen lähdekoodin Budget Controls -ratkaisun, joka toimii 90 prosentissa budjetista, kattaa neljä palvelua yhdellä alueella, ja myöntää, että tallennus ja verkotus keräävät maksuja edelleen. Kolmen hengen toimisto, josta kirjoitettiin heinäkuussa 2026, otti yhden päivän aikana vastaan 14 000 dollarin AWS-veloituksen normaalia 10-15 dollarin kuukausilaskuaan vasten sen jälkeen, kun hyökkääjät nappasivat staattiset avaimet instanssilta ja käyttivät ne Bedrock-mallikutsuihin.

Meidän vastauksemme on laittaa raja sinne, missä kredentiaalit myönnetään, eikä sinne, missä lasku kootaan. Kulutusta seurataan Sencaissa sitä mukaa kun se tapahtuu, palveluntarjoajan, projektin ja ympäristön mukaan, katoilla ja budjeteilla, jotka hälyttävät kertymisen aikana eivätkä 8-24 tunnin laskutussyklillä. Ylitetyn katon automaattinen käsittely on roadmapillamme eikä sitä ole julkaistu, joten tänään kredentiaalin vetää yhä ihminen. Tekoäly on se yksi budjetti, jonka voimme rajata etukäteen: se ostetaan krediitteinä, ja krediitti on kiinteä rahasumma eikä token-määrä, joten mallin hinnanmuutos siirtää sitä, kuinka monta tokenia krediitillä saa, eikä koskaan sitä, mitä se on arvoltaan. Jokaisella maksullisella henkilökohtaisella tilauksella on kuukausikiintiö ja kova katto, joka on asetettu sen monikertaan, joten karkaava skripti ei voi tuottaa rajatonta laskua. Runbookit ovat hyväksyntäportin takana samasta syystä: malli ehdottaa, nimetty ihminen suorittaa.

Auditointiloki, joka osaa kertoa, tekikö sen ihminen vai malli

EU:n tekoälysäädöksen 12 artiklan 1 kohta vaatii, että suuririskiset järjestelmät sallivat teknisesti tapahtumien automaattisen tallentamisen järjestelmän elinkaaren ajan, ja 26 artiklan 6 kohta vaatii käyttöönottajia säilyttämään nuo lokit vähintään kuusi kuukautta, ellei muu laki sano pidempään. Jos suunnittelet elokuun 2026 päivämäärää vasten, korjaa se. Asetus (EU) 2026/1744, tekoälyä koskeva digitaalinen omnibus, joka on ollut voimassa 27. heinäkuuta 2026 alkaen, siirsi liitteen III itsenäiset suuririskiset järjestelmät 2. joulukuuta 2027 alkaviksi ja liitteen I tuotteisiin upotetut järjestelmät 2. elokuuta 2028 alkaviksi. Päivämäärät siirtyivät; velvollisuudet eivät.

Operatiivinen syy rakentaa tämä ei liity määräaikaan mitenkään. Kuusi kuukautta häiriön jälkeen kysymys on siitä, tekikö muutoksen ihminen vai malli, eikä asetelma, joka tallentaa tekoälyn toiminnot yhteen järjestelmään ja ihmisten toiminnot toiseen, pysty vastaamaan siihen ilman liitosta, johon kukaan ei luota. Kieltäydyimme pitämästä kahta tietuetta: mallin toiminnot ja ihmisen toiminnot päätyvät samaan vain-lisäys-periaatteella toimivaan lokiin. Sencai vie sen CSV:nä niin, että entry_hash ja prev_hash ovat jokaisella rivillä, joten lukija, joka ei ota sanaamme todesta, voi laskea ketjun uudelleen. Kenttä, joka ansaitsee paikkansa, on se pieni tekijän vieressä oleva, joka kertoo, tuliko muutos ihmiseltä vai mallilta, joka kuluttaa jonkun ihmisen kiintiötä.

Evidenssistä putoava sääntö on epäglamouri ja se pitää. Anna mallin lukea mitä tahansa, myös niitä asioita, joita se lukee huonosti, koska huono luenta näkyy siinä kappaleessa, jonka se kirjoitti. Anna sen kirjoittaa vain siellä, missä nimetty ihminen allekirjoittaa muutoksen ja sen alla on kredentiaaliraja sen varalta, että sekin ihminen on väärässä. Palveluntarjoajan 8-24 tunnin syklillä lähettämän ilmoituksen ja arkisin sähköpostiaan lukevan ihmisen välissä on palovaroitin eikä sprinkleriä. DN42:n operaattorilla oli palovaroitin.