Μια αξιολόγηση που αναρτήθηκε στο arXiv στις 6 Ιουλίου 2026 πέρασε 302 περιστατικά Kubernetes ελεγμένης ποιότητας από μοντέλα με retrieval augmentation και βαθμολόγησε δύο ικανότητες χωριστά. Κατονομασία της υπαίτιας υπηρεσίας: σωστή μεταξύ 91,4% και 99,7% των περιπτώσεων. Επιλογή έγκυρης ενέργειας αποκατάστασης για το περιστατικό που μόλις είχε διαγνώσει: 36,8% έως 60,3%. Σαράντα έως πενήντα πέντε μονάδες κάθονται ανάμεσα σε αυτές τις δύο στήλες, και αυτή η απόσταση είναι ο πιο χρήσιμος αριθμός που δημοσιεύτηκε φέτος για το AIOps.
Αυτός είναι ισχυρισμός για είδη δουλειάς, όχι για την ποιότητα των μοντέλων. Το μοντέλο διαβάζει καλά και αποφασίζει άσχημα, και αυτό χωρίζει την αγορά σε δύο σωρούς. Κάποια λειτουργική δουλειά αποτυγχάνει ορατά, μπροστά στο άτομο που την κρατά. Κάποια αποτυγχάνει μετατρεπόμενη σε ενέργεια πάνω στην παραγωγή. Το AIOps βγάζει τα χρήματά του στο πρώτο είδος και προς το παρόν είναι βάρος στο δεύτερο, και η περισσότερη απογοήτευση σε αυτή την αγορά προέρχεται από το να το αγοράζει κανείς για το δεύτερο μετά από ένα demo του πρώτου.
Συσχέτιση ειδοποιήσεων, deduplication και το πρώτο προσχέδιο της ιστορίας
Η PagerDuty διαφημίζει το προϊόν AIOps της ως μείωση του θορύβου ειδοποιήσεων έως και 91%. Διαβάστε το δίπλα σε μια έρευνα του Φεβρουαρίου 2026 σε 1.039 επαγγελματίες SRE, DevOps και λειτουργιών IT, με χορηγό τη NeuBird, στην οποία το 44% ανέφερε διακοπή λειτουργίας τον προηγούμενο χρόνο συνδεδεμένη με κατεσταλμένες ή αγνοημένες ειδοποιήσεις. Η συσχέτιση που διπλώνει σαράντα ειδοποιήσεις σε ένα περιστατικό είναι πραγματικό κέρδος. Η συσχέτιση που αποφασίζει αθόρυβα ποιες ειδοποιήσεις δεν βλέπετε ποτέ είναι το πώς προκύπτει εκείνο το 44%, και αυτό που τις χωρίζει είναι αν η ομαδοποίηση μπορεί να επιθεωρηθεί.
Οι ισχυρότερες περιπτώσεις είναι εκείνες που ένας άνθρωπος μπορεί να ελέγξει σε δευτερόλεπτα. Ένα μοντέλο που διαβάζει το ιστορικό deploy, τη μετατόπιση μιας μετρικής και τρεις ροές logs και συντάσσει την αφήγηση του περιστατικού κάνει δουλειά που αλλιώς γίνεται στις 3 τα ξημερώματα από κάποιον με κακή μνήμη, και όταν κάνει λάθος το αποδεικτικό στοιχείο βρίσκεται μέσα στην ίδια την παράγραφο. Η εξήγηση του γιατί κινήθηκε ένας λογαριασμός είναι το ίδιο είδος εργασίας, γεμάτη συσχετίσεις που ένας άνθρωπος εντοπίζει έναν μήνα αργότερα, και το State of FinOps 2026 του FinOps Foundation, που κυκλοφόρησε στις 19 Φεβρουαρίου 2026 με 1.192 ερωτηθέντες που διαχειρίζονται πάνω από 83 δισ. δολάρια ετήσιας δαπάνης, διαπίστωσε ότι το 98% από αυτούς διαχειρίζεται πλέον δαπάνη ΤΝ, από 31% δύο χρόνια νωρίτερα. Η μετατροπή ενός επιλυμένου περιστατικού σε γραπτό runbook είναι ακόμη καλύτερη: τα γεγονότα έχουν παγιωθεί, και η χειρότερη έκβαση είναι ένας άνθρωπος να διορθώσει μια πρόταση.
Η επισκόπηση κώδικα από ΤΝ στην υποδομή πιάνει μια κατηγορία λαθών και είναι τυφλή σε μια άλλη
Το GenAI Code Security Report 2026 της Veracode, που δημοσιεύτηκε στις 28 Ιουλίου 2026, δοκίμασε περισσότερα από 100 μοντέλα και διαπίστωσε ότι το μέσο ποσοστό επιτυχίας σε θέματα ασφάλειας κόλλησε στο 56%, μία μονάδα πάνω από το 55%. Περίπου το 44% των εργασιών παραγωγής κώδικα εισήγαγε μια επικίνδυνη ευπάθεια όταν κανείς δεν ζητούσε ρητά ασφάλεια. Ο καλύτερος, το GPT-5.5, έφτασε το 68%, αποτυγχάνοντας ακόμη σε μία εργασία ασφάλειας στις τρεις.
Το άνισο κομμάτι είναι το χρήσιμο κομμάτι. Αυτά τα μοντέλα πέρασαν τις εργασίες SQL injection στο 83% των περιπτώσεων και την κρυπτογραφία στο 87%, αλλά το cross-site scripting μόνο στο 15% και το log injection στο 12%. Ένα μοντέλο που κάνει επισκόπηση κώδικα είναι δυνατό σε ό,τι έχει δει χαρακτηρισμένο χίλιες φορές, σχεδόν τυφλό αλλού, και δεν θα σας πει σε ποια από τις δύο καταστάσεις βρίσκεται. Σε ένα diff infrastructure-as-code, χρησιμοποιήστε το ως δεύτερο αναγνώστη για τα λάθη που είναι προφανή εκ των υστέρων: το security group ανοιγμένο στο 0.0.0.0/0, την αλλαγή που είναι αντικατάσταση και όχι ενημέρωση. Μην το κάνετε πύλη: οι κατηγορίες που του ξεφεύγουν είναι εκείνες για τις οποίες κανείς δεν έγραψε κανόνα.
Η αυτόνομη αποκατάσταση είναι εκεί που τα στοιχεία παύουν να στηρίζουν το επιχείρημα πώλησης
Η ίδια μελέτη φέρει το εύρημα που θα έπρεπε να κλείσει τη συζήτηση περί self-healing για άλλον έναν χρόνο. Ακόμη και όταν το μοντέλο αναγνώρισε σωστά και την υπαίτια υπηρεσία και τον τύπο της βλάβης, επέλεξε άκυρη αποκατάσταση στο 39,5% έως 62,0% εκείνων των σωστά διαγνωσμένων περιστατικών. Η διάγνωση δεν μεταφέρεται στην ενέργεια. Η πρόβλεψη της Gartner τον Ιούνιο του 2025 ότι πάνω από το 40% των έργων agentic ΤΝ θα ακυρωθούν έως το τέλος του 2027 κατονόμασε τους ανεπαρκείς ελέγχους κινδύνου δίπλα στο κόστος, και αυτοί ακριβώς είναι που λείπουν.
Ο σχεδιασμός χωρητικότητας αποτυγχάνει για συγγενή λόγο: το μοντέλο παράγει έναν αριθμό με αυτοπεποίθηση από ισχνά στοιχεία, και ένας αριθμός με αυτοπεποίθηση είναι ακριβώς αυτό που θέλει μια σύσκεψη σχεδιασμού. Το άρθρο 14 της Πράξης για την Τεχνητή Νοημοσύνη είναι γραμμένο ακριβώς ενάντια σε αυτό, απαιτώντας να μπορεί ένας ανθρώπινος επόπτης να διακόψει ένα σύστημα υψηλού κινδύνου και να το φέρει σε ασφαλή στάση, και κατονομάζοντας τη μεροληψία αυτοματισμού ως αυτό στο οποίο πρέπει να αντισταθεί η εποπτεία.
Η οροφή δαπάνης πρέπει να βρίσκεται πάνω από την κονσόλα χρέωσης του παρόχου
Τον Μάιο του 2026 ένας αυτόνομος agent πήρε απεριόριστα credentials AWS και την εντολή να σαρώσει θύρες στο DN42, ένα ερασιτεχνικό δίκτυο. Έκανε provisioning πέντε instances m8g.12xlarge, 48 vCPUs το καθένα, συν load balancers και συναρτήσεις Lambda, και μετά ξαναεφάρμοζε συνεχώς το ίδιο πρότυπο CloudFormation. Ο χειριστής το έμαθε περίπου 24 ώρες αργότερα από χρεώσεις πιστωτικής κάρτας συνολικού ύψους 6.531,30 δολαρίων, για ένα workload που η κοινότητα υπολόγισε ότι θα χωρούσε σε ένα VPS των 5 δολαρίων τον μήνα. Η AWS αργότερα μείωσε τον λογαριασμό στα 1.894 δολάρια. Η προστασία που λειτούργησε ήταν μια πίστωση καλής θέλησης.
Το εργαλείο προϋπολογισμού κανενός μεγάλου παρόχου δεν θα το είχε σταματήσει, και οι τρεις το λένε γραπτώς. Η Amazon τεκμηριώνει ότι το AWS Budgets ανανεώνεται έως τρεις φορές την ημέρα, με κάθε ενημέρωση τυπικά 8 έως 12 ώρες πίσω από την προηγούμενη, ρυθμός φτιαγμένος για ανθρώπους που κάνουν ακριβά λάθη ένα κάθε φορά. Η Microsoft δηλώνει ότι ένα όριο προϋπολογισμού του Azure που ξεπεράστηκε δεν επηρεάζει τους πόρους ούτε σταματά την κατανάλωση, με τα δεδομένα κόστους τυπικά διαθέσιμα εντός 8 έως 24 ωρών. Η Google Cloud δηλώνει ότι ένας προϋπολογισμός μόνο με ειδοποιήσεις δεν περιορίζει αυτόματα τη χρήση ή τη δαπάνη. Η AWS διαθέτει μια λύση ανοιχτού κώδικα Budget Controls που ενεργεί στο 90% ενός προϋπολογισμού, καλύπτει τέσσερις υπηρεσίες σε μία περιοχή, και παραδέχεται ότι το storage και το δίκτυο συνεχίζουν να συσσωρεύουν χρεώσεις. Ένα τριμελές πρακτορείο, για το οποίο γράφτηκε τον Ιούλιο του 2026, δέχτηκε χρέωση AWS 14.000 δολαρίων σε μία ημέρα έναντι κανονικού μηνιαίου λογαριασμού 10 έως 15 δολαρίων, αφού επιτιθέμενοι τράβηξαν στατικά κλειδιά από ένα instance και τα ξόδεψαν σε κλήσεις μοντέλων Bedrock.
Η δική μας απάντηση είναι να βάλουμε το όριο εκεί όπου εκδίδονται τα credentials, όχι εκεί όπου συντάσσεται το τιμολόγιο. Η δαπάνη στη Sencai παρακολουθείται καθώς συμβαίνει ανά πάροχο, project και περιβάλλον, με ανώτατα όρια και προϋπολογισμούς που ειδοποιούν όσο αυτή συσσωρεύεται και όχι πάνω σε έναν κύκλο χρέωσης 8 έως 24 ωρών. Η αυτόματη ενέργεια πάνω σε ένα ανώτατο όριο που ξεπεράστηκε βρίσκεται στον οδικό μας χάρτη και δεν έχει κυκλοφορήσει, οπότε σήμερα ένας άνθρωπος εξακολουθεί να τραβά το credential. Η ΤΝ είναι ο ένας προϋπολογισμός που μπορούμε να οριοθετήσουμε εκ των προτέρων: αγοράζεται σε πιστώσεις, και μια πίστωση είναι ένα σταθερό χρηματικό ποσό και όχι ένας αριθμός tokens, οπότε μια αλλαγή τιμής μοντέλου μετακινεί το πόσα tokens αγοράζει μια πίστωση και ποτέ το πόσο αξίζει. Κάθε επί πληρωμή προσωπικό πρόγραμμα έχει μηνιαία παροχή και μια αυστηρή οροφή ορισμένη σε πολλαπλάσιό της, ώστε ένα ανεξέλεγκτο script να μην μπορεί να παραγάγει απεριόριστο λογαριασμό. Τα runbooks περνούν από έγκριση για τον ίδιο λόγο: το μοντέλο προτείνει, ένας κατονομασμένος άνθρωπος εκτελεί.
Ένα ίχνος ελέγχου που μπορεί να πει αν το έκανε άνθρωπος ή μοντέλο
Το άρθρο 12(1) της Πράξης για την Τεχνητή Νοημοσύνη απαιτεί τα συστήματα υψηλού κινδύνου να επιτρέπουν τεχνικά την αυτόματη καταγραφή συμβάντων καθ' όλη τη διάρκεια ζωής του συστήματος, και το άρθρο 26(6) απαιτεί από τους φορείς εφαρμογής να τηρούν αυτά τα logs τουλάχιστον έξι μήνες, εκτός αν άλλος νόμος ορίζει περισσότερο. Αν σχεδιάζετε με βάση μια ημερομηνία του Αυγούστου 2026, διορθώστε την. Ο κανονισμός (ΕΕ) 2026/1744, το Digital Omnibus για την ΤΝ, σε ισχύ από τις 27 Ιουλίου 2026, μετέθεσε τα αυτοτελή συστήματα υψηλού κινδύνου του παραρτήματος III στις 2 Δεκεμβρίου 2027 και τα ενσωματωμένα σε προϊόντα συστήματα του παραρτήματος I στις 2 Αυγούστου 2028. Οι ημερομηνίες μετακινήθηκαν· οι υποχρεώσεις όχι.
Ο λειτουργικός λόγος για να το χτίσετε αυτό δεν έχει καμία σχέση με την προθεσμία. Έξι μήνες μετά από ένα περιστατικό το ερώτημα είναι αν την αλλαγή την έκανε άνθρωπος ή μοντέλο, και μια διάταξη που καταγράφει τις ενέργειες ΤΝ σε ένα σύστημα και τις ανθρώπινες σε άλλο δεν μπορεί να απαντήσει χωρίς ένα join που δεν εμπιστεύεται κανείς. Αρνηθήκαμε να κρατάμε δύο αρχεία: οι ενέργειες των μοντέλων και οι ενέργειες των ανθρώπων καταλήγουν στο ίδιο append-only ίχνος. Η Sencai το εξάγει ως CSV με το entry_hash και το prev_hash σε κάθε γραμμή, ώστε ένας αναγνώστης που δεν παίρνει τον λόγο μας τοις μετρητοίς να μπορεί να επανυπολογίσει την αλυσίδα. Το πεδίο που δικαιώνει τη θέση του είναι το μικρό δίπλα στον δράστη, που λέει αν η αλλαγή προήλθε από άνθρωπο ή από μοντέλο που ξοδεύει την παροχή ενός ανθρώπου.
Ο κανόνας που προκύπτει από τα στοιχεία δεν έχει καμία λάμψη και αντέχει. Αφήστε ένα μοντέλο να διαβάζει οτιδήποτε, ακόμη και αυτά που διαβάζει άσχημα, γιατί μια κακή ανάγνωση φαίνεται μέσα στην παράγραφο που έγραψε. Αφήστε το να γράφει μόνο εκεί όπου ένα κατονομασμένο άτομο υπογράφει την αλλαγή και ένα όριο credential κάθεται από κάτω για την περίπτωση που κάνει λάθος και εκείνο. Ανάμεσα σε μια ειδοποίηση παρόχου με κύκλο 8 έως 24 ωρών και σε κάποιον που διαβάζει email τις εργάσιμες υπάρχει ένας ανιχνευτής καπνού και κανένα σύστημα πυρόσβεσης. Ο χειριστής του DN42 είχε ανιχνευτή καπνού.