Η Anthropic προχωρά στην ευρύτερη διάθεση του νέου μοντέλου τεχνητής νοημοσύνης Fable 5, ενσωματώνοντας αυστηρές δικλίδες ασφαλείας που περιορίζουν τη χρήση του σε ευαίσθητους τομείς όπως η κυβερνοασφάλεια και η βιολογία. Η απόφαση έρχεται λίγους μήνες μετά τις προειδοποιήσεις της εταιρείας ότι το προηγμένο μοντέλο Mythos μπορούσε να εντοπίζει και να αξιοποιεί ευπάθειες σε κρίσιμα συστήματα λογισμικού.
Πώς λειτουργούν οι νέοι περιορισμοί
Σύμφωνα με την εταιρεία, το Fable 5 θα απορρίπτει ή θα ανακατευθύνει συγκεκριμένα αιτήματα που σχετίζονται με την κυβερνοασφάλεια και τη βιολογία. Σε αυτές τις περιπτώσεις, το chatbot Claude θα χρησιμοποιεί ένα διαφορετικό μοντέλο, το Opus 4.8, προκειμένου να διαχειρίζεται τα σχετικά ερωτήματα με μεγαλύτερη ασφάλεια.
Παράλληλα, η Anthropic διαθέτει και μια έκδοση του ίδιου μοντέλου με λιγότερους περιορισμούς, υπό την ονομασία Mythos 5. Η πρόσβαση σε αυτήν την έκδοση παραμένει περιορισμένη και προσφέρεται μόνο σε επιλεγμένους οργανισμούς μέσω του προγράμματος Project Glasswing.
Το Project Glasswing επεκτείνεται
Η εταιρεία ανακοίνωσε ότι πρόσθεσε ακόμη 150 οργανισμούς στο πρόγραμμα πρόσβασης, ανεβάζοντας τον συνολικό αριθμό των συμμετεχόντων σε περίπου 200. Στόχος είναι να επιτραπεί σε αξιόπιστες ομάδες να αξιοποιούν τις προηγμένες δυνατότητες του Mythos σε ελεγχόμενο περιβάλλον.
Το Mythos αποτελεί βασικό πυλώνα της στρατηγικής ανάπτυξης της Anthropic, η οποία προετοιμάζεται για μελλοντική είσοδο στις δημόσιες αγορές. Η εταιρεία είχε επιλέξει να περιορίσει τη διάθεση του μοντέλου, εκφράζοντας ανησυχίες ότι θα μπορούσε να εντοπίζει και να εκμεταλλεύεται ευπάθειες σε μεγάλα λειτουργικά συστήματα και δημοφιλείς φυλλομετρητές διαδικτύου.
Βελτιωμένες επιδόσεις στον προγραμματισμό
Το Fable 5 έχει σχεδιαστεί για να προσφέρει υψηλότερες επιδόσεις στον προγραμματισμό, στην ανάλυση σύνθετων προβλημάτων και σε επαγγελματικές εφαρμογές που απαιτούν εκτεταμένη επεξεργασία δεδομένων και λογική σκέψη για μεγάλα χρονικά διαστήματα.
Κατά τις δοκιμές, η Stripe χρησιμοποίησε το νέο μοντέλο για να ολοκληρώσει μέσα σε μία ημέρα ένα έργο μηχανικής λογισμικού που υπό φυσιολογικές συνθήκες θα απαιτούσε περίπου δύο μήνες εργασίας από ολόκληρη ομάδα προγραμματιστών.
Παράλληλα, η Anthropic υποστήριξε ότι μια επιστημονική υπόθεση που παρήγαγε το Mythos σχετικά με μηχανισμό πρωτεΐνης του E. coli επιβεβαιώθηκε αργότερα από ανεξάρτητη ερευνητική εργασία.
Δοκιμές ασφαλείας και αντοχή σε jailbreaks
Για την αξιολόγηση της ανθεκτικότητας των νέων περιορισμών, η εταιρεία υλοποίησε εκτεταμένο πρόγραμμα bug bounty και δοκιμές red teaming. Σύμφωνα με τα αποτελέσματα, πραγματοποιήθηκαν περισσότερες από 1.000 ώρες ελέγχων χωρίς να εντοπιστούν καθολικές μέθοδοι παράκαμψης των περιορισμών του μοντέλου.
Η επικεφαλής διαχείρισης έργων έρευνας της Anthropic, Νταϊάν Πεν, δήλωσε ότι η εταιρεία θα συνεχίσει να διευρύνει την πρόσβαση στο Mythos μέσω του Project Glasswing, ενώ εξετάζει πρόσθετες διαδικασίες ώστε αξιόπιστοι συνεργάτες να αποκτούν πρόσβαση στις προηγμένες δυνατότητες κυβερνοασφάλειας του μοντέλου.