computer chip
Fullscreen Image

Η Hexo Labs ανοίγει τον κώδικα του SIA, ενός AI agent που μαθαίνει από τον εαυτό του

Συγγραφέας auto.pub | Δημοσιεύτηκε: 01.06.2026

Η Hexo Labs παρουσίασε το SIA, ή Self Improving Agent, ένα ανοικτού κώδικα framework για AI agents. Δεν περιορίζεται στη βελτίωση prompts και ροών εργασίας. Ο βασικός του ισχυρισμός είναι πιο φιλόδοξος: ο agent αναλύει τις δικές του προσπάθειες, αλλάζει τον τρόπο εργασίας του και, όταν χρειάζεται, ξεκινά εσωτερικό fine tuning του μοντέλου ώστε να αποδίδει καλύτερα στον επόμενο κύκλο.

Ένας self improving agent δεν σημαίνει πλέον απλώς ένα καλύτερο prompt.

Η ανάπτυξη AI agents έχει κινηθεί μέχρι σήμερα σε δύο βασικές κατευθύνσεις. Στην πρώτη, ένας developer ή ένας meta agent βελτιώνει το σύστημα απ’ έξω: prompts, επιλογή εργαλείων, λογική επανάληψης προσπαθειών και στρατηγική αναζήτησης. Στη δεύτερη, μια ομάδα κάνει fine tuning στο ίδιο το μοντέλο, αξιοποιώντας feedback από τις εργασίες. Το SIA συνδυάζει αυτές τις δύο προσεγγίσεις σε έναν ενιαίο βρόχο.

Ο κρίσιμος όρος εδώ είναι το εσωτερικό fine tuning του μοντέλου, δηλαδή η αλλαγή των παραμέτρων του νευρωνικού δικτύου κατά την εκπαίδευση. Με πιο απλά λόγια, ο agent δεν λαμβάνει μόνο καλύτερες οδηγίες. Το ίδιο το μοντέλο μαθαίνει από επαναλαμβανόμενα λάθη και αποτελέσματα. Αυτό διαφοροποιεί το SIA από agents που απλώς ξαναγράφουν ένα prompt ή προσθέτουν ακόμη ένα βήμα στη ροή εργασίας.

Τρεις agents κινούν τον βρόχο βελτίωσης.

Σύμφωνα με την επίσημη περιγραφή στο GitHub, το SIA λειτουργεί μέσω τριών βασικών στοιχείων. Ο Meta Agent διαβάζει την περιγραφή της εργασίας και δημιουργεί τον πρώτο target agent. Ο Task Specific Agent λύνει την εργασία και καταγράφει τις ενέργειες και τα αποτελέσματά του. Ο Feedback Agent εξετάζει τα logs, εντοπίζει αδυναμίες και αποφασίζει αν θα βελτιώσει το scaffold του agent ή αν θα ενεργοποιήσει εσωτερικό fine tuning του μοντέλου.

Η διάκριση αυτή έχει τεχνική σημασία. Το scaffold του agent καθορίζει πώς το σύστημα αναζητά λύση, πώς χρησιμοποιεί εργαλεία και πώς ελέγχει τα αποτελέσματα. Το εσωτερικό fine tuning του μοντέλου θα πρέπει να προσθέτει κρίση σε επίπεδο πεδίου εφαρμογής, κάτι που κανένα prompt δεν μπορεί απλώς να εγγράψει στο μοντέλο. Στο paper στο arXiv, οι δημιουργοί του SIA αναφέρουν ότι η χρήση και των δύο μοχλών μαζί ξεπέρασε τη βελτίωση μόνο του scaffold και στους τρεις τομείς που δοκιμάστηκαν.

Τα αποτελέσματα δείχνουν ισχυρά, αλλά χρειάζονται ψύχραιμη μέτρηση.

Το τεχνικό paper του SIA αξιολόγησε το framework σε τρεις πολύ διαφορετικές εργασίες: ταξινόμηση κατηγοριών κατηγορητηρίου από κινεζικά νομικά κείμενα, βελτιστοποίηση χαμηλού επιπέδου GPU kernel και αποθορυβοποίηση δεδομένων RNA μονού κυττάρου. Η επιλογή αυτή δίνει στο σύστημα ευρύτερη δοκιμή από ένα τυπικό benchmark chatbot, επειδή οι εργασίες απαιτούν διαφορετικά είδη ακρίβειας, πειραματισμού και μετρήσιμου αποτελέσματος.

Στα χαρτιά, τα αποτελέσματα είναι σαφή. Σύμφωνα με τους συγγραφείς, το SIA συνδύασε τη βελτίωση του scaffold με το εσωτερικό fine tuning του μοντέλου και ξεπέρασε την προηγούμενη κορυφαία επίδοση κατά 25,1% στο LawBench. Το GPU kernel έτρεξε 12,4% ταχύτερα από την προηγούμενη κορυφαία επίδοση, ενώ η αποθορυβοποίηση δεδομένων RNA βελτιώθηκε κατά 20,4%. Το repository στο GitHub αναφέρει επίσης ακρίβεια Top 1 70,1% στο LawBench, επιτάχυνση 14 φορές για το TriMul kernel σε σχέση με το baseline και βαθμολογία MSE_norm 0,289 στην εργασία single cell RNA sequencing.

Ο ισχυρισμός για «350 φορές» είναι γραμμή δελτίου Τύπου, όχι ανεξάρτητη ετυμηγορία.

Η Hexo Labs αναφέρει στο δελτίο Τύπου της ότι το SIA επιταχύνει την πορεία προς την υπερνοημοσύνη κατά 350 φορές. Αυτό χρειάζεται προσοχή. Η εταιρεία συνδέει τον ισχυρισμό με το MLE bench της OpenAI, όμως αυτό δεν ισοδυναμεί με ανεξάρτητη απόδειξη ότι το SIA οδηγεί πράγματι την AI προς την υπερνοημοσύνη. Το δημόσια διαθέσιμο υλικό δείχνει προς το παρόν κάτι πιο προσγειωμένο: το SIA προσφέρει ένα ισχυρό πειραματικό framework για μετρήσιμες εργασίες ανάπτυξης.

Η OpenAI περιγράφει το MLE bench ως benchmark για να ελέγχεται αν AI agents μπορούν να εκτελούν εργασίες machine learning engineering: εκπαίδευση μοντέλων, προετοιμασία δεδομένων και εκτέλεση πειραμάτων. Περιλαμβάνει 75 διαγωνισμούς machine learning του Kaggle και δίνει στους agents έναν πολύ πιο πρακτικό στόχο από τα συνηθισμένα benchmarks ερωτήσεων και απαντήσεων.

Από ευρωπαϊκή σκοπιά, η διαφάνεια είναι το σημαντικότερο στοιχείο.

Για Ευρωπαίους developers και ερευνητικά ιδρύματα, η βασική αξία του SIA βρίσκεται στον ανοικτό του χαρακτήρα. Το repository στο GitHub δείχνει ότι το framework χρησιμοποιεί άδεια MIT, είναι γραμμένο σε Python και μπορεί να χρησιμοποιηθεί με custom tasks, όπου τα δημόσια inputs, τα κρυφά δεδομένα αξιολόγησης και ο evaluator ορίζονται ξεχωριστά. Αυτό βοηθά τους ερευνητές να επαναλάβουν πειράματα και να ελέγξουν τι ακριβώς αλλάζει ο agent.

Ταυτόχρονα, το εσωτερικό fine tuning του μοντέλου φέρνει μεγαλύτερη ευθύνη. Όταν ένας agent μπορεί να αλλάζει βαθύτερα τη συμπεριφορά του, το πλαίσιο αξιολόγησης πρέπει επίσης να εντοπίζει αν το σύστημα γίνεται γενικά καλύτερο ή αν απλώς μαθαίνει να εκμεταλλεύεται ένα συγκεκριμένο metric. Για αυτόν τον λόγο, το SIA ταιριάζει προς το παρόν περισσότερο σε επιστημονικές και μηχανικές εργασίες με σαφείς μετρήσεις, όχι σε αυτόνομη λήψη αποφάσεων με ανοικτού τύπου στόχους.

Τεχνική εικόνα.

Το SIA συνδυάζει τη βελτίωση του agent scaffold και το εσωτερικό fine tuning του μοντέλου σε έναν ενιαίο βρόχο αυτοβελτίωσης.

Το σύστημα χρησιμοποιεί έναν Meta Agent, έναν Task Specific Agent και έναν Feedback Agent.

Οι δοκιμές κάλυψαν νομικά κείμενα, βελτιστοποίηση GPU kernel και αποθορυβοποίηση δεδομένων RNA μονού κυττάρου.

Σύμφωνα με το repository στο GitHub, το SIA είναι ανοικτού κώδικα, διατίθεται με άδεια MIT και έχει χτιστεί για Python 3.11+.

Ο μεγάλος ισχυρισμός για «350 φορές» προέρχεται από το δελτίο Τύπου της Hexo Labs, όχι από ανεξάρτητο audit.

Το SIA μπορεί να μην είναι συντόμευση προς την υπερνοημοσύνη. Αυτό που προσφέρει είναι πιο πρακτικό και, προς το παρόν, πιο χρήσιμο: έναν τρόπο ώστε οι AI agents να δείχνουν τη δουλειά τους, να μαθαίνουν από αυτήν και να αντιμετωπίζουν την επόμενη δοκιμή με κάτι περισσότερο από μια καλύτερη ενθαρρυντική οδηγία.