Τι είναι η απόσταξη μοντέλου τεχνητής νοημοσύνης και γιατί γίνεται σημείο ανάφλεξης μεταξύ ΗΠΑ και Κίνας;
- Κατηγορία ΤΕΧΝΟΛΟΓΙΑ
- 0 σχόλια
ΠΕΚΙΝΟ, 31 Ιουλίου (Reuters) - Μια τεχνική που επιτρέπει στους προγραμματιστές να συρρικνώνουν ισχυρά μοντέλα τεχνητής νοημοσύνης σε φθηνότερα και πιο αποτελεσματικά συστήματα έχει γίνει το τελευταίο πεδίο μάχης στην εντεινόμενη κούρσα ΗΠΑ-Κίνας για την κυριαρχία της Τεχνητής Νοημοσύνης.
Γνωστή ως απόσταξη μοντέλου, η μέθοδος χρησιμοποιεί τα αποτελέσματα ενός ισχυρού συστήματος τεχνητής νοημοσύνης για να εκπαιδεύσει ένα μικρότερο μοντέλο που μπορεί να εκτελέσει ορισμένες από τις ίδιες εργασίες με λιγότερους υπολογιστικούς πόρους.
Η απόσταξη, η οποία θεωρείται εδώ και καιρό ως ένα τυπικό εργαλείο έρευνας για την Τεχνητή Νοημοσύνη, βρίσκεται πλέον στο επίκεντρο μιας αυξανόμενης διαμάχης σχετικά με το εάν οι προηγμένες δυνατότητες της Τεχνητής Νοημοσύνης μπορούν να μεταφερθούν χωρίς τη συγκατάθεση των εταιρειών που τις δημιούργησαν.
Η Ουάσινγκτον και κορυφαίες αμερικανικές εταιρείες τεχνητής νοημοσύνης έχουν κατηγορήσει τους Κινέζους ανταγωνιστές ότι χρησιμοποιούν την τεχνική για να εξάγουν δυνατότητες από ιδιόκτητα μοντέλα, ανοίγοντας ένα νέο μέτωπο σε έναν ολοένα και πιο σκληρό ανταγωνισμό για την τεχνολογική ηγεσία.
Παρακάτω παρατίθενται βασικά στοιχεία σχετικά με την πρακτική που βρίσκεται στο επίκεντρο της συζήτησης.
ΤΙ ΕΙΝΑΙ Η ΠΡΟΤΥΠΗ ΑΠΟΣΤΑΞΗ;
Τα μεγαλύτερα μοντέλα Τεχνητής Νοημοσύνης, γνωστά ως μοντέλα αιχμής, απαιτούν τεράστιες ποσότητες υπολογιστικής ισχύος, δεδομένων και επενδύσεων για την εκπαίδευσή τους.
Η απόσταξη μοντέλων προσφέρει έναν τρόπο δημιουργίας μικρότερων συστημάτων χρησιμοποιώντας ένα μεγάλο μοντέλο «δασκάλου» για την εκπαίδευση ενός μικρότερου μοντέλου «μαθητή».
Ο εκπαιδευτικός δημιουργεί παραδείγματα, όπως απαντήσεις και κώδικα υπολογιστή, τα οποία στη συνέχεια χρησιμοποιούνται ως εκπαιδευτικό υλικό για τον μαθητή.
Το μικρότερο μοντέλο δεν είναι αντίγραφο του δασκάλου. Δεν κληρονομεί τα βάρη, την αρχιτεκτονική ή τις πλήρεις δυνατότητες του δασκάλου. Αντίθετα, μαθαίνει επιλεγμένες συμπεριφορές που του επιτρέπουν να εκτελεί συγκεκριμένες εργασίες πιο αποτελεσματικά.
ΓΙΑΤΙ ΕΧΕΙ ΣΗΜΑΣΙΑ Η ΑΠΟΣΤΑΞΗ;
Η ελκυστικότητα της απόσταξης έγκειται στο ότι μπορεί να κάνει την τεχνητή νοημοσύνη φθηνότερη και ευκολότερη στην ανάπτυξη.
Ένα μοντέλο αιχμής μπορεί να απαιτεί μεγάλα κέντρα δεδομένων και ακριβά τσιπ για να λειτουργήσει. Τα αποσταγμένα μοντέλα μπορούν να λειτουργούν με λιγότερο ισχυρό υλικό και να είναι προσαρμοσμένα για συγκεκριμένες εργασίες.
Αυτό τα καθιστά ελκυστικά για εταιρείες και κυβερνήσεις που επιθυμούν να αναπτύξουν την Τεχνητή Νοημοσύνη σε ευρύτερο πλαίσιο, από συσκευές και εργοστάσια έως οχήματα και ιδιωτικά δίκτυα.
ΓΙΑΤΙ ΕΙΝΑΙ ΣΗΜΑΝΤΙΚΑ ΤΑ ΙΧΝΗ ΣΥΛΛΟΓΙΚΗΣ;
Τα πρόσφατα συστήματα τεχνητής νοημοσύνης έχουν αυξήσει το ενδιαφέρον για τη μεταφορά όχι μόνο των τελικών απαντήσεων αλλά και των βημάτων που χρησιμοποιούνται για την επίτευξή τους.
Αυτά τα «ίχνη συλλογισμού» μπορούν να δείξουν σε ένα μικρότερο μοντέλο πώς να προσεγγίσει ένα δύσκολο πρόβλημα και όχι απλώς ποια απάντηση να παράγει.
Ο Florian Tramèr, επίκουρος καθηγητής στο ETH Zurich, ο οποίος ερευνά την ασφάλεια της μηχανικής μάθησης, συνέκρινε τη διαδικασία με την ανθρώπινη μάθηση.
«Αν σας δώσω ένα βιβλίο με περίπλοκα μαθηματικά προβλήματα με τελικές λύσεις, θα δυσκολευτείτε πολύ περισσότερο να μάθετε πώς να λύνετε προβλήματα παρά αν σας έδινα λεπτομερείς λύσεις που περιγράφουν όλα τα βήματα που πρέπει να ακολουθήσετε», είπε.
Καθώς τα ίχνη συλλογισμού έχουν γίνει πιο πολύτιμα, η πρόσβαση στα αποτελέσματα της Τεχνητής Νοημοσύνης έχει γίνει πιο ευαίσθητη, επειδή ενδέχεται να αποκαλύψουν ορισμένες από τις μεθόδους που χρησιμοποιούν προηγμένα συστήματα για την αντιμετώπιση σύνθετων προβλημάτων.
ΠΟΙΟΣ ΧΡΗΣΙΜΟΠΟΙΕΙ ΤΗΝ ΑΠΟΣΤΑΞΗ;
Η απόσταξη είναι μια ευρέως χρησιμοποιούμενη τεχνική εκπαίδευσης Τεχνητής Νοημοσύνης και όχι μια εγγενώς ακατάλληλη πρακτική.
Αμερικανοί ερευνητές και εταιρείες το χρησιμοποιούν εδώ και καιρό, συμπεριλαμβανομένου του έργου Alpaca του Πανεπιστημίου Stanford και της έρευνας Orca της Microsoft, η οποία βασίστηκε σε αποτελέσματα από πιο προηγμένα μοντέλα για τη βελτίωση μικρότερων.
Κινέζοι ερευνητές έχουν επίσης χρησιμοποιήσει αποτελέσματα από αμερικανικά μοντέλα σε δημόσια ερευνητικά έργα, συμπεριλαμβανομένων των προσπαθειών για τη δημιουργία μοντέλων διδασκαλίας στην κινεζική γλώσσα.
Η βασική διαφορά έγκειται στην πρόσβαση. Τα μοντέλα ανοιχτού βάρους επιτρέπουν στους ερευνητές να ελέγχουν και να τροποποιούν υποκείμενες παραμέτρους. Τα κλειστά μοντέλα, όπως το ChatGPT της OpenAI και το Claude της Anthropic, παραμένουν υπό τον έλεγχο της εταιρείας και συνήθως η πρόσβαση σε αυτά γίνεται μέσω ιδιόκτητων διεπαφών ή API.
ΓΙΑΤΙ Η ΑΠΟΣΤΑΞΗ ΕΧΕΙ ΓΙΝΕΙ ΖΗΤΗΜΑ ΗΠΑ-ΚΙΝΑΣ;
Η διαμάχη αφορά λιγότερο την ίδια την απόσταξη και περισσότερο την μη εξουσιοδοτημένη εξαγωγή.
Οι εταιρείες τεχνητής νοημοσύνης υποστηρίζουν ότι υπάρχει διάκριση μεταξύ της νόμιμης έρευνας και της συστηματικής συλλογής αποτελεσμάτων από ιδιόκτητα μοντέλα για την αναπαραγωγή εμπορικά πολύτιμων δυνατοτήτων.
Η Anthropic κατηγόρησε κινεζικές οντότητες, όπως οι DeepSeek, Moonshot και MiniMax, ότι διεξάγουν μεγάλης κλίμακας εκστρατείες για την απόκτηση δυνατοτήτων από μοντέλα Claude.
Η εταιρεία δήλωσε ότι αυτές οι προσπάθειες στόχευαν σε δυνατότητες όπως η μηχανική λογισμικού και η προηγμένη συλλογιστική.
Η OpenAI δήλωσε επίσης ότι έχει εντοπίσει προσπάθειες Κινέζων φορέων να χρησιμοποιήσουν τα μοντέλα της για σκοπούς που σχετίζονται με την απόσταξη.
Μέχρι στιγμής, καμία κινεζική εταιρεία δεν έχει κατηγορήσει τους Αμερικανούς ανταγωνιστές της ότι παράγουν μοντέλα κλειστού κώδικα.
