Logo
Εκτύπωση αυτής της σελίδας

H DeepSeek σπεύδει να λανσάρει ένα νέο μοντέλο τεχνητής νοημοσύνης καθώς η Κίνα μπαίνει σε όλα

ΠΕΚΙΝΟ/ΧΟΝΓΚ ΚΟΝΓΚ/ΣΙΓΚΑΠΟΥΡΗ, 25 Φεβρουαρίου (Reuters) - Το DeepSeek θέλει να κερδίσει το πλεονέκτημά του.
 
Η κινεζική startup πυροδότησε ξεπούλημα αξίας 1 τρισεκατομμυρίου δολαρίων στις παγκόσμιες αγορές μετοχών τον περασμένο μήνα με ένα μοντέλο συλλογιστικής τεχνητής νοημοσύνης μειωμένης τιμής που ξεπέρασε πολλούς δυτικούς ανταγωνιστές.
 
Τώρα, η εταιρεία με έδρα το Hangzhou επιταχύνει την κυκλοφορία του διαδόχου του μοντέλου R1 του Ιανουαρίου, σύμφωνα με τρία άτομα που είναι εξοικειωμένα με την εταιρεία.
 
Η Deepseek είχε σχεδιάσει να κυκλοφορήσει το R2 στις αρχές Μαΐου, αλλά τώρα θέλει να κυκλοφορήσει όσο το δυνατόν νωρίτερα, είπαν δύο από αυτούς, χωρίς να δώσουν λεπτομέρειες.
 
Η εταιρεία λέει ότι ελπίζει ότι το νέο μοντέλο θα παράγει καλύτερο κώδικα και θα μπορεί να συλλογιστεί σε γλώσσες πέρα ​​από τα αγγλικά. Λεπτομέρειες για το επιταχυνόμενο χρονοδιάγραμμα για την κυκλοφορία του R2 δεν έχουν αναφερθεί προηγουμένως.
 
Το DeepSeek δεν απάντησε σε αίτημα για σχόλιο για αυτήν την ιστορία.
 
Οι αντίπαλοι εξακολουθούν να χωνεύουν τις συνέπειες του R1, το οποίο κατασκευάστηκε με λιγότερο ισχυρά τσιπ Nvidia, αλλά είναι ανταγωνιστικό με εκείνα που αναπτύχθηκαν με κόστος εκατοντάδων δισεκατομμυρίων δολαρίων από αμερικανικούς τεχνολογικούς γίγαντες.
 
«Η κυκλοφορία του μοντέλου R2 της DeepSeek θα μπορούσε να είναι μια κομβική στιγμή στον κλάδο της τεχνητής νοημοσύνης», δήλωσε ο Vijayasimha Alilughatta, διευθύνων σύμβουλος της ινδικής εταιρείας παροχής τεχνολογικών υπηρεσιών Zensar. Η επιτυχία της DeepSeek στη δημιουργία οικονομικά αποδοτικών μοντέλων τεχνητής νοημοσύνης «πιθανότατα θα ωθήσει τις εταιρείες σε όλο τον κόσμο να επιταχύνουν τις προσπάθειές τους ... σπάζοντας τον ασφυκτικό κλοιό των λίγων κυρίαρχων παικτών στον τομέα», είπε.
 
Το R2 είναι πιθανό να ανησυχήσει την κυβέρνηση των ΗΠΑ, η οποία έχει προσδιορίσει την ηγεσία της τεχνητής νοημοσύνης ως εθνική προτεραιότητα. Η κυκλοφορία του μπορεί να κινητοποιήσει περαιτέρω τις κινεζικές αρχές και εταιρείες, δεκάδες από τις οποίες λένε ότι έχουν αρχίσει να ενσωματώνουν μοντέλα DeepSeek στα προϊόντα τους.
 
Λίγα είναι γνωστά για το DeepSeek, του οποίου ο ιδρυτής Liang Wenfeng έγινε δισεκατομμυριούχος μέσω του ποσοτικού hedge fund του High-Flyer. Ο Liang, ο οποίος χαρακτηρίστηκε από έναν πρώην εργοδότη ως «χαμηλών τόνων και εσωστρεφής», δεν έχει μιλήσει σε κανένα μέσο από τον Ιούλιο του 2024.
 
Το Reuters πήρε συνεντεύξεις από δώδεκα πρώην υπαλλήλους, καθώς και επαγγελματίες του quant fund που γνωρίζουν τις λειτουργίες της DeepSeek και της μητρικής της εταιρείας High-Flyer. Εξέτασε επίσης άρθρα από τα κρατικά μέσα ενημέρωσης, αναρτήσεις στα μέσα κοινωνικής δικτύωσης από εταιρείες και ερευνητικές εργασίες που χρονολογούνται από το 2019.
 
Είπαν την ιστορία μιας εταιρείας που λειτουργούσε περισσότερο σαν ερευνητικό εργαστήριο παρά σαν μια κερδοσκοπική επιχείρηση και δεν ήταν επιβαρυμένη από τις ιεραρχικές παραδόσεις της βιομηχανίας τεχνολογίας υψηλής πίεσης της Κίνας, ακόμη και όταν έγινε υπεύθυνη για αυτό που πολλοί επενδυτές βλέπουν ως την τελευταία σημαντική ανακάλυψη στην τεχνητή νοημοσύνη.
ΔΙΑΦΟΡΕΤΙΚΗ ΔΙΑΔΡΟΜΗ
 
Ο Λιάνγκ γεννήθηκε το 1985 σε ένα αγροτικό χωριό στη νότια επαρχία Γκουανγκντόνγκ. Αργότερα απέκτησε πτυχία μηχανικού επικοινωνίας στο επίλεκτο Πανεπιστήμιο Zhejiang.
 
Μία από τις πρώτες του δουλειές ήταν να διευθύνει ένα ερευνητικό τμήμα σε μια εταιρεία έξυπνης απεικόνισης στη Σαγκάη. Το τότε αφεντικό του, Zhou Chaoen, είπε στα κρατικά μέσα ενημέρωσης στις 9 Φεβρουαρίου ότι ο Liang είχε προσλάβει μηχανικούς αλγορίθμων που βραβεύτηκαν και λειτουργούσε με «επίπεδο στυλ διαχείρισης».
 
Στο DeepSeek και στο High-Flyer, ο Liang έχει αποφύγει παρομοίως τις πρακτικές των κινεζικών τεχνολογικών κολοσσών γνωστών για την άκαμπτη διαχείριση από πάνω προς τα κάτω, τις χαμηλές αμοιβές για νέους υπαλλήλους και το "996" - εργάζονται από τις 9 το πρωί έως τις 9 το βράδυ έξι ημέρες την εβδομάδα.
 
 
Ο Λιάνγκ άνοιξε το γραφείο του στο Πεκίνο σε κοντινή απόσταση με τα πόδια από το Πανεπιστήμιο Tsinghua και το Πανεπιστήμιο του Πεκίνου, τα δύο πιο διάσημα εκπαιδευτικά ιδρύματα της Κίνας. Εβαλλόταν τακτικά σε τεχνικές λεπτομέρειες και ήταν ευτυχής να δουλέψει μαζί με ασκούμενους της Gen-Z και πρόσφατους αποφοίτους που αποτελούσαν το μεγαλύτερο μέρος του εργατικού δυναμικού της, σύμφωνα με δύο πρώην υπαλλήλους. Περιέγραψαν επίσης ότι συνήθως εργάζονταν οκτάωρες ημέρες σε μια ατμόσφαιρα συνεργασίας.
 
 
"Ο Liang μας έδωσε τον έλεγχο και μας αντιμετώπιζε ως ειδικούς. Έκανε συνεχώς ερωτήσεις και μάθαινε δίπλα μας", είπε ο 26χρονος ερευνητής Benjamin Liu, ο οποίος έφυγε από την εταιρεία τον Σεπτέμβριο. «Το DeepSeek μου επέτρεψε να αποκτήσω την κυριότητα κρίσιμων τμημάτων του αγωγού, κάτι που ήταν πολύ συναρπαστικό».
 
Ο Liang δεν απάντησε σε ερωτήσεις που στάλθηκαν μέσω του DeepSeek.
 
Ενώ η Baidu και άλλοι κινεζικοί τεχνολογικοί γίγαντες αγωνίζονταν για να δημιουργήσουν τις εκδόσεις του ChatGPT που απευθύνονται στους καταναλωτές το 2023 και να επωφεληθούν από την παγκόσμια έκρηξη της τεχνητής νοημοσύνης, ο Liang είπε στο κινεζικό μέσο ενημέρωσης Waves πέρυσι ότι απέφυγε σκόπιμα να ξοδέψει πολλά για την ανάπτυξη εφαρμογών, εστιάζοντας αντ 'αυτού στη βελτίωση της ποιότητας του μοντέλου AI.
 
Τόσο το DeepSeek όσο και το High-Flyer είναι γνωστά ότι πληρώνουν γενναιόδωρα, σύμφωνα με τρία άτομα που γνωρίζουν τις πρακτικές αποζημίωσης του. Στην High-Flyer, δεν είναι ασυνήθιστο για έναν ανώτερο επιστήμονα δεδομένων να βγάζει 1,5 εκατομμύριο γιουάν ετησίως, ενώ οι ανταγωνιστές σπάνια πληρώνουν περισσότερα από 800.000, είπε ένας από τους ανθρώπους, ένας αντίπαλος διαχειριστής quant fund που γνωρίζει τον Liang.
 
Η μεγάλη χρηματοδότηση χρηματοδοτήθηκε από την High-Flyer, η οποία έγινε ένα από τα πιο επιτυχημένα quant funds της Κίνας και, ακόμη και μετά από μια κυβερνητική καταστολή στον τομέα, εξακολουθεί να διαχειρίζεται δεκάδες δισεκατομμύρια γιουάν, σύμφωνα με δύο άτομα του κλάδου.
ΥΠΟΛΟΓΙΣΤΙΚΗ ΙΣΧΥΣ
 
Η επιτυχία του DeepSeek με ένα μοντέλο τεχνητής νοημοσύνης χαμηλού κόστους βασίζεται στη δεκαετή και ουσιαστική επένδυση της High-Flyer στην έρευνα και την υπολογιστική ισχύ, είπαν τρία άτομα.
 
Το quant fund ήταν παλαιότερα πρωτοπόρος στις συναλλαγές τεχνητής νοημοσύνης και ένα κορυφαίο στέλεχος είπε το 2020 ότι η High-Flyer εισήγαγε «όλα μέσα» στην τεχνητή νοημοσύνη, επενδύοντας εκ νέου το 70% των εσόδων της, κυρίως στην έρευνα τεχνητής νοημοσύνης.
 
Η High-Flyer δαπάνησε 1,2 δισεκατομμύρια γιουάν σε δύο συμπλέγματα τεχνητής νοημοσύνης υπερυπολογιστών το 2020 και το 2021. Το δεύτερο σύμπλεγμα, το Fire-Flyer II, αποτελούνταν από περίπου 10.000 τσιπ Nvidia A100, που χρησιμοποιούνται για την εκπαίδευση μοντέλων τεχνητής νοημοσύνης.
 
Το DeepSeek δεν είχε δημιουργηθεί εκείνη την εποχή, επομένως η συσσώρευση υπολογιστικής ισχύος τράβηξε την προσοχή των κινεζικών ρυθμιστικών αρχών κινητών αξιών, είπε ένα άτομο με άμεση γνώση της σκέψης των αξιωματούχων.
 
"Οι ρυθμιστικές αρχές ήθελαν να μάθουν γιατί χρειάζονται τόσες πολλές μάρκες;" είπε το άτομο. "Πώς θα το χρησιμοποιούσαν; Τι είδους αντίκτυπο θα είχε αυτό στην αγορά;"
 
Οι αρχές αποφάσισαν να μην επέμβουν, σε μια κίνηση που θα αποδεικνυόταν κρίσιμη για την τύχη του DeepSeek: οι ΗΠΑ απαγόρευσαν την εξαγωγή τσιπ A100 στην Κίνα το 2022, οπότε το Fire-Flyer II ήταν ήδη σε λειτουργία.
 
Το Πεκίνο γιορτάζει τώρα το DeepSeek, αλλά του έχει δώσει εντολή να μην ασχολείται με τα μέσα ενημέρωσης χωρίς έγκριση, σύμφωνα με ένα άτομο εξοικειωμένο με την κινεζική επίσημη σκέψη.
 
Οι αρχές είχαν ζητήσει από τον Liang να κρατήσει χαμηλό προφίλ επειδή ανησυχούσαν ότι η υπερβολική διαφημιστική εκστρατεία στα μέσα ενημέρωσης θα τραβούσε την περιττή προσοχή, είπε το άτομο.
 
Το υπουργικό συμβούλιο και το υπουργείο Εμπορίου της Κίνας, καθώς και η ρυθμιστική αρχή κινητών αξιών της Κίνας, δεν απάντησαν σε αιτήματα για σχόλια.
 
Ως μία από τις λίγες εταιρείες με μεγάλο σύμπλεγμα A100, η ​​High-Flyer και η DeepSeek μπόρεσαν να προσελκύσουν μερικά από τα καλύτερα ερευνητικά ταλέντα της Κίνας, δήλωσαν δύο πρώην υπάλληλοι.
 
«Το βασικό πλεονέκτημα των τεράστιων (υπολογιστικών) πόρων είναι ότι επιτρέπει πειραματισμούς μεγάλης κλίμακας», δήλωσε ο Liu, ο πρώην υπάλληλος.
 
Ορισμένοι δυτικοί επιχειρηματίες τεχνητής νοημοσύνης, όπως ο Διευθύνων Σύμβουλος της Scale AI, Alexandr Wang, ισχυρίστηκαν ότι το DeepSeek διέθετε έως και 50.000 τσιπ Nvidia ανώτερης τεχνολογίας που απαγορεύονται για εξαγωγή στην Κίνα. Δεν προσκόμισε στοιχεία για τον ισχυρισμό ούτε απάντησε στα αιτήματα του Reuters να παράσχει αποδείξεις.
 
Το DeepSeek δεν έχει απαντήσει στους ισχυρισμούς του Wang. Δύο πρώην υπάλληλοι απέδωσαν την επιτυχία της εταιρείας στην εστίαση του Liang σε πιο οικονομική αρχιτεκτονική τεχνητής νοημοσύνης .
 
Η εκκίνηση χρησιμοποίησε τεχνικές όπως το Mixture-of-Experts (MoE) και η λανθάνουσα προσοχή πολλαπλών κεφαλών (MLA), οι οποίες συνεπάγονται πολύ χαμηλότερο κόστος υπολογιστών, δείχνουν τα ερευνητικά της έγγραφα.
 
Η τεχνική MoE διαιρεί ένα μοντέλο τεχνητής νοημοσύνης σε διαφορετικούς τομείς εξειδίκευσης και ενεργοποιεί μόνο αυτούς που σχετίζονται με ένα ερώτημα, σε αντίθεση με τις πιο κοινές αρχιτεκτονικές που χρησιμοποιούν ολόκληρο το μοντέλο.
 
Η αρχιτεκτονική MLA επιτρέπει σε ένα μοντέλο να επεξεργάζεται διαφορετικές πτυχές μιας πληροφορίας ταυτόχρονα, βοηθώντας το να εντοπίζει τις βασικές λεπτομέρειες πιο αποτελεσματικά.
 
Ενώ ανταγωνιστές όπως η Mistral της Γαλλίας έχουν αναπτύξει μοντέλα βασισμένα στο MoE, η DeepSeek ήταν η πρώτη εταιρεία που εξαρτήθηκε σε μεγάλο βαθμό από αυτήν την αρχιτεκτονική, ενώ πέτυχε ισοτιμία με μοντέλα πιο ακριβά κατασκευασμένα.
 
Η τιμολόγηση του DeepSeek ήταν 20 έως 40 φορές φθηνότερη από αυτή που χρέωνε το OpenAI για ισοδύναμα μοντέλα, υπολόγισαν οι αναλυτές της χρηματιστηριακής εταιρείας Bernstein στις αρχές Φεβρουαρίου.
 
Προς το παρόν, οι δυτικοί και οι κινεζικοί τεχνολογικοί γίγαντες έχουν σηματοδοτήσει σχέδια να συνεχίσουν τις βαριές δαπάνες για τεχνητή νοημοσύνη, αλλά η επιτυχία του DeepSeek με το R1 και το προηγούμενο μοντέλο V3 ώθησε ορισμένους να αλλάξουν στρατηγικές.
 
Το OpenAI μείωσε τις τιμές αυτόν τον μήνα, ενώ ο Gemini της Google εισήγαγε μειωμένες βαθμίδες πρόσβασης. Από την κυκλοφορία του R1, το OpenAI κυκλοφόρησε επίσης ένα μοντέλο O3-Mini που βασίζεται σε λιγότερη υπολογιστική ισχύ.
 
Ο Adnan Masood του αμερικανικού παρόχου τεχνολογικών υπηρεσιών UST είπε στο Reuters ότι το εργαστήριό του είχε τρέξει δείκτες αναφοράς που βρήκαν ότι το R1 συχνά χρησιμοποιούσε τρεις φορές περισσότερα tokens ή μονάδες δεδομένων που επεξεργαζόταν το μοντέλο AI, για συλλογισμό από το μειωμένο μοντέλο του OpenAI.
ΚΡΑΤΙΚΗ ΑΓΚΑΛΙΑ
 
Ακόμη και πριν το R1 τραβήξει την παγκόσμια προσοχή, υπήρχαν ενδείξεις ότι το DeepSeek είχε τραβήξει την εύνοια του Πεκίνου. Τον Ιανουάριο, τα κρατικά μέσα ενημέρωσης ανέφεραν ότι ο Λιάνγκ παρακολούθησε μια συνάντηση με τον Κινέζο πρωθυπουργό Li Qiang στο Πεκίνο ως διορισμένος εκπρόσωπος του τομέα της τεχνητής νοημοσύνης, μπροστά από τους ηγέτες των πιο γνωστών εταιρειών.
 
Οι επακόλουθες φανφάρες σχετικά με την ανταγωνιστικότητα κόστους των μοντέλων της ενίσχυσαν την πεποίθηση του Πεκίνου ότι μπορεί να υπερ-καινοτομήσει τις ΗΠΑ, με τις κινεζικές εταιρείες και κυβερνητικούς φορείς να αγκαλιάζουν τα μοντέλα DeepSeek με ρυθμό που δεν έχει προσφερθεί σε άλλες εταιρείες.
 
Τουλάχιστον 13 κινεζικές κυβερνήσεις πόλεων και 10 κρατικές εταιρείες ενέργειας λένε ότι έχουν αναπτύξει το DeepSeek στα συστήματά τους, ενώ οι τεχνολογικοί γίγαντες Lenovo (0992.HK), ανοίγει νέα καρτέλα, Baidu (9888.HK), ανοίγει νέα καρτέλακαι Tencent (0700.HK), ανοίγει νέα καρτέλα- κάτοχος της μεγαλύτερης εφαρμογής κοινωνικών μέσων της Κίνας WeChat - έχουν ενσωματώσει τα μοντέλα της DeepSeek στα προϊόντα τους.
 
Ο Κινέζος ηγέτης Σι Τζινπίνγκ και ο Λι «έδειξαν ότι υποστηρίζουν το DeepSeek», δήλωσε ο Άλφρεντ Γου, ειδικός στη χάραξη κινεζικής πολιτικής στη Σχολή Δημόσιας Πολιτικής Lee Kuan Yew της Σιγκαπούρης. «Τώρα το επικυρώνουν όλοι».
 
Η κινεζική αγκαλιά έρχεται καθώς οι κυβερνήσεις από τη Νότια Κορέα έως την Ιταλία αφαιρούν το DeepSeek από τα εθνικά καταστήματα εφαρμογών, επικαλούμενες ανησυχίες για το απόρρητο.
 
«Εάν το DeepSeek γίνει το μοντέλο AI σε όλες τις κινεζικές κρατικές οντότητες, οι δυτικές ρυθμιστικές αρχές μπορεί να το δουν ως έναν άλλο λόγο για να κλιμακώσουν τους περιορισμούς στα τσιπ τεχνητής νοημοσύνης ή στις συνεργασίες λογισμικού», δήλωσε ο Stephen Wu, ειδικός τεχνητής νοημοσύνης και ιδρυτής του hedge fund Carthage Capital.
 
Περαιτέρω όρια σε προηγμένα τσιπ AI είναι μια πρόκληση που ο Liang έχει αναγνωρίσει.
 
«Το πρόβλημά μας δεν ήταν ποτέ η χρηματοδότηση», είπε στην Waves τον Ιούλιο. «Είναι το εμπάργκο σε μάρκες υψηλών προδιαγραφών».
 
Τελευταία τροποποίηση στιςΤετάρτη, 26 Φεβρουαρίου 2025 06:19
© Kifisia-Life. All Rights Reserved.