Η Amazon επανασχεδίασε την Alexa ώστε να εξαρτάται λιγότερο από τα μοντέλα τεχνητής νοημοσύνης της Anthropic, στο πλαίσιο μιας ευρύτερης προσπάθειας να μειώσει το κόστος λειτουργίας του φωνητικού της βοηθού. Σύμφωνα με εσωτερικά έγγραφα που εξέτασε το Business Insider και τα οποία καλύπτουν το διάστημα από τα τέλη του προηγούμενου έτους έως τις αρχές του τρέχοντος, η εταιρεία δρομολογεί μια σειρά αλλαγών στον τρόπο με τον οποίο η Alexa παράγει απαντήσεις: κατευθύνει περισσότερα αιτήματα στα δικά της μοντέλα, αποφεύγει περιττές κλήσεις προς τα μοντέλα Claude της Anthropic και αξιοποιεί περισσότερο κάθε GPU.
- Η Amazon μεταφέρει εξειδικευμένους “Experts” της Alexa από το Claude Sonnet σε δικά της μοντέλα.
- Οι εσωτερικές προβλέψεις για το κόστος cloud της Alexa+ έφταναν περίπου τα 1,7 δισ. δολάρια για το 2026, σχεδόν τριπλάσια σε σχέση με το προηγούμενο έτος.
- Οι πρωτοβουλίες αναμενόταν να τετραπλασιάσουν και πλέον τον αριθμό συναλλαγών ανά μονάδα υπολογιστικής ισχύος.
Συνολικά, οι πρωτοβουλίες αυτές αναμενόταν να αυξήσουν κατά περισσότερο από τέσσερις φορές τον αριθμό των συναλλαγών πελατών που μπορεί να υποστηρίξει κάθε μονάδα υπολογιστικής χωρητικότητας.
Γιατί η νέα Alexa+ κοστίζει πολύ περισσότερο
Σε αντίθεση με τις προηγούμενες εκδόσεις, η Alexa+ παράγει πολλές απαντήσεις μέσω μεγάλων γλωσσικών μοντέλων που τρέχουν σε υπηρεσίες cloud με έντονη χρήση GPU. Αυτό μετέτρεψε τα σχετικά φθηνά φωνητικά αιτήματα σε φόρτους εργασίας τεχνητής νοημοσύνης που κοστίζουν πολύ περισσότερο στην εξυπηρέτηση.
Οι εσωτερικές προβλέψεις των αρχών του έτους έδειχναν ότι το κόστος cloud της AWS για τη νέα, ενισχυμένη με ΤΝ Alexa+ βρισκόταν σε τροχιά να φτάσει περίπου τα 1,7 δισ. δολάρια το 2026, σχεδόν τριπλάσιο σε σχέση με το προηγούμενο έτος. Η υπηρεσία προβλεπόταν επίσης να λειτουργεί περίπου 60% πάνω από τον στόχο της Amazon για κόστος cloud ανά μηνιαία ενεργό χρήστη. Ακόμη και μετά τον εντοπισμό δυνητικών εξοικονομήσεων περίπου 450 εκατ. δολαρίων, εσωτερικές αξιολογήσεις κατέληξαν ότι η δραστηριότητα δεν θα πετύχαινε τους οικονομικούς της στόχους. Η Amazon αρνήθηκε να σχολιάσει.
Η κλιμάκωση της υπηρεσίας απλώς αύξησε την οικονομική πίεση — ένδειξη του πόσο διαφορετική είναι η γενετική ΤΝ από τις πιο παραδοσιακές υπηρεσίες λογισμικού.
Το κόστος αυτό απέκτησε μεγαλύτερη σημασία καθώς η Amazon διαχειριζόταν μια δύσκολη κυκλοφορία. Η εταιρεία, όπως έχει αναφερθεί, καθυστέρησε αρκετές φορές την Alexa+ ενώ οι μηχανικοί πάλευαν με τις “ψευδαισθήσεις” της ΤΝ. Η υπηρεσία επέκτεινε τη διαθεσιμότητά της στις ΗΠΑ νωρίτερα φέτος.
Λιγότερες κλήσεις προς τα μοντέλα Claude
Μία από τις προτεραιότητες της Amazon ήταν να περιορίσει τα σημεία όπου χρησιμοποιούνται τα μοντέλα Claude της Anthropic εντός της Alexa+. Οι εσωτερικοί οδικοί χάρτες προέβλεπαν τη μεταφορά εξειδικευμένων “Experts” της Alexa από το Claude Sonnet στα δικά της μοντέλα, μειώνοντας παράλληλα και άλλες χρήσεις του Claude.
Η εταιρεία επιδίωξε επίσης να αποφεύγει την εξαγωγή συμπερασμάτων (inference) όποτε είναι δυνατόν. Ένας τρόπος για να περιοριστεί το σχετικό κόστος είναι η προσωρινή αποθήκευση (caching), που αποθηκεύει απαντήσεις σε συνηθισμένα αιτήματα ώστε το μοντέλο να μην επαναλαμβάνει την ίδια εργασία. Ένας οδικός χάρτης προέβλεπε η Alexa+ να σταματά να καλεί τα μοντέλα Claude όταν κατάλληλες απαντήσεις είναι ήδη διαθέσιμες στην κρυφή μνήμη, καθώς και τη διεύρυνση της “ντετερμινιστικής” διαχείρισης πιο προβλέψιμων αιτημάτων χωρίς προσφυγή σε μεγάλο γλωσσικό μοντέλο.
Η στρατηγική αυτή είναι αξιοσημείωτη δεδομένων των βαθιών δεσμών της Amazon με την Anthropic. Η Amazon έχει επενδύσει δισεκατομμύρια στη νεοφυή επιχείρηση, συνεργάζεται στενά μαζί της και θα μπορούσε να αποκομίσει σημαντικό όφελος από μια ενδεχόμενη δημόσια εγγραφή της Anthropic.
Μια τάση που εξαπλώνεται σε όλον τον κλάδο
Η προσέγγιση της Amazon αντικατοπτρίζει μια ευρύτερη τάση στη βιομηχανία της τεχνητής νοημοσύνης. Καθώς τα πιο προηγμένα μοντέλα γίνονται ικανότερα, ο ανταγωνισμός μετατοπίζεται από την κατασκευή εξυπνότερης ΤΝ στη φθηνότερη λειτουργία της. Η Google προωθεί χαμηλότερου κόστους ΤΝ μέσω του Gemini Flash, ενώ εταιρείες όπως η OpenAI και η Cursor έχουν εισαγάγει τεχνικές που κατευθύνουν αυτόματα τα απλούστερα αιτήματα σε φθηνότερα μοντέλα.
Η επενδυτική εταιρεία William Blair ανέφερε σε πρόσφατη έκθεση ότι οι εταιρείες λογισμικού αρχίζουν να επιφυλάσσουν τα κορυφαία μοντέλα για δύσκολες, υψηλής σημασίας εργασίες συλλογιστικής, δρομολογώντας τα λιγότερο σύνθετα αιτήματα σε φθηνότερα μοντέλα. “Η δρομολόγηση πολλαπλών μοντέλων γίνεται πλέον τυπική αρχιτεκτονική στο λογισμικό”, σημείωσαν οι αναλυτές της.
Περισσότερη δουλειά με λιγότερες GPU
Η μείωση του κόστους των μοντέλων ήταν μόνο ένα κομμάτι της στρατηγικής. Η Amazon εστίασε επίσης στην αύξηση του όγκου εργασίας που μπορεί να εκτελέσει κάθε GPU. Αντί απλώς να προσθέτει περισσότερες GPU της Nvidia, η εταιρεία ήθελε να επεξεργάζεται περισσότερα αιτήματα από τον ίδιο εξοπλισμό. Ένας οδικός χάρτης προέβλεπε ότι οι αναβαθμίσεις λογισμικού θα αύξαναν τη διαθέσιμη υπολογιστική χωρητικότητα κατά περίπου 50%, μειώνοντας παράλληλα τους χρόνους απόκρισης κατά περίπου 40%.
Οι προσπάθειες εξοικονόμησης επεκτάθηκαν και πέρα από το λογισμικό. Έγγραφα σχεδιασμού δείχνουν την εταιρεία να αξιολογεί τόσο GPU της Nvidia όσο και τα δικά της τσιπ Trainium για περαιτέρω μείωση του κόστους λειτουργίας.
Η φιλοσοφία αυτή αντηχεί μια θέση που έχει διατυπώσει δημόσια ο διευθύνων σύμβουλος Andy Jassy. Στην περσινή επιστολή του προς τους μετόχους, ο Jassy υποστήριξε ότι υπάρχει “επείγουσα ανάγκη” να γίνει η εξαγωγή συμπερασμάτων της ΤΝ δραματικά φθηνότερη. “Η μείωση του κόστους ανά μονάδα στην ΤΝ θα απελευθερώσει τη χρήση της ΤΝ όσο ευρέως επιθυμούν οι πελάτες, και θα οδηγήσει επίσης σε περισσότερες συνολικά δαπάνες για ΤΝ”, έγραψε.
Πιστεύετε ότι η δρομολόγηση αιτημάτων σε φθηνότερα μοντέλα θα επηρεάσει την εμπειρία σας με φωνητικούς βοηθούς όπως η Alexa; Μοιραστείτε τη γνώμη σας στα σχόλια.































