OFF THE RECORD: Μη μου λες να ζω με αναμνήσεις…
Arena: Στα 3,1 δισ. δολάρια η αποτίμηση της πλατφόρμας αξιολόγησης AI μετά από νέο γύρο χρηματοδότησης

Σε έναν από τους ταχύτερα αναπτυσσόμενους πυλώνες του οικοσυστήματος της τεχνητής νοημοσύνης εξελίσσεται η Arena, η δημοφιλής πλατφόρμα αξιολόγησης μοντέλων AI, η οποία ανακοίνωσε την άντληση 200 εκατομμυρίων δολαρίων στον γύρο χρηματοδότησης Series B. Η συμφωνία εκτοξεύει την αποτίμηση της εταιρείας στα 3,1 δισεκατομμύρια δολάρια, σχεδόν διπλασιάζοντας την αξία της μέσα σε μόλις δέκα μήνες, έπειτα από την προηγούμενη χρηματοδότηση του Ιανουαρίου, όταν είχε αποτιμηθεί στα 1,7 δισεκατομμύρια δολάρια.
Η νέα επενδυτική κίνηση έρχεται σε συνέχεια της ραγδαίας οικονομικής της εκτόξευσης, καθώς η Arena κατέγραψε ετησιοποιημένο ρυθμό εσόδων (run-rate revenue) ύψους 100 εκατομμυρίων δολαρίων τον περασμένο Ιούνιο, σημειώνοντας θεαματική άνοδο από τα 30 εκατομμύρια δολάρια στις αρχές του έτους. Του γύρου χρηματοδότησης ηγήθηκαν οι Lightspeed Venture Partners και Khosla Ventures, με τη συμμετοχή ισχυρών ονομάτων της Silicon Valley, όπως η Salesforce Ventures, η a16z, η Dell Technologies Capital, η 01 Advisors, η Felicis και η Endeavor Catalyst.
Από ακαδημαϊκό εγχείρημα σε κορυφαία B2B λύση
Η Arena ξεκίνησε τη διαδρομή της το 2023 ως ερευνητικό πρόγραμμα στο Πανεπιστήμιο της Καλιφόρνιας στο Μπέρκλεϊ (UC Berkeley), παρέχοντας μια ανοιχτή, crowdsourced πλατφόρμα όπου εκατομμύρια χρήστες εισάγουν prompts και βαθμολογούν τυφλά ποιο μοντέλο αποδίδει καλύτερα. Σήμερα, η πλατφόρμα συγκεντρώνει δεκάδες εκατομμύρια μηνιαίους επισκέπτες, λειτουργώντας ως το de facto σημείο αναφοράς για την καθημερινή εμπειρία χρήσης AI.
Η εμπορική επιτυχία ωστόσο επιταχύνθηκε δραστικά με το λανσάρισμα του AI Evaluations. Η υπηρεσία αυτή προσφέρει σε ερευνητικά εργαστήρια και επιχειρήσεις αναλυτικά δεδομένα απόδοσης βασισμένα στις πραγματικές αντιδράσεις της κοινότητας. Η ανάγκη αυτή κατέστη επιτακτική καθώς τα στατικά τεστ αξιολόγησης (benchmarks) άρχισαν να παρουσιάζουν σοβαρές στρεβλώσεις, με τα μοντέλα να «χειραγωγούν» τις δοκιμές για να επιτύχουν υψηλές βαθμολογίες χωρίς πραγματική βελτίωση στις πραγματικές συνθήκες λειτουργίας.
Η αξιολόγηση της ασφάλειας και το ζήτημα του Alignment
«Η τεχνητή νοημοσύνη εξελίσσεται ταχύτερα από την ικανότητά μας να την αξιολογήσουμε, και τα στατικά benchmarks καταρρέουν μόλις τα μοντέλα αντιληφθούν ότι ελέγχονται», επισημαίνει η Arena στην επίσημη ανακοίνωσή της. Υπογραμμίζει μάλιστα ότι η παγκόσμια αγορά απαιτεί έναν ανεξάρτητο, ουδέτερο παρατηρητή για να μετρά κατά πόσο η τεχνολογία παραμένει ασφαλής και ευθυγραμμισμένη με τις ανθρώπινες προθέσεις, έναν ρόλο τον οποίο αναλαμβάνει πλέον ενεργά.
Στο πλαίσιο αυτό, η εταιρεία εισήγαγε μια νέα ειδική κατηγορία στο leaderboard της, εστιασμένη στο alignment. Στη συγκεκριμένη κατάταξη τα μοντέλα αξιολογούνται για κρίσιμα σφάλματα συμπεριφοράς, όπως οι μη εξουσιοδοτημένες ενέργειες (unauthorized action), η εσφαλμένη απόδοση πηγών ή γεγονότων (false attribution), καθώς και η παραπλανητική ολοκλήρωση εργασιών (deceptive completion), όταν δηλαδή το μοντέλο ψευδώς δηλώνει ότι έφερε εις πέρας μια εντολή. Μέχρι στιγμής, η σειρά μοντέλων της OpenAI διατηρεί την κορυφή στον προκαταρκτικό πίνακα alignment, ενώ τα Claude Opus 5.5 και Claude Fable καταλαμβάνουν την έκτη και ένατη θέση αντίστοιχα.























