Τεχνητή Νοημοσύνη: Πώς η Vals επαναπροσδιορίζει την αξιολόγηση των μοντέλων AI με επένδυση 40 εκατ. δολαρίων

Η ραγδαία εξέλιξη της τεχνητής νοημοσύνης έχει καταστήσει τη μέτρηση των επιδόσεων (benchmarking) βασικό εργαλείο αξιοπιστίας αλλά και μάρκετινγκ για τις εταιρείες τεχνολογίας. Όταν οι δείκτες ευνοούν ένα μοντέλο, αποτελούν το ισχυρότερο όπλο δημοσίων σχέσεων. Ωστόσο, τα παραδοσιακά συστήματα μέτρησης αποδεικνύονται συχνά παρωχημένα ή ευάλωτα σε χειραγώγηση. Την απάντηση σε αυτό το δομικό πρόβλημα επιδιώκει να δώσει η Vals, μια ανερχόμενη startup που ιδρύθηκε το 2024 και εξασφάλισε πρόσφατα χρηματοδότηση Series A ύψους 40 εκατομμυρίων δολαρίων, υπό την ηγεσία του κορυφαίου επενδυτικού κεφαλαίου Andreessen Horowitz.

Το πρόβλημα με τα παραδοσιακά AI benchmarks και η ανάγκη για αξιοπιστία

Ο 25χρονος συνιδρυτής της Vals, Ράιαν Κρίσναν, διαθέτει ήδη σημαντική εμπειρία έχοντας εργαστεί στην Palantir, τη Microsoft και το εργαστήριο τεχνητής νοημοσύνης του Πανεπιστημίου Stanford. Ο ίδιος παρατήρησε ότι τα ακαδημαϊκά τεστ αδυνατούν να συμβαδίσουν με την ταχύτητα ανάπτυξης των σύγχρονων μοντέλων. Πολλά παραδοσιακά benchmarks είναι δημόσια προσβάσιμα, γεγονός που επιτρέπει στις εταιρείες να «εκπαιδεύουν» τα συστήματά τους πάνω στις συγκεκριμένες ερωτήσεις, αλλοιώνοντας την πραγματική εικόνα των δυνατοτήτων τους.

Σε αντίθεση με τη συμβατική πρακτική, η Vals δεν δημοσιοποιεί το υλικό των δοκιμών της. Στόχος της δεν είναι να ελέγξει αν ένα μοντέλο διαθέτει γενικές εγκυκλοπαιδικές γνώσεις, αλλά αν μπορεί να επιλύσει σύνθετες εργασίες με την ποιότητα ενός ανθρώπινου επαγγελματία σε πραγματικές συνθήκες αγοράς.

Αξιολόγηση σε πραγματικές συνθήκες και ανάλυση ρίσκου

Η μεθοδολογία της Vals επικεντρώνεται σε εξειδικευμένους τομείς όπως η νομική επιστήμη, τα χρηματοοικονομικά, η συγγραφή κώδικα, η κυβερνοασφάλεια και η βιοασφάλεια. Παράλληλα, αναπτύσσει πρωτόκολλα αξιολόγησης για την αναδρομική αυτοβελτίωση των μοντέλων, την ψυχική υγεία, καθώς και την εφαρμογή των Συμβάσεων της Γενεύης σε συνθήκες ένοπλης σύγκρουσης.

Κεντρικός πυλώνας της στρατηγικής της είναι η καταγραφή όχι μόνο των θετικών αποτελεσμάτων αλλά και των δυνητικών κινδύνων. Η εταιρεία αναλύει τις αρνητικές επιπτώσεις που θα μπορούσαν να προκύψουν εάν ένα μοντέλο αναπτυχθεί ανεξέλεγκτα στον πραγματικό κόσμο. Οι εταιρείες τεχνολογίας πληρώνουν τη Vals για να υποβάλει τα συστήματά τους σε εξονυχιστικό έλεγχο, λειτουργώντας με ένα μοντέλο παρόμοιο με τις εξετάσεις πιστοποίησης, ώστε να εντοπίσουν αδυναμίες και να βελτιώσουν τα προϊόντα τους πριν από την εμπορική τους διάθεση.

Εκρηκτική ανάπτυξη, κρατικές συνεργασίες και το μέλλον των AI IPOs

Η ζήτηση για αντικειμενική αξιολόγηση έχει οδηγήσει τη Vals σε ταχύτατη κλιμάκωση. Η startup, η οποία ξεκίνησε με αρχική χρηματοδότηση από τα funds 8VC και Bloomberg Beta, είδε τα έσοδά της να οκταπλασιάζονται μέσα σε έναν χρόνο, ενώ το ανθρώπινο δυναμικό της τριπλασιάστηκε φτάνοντας τα 25 άτομα, με σχέδια για περαιτέρω επέκταση στα γραφεία της στο Σαν Φρανσίσκο. Παράλληλα, εγκαινίασε ειδικό πρόγραμμα αξιολόγησης μοντέλων για ομοσπονδιακές υπηρεσίες των ΗΠΑ.

Ο Ράιαν Κρίσναν εκτιμά ότι καθώς η τεχνητή νοημοσύνη ενσωματώνεται στον πυρήνα της παγκόσμιας οικονομίας και εταιρείες όπως η Anthropic ή η OpenAI πλησιάζουν στο κατώφλι των δημόσιων εγγραφών (IPO), τα ανεξάρτητα benchmarks θα αποτελέσουν θεμέλιο λίθο για τις οικονομικές καταστάσεις, την επενδυτική εμπιστοσύνη και τη ρυθμιστική συμμόρφωση της νέας ψηφιακής εποχής.

ThePostPolitics Newsroom
ThePostPolitics Newsroom