
Το GPTZero εντόπισε εκατοντάδες «παραισθήσεις» AI σε έρευνες του συνεδρίου NeurIPS. Πώς τα LLMs και οι ψεύτικες παραπομπές απειλούν την επιστημονική εγκυρότητα;

Η εταιρεία που ειδικεύεται στην τεχνολογία ανίχνευσης περιεχομένου, GPTZero, προχώρησε σε μια αποκαλυπτική ανάλυση και των 4.841 εργασιών που έγιναν δεκτές από το διεθνώς αναγνωρισμένο συνέδριο NeurIPS. Το συνέδριο, το οποίο θεωρείται η κορωνίδα για την τεχνολογία και την εξέλιξη της μηχανικής μάθησης, πραγματοποιήθηκε τον περασμένο μήνα στο San Diego.
Σύμφωνα με τα στοιχεία που παρουσίασε η εταιρεία στο TechCrunch, η έρευνα έφερε στο φως 100 περιπτώσεις «παραισθήσεων» (hallucinations) σε βιβλιογραφικές παραπομπές εντός 51 εργασιών, τις οποίες και επιβεβαίωσε ως ψεύτικες. Το γεγονός αυτό εγείρει σοβαρά ερωτήματα για το πώς η ταχεία εξέλιξη των εργαλείων AI επηρεάζει την ακαδημαϊκή ακεραιότητα.
Η αποδοχή μιας επιστημονικής εργασίας από το NeurIPS αποτελεί ένα αδιαμφισβήτητο επίτευγμα καριέρας στον κόσμο του AI. Δεδομένου ότι στο συνέδριο συμμετέχουν τα κορυφαία μυαλά της έρευνας παγκοσμίως, η είδηση φαντάζει ειρωνική: θα περίμενε κανείς ότι οι ειδικοί θα χρησιμοποιούσαν τα LLMs (Μεγάλα Γλωσσικά Μοντέλα) για να αυτοματοποιήσουν την εξαιρετικά χρονοβόρα διαδικασία της συγγραφής αναφορών.
Ωστόσο, για να είμαστε δίκαιοι, υπάρχουν σημαντικοί αστερίσκοι σε αυτό το εύρημα:
Είναι κρίσιμο να σημειωθεί ότι μια ανακριβής παραπομπή, αν και προβληματική, δεν ακυρώνει απαραίτητα την επιστημονική αξία ή την καινοτομία της εργασίας. Όπως δήλωσαν εκπρόσωποι του NeurIPS στο Fortune, το οποίο ήταν το πρώτο μέσο που ανέδειξε την έρευνα του GPTZero:
«Ακόμα κι αν το 1,1% των εργασιών έχει μία ή περισσότερες λανθασμένες αναφορές λόγω της χρήσης LLMs, το περιεχόμενο των ίδιων των εργασιών δεν είναι απαραίτητα άκυρο».
Παρόλα αυτά, μια πλαστή παραπομπή που δημιουργείται από το AI δεν είναι αμελητέο ζήτημα. Το NeurIPS υπερηφανεύεται για την «αυστηρή επιστημονική δημοσίευση στη μηχανική μάθηση και την τεχνητή νοημοσύνη». Κάθε εργασία περνά από εξονυχιστικό έλεγχο από πολλούς κριτές, οι οποίοι έχουν λάβει σαφείς οδηγίες να εντοπίζουν τυχόν «παραισθήσεις».
Οι παραπομπές λειτουργούν ως ένα είδος «νομίσματος» στην ακαδημαϊκή κοινότητα. Χρησιμοποιούνται ως βασικός δείκτης καριέρας για να αποδείξουν πόσο επιδραστικό είναι το έργο ενός ερευνητή μεταξύ των συναδέλφων του. Όταν το AI δημιουργεί αναφορές από το μηδέν, υπονομεύει την αξία αυτού του συστήματος αξιολόγησης.
Στην πραγματικότητα, είναι δύσκολο να κατηγορήσει κανείς τους κριτές που δεν εντόπισαν μερικές κατασκευασμένες από το AI παραπομπές, δεδομένου του τεράστιου όγκου των εργασιών που καλούνται να ελέγξουν. Το GPTZero σπεύδει να το επισημάνει αυτό, τονίζοντας τις προκλήσεις που φέρνει η νέα τεχνολογία.
Ο στόχος της άσκησης ήταν να προσφέρει συγκεκριμένα δεδομένα σχετικά με το πώς το κακής ποιότητας περιεχόμενο AI εισχωρεί μέσω ενός «tsunami υποβολών». Όπως αναφέρει η startup στην έκθεσή της, αυτός ο όγκος έχει «πιέσει τις διαδικασίες αξιολόγησης αυτών των συνεδρίων στα όριά τους», δείχνοντας την ανάγκη για προηγμένα εργαλεία ελέγχου στο μέλλον.