Sztuczna Inteligencja Ogólna (AGI) jest uznawana za kluczowy punkt zwrotny, który może znacząco przyspieszyć odkrycia naukowe i pomóc w rozwiązaniu najtrudniejszych problemów ludzkości. Mimo ogromnego potencjału, precyzyjne określenie stopnia zaawansowania systemów AI w drodze do osiągnięcia poziomu ogólnej inteligencji pozostaje wyzwaniem. Obecnie brakuje bowiem ustandaryzowanych narzędzi empirycznych, które pozwoliłyby obiektywnie ocenić, jak blisko jesteśmy tego celu.
Nowe podejście do pomiaru inteligencji maszynowej
Google DeepMind proponuje rozwiązanie tego problemu, opierając się na dorobku psychologii, neuronauki oraz nauk kognitywnych. W opublikowanej pracy zatytułowanej „Measuring Progress Toward AGI: A Cognitive Taxonomy” badacze przedstawiają ramy teoretyczne, które pozwalają na systematyczną analizę zdolności poznawczych systemów AI. Zamiast skupiać się wyłącznie na wynikach w konkretnych testach, autorzy proponują taksonomię obejmującą dziesięć kluczowych obszarów poznawczych, które uznaje się za fundamenty inteligencji:
- Percepcja: zdolność do wyodrębniania i przetwarzania informacji sensorycznych z otoczenia.
- Generowanie: tworzenie treści, takich jak tekst, mowa czy wykonywanie działań.
- Uwaga: umiejętność koncentracji zasobów poznawczych na istotnych elementach.
- Uczenie się: zdobywanie nowej wiedzy poprzez doświadczenie i instrukcje.
- Pamięć: przechowywanie i odzyskiwanie informacji w czasie.
- Rozumowanie: wyciąganie poprawnych wniosków poprzez logiczne wnioskowanie.
- Metapoznanie: świadomość własnych procesów poznawczych i ich monitorowanie.
- Funkcje wykonawcze: planowanie, hamowanie reakcji i elastyczność poznawcza.
- Rozwiązywanie problemów: znajdowanie skutecznych rozwiązań w określonych dziedzinach.
- Poznanie społeczne: interpretacja sygnałów społecznych i odpowiednie reagowanie w sytuacjach międzyludzkich.
Protokół ewaluacji i porównanie z człowiekiem
Aby przełożyć teorię na praktykę, zaproponowano trzyetapowy protokół oceny systemów AI. Pierwszym krokiem jest poddanie modelu serii zadań poznawczych, przy czym kluczowe jest stosowanie zestawów testowych, z którymi model nie miał wcześniej styczności, aby uniknąć zjawiska zanieczyszczenia danych. Następnie zbierane są wyniki od reprezentatywnej grupy dorosłych ludzi, co stanowi punkt odniesienia. Ostatnim etapem jest mapowanie wydajności AI względem rozkładu wyników uzyskanych przez ludzi w każdej z wymienionych kategorii.
Współpraca ze społecznością badawczą
W celu wdrożenia tych założeń, Google DeepMind nawiązało współpracę z platformą Kaggle, organizując hackathon poświęcony tworzeniu ewaluacji dla pięciu obszarów, w których obecnie występuje największa luka badawcza: uczenia się, metapoznania, uwagi, funkcji wykonawczych oraz poznania społecznego. Uczestnicy mogą korzystać z platformy Community Benchmarks, aby testować swoje rozwiązania na czołowych modelach AI.
Łączna pula nagród w konkursie wynosi 200 000 dolarów (około 800 000 złotych). Przewidziano nagrody w wysokości 10 000 dolarów (ok. 40 000 złotych) dla dwóch najlepszych zgłoszeń w każdej z pięciu kategorii oraz cztery nagrody główne po 25 000 dolarów (ok. 100 000 złotych) za najlepsze prace ogólne. Zgłoszenia przyjmowane są od 17 marca do 16 kwietnia, a ogłoszenie wyników zaplanowano na 1 czerwca.
