
OpenAI opublikowało MentalHealthBench – benchmark sprawdzający, jak sztuczna inteligencja radzi sobie w rozmowach dotyczących zdrowia psychicznego.
Zamiast jednak uspokoić nastroje, publikacja obnażyła dwa zjawiska: metodologię, która premiuje algorytmiczną kompletność, oraz fakt, iż chatboty stają się dla wielu ludzi domyślnym, dodatkowym źródłem emocjonalnego wsparcia.
Publikacja naukowa przygotowana z udziałem ponad 80 licencjonowanych specjalistów z 22 państw miała wyznaczyć standardy bezpieczeństwa dla modeli wchodzących w interakcje z osobami w kryzysie lub szukającymi porady życiowej. Analiza 1215 syntetycznych konwersacji przyniosła jednak rezultat, który na pierwszy rzut oka wygląda na prowokację: odpowiedzi przygotowane przez ludzi uzyskały w teście znacznie gorsze noty niż algorytmy.
Paradoks kompletności: dlaczego odpowiedzi ekspertów zdobyły mniej punktów
W ogólnym zestawieniu najwyższy wynik zdobył GPT-6 Astra (57,3%), wyprzedzając m.in. Claude Opus 5.5 (52,4%) czy Muse Spark 1.3 (48,6%). Tymczasem referencyjne odpowiedzi przygotowane samodzielnie przez licencjonowanych klinicystów uzyskały średnio zaledwie 38,5%. Czy to znaczy iż np. profesjonalni psychoterapeuci są „głupsi” niż AI? Nie wiemy czy taki cel miało OpenAI, ale klucz tkwi w czymś innym: w metodologii.
Wyjaśnienie tego zjawiska tkwi w samej konstrukcji testu oraz mechanice modeli językowych. Klinicyści byli bardzo powściągliwi: często zadawali jedno pytanie albo formułowali krótkie stwierdzenie. Ich wypowiedź zamykała się zwykle w kilkunastu słowach. I tu pojawia się problem metodologiczny: w prawdziwej relacji krótka reakcja jest dopiero początkiem dalszej pracy. W benchmarku oceniano wyłącznie pojedynczą, wyizolowaną odpowiedź końcową.
Z kolei modele językowe generują obszerne wypowiedzi liczące setki tokenów. W jednej wiadomości potrafią zmieścić wstępną analizę, techniki relaksacyjne, skrypty rozmów z bliskimi i namiary na infolinie kryzysowe. Choć kryteria testu nie nagradzały samej liczby słów, to rozbicie oceny na zestaw ważonych wytycznych sprawiło, iż konstrukcja testu premiowała kompletność – a to pośrednio faworyzowało znacznie dłuższe odpowiedzi maszyn.
To mocno sugeruje, iż test mierzy również algorytmiczną skrupulatność w wyczerpywaniu listy zaleceń, co niekoniecznie pokrywa się z dynamiką i jakością realnej rozmowy terapeutycznej. MentalHealthBench nie dowodzi więc, iż AI radzi sobie lepiej od człowieka. Pokazuje coś znacznie ciekawszego: odpowiedź uznana przez zautomatyzowany system oceniania za kompletną diametralnie różni się od tego, co doświadczony specjalista uznałby za adekwatne w żywym dialogu.
Czego szuka użytkownik, przed czym ostrzegają klinicyści
Równie ciekawie wygląda rozdźwięk między oczekiwaniami odbiorców a podejściem medycznym. Twórcy badania zestawili kryteria klinicystów z ocenami grupy ponad 40 dorosłych użytkowników AI z 16 krajów.
Wynik? Tylko 25,7% wag kryteriów było wspólnych dla obu grup. Aż 73,3% kryteriów pojawiało się wyłącznie po jednej ze stron, przy czym zaledwie 1% było ze sobą bezpośrednio sprzeczne. Problem nie polega więc na otwartym konflikcie, ale na fundamentalnie innych priorytetach.
Użytkownicy oczekują przede wszystkim natychmiastowych wskazówek, gotowych planów działania i emocjonalnej walidacji („powiedz mi, co mam zrobić z tą relacją”). Klinicyści w swoich rubrykach kładli natomiast nacisk na ostrożność, zbieranie kontekstu i nieodbieranie rozmówcy sprawczości – karząc ujemnymi punktami np. za sugerowanie, co użytkownik „powinien” zrobić.
Co więcej, American Psychological Association (APA) zwraca uwagę na fakt, iż chatboty mają naturalną tendencję do przytakiwania rozmówcy i utwierdzania go w jego własnych przekonaniach. Dla szukającego pocieszenia człowieka brzmi to komfortowo, ale w procesie terapeutycznym rzadko bywa zaletą.
Nowe, cyfrowe źródło wsparcia
Publikacja OpenAI dotyka zjawiska, którego skala dawno przekroczyła ramy technologicznej ciekawostki. Według danych APA z 2026 roku aż 77% psychologów deklaruje, iż ich pacjenci zgłaszają korzystanie z AI, a ponad jedna trzecia mówi, iż pacjenci używają algorytmów jako dodatkowego źródła wsparcia psychicznego. Z kolei raport Common Sense Media z czerwca 2026 roku wskazuje, iż 37% korzystających z AI dzieci i nastolatków (w wieku 9–17 lat) rozmawia z narzędziami pokroju ChatGPT o swoich emocjach i osobistych trudnościach.
Dla wielu użytkowników chatbot przestał być jedynie generatorem maili czy kodu. Stał się podręcznym, stale dostępnym źródłem rozmowy i wsparcia. I właśnie dlatego sposób, w jaki mierzymy jakość jego odpowiedzi, przestaje być akademickim szczegółem. Opracowanie MentalHealthBench to cenny krok w stronę badania zachowań modeli AI w tak delikatnej materii, ale warto pamiętać o wniosku z tego eksperymentu: wygrana w tabeli punktowej nie oznacza jeszcze, iż algorytm potrafi zastąpić wyczucie drugiego człowieka.
Sztuczna inteligencja przestaje być dodatkiem do Worda. Anthropic zamienia Claude’a w kompletne biuro
Jeśli artykuł AI lepsza od psychiatry? W nowym teście specjaliści przegrali z algorytmem nie wygląda prawidłowo w Twoim czytniku RSS, to zobacz go na iMagazine.













