Urządzenia medyczne wykorzystujące sztuczną inteligencję coraz częściej trafiają do szpitali i gabinetów, jednak ich dopuszczenie do użytku nie musi oznaczać, że udowodniono ich rzeczywistą korzyść dla pacjentów. Analiza 1357 urządzeń AI autoryzowanych przez amerykańską FDA wykazała, że tylko trzy oceniono pod kątem takich wyników jak śmiertelność, udary, hospitalizacje czy jakość życia. Wyniki badania opublikowano 19 sierpnia 2026 roku w „PLOS Digital Health”.
Z tego artykułu dowiesz się…
- Jak często urządzenia medyczne wykorzystujące sztuczną inteligencję zatwierdzone przez FDA są badane pod kątem rzeczywistych korzyści dla pacjentów.
- Jakie są wyniki analizy 1357 urządzeń medycznych AI i dowiesz się, dlaczego tylko trzy z nich oceniono pod kątem takich wyników jak śmiertelność, udary, hospitalizacje czy jakość życia.
- Dlaczego autoryzacja urządzenia przez FDA nie musi oznaczać, że udowodniono jego wpływ na poprawę zdrowia pacjentów.
- Dlaczego naukowcy postulują bardziej rygorystyczne i reprezentatywne badania kliniczne medycznej AI, obejmujące różne grupy pacjentów i systemy ochrony zdrowia.
1357 urządzeń AI zatwierdzonych przez FDA. Tylko trzy oceniono pod kątem korzyści dla pacjentów
Sztuczna inteligencja znajduje zastosowanie w coraz większej liczbie obszarów medycyny. Algorytmy pomagają interpretować mammografię i inne badania obrazowe, wspierają planowanie operacji czy obliczają ryzyko sercowo-naczyniowe. Jednak autorzy nowej analizy zwracają uwagę na istotną lukę między dopuszczeniem technologii do użytku, a dowodami wskazującymi, że faktycznie poprawia ona stan zdrowia pacjentów. Rawan Abulibdeh z Uniwersytetu w Toronto wraz ze współpracownikami przeanalizowała wszystkie 1357 urządzeń medycznych wykorzystujących AI, które FDA dopuściła do stosowania do 5 grudnia 2025 roku. Badacze sprawdzili przede wszystkim, w jaki sposób technologie były oceniane na pacjentach przed uzyskaniem autoryzacji.
Wyniki wskazują, że jedynie 34 urządzenia były przedmiotem zarejestrowanych badań klinicznych. W przypadku 12 opublikowano wyniki, a 12 manuskryptów poddano recenzji. Najbardziej znaczący okazał się jednak inny wynik. Zaledwie trzy z 1357 urządzeń zostały przetestowane pod kątem rezultatów bezpośrednio istotnych dla pacjentów, takich jak śmiertelność, występowanie udarów mózgu, hospitalizacje czy jakość życia.
Autoryzacja FDA nie oznacza potwierdzenia poprawy zdrowia
Problem częściowo wynika ze sposobu dopuszczania urządzeń medycznych na amerykański rynek. Wiele nowych rozwiązań wykorzystujących AI nie musi przed autoryzacją udowadniać, że dzięki ich zastosowaniu pacjenci żyją dłużej, mają mniej powikłań lub lepszą jakość życia. W określonych ścieżkach regulacyjnych podstawą może być wykazanie tzw. znacznej równoważności z urządzeniem już znajdującym się na rynku. Oznacza to, że ocena regulacyjna i wykazanie rzeczywistych korzyści klinicznych nie są tym samym. Autorzy badania podsumowują skalę problemu następująco:
Spodziewaliśmy się, że baza dowodowa będzie niewielka, ale nie aż tak niewielka. Spośród 1357 urządzeń AI, które FDA dopuściła do użytku w opiece nad pacjentami, tylko trzy zostały przetestowane pod kątem tego, czy pacjenci rzeczywiście żyją dłużej lub lepiej. Dopuszczenie do użytku oznacza, że urządzenie przypomina coś, co już jest dostępne na rynku. Nie oznacza to jednak, że komukolwiek pomaga.
W badaniach brakuje ważnych grup pacjentów
Analiza zwróciła uwagę również na reprezentatywność dostępnych danych. Większość badań prowadzono w systemach ochrony zdrowia dysponujących dużymi zasobami. Jednocześnie z badań często wykluczano grupy pacjentów, które później mogą mieć kontakt z daną technologią.
Dotyczyło to między innymi kobiet w ciąży, osób powyżej 75. roku życia oraz pacjentów nieposługujących się językiem angielskim. W efekcie skuteczność narzędzia może być potwierdzona w określonej populacji, podczas gdy znacznie mniej wiadomo o jego działaniu w innych grupach. Ma to szczególne znaczenie w przypadku AI, ponieważ jakość działania algorytmu może zależeć m.in. od danych wykorzystanych do jego opracowania i walidacji oraz od środowiska klinicznego, w którym jest stosowany.
Szybki rozwój AI może wyprzedzać gromadzenie dowodów
Zdaniem badaczy obecny model może premiować szybkość rozwoju technologii bardziej niż prowadzenie wymagających badań nad wynikami leczenia. Wśród przyczyn wskazują oni bariery strukturalne, zachęty finansowe oraz trudności logistyczne związane z prowadzeniem dużych badań klinicznych.
Problem może wykraczać poza Stany Zjednoczone. Wiele państw o niskich i średnich dochodach bierze pod uwagę decyzje regulacyjne podejmowane w krajach o wysokich dochodach. Zdaniem autorów istnieje zatem ryzyko, że technologie niewystarczająco przebadane pod względem korzyści klinicznych będą szeroko wdrażane w kolejnych systemach ochrony zdrowia.
Potrzebne nowe zasady oceny medycznej AI
Autorzy badania uważają, że obecne zasady autoryzacji urządzeń wykorzystujących sztuczną inteligencję wymagają przeprojektowania. Proponują trzyetapowe ramy oceny, które większy nacisk kładłyby na potwierdzanie skuteczności w różnych grupach pacjentów oraz w różnych placówkach i systemach ochrony zdrowia.
Celem byłoby nie tylko ustalenie, czy algorytm poprawnie wykonuje określone zadanie, ale także sprawdzenie, czy jego zastosowanie przekłada się na mierzalną korzyść dla pacjenta i czy korzyści te dotyczą różnych grup społecznych i demograficznych.
Medyczna AI potrzebuje dowodów klinicznych
Sztuczna inteligencja może istotnie zmienić diagnostykę i leczenie, ale sama skuteczność techniczna algorytmu nie przesądza jeszcze o jego wartości klinicznej. Analiza opublikowana w „PLOS Digital Health” pokazuje skalę tej różnicy: spośród 1357 urządzeń AI autoryzowanych przez FDA tylko trzy oceniono pod kątem rzeczywistych wyników zdrowotnych pacjentów.
Dalszy rozwój medycznej AI może więc wymagać nie tylko coraz bardziej zaawansowanych modeli, lecz także bardziej rygorystycznych, reprezentatywnych badań klinicznych, które odpowiedzą na podstawowe pytanie: czy zastosowanie danej technologii rzeczywiście pomaga pacjentom żyć dłużej lub lepiej?
Główne wnioski
- Spośród 1357 urządzeń medycznych wykorzystujących AI autoryzowanych przez FDA do 5 grudnia 2025 roku tylko trzy przetestowano pod kątem wyników bezpośrednio istotnych dla pacjentów, takich jak śmiertelność, udary, hospitalizacje czy jakość życia.
- Tylko 34 urządzenia AI były przedmiotem zarejestrowanych badań klinicznych, co wskazuje na dużą różnicę między liczbą technologii dopuszczonych do stosowania a zakresem dostępnych dowodów klinicznych.
- Badania często nie obejmowały ważnych grup pacjentów, m.in. kobiet w ciąży, osób powyżej 75. roku życia oraz osób nieposługujących się językiem angielskim.
- Autorzy analizy opublikowanej w „PLOS Digital Health” postulują zmianę zasad oceny medycznej AI i proponują trzyetapowe ramy uwzględniające skuteczność w różnych grupach pacjentów oraz placówkach ochrony zdrowia.
Źródło:
- PLOS Digital Health https://journals.plos.org/digitalhealth/article?id=10.1371/journal.pdig.0001597



