Amerykańska Agencja ds. Żywności i Leków (FDA) przyznała Cognita Imaging kontrakt badawczy o wartości 1,29 mln dolarów na opracowanie i sprawdzenie nowej metody oceny raportów radiologicznych generowanych przez sztuczną inteligencję. Projekt zakłada wykorzystanie kilku dużych modeli językowych działających jako „LLMs-as-a-jury”. Metoda zostanie przetestowana na około 1 mln badań pacjentów z dużej i zróżnicowanej kohorty w USA. Kontrakt rozpoczął się 22 czerwca 2026 r. i potrwa 18 miesięcy.
Z tego artykułu dowiesz się…
- Na czym polega metoda „LLMs-as-a-jury” do oceny raportów radiologicznych generowanych przez AI.
- Jaką rolę w badaniu finansowanym przez FDA będą pełnić radiolodzy.
- Dlaczego nowa metoda zostanie sprawdzona na około 1 mln badań pacjentów.
- Jak Cognita Imaging chce porównać wyniki uzyskiwane na dużych i małych kohortach walidacyjnych.
FDA chce sprawdzić, jak oceniać raporty tworzone przez AI
Projekt „Virtual Subject Matter Expert Agents for Radiology Report Evaluation” dotyczy problemu oceny systemów AI, które generują kompletne raporty radiologiczne. Standardowe badania z udziałem ekspertów pozostają istotne, ale wymagają czasu i trudno objąć nimi liczbę oraz różnorodność przypadków odpowiadającą codziennej praktyce klinicznej.
Cognita Imaging, spółka należąca do Mosaic Clinical Technologies, opracuje i zwaliduje rozwiązanie wykorzystujące kilka dużych modeli językowych (LLM) do oceny raportów przygotowanych zarówno przez radiologów, jak i przez AI.
Badaniami kieruje Akshay Chaudhari, Ph.D., współzałożyciel Cognita, associate professor radiologii i biomedical data science na Stanford University. Współbadaczem jest Louis Blankemeier, Ph.D., współzałożyciel i CEO Cognita.
– Chcemy sprawdzić, czy grupa modeli językowych, z radiologami analizującymi trudne przypadki, może dać nam jaśniejszy i bardziej powtarzalny obraz w skali rzeczywistej – powiedział Chaudhari.
Kilka modeli LLM będzie wspólnie oceniać raporty
Cognita określa opracowywaną metodę jako „LLMs-as-a-jury”. Zamiast zlecać jednemu modelowi językowemu ocenę raportu wygenerowanego przez AI, system będzie porównywał oceny kilku modeli.
Ma to zwiększyć powtarzalność wyników, zmniejszyć zależność od specyfiki pojedynczego LLM i pomóc ustalić, w jakim zakresie automatyczna analiza może uzupełnić ocenę ekspertów.
Po opracowaniu metody zostanie ona zastosowana do około 1 mln badań pacjentów z USA. Naukowcy sprawdzą działanie AI w różnych grupach pacjentów, miejscach udzielania świadczeń, przy wykorzystaniu różnego sprzętu do diagnostyki obrazowej i w przypadku różnych chorób. Analiza obejmie również rzadkie nieprawidłowości, które trudno odpowiednio zbadać na małych zbiorach danych.
Badacze utworzą też mniejsze kohorty walidacyjne, aby sprawdzić, jakie informacje mogą zostać pominięte, gdy ocena systemu AI opiera się na ograniczonej liczbie przypadków.
Radiolodzy ocenią istotne rozbieżności
Lekarze pozostaną częścią procesu. Radiolodzy będą analizować rozbieżności istotne klinicznie i ustalać, czy problem wynikał z raportu wygenerowanego przez AI, oceny dokonanej przez modele językowe czy pierwotnego raportu radiologa.
– Model może wypadać bardzo dobrze w starannie dobranym badaniu, a mimo to mieć problemy w innym szpitalu, na innym sprzęcie lub przy rzadkim obrazie choroby – powiedziała Nina Kottler, M.D., chief medical AI officer w Mosaic Clinical Technologies.
Projekt wykorzysta także doświadczenia Cognita związane z GREEN – otwartym narzędziem porównującym referencyjne raporty radiologiczne z raportami wygenerowanymi przez AI i identyfikującym różnice mające znaczenie kliniczne.
FDA otrzyma kod i wyniki badań
W ramach 18-miesięcznego kontraktu Cognita ma przekazać FDA m.in. kod oprogramowania i wskazówki dotyczące tworzenia „LLM jury”, analizy porównujące duże i małe kohorty walidacyjne, wyniki oceny rozbieżności przez radiologów oraz raporty opisujące rezultaty i ograniczenia projektu.
Kontrakt został przyznany w ramach programu Broad Agency Announcement FDA dotyczącego badań i rozwoju w obszarze regulatory science.
Główne wnioski
- FDA przyznała Cognita Imaging kontrakt badawczy o wartości 1,29 mln dolarów na opracowanie metody oceny raportów radiologicznych generowanych przez AI.
- Metoda „LLMs-as-a-jury” zakłada, że raporty będzie oceniać kilka dużych modeli językowych, a nie pojedynczy LLM.
- Rozwiązanie zostanie zastosowane do około 1 mln badań pacjentów z USA, obejmujących różne grupy pacjentów, sprzęt, miejsca udzielania świadczeń i choroby.
- Radiolodzy ocenią klinicznie istotne rozbieżności i sprawdzą, czy ich źródłem był raport AI, ocena modeli językowych czy pierwotny raport lekarza.
Źródło:
- https://www.businesswire.com/news/home/20260916329852/en/Cognita-Imaging-Receives-%241.29-Million-FDA-Contract-to-Test-New-Approach-to-Evaluating-Generative-AI-in-Radiology?_sp=d4ee1228-1f21-4f1d-a302-47edee8037f8.1789971934981

