Analiza wykazała brak gotowości AI do prognozowania chorób serca

Komentarz redakcji

Autorzy nowej analizy ocenili 30 projektów naukowych i wskazali na brak walidacji zewnętrznej oraz brak oceny wpływu algorytmów na decyzje lekarzy. Większość systemów powstała na bazie danych z USA, Wielkiej Brytanii i Korei Południowej. Naukowcy postulują pilne wdrożenie standardów TRIPOD+AI oraz przeprowadzenie niezależnych badań prospektywnych.

Najważniejsze

  • •Obecne modele sztucznej inteligencji do prognozowania chorób serca nie są gotowe do wdrożenia w rutynowej praktyce klinicznej ze względu na poważne braki metodologiczne.
  • •W analizie 30 badań żadne nie oceniało kalibracji modeli, a jedynie 7 przeprowadziło walidację na niezależnych populacjach pacjentów.
  • •Algorytmy AI wykazują skuteczność porównywalną lub tylko nieznacznie lepszą od tradycyjnych kalkulatorów ryzyka, takich jak Framingham Risk Score.
  • •Modele trenowane na populacjach zachodnich nie uwzględniają specyficznych czynników ryzyka dla innych grup, np. mieszkańców Indii (m.in. używanie tytoniu bezdymnego, predyspozycje genetyczne).
  • •Konieczne jest powszechne wdrożenie międzynarodowych standardów TRIPOD+AI oraz PROBAST+AI w celu weryfikacji algorytmów medycznych.
·
2 min

Modele sztucznej inteligencji przeznaczone do prognozowania chorób serca nie są jeszcze gotowe do użytku klinicznego z powodu poważnych braków metodologicznych. Takie wnioski płyną z międzynarodowego badania opublikowanego 12 sierpnia 2026 roku.

Wikimedia Commons — Microsoft Corporation (MIT)
Wikimedia Commons — Microsoft Corporation (MIT)

Międzynarodowy zespół naukowców z Indii i Wielkiej Brytanii opublikował 12 sierpnia 2026 roku przegląd systematyczny w czasopiśmie „BMC Medical Informatics and Decision Making”. Z analizy wynika, że modele sztucznej inteligencji (AI) przeznaczone do prognozowania chorób serca nie są obecnie gotowe do rutynowego użytku klinicznego.

Badacze przeanalizowali 30 prac dotyczących modeli sztucznej inteligencji służących do przewidywania ryzyka chorób sercowo-naczyniowych u dorosłych bez wcześniejszego wywiadu w kierunku tych schorzeń. Publikacje te, wydane od 2017 roku, wyselekcjonowano z bazy obejmującej ponad 6700 rekordów. Większość ocenianych algorytmów, takich jak lasy losowe, maszyny wektorów nośnych oraz sztuczne sieci neuronowe, opracowano na podstawie danych pacjentów z USA, Wielkiej Brytanii i Korei Południowej.

Słabe punkty metodologiczne dotychczasowych modeli

Analiza wykazała istotne braki metodologiczne w ocenianych systemach. W żadnym z 30 badań nie oceniono kalibracji modeli, czyli zgodności prognozowanego ryzyka z rzeczywistym występowaniem chorób. Tylko w siedmiu pracach przeprowadzono walidację algorytmów na niezależnych populacjach pacjentów. Ponadto w żadnym projekcie nie zbadano wpływu sztucznej inteligencji na ostateczne decyzje podejmowane przez lekarzy, a wskaźnik czułości modeli podano zaledwie w czterech publikacjach. W dwunastu badaniach bezpośrednio zestawiono sztuczną inteligencję z tradycyjnymi narzędziami, takimi jak kalkulator Framingham Risk Score. W horyzoncie prognozowania od 5 do 10 lat wyniki algorytmów okazały się zbliżone lub tylko nieznacznie lepsze od tradycyjnych metod.

Wyniki te mają kluczowe znaczenie m.in. dla Indii, gdzie choroby układu krążenia odpowiadają za blisko jedną trzecią zgonów, a pacjenci zapadają na nie średnio o 5–10 lat wcześniej niż w krajach zachodnich. Modele trenowane na danych z USA czy Wielkiej Brytanii nie uwzględniają specyficznych dla populacji indyjskiej czynników ryzyka. Należą do nich m.in. używanie tytoniu bezdymnego, genetyczne predyspozycje do niskiego stężenia cholesterolu HDL oraz wysoka podatność na cukrzycę typu 2 przy niskim wskaźniku masy ciała (BMI). Do oceny takich rozwiązań służą międzynarodowe standardy TRIPOD+AI oraz PROBAST+AI, których powszechne wdrażanie ma zapobiegać błędom algorytmicznym w medycynie.

Wdrożenie standardów TRIPOD+AI oraz konieczność prowadzenia bardziej kosztownych badań prospektywnych wpłyną na rynek medyczny. Choć zmiany te mogą w najbliższych latach spowolnić komercjalizację nowych technologii kardiologicznych, to przełożą się na większe bezpieczeństwo pacjentów.

Artificial Intelligence in emergency department triage: A scoping review.

PloS one

,,IMiD- Czy zespoły do innowacji i AI są potrzebne w szpitalach?''

Dlaczego obecne modele AI nie sprawdzają się globalnie?

Brak danych regionalnych
Niedoreprezentowanie populacyjne
Modele trenowane na pacjentach z USA i UK pomijają specyfikę populacji azjatyckich.
Specyfika Indii
Nietypowe czynniki ryzyka
Używanie tytoniu bezdymnego, wysoka podatność na cukrzycę typu 2 przy niskim BMI.
Niski poziom HDL
Predyspozycje genetyczne
Genetycznie uwarunkowane niskie stężenie cholesterolu o wysokiej gęstości.
Niedokładne prognozy
Błędy metodologiczne
Brak oceny kalibracji algorytmów oraz rzadkie testy na niezależnych grupach pacjentów.

Opracowanie własne na podstawie wniosków z badania.

Analiza metodologii i wyników w 30 badaniach nad modelami AI w kardiologii

Kryterium oceny badanych modeli AILiczba badań spełniających kryteriumWnioski / Wyniki porównania
Ocena kalibracji modeli (zgodność prognoz z rzeczywistością)0 / 30Całkowity brak oceny w analizowanych publikacjach
Walidacja na niezależnych populacjach pacjentów7 / 30Większość modeli testowano tylko na danych, na których powstały
Podanie wskaźnika czułości modeli4 / 30Bardzo rzadkie raportowanie kluczowego parametru diagnostycznego
Bezpośrednie zestawienie z tradycyjnymi kalkulatorami (np. Framingham)12 / 30Wyniki AI porównywalne lub tylko nieznacznie lepsze
Ocena wpływu algorytmu na decyzje lekarzy0 / 30Brak danych na temat realnego wpływu klinicznego

Na podstawie przeglądu systematycznego w BMC Medical Informatics and Decision Making, 2026.

Słownik pojęć

Kalibracja modelu
Zgodność szacowanego przez model matematyczny prawdopodobieństwa wystąpienia zdarzenia (np. zawału) z rzeczywistą częstością występowania tego zdarzenia w obserwowanej grupie pacjentów.
Walidacja zewnętrzna
Ocena skuteczności algorytmu na zupełnie nowym, niezależnym zbiorze danych pacjentów, którzy nie brali udziału w procesie uczenia i trenowania danego modelu.
Framingham Risk Score
Jeden z tradycyjnych kalkulatorów ryzyka sercowo-naczyniowego, określający prawdopodobieństwo wystąpienia incydentu wieńcowego w ciągu najbliższych 10 lat na podstawie podstawowych czynników ryzyka.
TRIPOD+AI
(Transparent Reporting of a multivariable prediction model for Individual Prognosis Or Diagnosis) - międzynarodowy standard raportowania modeli prognostycznych i diagnostycznych, rozszerzony o wytyczne dla sztucznej inteligencji (+AI).
PROBAST+AI
(Prediction model Risk Of Bias Assessment Tool) - narzędzie do oceny ryzyka błędu systematycznego w badaniach nad modelami prognostycznymi, również dostosowane do algorytmów sztucznej inteligencji (+AI).

Najczęstsze pytania

Dlaczego sztuczna inteligencja nie jest jeszcze gotowa do prognozowania chorób serca w gabinetach?▼
Głównymi problemami są poważne braki metodologiczne: brak oceny kalibracji modeli (czy przewidywane ryzyko odpowiada rzeczywistości), rzadkie testowanie algorytmów na niezależnych grupach pacjentów (walidacja zewnętrzna) oraz brak weryfikacji, jak AI wpływa na ostateczne decyzje lekarzy.
Czy modele AI stworzone w USA sprawdzą się u pacjentów w innych częściach świata?▼
Modele te są najczęściej trenowane na danych pacjentów z krajów zachodnich (USA, Wielka Brytania). Nie uwzględniają one specyficznych czynników ryzyka dla innych populacji, takich jak chociażby w Indiach, gdzie pacjenci chorują o 5-10 lat wcześniej, a istotnymi czynnikami są m.in. używanie tytoniu bezdymnego czy genetycznie niski poziom cholesterolu HDL.
Jak wypada porównanie AI z tradycyjnymi kalkulatorami ryzyka (np. Framingham)?▼
W przedziałach prognozowania od 5 do 10 lat algorytmy sztucznej inteligencji radzą sobie porównywalnie lub tylko nieznacznie lepiej niż tradycyjne narzędzia, takie jak Framingham Risk Score. Nie oferują obecnie rewolucyjnego skoku dokładności.
Co to są standardy TRIPOD+AI oraz PROBAST+AI?▼
Są to międzynarodowe wytyczne i standardy oceny ryzyka błędów dla modeli prognostycznych. Ich wdrożenie ma zmusić twórców AI do dokładniejszego testowania algorytmów przed ich komercjalizacją, co podniesie bezpieczeństwo pacjentów.

Pierwsi napisali na ten temat

Komentarze (0)

0/2000

Powiązane artykuły

AI może przewidywać zaostrzenia astmy u dzieci

Badacze przeanalizowali siedem badań obejmujących 17 modeli uczenia maszynowego i ocenili ich skuteczność w prognozowaniu wizyt na oddziale ratunkowym oraz hospitalizacji z powodu astmy u dzieci. Wyniki wskazują na umiarkowaną dokładność w pierwszym przypadku i dobrą w drugim, lecz autorzy podkreślają dużą zmienność wyników między badaniami.

20 czerwca 2026

Badanie: tylko trzy z 1357 medycznych urządzeń AI zbadano pod kątem wpływu na zdrowie pacjentów

Analiza zespołu z Uniwersytetu w Toronto wskazuje na brak publicznie dostępnych dowodów klinicznych potwierdzających skuteczność większości technologii AI zatwierdzonych przez FDA. Większość tych urządzeń trafia na rynek w USA uproszczoną ścieżką regulacyjną 510(k), wymagającą jedynie wykazania równoważności z istniejącym już produktem. Najwięcej zatwierdzonych systemów dotyczy radiologii, kardiologii i neurologii.

21 sierpnia 2026

Metaanaliza z Chin: AI zwiększa wykrywalność pięciu z siedmiu analizowanych nowotworów

Naukowcy z Chin przeanalizowali 49 randomizowanych badań z lat 2017–2024 i sprawdzili, czy sztuczna inteligencja poprawia wykrywanie zmian nowotworowych w obrazowaniu medycznym. Największe efekty odnotowano w raku płuca i przełyku, a korzyści widoczne były też w przypadku jelita grubego, prostaty i piersi.

26 czerwca 2026

AI w diagnostyce raka piersi: przyszłość, która potrzebuje zrozumienia

Wprowadzenie technologii AI do wczesnego wykrywania raka piersi może znacząco poprawić wyniki zdrowotne, ale wymaga zrozumienia jej skuteczności i potencjalnych ograniczeń w różnych populacjach. Badania pokazują, że AI może identyfikować kobiety z wyższym ryzykiem raka, ale różnorodność demograficzna oraz kwestie etyczne pozostają kluczowymi wyzwaniami.

16 marca 2026

Zwapnienia w mammografii wykryte przez AI zwiększają ryzyko serca nawet czterokrotnie

Badanie retrospektywne objęło 123 762 kobiet z dwóch amerykańskich systemów opieki zdrowotnej. AI mierzyła zwapnienia tętnic piersiowych (BAC) na standardowych mammografiach, a kobiety z największymi zwapnieniami miały ponad czterokrotnie wyższe ryzyko względne. Autorzy nie podali jednak bezwzględnych liczb zdarzeń, co utrudnia ocenę rzeczywistego znaczenia klinicznego.

14 maja 2026

Sztuczna inteligencja wykrywa wady serca z EKG w dwie sekundy

Podczas kongresu European Society of Cardiology zaprezentowano system AI analizujący mikrowzorce sygnału EKG. Narzędzie osiąga do 81 procent dokładności w wykrywaniu niewydolności serca i do 90 procent przy stenozie aortalnej. Badacze planują pilotażowe wdrożenia w brytyjskich szpitalach NHS w Londynie i Bristolu.

3 września 2026

StartSzukaj