Analiza wykazała brak gotowości AI do prognozowania chorób serca

Komentarz redakcji

Autorzy nowej analizy ocenili 30 projektów naukowych i wskazali na brak walidacji zewnętrznej oraz brak oceny wpływu algorytmów na decyzje lekarzy. Większość systemów powstała na bazie danych z USA, Wielkiej Brytanii i Korei Południowej. Naukowcy postulują pilne wdrożenie standardów TRIPOD+AI oraz przeprowadzenie niezależnych badań prospektywnych.

Najważniejsze

  • Obecne modele sztucznej inteligencji do prognozowania chorób serca nie są gotowe do wdrożenia w rutynowej praktyce klinicznej ze względu na poważne braki metodologiczne.
  • W analizie 30 badań żadne nie oceniało kalibracji modeli, a jedynie 7 przeprowadziło walidację na niezależnych populacjach pacjentów.
  • Algorytmy AI wykazują skuteczność porównywalną lub tylko nieznacznie lepszą od tradycyjnych kalkulatorów ryzyka, takich jak Framingham Risk Score.
  • Modele trenowane na populacjach zachodnich nie uwzględniają specyficznych czynników ryzyka dla innych grup, np. mieszkańców Indii (m.in. używanie tytoniu bezdymnego, predyspozycje genetyczne).
  • Konieczne jest powszechne wdrożenie międzynarodowych standardów TRIPOD+AI oraz PROBAST+AI w celu weryfikacji algorytmów medycznych.
·
2 min

Modele sztucznej inteligencji przeznaczone do prognozowania chorób serca nie są jeszcze gotowe do użytku klinicznego z powodu poważnych braków metodologicznych. Takie wnioski płyną z międzynarodowego badania opublikowanego 12 sierpnia 2026 roku.

Wikimedia Commons — Microsoft Corporation (MIT)
Wikimedia Commons — Microsoft Corporation (MIT)

Międzynarodowy zespół naukowców z Indii i Wielkiej Brytanii opublikował 12 sierpnia 2026 roku przegląd systematyczny w czasopiśmie „BMC Medical Informatics and Decision Making”. Z analizy wynika, że modele sztucznej inteligencji (AI) przeznaczone do prognozowania chorób serca nie są obecnie gotowe do rutynowego użytku klinicznego.

Badacze przeanalizowali 30 prac dotyczących modeli sztucznej inteligencji służących do przewidywania ryzyka chorób sercowo-naczyniowych u dorosłych bez wcześniejszego wywiadu w kierunku tych schorzeń. Publikacje te, wydane od 2017 roku, wyselekcjonowano z bazy obejmującej ponad 6700 rekordów. Większość ocenianych algorytmów, takich jak lasy losowe, maszyny wektorów nośnych oraz sztuczne sieci neuronowe, opracowano na podstawie danych pacjentów z USA, Wielkiej Brytanii i Korei Południowej.

Słabe punkty metodologiczne dotychczasowych modeli

Analiza wykazała istotne braki metodologiczne w ocenianych systemach. W żadnym z 30 badań nie oceniono kalibracji modeli, czyli zgodności prognozowanego ryzyka z rzeczywistym występowaniem chorób. Tylko w siedmiu pracach przeprowadzono walidację algorytmów na niezależnych populacjach pacjentów. Ponadto w żadnym projekcie nie zbadano wpływu sztucznej inteligencji na ostateczne decyzje podejmowane przez lekarzy, a wskaźnik czułości modeli podano zaledwie w czterech publikacjach. W dwunastu badaniach bezpośrednio zestawiono sztuczną inteligencję z tradycyjnymi narzędziami, takimi jak kalkulator Framingham Risk Score. W horyzoncie prognozowania od 5 do 10 lat wyniki algorytmów okazały się zbliżone lub tylko nieznacznie lepsze od tradycyjnych metod.

Wyniki te mają kluczowe znaczenie m.in. dla Indii, gdzie choroby układu krążenia odpowiadają za blisko jedną trzecią zgonów, a pacjenci zapadają na nie średnio o 5–10 lat wcześniej niż w krajach zachodnich. Modele trenowane na danych z USA czy Wielkiej Brytanii nie uwzględniają specyficznych dla populacji indyjskiej czynników ryzyka. Należą do nich m.in. używanie tytoniu bezdymnego, genetyczne predyspozycje do niskiego stężenia cholesterolu HDL oraz wysoka podatność na cukrzycę typu 2 przy niskim wskaźniku masy ciała (BMI). Do oceny takich rozwiązań służą międzynarodowe standardy TRIPOD+AI oraz PROBAST+AI, których powszechne wdrażanie ma zapobiegać błędom algorytmicznym w medycynie.

Wdrożenie standardów TRIPOD+AI oraz konieczność prowadzenia bardziej kosztownych badań prospektywnych wpłyną na rynek medyczny. Choć zmiany te mogą w najbliższych latach spowolnić komercjalizację nowych technologii kardiologicznych, to przełożą się na większe bezpieczeństwo pacjentów.

Artificial Intelligence in emergency department triage: A scoping review.

PloS one

,,IMiD- Czy zespoły do innowacji i AI są potrzebne w szpitalach?''

Dlaczego obecne modele AI nie sprawdzają się globalnie?

Brak danych regionalnych
Niedoreprezentowanie populacyjne
Modele trenowane na pacjentach z USA i UK pomijają specyfikę populacji azjatyckich.
Specyfika Indii
Nietypowe czynniki ryzyka
Używanie tytoniu bezdymnego, wysoka podatność na cukrzycę typu 2 przy niskim BMI.
Niski poziom HDL
Predyspozycje genetyczne
Genetycznie uwarunkowane niskie stężenie cholesterolu o wysokiej gęstości.
Niedokładne prognozy
Błędy metodologiczne
Brak oceny kalibracji algorytmów oraz rzadkie testy na niezależnych grupach pacjentów.

Opracowanie własne na podstawie wniosków z badania.

Analiza metodologii i wyników w 30 badaniach nad modelami AI w kardiologii

Kryterium oceny badanych modeli AILiczba badań spełniających kryteriumWnioski / Wyniki porównania
Ocena kalibracji modeli (zgodność prognoz z rzeczywistością)0 / 30Całkowity brak oceny w analizowanych publikacjach
Walidacja na niezależnych populacjach pacjentów7 / 30Większość modeli testowano tylko na danych, na których powstały
Podanie wskaźnika czułości modeli4 / 30Bardzo rzadkie raportowanie kluczowego parametru diagnostycznego
Bezpośrednie zestawienie z tradycyjnymi kalkulatorami (np. Framingham)12 / 30Wyniki AI porównywalne lub tylko nieznacznie lepsze
Ocena wpływu algorytmu na decyzje lekarzy0 / 30Brak danych na temat realnego wpływu klinicznego

Na podstawie przeglądu systematycznego w BMC Medical Informatics and Decision Making, 2026.

Słownik pojęć

Kalibracja modelu
Zgodność szacowanego przez model matematyczny prawdopodobieństwa wystąpienia zdarzenia (np. zawału) z rzeczywistą częstością występowania tego zdarzenia w obserwowanej grupie pacjentów.
Walidacja zewnętrzna
Ocena skuteczności algorytmu na zupełnie nowym, niezależnym zbiorze danych pacjentów, którzy nie brali udziału w procesie uczenia i trenowania danego modelu.
Framingham Risk Score
Jeden z tradycyjnych kalkulatorów ryzyka sercowo-naczyniowego, określający prawdopodobieństwo wystąpienia incydentu wieńcowego w ciągu najbliższych 10 lat na podstawie podstawowych czynników ryzyka.
TRIPOD+AI
(Transparent Reporting of a multivariable prediction model for Individual Prognosis Or Diagnosis) - międzynarodowy standard raportowania modeli prognostycznych i diagnostycznych, rozszerzony o wytyczne dla sztucznej inteligencji (+AI).
PROBAST+AI
(Prediction model Risk Of Bias Assessment Tool) - narzędzie do oceny ryzyka błędu systematycznego w badaniach nad modelami prognostycznymi, również dostosowane do algorytmów sztucznej inteligencji (+AI).

Najczęstsze pytania

Dlaczego sztuczna inteligencja nie jest jeszcze gotowa do prognozowania chorób serca w gabinetach?
Głównymi problemami są poważne braki metodologiczne: brak oceny kalibracji modeli (czy przewidywane ryzyko odpowiada rzeczywistości), rzadkie testowanie algorytmów na niezależnych grupach pacjentów (walidacja zewnętrzna) oraz brak weryfikacji, jak AI wpływa na ostateczne decyzje lekarzy.
Czy modele AI stworzone w USA sprawdzą się u pacjentów w innych częściach świata?
Modele te są najczęściej trenowane na danych pacjentów z krajów zachodnich (USA, Wielka Brytania). Nie uwzględniają one specyficznych czynników ryzyka dla innych populacji, takich jak chociażby w Indiach, gdzie pacjenci chorują o 5-10 lat wcześniej, a istotnymi czynnikami są m.in. używanie tytoniu bezdymnego czy genetycznie niski poziom cholesterolu HDL.
Jak wypada porównanie AI z tradycyjnymi kalkulatorami ryzyka (np. Framingham)?
W przedziałach prognozowania od 5 do 10 lat algorytmy sztucznej inteligencji radzą sobie porównywalnie lub tylko nieznacznie lepiej niż tradycyjne narzędzia, takie jak Framingham Risk Score. Nie oferują obecnie rewolucyjnego skoku dokładności.
Co to są standardy TRIPOD+AI oraz PROBAST+AI?
Są to międzynarodowe wytyczne i standardy oceny ryzyka błędów dla modeli prognostycznych. Ich wdrożenie ma zmusić twórców AI do dokładniejszego testowania algorytmów przed ich komercjalizacją, co podniesie bezpieczeństwo pacjentów.

Pierwsi napisali na ten temat

Komentarze (0)

0/2000
Następny artykuł

Jak AI rewolucjonizuje wczesne wykrywanie raka piersi w Szwecji?

Badanie Szpitala Uniwersyteckiego Karolinska objęło prawie 90 tys. mammogramów od ponad 31 tys. pacjentek z czterech regionów Szwecji. Wyniki opublikowane w „Radiology” pokazują, że algorytmy częściej wskazywały podwyższone ryzyko u kobiet, u których później rozpoznano raka piersi.

Czytaj dalej

Powiązane artykuły

Jak AI rewolucjonizuje wczesne wykrywanie raka piersi w Szwecji?

Szwedzcy naukowcy przekazali, że komercyjna AI może wykrywać ślady raka piersi nawet 6 lat przed diagnozą. Dotyczy to około 20 proc. przypadków.

rynekzdrowia.pl
poradnikzdrowie.pl
+6
13 cze

Błędy AI w gabinetach: 9 z 20 narzędzi dopisuje nieistniejące objawy

Audytorka generalna Ontario Shelley Spence opublikowała 15 maja 2026 roku raport, z którego wynika, że 9 z 20 testowanych systemów AI do transkrypcji rozmów lekarskich dopisywało fałszywe dane medyczne.

pulsmedycyny.pl
rynekzdrowia.pl
16 maj

AI może przewidywać zaostrzenia astmy u dzieci

Metaanaliza opublikowana 19 czerwca 2026 roku sugeruje, że modele uczenia maszynowego mogą przewidywać zaostrzenia astmy u dzieci, ale wymagają dalszych badań.

deutschesgesundheitsportal.de
medwiss.de
+2
20 cze

Metaanaliza z Chin: AI zwiększa wykrywalność pięciu z siedmiu analizowanych nowotworów

Chińska metaanaliza 49 badań wykazała, że sztuczna inteligencja w diagnostyce obrazowej zwiększa wykrywalność pięciu z siedmiu analizowanych nowotworów.

deutschesgesundheitsportal.de
medwiss.de
26 cze

AI w diagnostyce raka piersi: przyszłość, która potrzebuje zrozumienia

Wprowadzenie technologii AI do wczesnego wykrywania raka piersi może znacząco poprawić wyniki zdrowotne, ale wymaga zrozumienia jej skuteczności i potencjalnych ograniczeń w różnych populacjach. Badania pokazują, że AI może identyfikować kobiety z wyższym ryzykiem raka, ale różnorodność demograficzna oraz kwestie etyczne pozostają kluczowymi wyzwaniami.

healtheuropa.com
16 mar

Zwapnienia w mammografii wykryte przez AI zwiększają ryzyko serca nawet czterokrotnie

Naukowcy z Emory Healthcare i Mayo Clinic wykazali, że automatyczna analiza mammografii przez AI pozwala przewidzieć ryzyko poważnych zdarzeń sercowo-naczyniowych u kobiet.

medwiss.de
deutschesgesundheitsportal.de
+1
14 maj
StartSzukaj