A COVID-19-pandémia idején a tudósoknak volt egy kritikus előnyük: évtizedes koronavírus-kutatásoknak köszönhetően a vírus kulcsfontosságú fehérjéit elég jól ismerték ahhoz, hogy rekordidő alatt vakcinát fejlesszenek. A következő pandémia esetén azonban ez az előny talán nem lesz adott. Éppen erre a kihívásra reagálva az NVIDIA egy globális kutatói koalícióhoz csatlakozva – amelynek tagja a Google DeepMind és az EMBL-EBI (az Európai Molekuláris Biológiai Laboratórium bioinformatikai intézete) is – nyilvánosan elérhetővé tette több mint 2800 vírus fehérjekomplexeinek előre jelzett háromdimenziós szerkezetét az AlphaFold Database-ben.
Vírus fehérjestruktúra AI-alapon: mit tartalmaz az adatbázis?
Az újonnan publikált adatkészlet struktúráit az AlphaFold2 – a Google DeepMind fehérjehajtogatást előrejelző MI-modellje – segítségével állították elő, amelyet az NVIDIA BioNeMo Inference Runtime optimalizált. Ez tette lehetővé, hogy az elemzést több ezer virális proteomra kiterjesszék, és meghatározzák az egyes vírusokban kódolt fehérjekomplexeket, vagyis az egymással kölcsönhatásba lépő fehérjecsoportokat.
A legfontosabb számok és tények:
- Több mint 2800 vírus fehérjekomplexeinek előrejelzett 3D-s szerkezete vált nyilvánosan hozzáférhetővé.
- Az adatbázisba kerülő fehérje-kölcsönhatások közel 30%-a teljesen új a tudomány számára – olyan interakciós formák, amelyeket a Protein Data Bank (a kísérletileg meghatározott fehérjestruktúrák fő tárháza) korábban még soha nem dokumentált.
- Az AlphaFold Database jelenleg összesen több mint 260 millió fehérje- és fehérjekomplex-előrejelzést tartalmaz, lefedve szinte minden katalogizált, tudományosan ismert fehérjét.
- A vizsgálat kiterjedt az embereket megfertőző vírусcsaládokra, a közönséges megfázást okozó vírusoktól az olyan felmerülő fenyegetésekig, mint az Mpox.
„Az AlphaFold Database-szel mindig is az volt a célunk, hogy demokratizáljuk a hozzáférést az alapvető biológiához, nagyszabású szinten” – mondta Risha Patel, a Google DeepMind élettudományi partnerségi menedzsere. „Ez az együttműködés, amely ezrével viszi be a virális komplexeket az adatbázisba, felvértezi a világ tudósait azokkal az ismeretekkel, amelyekre szükségük van a jövőbeli járványok elleni felkészüléshez.”
Miért kritikus a nyílt hozzáférés a pandémiás felkészültséghez?
A Center for Global Development egyik elemzése szerint nagyjából 50% a valószínűsége annak, hogy 2050-ig a világ egy COVID-19-hez hasonlóan súlyos pandémiával néz szembe. A kutatók szerint éppen ezért nem lehet várni – a tudáskészletet most kell felhalmozni.
„Ha bekövetkezik a következő pandémia, lehet, hogy valami teljesen váratlanul tör elő, és hiányozni fog az a tudás, amellyel a COVID esetében rendelkeztünk” – fogalmazott Joe Grove, a Glasgow-i Egyetem MRC Vírusvizsgálati Központjának molekuláris virológia professzora, aki maga is részt vett a projektben. „Amit mi most csinálunk, az nem más, mint hogy ezt a tudást előre felhalmozzuk.”
A hagyományos fehérjestruktúra-meghatározási módszerek – mint a fehérjék kristályosítása és röntgensugárral való vizsgálata – évekig tarthatnak, és struktúránként akár több ezer dollárba kerülhetnek. Az NVIDIA GPU-kra optimalizált AlphaFold2 viszont percek alatt képes előrejelezni egy struktúrát, és tömegesen is futtatható. A nagy megbízhatósággal előrejelzett struktúrákat a tudósok ezután kísérleti módszerekkel is ellenőrizhetik.
„Ez az adatbázis egy hipotézisgeneráló motor” – emelte ki Chris Dallago, az NVIDIA digitális biológiai alkalmazott kutatási csapatának vezetője. „Lehetővé tesszük a biológusok és az MI-közösség számára, hogy fehérje-kölcsönhatásokat vizsgáljanak – nem csupán egyedi molekulákként, hanem komplexekként –, hogy az egész terület előre tudjon lépni.”
Globális konzorcium a nyílt tudomány mögött
Az együttműködésben részt vevő szervezetek listája impozáns, és több kontinenst átfog:
- Coalition for Epidemic Preparedness Innovations (CEPI)
- EMBL-EBI (Európai Bioinformatikai Intézet)
- Google DeepMind
- NVIDIA
- Seoul National University (Szöuli Nemzeti Egyetem)
- Sungkyunkwan University
- Swiss Institute of Bioinformatics (Svájci Bioinformatikai Intézet)
- University of Glasgow (Glasgow-i Egyetem)
Az adatkészlet publikálása egybeesett az ENSZ Közgyűlésének egy ülésével, amelyet a Világgazdasági Fórum hívott össze New Yorkban a pandémiamegelőzés, -felkészültség és -reagálás témájában.
„Az adatok nyílt elérhetővé tétele alapvető fontosságú a virális diagnosztika megértéséhez, valamint a kezelések és vakcinák fejlesztéséhez” – hangsúlyozta Jo McEntyre, az EMBL-EBI ideiglenes igazgatója. „Az adatkészlet alacsonyabb ismertségű vírusokat is lefed, és csökkenti a korlátokat az alacsony erőforrásokkal rendelkező környezetben dolgozó, járványokkal szemtől szemben álló tudósok számára.”
A nyílt hozzáférés kapcsán a Lenovo is hasonló szemléletet képvisel, amikor nyílt AI-biztonsági kezdeményezésekhez csatlakozik – a technológiai ipar egyre inkább a közös, átlátható tudásmegosztás irányába mozdul.
A BioNeMo pipeline: nyílt eszköz a kutatóknak
Az NVIDIA nem csupán az adatkészletet teszi nyilvánosan hozzáférhetővé, hanem a struktúrák generálásához használt GPU-gyorsított munkafolyamatot, a BioNeMo Structure Prediction Pipeline-t is. Ez azt jelenti, hogy bármely kutató – akár egy kevésbé forrásgazdag intézménynél dolgozó is – képes lehet fehérjeszekvenciától az előrejelzett 3D-s struktúráig eljutni saját célmolekulái esetén.
A projekt tudományos jelentőségét jól illusztrálja Grove professzor személyes tapasztalata: „Amikor a PhD-met csináltam, egyetlen struktúra sem állt rendelkezésre azokhoz a fehérjékhez, amelyeket vizsgáltunk. Olyan volt, mintha sötétben dolgoztunk volna – csak találgattunk. Ez az adatkészlet egy hatékony eszköz mindazoknak a kutatóknak, akik most végzik a doktorikat, és kiváló minőségű strukturális adatokhoz juthatnak, amelyek felgyorsítják az alapkutatást.”
Az MI szerepe az élettudomány területén egyre meghatározóbb – ahogy azt a Lenovo AI-ügynök és oktatási platformja is mutatja, a következő generációs számítástechnika már nemcsak az irodai munkát, hanem a tudományos kutatást is alapvetően átalakítja.
Gyakori kérdések
Pontosan mit tartalmaz az újonnan kiadott adatkészlet?
Az adatkészlet több mint 2800 vírus fehérjekomplexeinek előrejelzett háromdimenziós struktúráit tartalmazza. Az interakciók közel 30%-a teljesen új a tudományban – olyan szerkezeteket mutat, amelyeket a Protein Data Bank korábban még nem dokumentált.
Miért számít, hogy a struktúrákat AI jósolja meg, nem kísérleti módszer?
A hagyományos kísérleti módszerek – például a röntgenkristallográfia – egyetlen fehérjestruktúra meghatározásához évekig tarthatnak és akár több ezer dollárba kerülhetnek. Az AlphaFold2 percek alatt képes elvégezni ugyanezt, és tömegesen is futtatható NVIDIA GPU-kon, így a kutatás drámaian felgyorsítható és olcsóbbá tehető.
Ki fér hozzá az adatbázishoz?
Az adatkészlet az AlphaFold Database-en keresztül bármely kutató számára nyilvánosan és ingyenesen elérhető, beleértve az alacsony erőforrásokkal rendelkező intézményeket is. Az NVIDIA a BioNeMo Structure Prediction Pipeline munkafolyamatot szintén nyíltan elérhetővé teszi.
Mekkora a kockázata egy újabb COVID-19-szintű pandémiának?
A Center for Global Development elemzése szerint nagyjából 50% a valószínűsége annak, hogy 2050-ig a világ egy COVID-19-hez hasonlóan súlyos pandémiával szembesül – ez az egyik fő motiváció a kutatói konzorcium munkája mögött.
Forrás: NVIDIA Blog













