Ľudský genóm nie je jednoduchý kód. Jeho priestorová a živá povaha môže brzdiť aj AI

Ľudský genóm sa podľa opisu v Quanta Magazine nedá chápať ako jednoduchý plán, algoritmus ani lineárny kód, z ktorého by sa dalo priamo vyčítať, ako funguje život. Aj keď vedci už poznajú takmer celú sekvenciu ľudskej DNA, oveľa ťažšou otázkou zostáva, ako sa gény v skutočnosti zapínajú, vypínajú a koordinujú v priestore a čase. Práve táto zložitá, trojrozmerná a neustále sa meniaca organizácia genómu môže byť problémom aj pre modely umelej inteligencie, ktoré sa spoliehajú najmä na vzťahy medzi vstupom a výstupom.

Why the Human Genome’s Tangled Physicality May Confound AI.

Zdroj: https://www.quantamagazine.org/why-the-human-genomes-tangled-physicality-may-confound-ai-20260618

Od 50. rokov minulého storočia sa DNA často opisovala ako „tajomstvo života“. Mnohí biológovia v nej videli akýsi návod, skript alebo biologický program. Lenže úplné prečítanie genómu túto predstavu nepotvrdilo. Human Genome Project medzi rokmi 1990 a 2003 ukázal, že skutočné gény tvoria len malú časť ľudského genómu: približne 2 % DNA obsahujú sekvencie, ktoré kódujú proteíny.

Tým sa pozornosť presunula od otázky, čo jednotlivé gény robia, k oveľa náročnejšiemu problému: ako sa používajú. Práve regulácia génov rozhoduje o tom, prečo majú bunky s rovnakou DNA odlišné vlastnosti a funkcie. Svalová bunka, nervová bunka aj kožná bunka vychádzajú z rovnakého genetického materiálu, no líšia sa tým, ktoré gény sú v nich aktívne a ktoré umlčané. Navyše bunky na signály z okolia reagujú priebežne, takže regulácia sa mení z okamihu na okamih.

Časť výskumníkov dúfa, že s touto zložitosťou pomôže umelá inteligencia. Genomické „foundation models“ ako Evo 2, Genos či AlphaGenome od Google DeepMind sa trénujú na obrovských súboroch genomických dát. Biológom môžu pomôcť predpovedať, ako rozdiely v sekvencii DNA súvisia s biologickými procesmi alebo znakmi organizmu vrátane rizika chorôb. Text však upozorňuje, že takýto prístup síce môže byť užitočný, no nemusí priniesť skutočné porozumenie. Ak genóm nefunguje ako priamočiary systém vstup–výstup, čierna skrinka AI môže naraziť na základný limit.

Tradičný obraz genómu vychádza z predstavy, že gény nesú inštrukcie na tvorbu proteínov. Tých máme približne 20 000. Keď bunka potrebuje určitý proteín, enzým polymeráza najprv prepíše príslušný úsek DNA do molekuly mRNA. Následne ribozóm podľa tejto predlohy zostaví proteín. Tento základný rámec stále platí, no podľa biológov už nestačí na pochopenie ľudského genómu.

Dôležitejšie než samotné gény môže byť to, čo ich riadi. Veľkú rolu zohráva nekódujúca DNA, teda časti genómu, ktoré priamo nevyrábajú proteíny, no podieľajú sa na regulácii. Biológovia o tom vedia už desaťročia, no pri zložitejších organizmoch, akým je človek, sa ukazuje, že tieto regulačné systémy sú omnoho vrstvenejšie a menej prehľadné, než sa kedysi predpokladalo.

Kľúčovými aktérmi sú transkripčné faktory, proteíny, ktoré pomáhajú spustiť prepis génu. V jednoduchších organizmoch, napríklad v baktériách, býva táto logika pomerne priamočiara. V ľudských bunkách však transkripčné faktory často pôsobia v dvojiciach alebo väčších skupinách a ich účinok závisí od kontextu. Ten istý faktor môže v jednom type bunky aktivovať gén a v inom ho tlmiť. Regulácia tu preto nepripomína jednoduchý prepínač, ale skôr systém, ktorý naraz vyhodnocuje viacero signálov.

Osobitnou kapitolou sú enhancery, úseky DNA, na ktoré sa transkripčné faktory viažu a ktoré výrazne ovplyvňujú, či sa gén prepíše. Ľudský genóm ich obsahuje státisíce, možno milióny. Je ich teda oveľa viac než génov. Jeden gén môže ovplyvňovať viac enhancerov a jeden enhancer môže zasahovať do regulácie viacerých génov. Už len zmapovať, kde všetky enhancery ležia a ktoré gény riadia, zostáva podľa textu nedoriešená úloha aj štvrťstoročie po Human Genome Project.

Ďalší problém je vzdialenosť. Niektoré enhancery ležia blízko génu, ktorý riadia, iné sú od neho veľmi ďaleko a medzi nimi ležia ďalšie gény. Podľa vedcov sa táto prekážka rieši slučkami chromatínu. DNA v bunke totiž neexistuje ako natiahnutá niť, ale ako chromatín, teda DNA zabalená s proteínmi. Proteínový motor cohesin dokáže vytvárať slučky, ktoré vzdialené časti chromatínu priblížia k sebe.

Ani tým sa však príbeh nekončí. Keď sa takéto prvky stretnú, nevzniká pevný a stabilný stroj. Skôr ide o husté, no voľné a veľmi premenlivé zoskupenia, niekedy označované ako kondenzáty alebo transkripčné huby. Tieto štruktúry sú mimoriadne dynamické a môžu sa líšiť aj medzi bunkami rovnakého typu. Inými slovami, genóm nie je statický objekt, ale živý systém v neustálom pohybe.

To mení aj pohľad na samotný chromozóm. Učebnicový obrázok kompaktného chromozómu v tvare X platí najmä pre deliace sa bunky. Väčšinu času je chromatín rozvinutý do zdanlivo neprehľadnej spleti. Tá však nie je náhodná. Niektoré úseky sú husto zbalené do heterochromatínu, kde sú gény zväčša umlčané. Iné zostávajú otvorenejšie ako euchromatín, a sú preto prístupnejšie pre transkripčné faktory.

Dôležité sú aj väčšie priestorové celky nazývané TADs, teda topologicky asociované domény. V ich rámci sa gény zrejme regulujú spoločne a zapínajú či vypínajú v skupinách. Takéto usporiadanie pomáha bunkám udržiavať celé súbory génov aktívne alebo neaktívne podľa toho, akú funkciu majú plniť.

Do regulácie vstupujú aj epigenetické značky, chemické úpravy na histónoch alebo priamo na DNA. Tie môžu meniť fyzikálne vlastnosti balenia chromatínu, a tým aj dostupnosť génov. Ich účinok sa často opisuje ako poznámky pri texte DNA, ktoré menia význam podľa kontextu. Text však zároveň upozorňuje, že predstava jednotného a systematického „epigenetického kódu“ nie je vôbec jasná.

V praktickej rovine to znamená, že samotná sekvencia DNA nestačí na vysvetlenie fungovania genómu. Rozhoduje aj to, ako je DNA priestorovo poskladaná, ktoré molekuly sa k nej v danom momente viažu, aké signály bunka prijíma a ako sa celý systém priebežne prestavuje. Práve preto nemusí byť ľahké naučiť AI modely nielen predpovedať výsledky, ale aj skutočne vysvetliť, prečo sa dejú.

Prečo nestačí poznať sekvenciu DNA

Poznanie poradia „písmen“ DNA bolo obrovským technickým úspechom, no samo osebe nevyriešilo hlavnú biologickú otázku. Ak len malá časť genómu priamo kóduje proteíny, zvyšok nemožno automaticky označiť za nepodstatný. Práve naopak: veľká časť regulačných dejov sa zrejme odohráva v nekódujúcich oblastiach. Všeobecný význam tohto posunu je jasný. Biológia sa už nepýta iba na obsah genetickej informácie, ale aj na pravidlá jej používania.

Ako bunky rozhodujú, ktoré gény zapnú

Všeobecne platí, že bunka nepracuje s génmi ako s pevným zoznamom príkazov, ktoré sa vždy vykonajú rovnako. O aktivite génov rozhoduje súhra viacerých faktorov naraz. Do hry vstupujú transkripčné faktory, enhancery, dostupnosť chromatínu aj signály z okolia bunky. Preto môže tá istá DNA viesť v rôznych bunkách k odlišným výsledkom. Z praktického hľadiska je to základný dôvod, prečo z jednej genetickej výbavy vznikajú veľmi odlišné tkanivá a funkcie.

Why the Human Genome’s Tangled Physicality May Confound AI

Snímka zobrazuje: Why the Human Genome’s Tangled Physicality May Confound AI.

Zdroj: https://www.quantamagazine.org/why-the-human-genomes-tangled-physicality-may-confound-ai-20260618

Priestorové usporiadanie genómu ako súčasť regulácie

Dôležitou zmenou v uvažovaní je prijatie faktu, že genóm nefunguje ako plochý text. Jeho trojrozmerné skladanie je priamo súčasťou regulácie. Slučky chromatínu, rozdiel medzi heterochromatínom a euchromatínom či usporiadanie do TADs vytvárajú prostredie, v ktorom sa niektoré gény ľahšie aktivujú a iné zostávajú nedostupné. Toto je širší kontext, ktorý pomáha pochopiť, prečo jednoduché čítanie sekvencie ešte neodhaľuje biologický výsledok.

Why the Human Genome’s Tangled Physicality May Confound AI

Snímka zobrazuje: Why the Human Genome’s Tangled Physicality May Confound AI.

Zdroj: https://www.quantamagazine.org/why-the-human-genomes-tangled-physicality-may-confound-ai-20260618

Čo z toho vyplýva pre modely umelej inteligencie

AI modely môžu byť užitočné pri hľadaní vzorov v obrovskom množstve genomických dát. Zdroj však upozorňuje, že korelácie nemusia automaticky znamenať porozumenie mechanizmu. Ak je regulácia génov závislá od fyzického usporiadania DNA, od krátkodobých interakcií a od kontextu konkrétnej bunky, potom sa časť reality môže ťažko zmestiť do schémy, kde sekvencia vstupuje do modelu a na výstupe sa objaví predpoveď. To neznamená, že AI zlyhá úplne, skôr to, že jej úspech nemusí byť totožný s vysvetlením fungovania genómu.

Why the Human Genome’s Tangled Physicality May Confound AI

Snímka zobrazuje: Why the Human Genome’s Tangled Physicality May Confound AI.

Zdroj: https://www.quantamagazine.org/why-the-human-genomes-tangled-physicality-may-confound-ai-20260618

Čo zostáva nejasné a kam sa výskum posúva

Text otvorene priznáva, že mnohé základné otázky ešte nemajú odpoveď. Vedci stále nepoznajú všetky enhancery, nevedia presne priradiť každý z nich ku konkrétnym génom a úplne nerozumejú ani tomu, ako sa vytvárajú a menia regulačné centrá v priestore bunkového jadra. Neistota sa týka aj epigenetických značiek a toho, či vôbec tvoria súvislý „kód“. Ďalší výskum preto smeruje nielen k presnejším mapám genómu, ale aj k lepšiemu pochopeniu jeho fyzickej, dynamickej organizácie.

Why the Human Genome’s Tangled Physicality May Confound AI

Snímka zobrazuje: Why the Human Genome’s Tangled Physicality May Confound AI.

Zdroj: https://www.quantamagazine.org/why-the-human-genomes-tangled-physicality-may-confound-ai-20260618


Zdroj: Quanta Magazine

Pôvodný článok: https://www.quantamagazine.org/why-the-human-genomes-tangled-physicality-may-confound-ai-20260618


Môže sa Vám ešte páčiť...

Pridaj komentár

Vaša e-mailová adresa nebude zverejnená. Vyžadované polia sú označené *