Evo 2 — глибокий розбір + портфоліо-проєкт (genomic foundation model)
Категорія B (технології). Створено: 23 липня 2026. Поглиблення до каталогу моделей (B18): що таке Evo 2 всередині, що вміє, і покрокова інструкція зробити з неї реальний проєкт для портфоліо bio-AI.
- Evo 2 (Arc Institute + NVIDIA, Nature 2026) — найбільша відкрита genomic foundation model: до 40 млрд параметрів, навчена на 9,3 трлн нуклеотидів з усіх доменів життя (бактерії, археї, еукаріоти, фаги).
- Головні суперсили: контекст до 1 млн пар основ, zero-shot передбачення ефекту мутацій (без донавчання) і генерація/дизайн ДНК аж до масштабу хромосом.
- Все відкрите: ваги на HuggingFace, код на GitHub, дані OpenGenome2, вебтул Evo Designer, ліцензія Apache 2.0 → ідеальний матеріал для портфоліо.
- Твій проєкт (нижче): zero-shot передбачення патогенності варіантів гена (канонічно — BRCA1, потім розширюєш на ген довголіття). Показує саме навички Foundation-Model Scientist.
Що це таке (простими словами)
Section titled “Що це таке (простими словами)”Evo 2 — «мовна модель», але замість англійської вона вивчила мову ДНК (літери A, C, G, T) на майже всьому живому. Тому вона «відчуває», яка послідовність «правильна/природна», а яка — ні. З цього випливає магія: якщо мутація робить послідовність «неприродною» для моделі, це сигнал, що вона шкідлива — і це працює без жодного донавчання (zero-shot).
Технічна суть
Section titled “Технічна суть”- Архітектура: не чистий трансформер, а StripedHyena 2 — гібрид згорток і уваги (convolutional multi-hybrid). Саме він дає дешевий наддовгий контекст (1 Mb) — критично, бо регуляція генів «розмазана» по геному.
- Дані: OpenGenome2 — 9,3 трлн нуклеотидів, усі домени життя. Одна з причин, чому модель узагальнює краще за вузькоспеціалізовані.
- Токенізація: по одному нуклеотиду (single-base) — тому передбачення «поштучне», з base-resolution.
- Розміри (8 чекпойнтів):
| Чекпойнт | Контекст | Нащо |
|---|---|---|
evo2_40b | 1M | найсильніший, потребує кількох H100 |
evo2_20b | 1M | компроміс якість/ресурси |
evo2_7b | 1M | робочий кінь для більшості задач |
evo2_7b_262k | 262K | коротший контекст, легший |
evo2_40b_base / evo2_7b_base | 8K | базові (короткий контекст) |
evo2_1b_base | 8K | для старту/слабкого GPU |
evo2_7b_microviridae | — | приклад донавченого варіанта |
Що вміє (з прикладами)
Section titled “Що вміє (з прикладами)”- Zero-shot variant effect prediction (VEP). Порівнюємо, наскільки модель «вірить» у референсну vs мутовану послідовність. Офіційний приклад — BRCA1: передбачення патогенності мутацій без навчання, на рівні спеціалізованих методів.
- Генерація ДНК. Створює правдоподібні послідовності — від генів до цілих бактеріальних/мітохондріальних геномів і хромосомного масштабу.
- Дизайн із керуванням. З inference-time search проєктує послідовності із заданими рисами (напр. патерни доступності хроматину/епігеному).
- Ембединги для задач. Внутрішні представлення → класифікатори (напр. екзон/інтрон, регуляторні елементи).
- Інтерпретованість. Через sparse autoencoders (SAE) видно, що модель «вивчила» біологічні ознаки (мотиви, структура генів).
Доступ (усе відкрите)
Section titled “Доступ (усе відкрите)”- HuggingFace:
arcinstitute/evo2_7b,arcinstitute/evo2_40bта інші. - GitHub:
ArcInstitute/evo2— пакетpip install evo2, приклади й ноутбуки (зокрема BRCA1). - Evo Designer — вебінтерфейс для генерації без коду.
- NVIDIA BioNeMo — Evo 2 як готовий сервіс/NIM (варіант без власного важкого GPU).
- Ліцензія: Apache 2.0 (можна вільно використовувати, зокрема для портфоліо).
Чесний реаліті-чек
Section titled “Чесний реаліті-чек”- Компют важкий: 40B — це кілька H100 і FP8. Для навчання/старту бери 7B (одна потужна карта) або 1B/BioNeMo.
- Прогноз ≠ істина: zero-shot VEP найкраще працює в консервативних/кодуючих ділянках; у складній регуляції гірше. Валідуй метрикою й бейзлайном.
- Не для клініки й персонального геному: це дослідницький інструмент, не діагностика.
- Генерація ≠ робочий організм: «намалювати» геном ≠ жива клітина.
🎯 Портфоліо-проєкт: zero-shot передбачення патогенності варіантів
Section titled “🎯 Портфоліо-проєкт: zero-shot передбачення патогенності варіантів”Ідея: взяти ген, для якого відомі «патогенні/доброякісні» мутації (ClinVar), і показати, що ймовірність за Evo 2 розділяє їх — без навчання. Це канонічний, «чесний» проєкт, який одразу видно рекрутеру.
- Рівень: середній (базовий Python + трохи біології).
- Час: 1–2 вихідні.
- Компют: Google Colab (A100) або BioNeMo; старт на
evo2_1b_base/evo2_7b.
- Середовище. Colab з GPU або BioNeMo.
pip install evo2(потрібні Linux/WSL2, CUDA 12.1+, flash-attn). Найлегший старт — офіційний ноутбукnotebooks/brca1з репозиторію. - Дані. Візьми набір варіантів BRCA1 з мітками (є в офіційному прикладі) — це твій «hello world». Пізніше — витягни варіанти гена довголіття (FOXO3, APOE, KLOTHO) з ClinVar.
- Скоринг. Для кожного варіанта побудуй вікно референсної послідовності навколо позиції, зроби копію з мутацією (alt) і оціни log-ймовірність обох.
- Дельта-скор.
delta = score(alt) − score(ref). Чим більш негативна дельта, тим імовірніше варіант шкідливий. - Оцінка. Порахуй AUROC дельти проти міток ClinVar; побудуй ROC-криву й розподіли. Додай бейзлайн (напр. консервативність/простий скор), щоб показати, що модель кращa.
- Зроби «своїм». Перенеси пайплайн на ген довголіття — це і оригінальність, і прив’язка до теми проєкту «Біо».
- Упакуй. Чистий GitHub-репозиторій: README з графіками й числами (AUROC), відтворюваний ноутбук, короткий висновок «що зробив і чого навчився».
Код-скелет (ілюстративно; точний API — в офіційному ноутбуку)
Section titled “Код-скелет (ілюстративно; точний API — в офіційному ноутбуку)”from evo2 import Evo2import torch
model = Evo2('evo2_7b') # або 'evo2_1b_base' для слабшого GPU
def seq_loglik(seq): # середня log-ймовірність послідовності ids = model.tokenizer.tokenize(seq) x = torch.tensor(ids, dtype=torch.int).unsqueeze(0).to('cuda:0') logits, _ = model(x) logp = torch.log_softmax(logits.float(), dim=-1) tgt = x[:, 1:] lp = logp[:, :-1].gather(-1, tgt.unsqueeze(-1)).squeeze(-1) return lp.mean().item()
delta = seq_loglik(alt_window) - seq_loglik(ref_window) # < 0 → ймовірно патогеннийЩо це доводить роботодавцю
Section titled “Що це доводить роботодавцю”- Вмієш завантажити й запустити genomic FM (не тільки читати про неї).
- Розумієш zero-shot інференс і коректну оцінку (AUROC, бейзлайн, held-out).
- Можеш прив’язати модель до біологічного питання (гени довголіття) — саме це робить Foundation-Model Scientist.
Розширення (якщо хочеш «вау»)
Section titled “Розширення (якщо хочеш «вау»)”- Ембединг-класифікатор: витягни ембединги (
return_embeddings=True, layer_names=[...]) і навчи простий класифікатор екзон/інтрон. - Генерація:
model.generate(prompt_seqs=["ACGT..."], n_tokens=400)— згенеруй і проаналізуй коротку послідовність. - Інтерпретованість: повтори SAE-аналіз, покажи, які біо-ознаки «вимикаються» на мутації.
Ресурси
Section titled “Ресурси”- Репозиторій і ноутбуки:
github.com/ArcInstitute/evo2(див.notebooks/). - Ваги: HuggingFace
arcinstitute/evo2_7b,evo2_40b. - Без власного GPU: NVIDIA BioNeMo (Evo2) + офіційний туторіал «Zero-shot BRCA1».
- Генерація без коду: Evo Designer.
Джерела
Section titled “Джерела”- Evo 2 — Nature (2026), «Genome modelling and design across all domains of life»: https://www.nature.com/articles/s41586-026-10176-5
- Репозиторій ArcInstitute/evo2 (моделі, API, ноутбуки): https://github.com/ArcInstitute/evo2
- HuggingFace
arcinstitute/evo2_7b: https://huggingface.co/arcinstitute/evo2_7b - Zero-shot BRCA1 variant effect (туторіал), NVIDIA BioNeMo: https://docs.nvidia.com/bionemo-framework/2.5/user-guide/examples/bionemo-evo2/zeroshot_brca1/
- Evo2 у BioNeMo (доступ без власного кластера): https://docs.nvidia.com/bionemo-framework/latest/models/evo2/
Матеріали сайту мають освітній характер і не є медичною порадою. Рішення про будь-які втручання ухвалюйте разом із лікарем.