Перейти до вмісту

Evo 2 — глибокий розбір + портфоліо-проєкт (genomic foundation model)

B1bТехнології та генна терапіяоновлено 23 липня 2026 р.

Категорія B (технології). Створено: 23 липня 2026. Поглиблення до каталогу моделей (B18): що таке Evo 2 всередині, що вміє, і покрокова інструкція зробити з неї реальний проєкт для портфоліо bio-AI.


  • Evo 2 (Arc Institute + NVIDIA, Nature 2026) — найбільша відкрита genomic foundation model: до 40 млрд параметрів, навчена на 9,3 трлн нуклеотидів з усіх доменів життя (бактерії, археї, еукаріоти, фаги).
  • Головні суперсили: контекст до 1 млн пар основ, zero-shot передбачення ефекту мутацій (без донавчання) і генерація/дизайн ДНК аж до масштабу хромосом.
  • Все відкрите: ваги на HuggingFace, код на GitHub, дані OpenGenome2, вебтул Evo Designer, ліцензія Apache 2.0 → ідеальний матеріал для портфоліо.
  • Твій проєкт (нижче): zero-shot передбачення патогенності варіантів гена (канонічно — BRCA1, потім розширюєш на ген довголіття). Показує саме навички Foundation-Model Scientist.

Що це таке (простими словами)

Section titled “Що це таке (простими словами)”

Evo 2 — «мовна модель», але замість англійської вона вивчила мову ДНК (літери A, C, G, T) на майже всьому живому. Тому вона «відчуває», яка послідовність «правильна/природна», а яка — ні. З цього випливає магія: якщо мутація робить послідовність «неприродною» для моделі, це сигнал, що вона шкідлива — і це працює без жодного донавчання (zero-shot).


  • Архітектура: не чистий трансформер, а StripedHyena 2 — гібрид згорток і уваги (convolutional multi-hybrid). Саме він дає дешевий наддовгий контекст (1 Mb) — критично, бо регуляція генів «розмазана» по геному.
  • Дані: OpenGenome2 — 9,3 трлн нуклеотидів, усі домени життя. Одна з причин, чому модель узагальнює краще за вузькоспеціалізовані.
  • Токенізація: по одному нуклеотиду (single-base) — тому передбачення «поштучне», з base-resolution.
  • Розміри (8 чекпойнтів):
ЧекпойнтКонтекстНащо
evo2_40b1Mнайсильніший, потребує кількох H100
evo2_20b1Mкомпроміс якість/ресурси
evo2_7b1Mробочий кінь для більшості задач
evo2_7b_262k262Kкоротший контекст, легший
evo2_40b_base / evo2_7b_base8Kбазові (короткий контекст)
evo2_1b_base8Kдля старту/слабкого GPU
evo2_7b_microviridaeприклад донавченого варіанта

  1. Zero-shot variant effect prediction (VEP). Порівнюємо, наскільки модель «вірить» у референсну vs мутовану послідовність. Офіційний приклад — BRCA1: передбачення патогенності мутацій без навчання, на рівні спеціалізованих методів.
  2. Генерація ДНК. Створює правдоподібні послідовності — від генів до цілих бактеріальних/мітохондріальних геномів і хромосомного масштабу.
  3. Дизайн із керуванням. З inference-time search проєктує послідовності із заданими рисами (напр. патерни доступності хроматину/епігеному).
  4. Ембединги для задач. Внутрішні представлення → класифікатори (напр. екзон/інтрон, регуляторні елементи).
  5. Інтерпретованість. Через sparse autoencoders (SAE) видно, що модель «вивчила» біологічні ознаки (мотиви, структура генів).

  • HuggingFace: arcinstitute/evo2_7b, arcinstitute/evo2_40b та інші.
  • GitHub: ArcInstitute/evo2 — пакет pip install evo2, приклади й ноутбуки (зокрема BRCA1).
  • Evo Designer — вебінтерфейс для генерації без коду.
  • NVIDIA BioNeMo — Evo 2 як готовий сервіс/NIM (варіант без власного важкого GPU).
  • Ліцензія: Apache 2.0 (можна вільно використовувати, зокрема для портфоліо).

  • Компют важкий: 40B — це кілька H100 і FP8. Для навчання/старту бери 7B (одна потужна карта) або 1B/BioNeMo.
  • Прогноз ≠ істина: zero-shot VEP найкраще працює в консервативних/кодуючих ділянках; у складній регуляції гірше. Валідуй метрикою й бейзлайном.
  • Не для клініки й персонального геному: це дослідницький інструмент, не діагностика.
  • Генерація ≠ робочий організм: «намалювати» геном ≠ жива клітина.

🎯 Портфоліо-проєкт: zero-shot передбачення патогенності варіантів

Section titled “🎯 Портфоліо-проєкт: zero-shot передбачення патогенності варіантів”

Ідея: взяти ген, для якого відомі «патогенні/доброякісні» мутації (ClinVar), і показати, що ймовірність за Evo 2 розділяє їх — без навчання. Це канонічний, «чесний» проєкт, який одразу видно рекрутеру.

  • Рівень: середній (базовий Python + трохи біології).
  • Час: 1–2 вихідні.
  • Компют: Google Colab (A100) або BioNeMo; старт на evo2_1b_base/evo2_7b.
  1. Середовище. Colab з GPU або BioNeMo. pip install evo2 (потрібні Linux/WSL2, CUDA 12.1+, flash-attn). Найлегший старт — офіційний ноутбук notebooks/brca1 з репозиторію.
  2. Дані. Візьми набір варіантів BRCA1 з мітками (є в офіційному прикладі) — це твій «hello world». Пізніше — витягни варіанти гена довголіття (FOXO3, APOE, KLOTHO) з ClinVar.
  3. Скоринг. Для кожного варіанта побудуй вікно референсної послідовності навколо позиції, зроби копію з мутацією (alt) і оціни log-ймовірність обох.
  4. Дельта-скор. delta = score(alt) − score(ref). Чим більш негативна дельта, тим імовірніше варіант шкідливий.
  5. Оцінка. Порахуй AUROC дельти проти міток ClinVar; побудуй ROC-криву й розподіли. Додай бейзлайн (напр. консервативність/простий скор), щоб показати, що модель кращa.
  6. Зроби «своїм». Перенеси пайплайн на ген довголіття — це і оригінальність, і прив’язка до теми проєкту «Біо».
  7. Упакуй. Чистий GitHub-репозиторій: README з графіками й числами (AUROC), відтворюваний ноутбук, короткий висновок «що зробив і чого навчився».

Код-скелет (ілюстративно; точний API — в офіційному ноутбуку)

Section titled “Код-скелет (ілюстративно; точний API — в офіційному ноутбуку)”
from evo2 import Evo2
import torch
model = Evo2('evo2_7b') # або 'evo2_1b_base' для слабшого GPU
def seq_loglik(seq): # середня log-ймовірність послідовності
ids = model.tokenizer.tokenize(seq)
x = torch.tensor(ids, dtype=torch.int).unsqueeze(0).to('cuda:0')
logits, _ = model(x)
logp = torch.log_softmax(logits.float(), dim=-1)
tgt = x[:, 1:]
lp = logp[:, :-1].gather(-1, tgt.unsqueeze(-1)).squeeze(-1)
return lp.mean().item()
delta = seq_loglik(alt_window) - seq_loglik(ref_window) # < 0 → ймовірно патогенний

Що це доводить роботодавцю

Section titled “Що це доводить роботодавцю”
  • Вмієш завантажити й запустити genomic FM (не тільки читати про неї).
  • Розумієш zero-shot інференс і коректну оцінку (AUROC, бейзлайн, held-out).
  • Можеш прив’язати модель до біологічного питання (гени довголіття) — саме це робить Foundation-Model Scientist.

Розширення (якщо хочеш «вау»)

Section titled “Розширення (якщо хочеш «вау»)”
  • Ембединг-класифікатор: витягни ембединги (return_embeddings=True, layer_names=[...]) і навчи простий класифікатор екзон/інтрон.
  • Генерація: model.generate(prompt_seqs=["ACGT..."], n_tokens=400) — згенеруй і проаналізуй коротку послідовність.
  • Інтерпретованість: повтори SAE-аналіз, покажи, які біо-ознаки «вимикаються» на мутації.

  • Репозиторій і ноутбуки: github.com/ArcInstitute/evo2 (див. notebooks/).
  • Ваги: HuggingFace arcinstitute/evo2_7b, evo2_40b.
  • Без власного GPU: NVIDIA BioNeMo (Evo2) + офіційний туторіал «Zero-shot BRCA1».
  • Генерація без коду: Evo Designer.

Матеріали сайту мають освітній характер і не є медичною порадою. Рішення про будь-які втручання ухвалюйте разом із лікарем.