Перейти до вмісту

MAMMAL — мультимодальна біологічна foundation-модель IBM Research: глибокий розбір і практичний посібник з відтворення

  • Модель, яку ви шукаєте, — це MAMMAL (Molecular Aligned Multi-Modal Architecture and Language) від IBM Research, а конкретний чекпойнт — ibm/biomed.omics.bl.sm.ma-ted-458m (458 млн параметрів), попередньо навчений на ~2 млрд зразків з OAS (антитіла), UniRef90/UniProt (білки), ZINC-22 + PubChem (хімія), STRING (білок-білкові взаємодії) та CELLxGENE (single-cell). Це НЕ Model-Agnostic Meta-Learning (Finn 2017) і НЕ mammalian methylation clock Хорвата.
  • Модель повністю відкрита (Apache 2.0): код на GitHub (BiomedSciAI/biomed-multi-alignment), ваги на HuggingFace, стаття — arXiv:2410.22367 (v1 від 28 жовтня 2024) і рецензована публікація в npj Drug Discovery (2026, DOI 10.1038/s44386-026-00047-4). Inference і fine-tuning реально запустити на одному GPU (навіть у безкоштовному Google Colab), бо модель невелика (0.5B параметрів).
  • Повне відтворення pre-training з нуля для соло-розробника нереалістичне без бюджету рівня лабораторії: IBM тренувала модель три місяці на 16 A100-80GB GPU (~35 000 A100-годин, орієнтовно $27–70 тис. у хмарі). Реалістичний шлях для однієї людини — fine-tuning готового чекпойнта або відтворення зменшеної версії на підмножині даних.

Ідентифікація. MAMMAL — це метод/архітектура, а ibm/biomed.omics.bl.sm.ma-ted-458m — конкретна навчена модель у складі IBM Biomedical Foundation Model (BMFM) suite. Абревіатура розшифровується як Molecular Aligned Multi-Modal Architecture and Language. Автори — команда IBM Research (IBM Research-Israel, Haifa + IBM TJ Watson Research Center, Yorktown Heights, за участі Technion). Провідні автори з рівним внеском — Yoel Shoshan, Moshiko Raboh, Michal Ozery-Flato, а також Michal Rosen-Zvi (Director, AI for Healthcare and Life Sciences, IBM Research) та Efrat Hexter. Препринт на arXiv опубліковано 28 жовтня 2024; рецензована версія вийшла в npj Drug Discovery у 2026.

Дисамбіговація. Існують дві абсолютно інші речі з тією ж абревіатурою: (1) Model-Agnostic Meta-Learning (Finn et al., 2017) — метод few-shot meta-learning, що вчить хорошу ініціалізацію ваг для швидкої адаптації через inner/outer-loop градієнтні оновлення; (2) mammalian methylation clock (годинник метилювання ссавців Хорвата) — епігенетика старіння. Ваша модель — це третє, окреме: мультимодальна біо-foundation модель IBM для drug discovery.

Архітектура. Трансформер у стилі T5 (Vaswani + T5 seq2seq), з ключовою особливістю: спільний стек енкодера, який працює в двох режимах — encoder-only (як BERT, для класифікації/регресії) та encoder-decoder (авторегресійний, для генерації). Модель підтримує безперервні скалярні значення (континуальні ембединги через лінійну проєкцію, що додається до токен-ембедингів), і має Modular Tokenizer, що зводить різні модальності (амінокислоти, SMILES, гени) в єдиний ID-простір.

Дані. Претренування на ~2 млрд зразків із шести публічних датасетів, що покривають три домени через сім завдань (verbatim зі статті: «Pretraining was conducted on two billion samples sourced from six datasets, which are all publicly available, covering three distinct domains across seven tasks»).

Порівняння. MAMMAL унікальна тим, що це один з небагатьох по-справжньому крос-модальних (білки + хімія + транскриптоміка) foundation-моделей із єдиною архітектурою для всього drug-discovery пайплайну, тоді як більшість конкурентів вузькоспеціалізовані (ESM — тільки білки, scGPT/Geneformer — тільки клітини, Boltz-2/AF3 — тільки структура).

1. Ідентифікація моделі

Section titled “1. Ідентифікація моделі”
АтрибутЗначення
Повна назваMAMMAL — Molecular Aligned Multi-Modal Architecture and Language
Чекпойнтibm/biomed.omics.bl.sm.ma-ted-458m
Розмір458 млн параметрів (0.5B, F32, safetensors)
РозробникIBM Research (Haifa + TJ Watson), частина IBM BMFM suite
Дата релізу28 жовтня 2024 (arXiv v1), npj Drug Discovery 2026
ЛіцензіяApache 2.0
arXiv2410.22367 (v1 28.10.2024, v2 01.11.2024, v3 06.05.2025)
DOI (журнал)10.1038/s44386-026-00047-4
GitHubgithub.com/BiomedSciAI/biomed-multi-alignment
HuggingFacehuggingface.co/ibm-research/biomed.omics.bl.sm.ma-ted-458m
PyPIpip install biomed-multi-alignment

Розшифровка імені чекпойнта: biomed.omics — домен; bl.sm — biologics + small molecules; ma — multi-aligned; ted — T5-style transformer encoder-decoder; 458m — 458 млн параметрів.

2. Архітектура та механізм роботи

Section titled “2. Архітектура та механізм роботи”
  • База: трансформер (Vaswani et al. 2017), натхненний T5 — задачі формулюються як seq2seq у єдиній моделі.
  • Два режими зі спільним енкодером: encoder-only (як BERT) для представлень/класифікації/регресії; encoder-decoder (авторегресійний) для генерації. Ваги енкодера спільні для обох режимів; оновлення параметрів через акумуляцію градієнтів по всіх задачах.
  • Обробка модальностей: кожна модальність кодується як послідовність токенів у своєму «під-токенайзері», але всі відображаються в спільний ID-простір через Modular Tokenizer. Білки й антитіла — амінокислотні послідовності (токенайзер AA), малі молекули — SMILES, клітини — формат Geneformer (ранжовані за експресією списки генів). Модульний токенайзер відображає, наприклад, вуглець «C» у SMILES та цистеїн «C» у амінокислотах у різні ID, розв’язуючи колізії.
  • Спільний ембединг-простір: досягається через єдиний енкодер і спільний словник; спеціальні токени позначають тип сутності (напр. <MOLECULAR_ENTITY_TYPE_ANTIBODY_HEAVY_CHAIN>) та організм (<ATTRIBUTE_ORGANISM_HUMAN>).
  • Скаляри: безперервні числові значення (експресія генів, енергія зв’язування) проєктуються навченою лінійною трансформацією в model_dim і додаються (не конкатенуються) до токен-ембедингів. Позиції без скаляра позначаються NaN. Для виходів є окрема scalar prediction head (поки що лише в encoder-only режимі; підтримку скалярних виходів в encoder-decoder режимі IBM планує додати в майбутніх версіях).
  • Претренувальні задачі: span-denoising у стилі T5 (середня довжина спану 5, щільність шуму 0.15), mask infilling, denoising, генерація, класифікація.
  • Задачі, які вирішує: передбачення взаємодії білок-білок (PPI), drug-target interaction (DTI/binding affinity), toxicity (ClinTox), проникність гемато-енцефалічного бар’єру (BBBP), cancer-drug response, antibody-antigen binding, TCR-epitope binding, дизайн антитіл (CDR infilling), анотація типів клітин, генерація малих молекул і білків.

Оцінка на 11 бенчмарках (verbatim з абстракту): «it reaches a new state of the art (SOTA) in nine tasks and is comparable to SOTA in two tasks, all within a unified architecture». У тесті antibody-antigen/nanobody-antigen binding fine-tuned MAMMAL показав кращу класифікаційну ефективність, ніж AlphaFold 3, у 3 із 4 мішеней (журнальна версія / arXiv v3; рання версія повідомляла 5 із 7). Важливе застереження: MAMMAL — sequence-only і дає ймовірнісну оцінку зв’язування, тоді як AF3 дає повноцінну 3D-структуру; це не означає загальну перевагу над AF3.

3. Тренувальні дані (структура ~2 млрд зразків)

Section titled “3. Тренувальні дані (структура ~2 млрд зразків)”
ЗадачаДоменДатасетК-сть зразків (після фільтрації)
Protein LM (span masking)білкиUniRef90 (UniProt)180 млн
Antibody LM (span masking)антитілаOAS (Observed Antibody Space)650 млн
Small Molecule LM (span masking)хіміяZINC-22 + PubChem200 млн
Cell Genes LM (span masking)транскриптомікаCELLxGENE30 млн
Protein-Protein Interaction (classification)білкиSTRING780 млн
PPI GenerationбілкиSTRING390 млн
Antibody DenoiseантитілаOAS650 млн

Деталі препроцесингу:

  • UniRef90 — кластери UniProt з ≥90% ідентичності та 80% перекриття послідовностей, зменшує надлишковість, зберігаючи функціональне різноманіття.
  • OAS — непарні послідовності варіабельних регіонів (важкі/легкі ланцюги); фільтр на повні варіабельні домени та стандартні амінокислоти → ~650 млн; анотація типу ланцюга і виду.
  • CELLxGENE — після фільтра suspension_type == "cell" → 30 млн, конвертовано у формат Geneformer.
  • STRING — 390 млн позитивних пар білок-білок (confidence-score > 500) + 390 млн псевдонегативних (випадкові пари того ж виду) = 780 млн.
  • ZINC-22 + PubChem — drug-like молекули у форматі SMILES.

Зверніть увагу на розбіжність між джерелами щодо переліку баз: у деяких версіях статті білки позначено як UniProt, в інших конкретніше як UniRef90 (кластеризований підмножина UniProt). STRING (PPI) фігурує в усіх версіях, але користувач його не назвав — це шоста база, яку варто врахувати при відтворенні.

4. Як повторити самостійно (практична частина)

Section titled “4. Як повторити самостійно (практична частина)”

Що вже відкрито:

  • Код — Apache 2.0, GitHub BiomedSciAI/biomed-multi-alignment (core MAMMAL + fine-tuning + inference + MCP-інтеграція для агентів).
  • Ваги — публічно на HuggingFace (ibm-research/biomed.omics.bl.sm.ma-ted-458m), плюс ~8 fine-tuned варіантів (напр. .dti_bindingdb_pkd для передбачення афінності drug-target).
  • Тьюторіали — Google Colab для inference (приклад PPI), приклади по одній задачі з кожного домену з датасетами, що автоматично завантажуються.

Обчислювальні вимоги для pre-training (як робила IBM):

  • Кластер OpenShift, дві вузли, 16 A100-80GB GPU загалом, ~3 місяці навчання (verbatim: «It was trained for three months over two nodes with 16 A100-80G GPUs»).
  • Фреймворк: FuseMedML + PyTorch, distributed через PyTorch Fully Sharded Data Parallel (FSDP).
  • Оцінка GPU-годин: 16 GPU × ~2190 год ≈ ~35 000 A100-годин.
  • Орієнтовна вартість у хмарі (2026): A100-80GB ~$0.78–1.99/год у бюджетних провайдерів (Thunder Compute, Lambda) → приблизно $27–70 тис. за один повний прогін (без урахування сховища, невдалих запусків, попередніх експериментів).
  • Гіперпараметри (verbatim з Appendix C.2): AdamW з β1=0.9, β2=0.999, weight decay 0.01, gradient clipping norm 1.0, 2K warmup steps, cosine decay до 10% максимального learning rate до кінця навчання; максимальна довжина послідовності і batch size — налаштовуються per-task.

Обчислювальні вимоги для inference / fine-tuning:

  • Модель усього 0.5B параметрів → inference комфортно вміщується на споживчому GPU (RTX 4090 24GB, і навіть менше) або в безкоштовному Colab.
  • Fine-tuning (LoRA або повний) на одному A100-40/80GB чи навіть RTX 4090 цілком реальний для більшості downstream задач.

Покроковий підхід до відтворення:

  1. Встановлення: conda create -n mammal_env python=3.10; встановити PyTorch ≥2.0 з CUDA (напр. pytorch-cuda=12.1); pip install biomed-multi-alignment[examples] або з git.
  2. Дані: усі шість баз публічні — UniRef90 (UniProt FTP), OAS (сайт Observed Antibody Space), ZINC-22, PubChem (NCBI), CELLxGENE (CZ census API), STRING. Препроцесинг за Appendix C статті.
  3. Токенізація: використати наявний ModularTokenizer з репозиторію (він уже містить під-токенайзери для AA/SMILES/genes) — не потрібно навчати з нуля.
  4. Тренування: повторити span-denoising + класифікаційні/генеративні задачі через FuseMedML pipeline; FSDP для мульти-GPU.
  5. Реалістична альтернатива для соло: взяти готовий чекпойнт і робити fine-tuning під свою задачу, або тренувати зменшену версію на підмножині (наприклад тільки білки + одна задача span-denoising) на 1–8 GPU.

Реалістична оцінка: повне відтворення pre-training з нуля вимагає ресурсів рівня добре фінансованої лабораторії чи компанії (десятки тисяч GPU-годин, інженерія даних на мільярди зразків, кілька місяців wall-clock часу). Соло-розробник практично не відтворить повний прогін за розумний час/бюджет, але може: (а) запускати inference; (б) робити fine-tuning; (в) відтворити методологію на зменшеному масштабі як навчальний/дослідницький проєкт для портфоліо.

5. Порівняння з іншими мультимодальними bio-foundation моделями

Section titled “5. Порівняння з іншими мультимодальними bio-foundation моделями”
МодельРозробникПараметриМодальностіЛіцензія/вагиКлючова відмінність
MAMMALIBM Research458Mбілки + антитіла + хімія + single-cell + PPIApache 2.0, відкритіЄдина архітектура + prompt-синтаксис для всього drug-discovery пайплайну, крос-модальність
ESM-2Meta/FAIR8M–15Bтільки білкові послідовностівідкритіEncoder-only MLM (6–72 шари, hidden 320–5120); 650M — оптимум ціна/якість
ESM-3EvolutionaryScaleдо 98Bпослідовність + структура + функція білківчастково (менша некомерційна версія відкрита)Генеративна, promptable; ~25× більше FLOPs і 60× більше даних, ніж ESM-2; тренована на H100 Andromeda
scGPTBo Wang lab (UofT)~51–53Msingle-cell (scRNA-seq, multi-omics)відкриті12 шарів, d=512, ~33M клітин, continuous-value gene encoding, MLM
GeneformerTheodoris et al.10M/106Msingle-cell транскриптомікавідкритіRank-value tokens, ~30M клітин, context 2048–4096
Boltz-2MIT/Recursion~1Bструктура + binding affinityMIT, відкриті (ваги+код)~FEP-точність у ~1000× швидше; open-source аналог AF3
AlphaFold 3Google DeepMindструктура (білки+НК+ліганди)обмежений доступ (сервер)SOTA для 3D-структур комплексів
C2S-Scale 27BGoogle/Yale (van Dijk)410M–27Bsingle-cell + текствідкриті (HF)На базі Gemma-2, «cell sentences», decoder-only, >50M клітин, тренована на TPU v5
xTrimoBioMapвеликий (MoE)7 модальностей (DNA/RNA/білок/клітини/текст/системи)закритий/комерційнийMoE, FP8, NVIDIA Megatron; партнерство з Sanofi

Що унікального в MAMMAL: (1) справжня крос-модальність в одній моделі — може приймати в одному промпті білок + малу молекулу + профіль експресії; (2) prompt-синтаксис із динамічними комбінаціями токенів і скалярів; (3) безперервні скаляри без бінінгу/дискретизації; (4) один набір ваг для класифікації, регресії й генерації (замість окремих tailored-архітектур для кожної SOTA-задачі); (5) повна відкритість під Apache 2.0.

Обмеження MAMMAL: (1) sequence-only — не дає 3D-структур (на відміну від AF3/Boltz-2); (2) відносно невеликий масштаб (458M) проти ESM-3 (98B) чи C2S-Scale (27B); (3) single-cell частина відносно скромна (30M клітин проти >50M у C2S-Scale); (4) точні гіперпараметри архітектури (кількість шарів, розмірність, розмір словника) не наведені у статті — треба дивитися config.json у репозиторії; (5) відомість нішева — десятки зірок/форків на GitHub, тобто це не мейнстрім рівня ESM/AlphaFold.

Етап 1 — Знайомство (кілька годин, $0): Запустіть офіційний Colab-тьюторіал для PPI-inference на готовому чекпойнті. Це дасть відчуття prompt-синтаксису й Modular Tokenizer без будь-яких витрат. Benchmark для переходу далі: ви розумієте, як формується промпт <@TOKENIZER-TYPE=AA>...<SEQUENCE_NATURAL_START>....

Етап 2 — Fine-tuning під свою задачу (дні, десятки $): Візьміть один A100-40GB (або RTX 4090) у бюджетному хмарному провайдері ($0.8–2/год) і зробіть fine-tuning на своєму датасеті через приклади з репозиторію. Це реалістична «власна» робота для соло-розробника, що добре лягає у портфоліо bio-AI. Benchmark: ваша fine-tuned модель б’є простий baseline (напр. ESM-2 embeddings + логістична регресія) на вашій задачі.

Етап 3 — Відтворення методології на зменшеному масштабі (тижні, сотні $): Оберіть ОДИН домен (наприклад білки з UniRef90) та ОДНУ задачу (span-denoising), натренуйте маленьку модель з нуля на 1–8 GPU. Це продемонструє розуміння pipeline без бюджету на повні 2 млрд зразків.

Коли переходити до повного pre-training: тільки якщо у вас є доступ до ≥16 A100/H100 на кілька місяців. Порогові показники, що змінюють рішення: бюджет ≥$50 тис. на compute АБО безкоштовний доступ до HPC-кластера з ≥16 GPU (грант, університет, хмарні кредити).

Для вашого кар’єрного переходу: MAMMAL — чудовий навчальний об’єкт, бо поєднує все, що ви вивчаєте (protein LM, drug discovery), в одній відкритій кодовій базі з Apache 2.0. Рекомендую паралельно вивчити ESM-2 650M (для інтуїції про pLM) і Boltz-2 (для структурного напрямку), бо разом вони покривають три стовпи сучасного bio-AI: послідовність (ESM), крос-модальність/взаємодії (MAMMAL), структура+афінність (Boltz-2/AF3).

  • Точні архітектурні гіперпараметри (кількість шарів енкодера/декодера, d_model, кількість attention heads, розмір словника, глобальна max-довжина) не опубліковані у статті; значення «768» згадується лише як приклад model_dim, а не підтверджена специфікація. Достовірні числа треба брати з config.json у HuggingFace-репозиторії.
  • Компанія тренувала на 16 A100-80GB GPU загалом (два вузли), а не 2×16=32 — це важливо для коректної оцінки compute. Мої оцінки вартості хмарного тренування ($27–70 тис.) — приблизна екстраполяція з опублікованих IBM «16 GPU × 3 місяці» й ринкових цін A100 станом на 2026; фактична вартість залежить від провайдера, spot vs on-demand, кількості невдалих прогонів.
  • Джерела трохи розходяться щодо переліку баз (UniProt vs UniRef90; наявність STRING у переліку) — я звів усі варіанти вище.
  • Результати «перевершив AlphaFold 3» стосуються вузького antibody/nanobody-antigen binding classification (3/4 мішені в журнальній версії, 5/7 у ранній) і не означають загальної переваги над AF3, який розв’язує іншу задачу (3D-структура).
  • Число завантажень і зірок репозиторію невелике (десятки), тобто модель відома у нішевих колах, але не є мейнстрімом рівня ESM/AlphaFold — публічної інформації про неї менше, ніж про топові моделі; частину технічних деталей доведеться діставати безпосередньо з коду.

Матеріали сайту мають освітній характер і не є медичною порадою. Рішення про будь-які втручання ухвалюйте разом із лікарем.