MAMMAL — мультимодальна біологічна foundation-модель IBM Research: глибокий розбір і практичний посібник з відтворення
- Модель, яку ви шукаєте, — це MAMMAL (Molecular Aligned Multi-Modal Architecture and Language) від IBM Research, а конкретний чекпойнт —
ibm/biomed.omics.bl.sm.ma-ted-458m(458 млн параметрів), попередньо навчений на ~2 млрд зразків з OAS (антитіла), UniRef90/UniProt (білки), ZINC-22 + PubChem (хімія), STRING (білок-білкові взаємодії) та CELLxGENE (single-cell). Це НЕ Model-Agnostic Meta-Learning (Finn 2017) і НЕ mammalian methylation clock Хорвата. - Модель повністю відкрита (Apache 2.0): код на GitHub (
BiomedSciAI/biomed-multi-alignment), ваги на HuggingFace, стаття — arXiv:2410.22367 (v1 від 28 жовтня 2024) і рецензована публікація в npj Drug Discovery (2026, DOI 10.1038/s44386-026-00047-4). Inference і fine-tuning реально запустити на одному GPU (навіть у безкоштовному Google Colab), бо модель невелика (0.5B параметрів). - Повне відтворення pre-training з нуля для соло-розробника нереалістичне без бюджету рівня лабораторії: IBM тренувала модель три місяці на 16 A100-80GB GPU (~35 000 A100-годин, орієнтовно $27–70 тис. у хмарі). Реалістичний шлях для однієї людини — fine-tuning готового чекпойнта або відтворення зменшеної версії на підмножині даних.
Key Findings
Section titled “Key Findings”Ідентифікація. MAMMAL — це метод/архітектура, а ibm/biomed.omics.bl.sm.ma-ted-458m — конкретна навчена модель у складі IBM Biomedical Foundation Model (BMFM) suite. Абревіатура розшифровується як Molecular Aligned Multi-Modal Architecture and Language. Автори — команда IBM Research (IBM Research-Israel, Haifa + IBM TJ Watson Research Center, Yorktown Heights, за участі Technion). Провідні автори з рівним внеском — Yoel Shoshan, Moshiko Raboh, Michal Ozery-Flato, а також Michal Rosen-Zvi (Director, AI for Healthcare and Life Sciences, IBM Research) та Efrat Hexter. Препринт на arXiv опубліковано 28 жовтня 2024; рецензована версія вийшла в npj Drug Discovery у 2026.
Дисамбіговація. Існують дві абсолютно інші речі з тією ж абревіатурою: (1) Model-Agnostic Meta-Learning (Finn et al., 2017) — метод few-shot meta-learning, що вчить хорошу ініціалізацію ваг для швидкої адаптації через inner/outer-loop градієнтні оновлення; (2) mammalian methylation clock (годинник метилювання ссавців Хорвата) — епігенетика старіння. Ваша модель — це третє, окреме: мультимодальна біо-foundation модель IBM для drug discovery.
Архітектура. Трансформер у стилі T5 (Vaswani + T5 seq2seq), з ключовою особливістю: спільний стек енкодера, який працює в двох режимах — encoder-only (як BERT, для класифікації/регресії) та encoder-decoder (авторегресійний, для генерації). Модель підтримує безперервні скалярні значення (континуальні ембединги через лінійну проєкцію, що додається до токен-ембедингів), і має Modular Tokenizer, що зводить різні модальності (амінокислоти, SMILES, гени) в єдиний ID-простір.
Дані. Претренування на ~2 млрд зразків із шести публічних датасетів, що покривають три домени через сім завдань (verbatim зі статті: «Pretraining was conducted on two billion samples sourced from six datasets, which are all publicly available, covering three distinct domains across seven tasks»).
Порівняння. MAMMAL унікальна тим, що це один з небагатьох по-справжньому крос-модальних (білки + хімія + транскриптоміка) foundation-моделей із єдиною архітектурою для всього drug-discovery пайплайну, тоді як більшість конкурентів вузькоспеціалізовані (ESM — тільки білки, scGPT/Geneformer — тільки клітини, Boltz-2/AF3 — тільки структура).
Details
Section titled “Details”1. Ідентифікація моделі
Section titled “1. Ідентифікація моделі”| Атрибут | Значення |
|---|---|
| Повна назва | MAMMAL — Molecular Aligned Multi-Modal Architecture and Language |
| Чекпойнт | ibm/biomed.omics.bl.sm.ma-ted-458m |
| Розмір | 458 млн параметрів (0.5B, F32, safetensors) |
| Розробник | IBM Research (Haifa + TJ Watson), частина IBM BMFM suite |
| Дата релізу | 28 жовтня 2024 (arXiv v1), npj Drug Discovery 2026 |
| Ліцензія | Apache 2.0 |
| arXiv | 2410.22367 (v1 28.10.2024, v2 01.11.2024, v3 06.05.2025) |
| DOI (журнал) | 10.1038/s44386-026-00047-4 |
| GitHub | github.com/BiomedSciAI/biomed-multi-alignment |
| HuggingFace | huggingface.co/ibm-research/biomed.omics.bl.sm.ma-ted-458m |
| PyPI | pip install biomed-multi-alignment |
Розшифровка імені чекпойнта: biomed.omics — домен; bl.sm — biologics + small molecules; ma — multi-aligned; ted — T5-style transformer encoder-decoder; 458m — 458 млн параметрів.
2. Архітектура та механізм роботи
Section titled “2. Архітектура та механізм роботи”- База: трансформер (Vaswani et al. 2017), натхненний T5 — задачі формулюються як seq2seq у єдиній моделі.
- Два режими зі спільним енкодером: encoder-only (як BERT) для представлень/класифікації/регресії; encoder-decoder (авторегресійний) для генерації. Ваги енкодера спільні для обох режимів; оновлення параметрів через акумуляцію градієнтів по всіх задачах.
- Обробка модальностей: кожна модальність кодується як послідовність токенів у своєму «під-токенайзері», але всі відображаються в спільний ID-простір через Modular Tokenizer. Білки й антитіла — амінокислотні послідовності (токенайзер AA), малі молекули — SMILES, клітини — формат Geneformer (ранжовані за експресією списки генів). Модульний токенайзер відображає, наприклад, вуглець «C» у SMILES та цистеїн «C» у амінокислотах у різні ID, розв’язуючи колізії.
- Спільний ембединг-простір: досягається через єдиний енкодер і спільний словник; спеціальні токени позначають тип сутності (напр.
<MOLECULAR_ENTITY_TYPE_ANTIBODY_HEAVY_CHAIN>) та організм (<ATTRIBUTE_ORGANISM_HUMAN>). - Скаляри: безперервні числові значення (експресія генів, енергія зв’язування) проєктуються навченою лінійною трансформацією в model_dim і додаються (не конкатенуються) до токен-ембедингів. Позиції без скаляра позначаються NaN. Для виходів є окрема scalar prediction head (поки що лише в encoder-only режимі; підтримку скалярних виходів в encoder-decoder режимі IBM планує додати в майбутніх версіях).
- Претренувальні задачі: span-denoising у стилі T5 (середня довжина спану 5, щільність шуму 0.15), mask infilling, denoising, генерація, класифікація.
- Задачі, які вирішує: передбачення взаємодії білок-білок (PPI), drug-target interaction (DTI/binding affinity), toxicity (ClinTox), проникність гемато-енцефалічного бар’єру (BBBP), cancer-drug response, antibody-antigen binding, TCR-epitope binding, дизайн антитіл (CDR infilling), анотація типів клітин, генерація малих молекул і білків.
Оцінка на 11 бенчмарках (verbatim з абстракту): «it reaches a new state of the art (SOTA) in nine tasks and is comparable to SOTA in two tasks, all within a unified architecture». У тесті antibody-antigen/nanobody-antigen binding fine-tuned MAMMAL показав кращу класифікаційну ефективність, ніж AlphaFold 3, у 3 із 4 мішеней (журнальна версія / arXiv v3; рання версія повідомляла 5 із 7). Важливе застереження: MAMMAL — sequence-only і дає ймовірнісну оцінку зв’язування, тоді як AF3 дає повноцінну 3D-структуру; це не означає загальну перевагу над AF3.
3. Тренувальні дані (структура ~2 млрд зразків)
Section titled “3. Тренувальні дані (структура ~2 млрд зразків)”| Задача | Домен | Датасет | К-сть зразків (після фільтрації) |
|---|---|---|---|
| Protein LM (span masking) | білки | UniRef90 (UniProt) | 180 млн |
| Antibody LM (span masking) | антитіла | OAS (Observed Antibody Space) | 650 млн |
| Small Molecule LM (span masking) | хімія | ZINC-22 + PubChem | 200 млн |
| Cell Genes LM (span masking) | транскриптоміка | CELLxGENE | 30 млн |
| Protein-Protein Interaction (classification) | білки | STRING | 780 млн |
| PPI Generation | білки | STRING | 390 млн |
| Antibody Denoise | антитіла | OAS | 650 млн |
Деталі препроцесингу:
- UniRef90 — кластери UniProt з ≥90% ідентичності та 80% перекриття послідовностей, зменшує надлишковість, зберігаючи функціональне різноманіття.
- OAS — непарні послідовності варіабельних регіонів (важкі/легкі ланцюги); фільтр на повні варіабельні домени та стандартні амінокислоти → ~650 млн; анотація типу ланцюга і виду.
- CELLxGENE — після фільтра
suspension_type == "cell"→ 30 млн, конвертовано у формат Geneformer. - STRING — 390 млн позитивних пар білок-білок (confidence-score > 500) + 390 млн псевдонегативних (випадкові пари того ж виду) = 780 млн.
- ZINC-22 + PubChem — drug-like молекули у форматі SMILES.
Зверніть увагу на розбіжність між джерелами щодо переліку баз: у деяких версіях статті білки позначено як UniProt, в інших конкретніше як UniRef90 (кластеризований підмножина UniProt). STRING (PPI) фігурує в усіх версіях, але користувач його не назвав — це шоста база, яку варто врахувати при відтворенні.
4. Як повторити самостійно (практична частина)
Section titled “4. Як повторити самостійно (практична частина)”Що вже відкрито:
- Код — Apache 2.0, GitHub
BiomedSciAI/biomed-multi-alignment(core MAMMAL + fine-tuning + inference + MCP-інтеграція для агентів). - Ваги — публічно на HuggingFace (
ibm-research/biomed.omics.bl.sm.ma-ted-458m), плюс ~8 fine-tuned варіантів (напр..dti_bindingdb_pkdдля передбачення афінності drug-target). - Тьюторіали — Google Colab для inference (приклад PPI), приклади по одній задачі з кожного домену з датасетами, що автоматично завантажуються.
Обчислювальні вимоги для pre-training (як робила IBM):
- Кластер OpenShift, дві вузли, 16 A100-80GB GPU загалом, ~3 місяці навчання (verbatim: «It was trained for three months over two nodes with 16 A100-80G GPUs»).
- Фреймворк: FuseMedML + PyTorch, distributed через PyTorch Fully Sharded Data Parallel (FSDP).
- Оцінка GPU-годин: 16 GPU × ~2190 год ≈ ~35 000 A100-годин.
- Орієнтовна вартість у хмарі (2026): A100-80GB ~$0.78–1.99/год у бюджетних провайдерів (Thunder Compute, Lambda) → приблизно $27–70 тис. за один повний прогін (без урахування сховища, невдалих запусків, попередніх експериментів).
- Гіперпараметри (verbatim з Appendix C.2): AdamW з β1=0.9, β2=0.999, weight decay 0.01, gradient clipping norm 1.0, 2K warmup steps, cosine decay до 10% максимального learning rate до кінця навчання; максимальна довжина послідовності і batch size — налаштовуються per-task.
Обчислювальні вимоги для inference / fine-tuning:
- Модель усього 0.5B параметрів → inference комфортно вміщується на споживчому GPU (RTX 4090 24GB, і навіть менше) або в безкоштовному Colab.
- Fine-tuning (LoRA або повний) на одному A100-40/80GB чи навіть RTX 4090 цілком реальний для більшості downstream задач.
Покроковий підхід до відтворення:
- Встановлення:
conda create -n mammal_env python=3.10; встановити PyTorch ≥2.0 з CUDA (напр.pytorch-cuda=12.1);pip install biomed-multi-alignment[examples]або з git. - Дані: усі шість баз публічні — UniRef90 (UniProt FTP), OAS (сайт Observed Antibody Space), ZINC-22, PubChem (NCBI), CELLxGENE (CZ census API), STRING. Препроцесинг за Appendix C статті.
- Токенізація: використати наявний ModularTokenizer з репозиторію (він уже містить під-токенайзери для AA/SMILES/genes) — не потрібно навчати з нуля.
- Тренування: повторити span-denoising + класифікаційні/генеративні задачі через FuseMedML pipeline; FSDP для мульти-GPU.
- Реалістична альтернатива для соло: взяти готовий чекпойнт і робити fine-tuning під свою задачу, або тренувати зменшену версію на підмножині (наприклад тільки білки + одна задача span-denoising) на 1–8 GPU.
Реалістична оцінка: повне відтворення pre-training з нуля вимагає ресурсів рівня добре фінансованої лабораторії чи компанії (десятки тисяч GPU-годин, інженерія даних на мільярди зразків, кілька місяців wall-clock часу). Соло-розробник практично не відтворить повний прогін за розумний час/бюджет, але може: (а) запускати inference; (б) робити fine-tuning; (в) відтворити методологію на зменшеному масштабі як навчальний/дослідницький проєкт для портфоліо.
5. Порівняння з іншими мультимодальними bio-foundation моделями
Section titled “5. Порівняння з іншими мультимодальними bio-foundation моделями”| Модель | Розробник | Параметри | Модальності | Ліцензія/ваги | Ключова відмінність |
|---|---|---|---|---|---|
| MAMMAL | IBM Research | 458M | білки + антитіла + хімія + single-cell + PPI | Apache 2.0, відкриті | Єдина архітектура + prompt-синтаксис для всього drug-discovery пайплайну, крос-модальність |
| ESM-2 | Meta/FAIR | 8M–15B | тільки білкові послідовності | відкриті | Encoder-only MLM (6–72 шари, hidden 320–5120); 650M — оптимум ціна/якість |
| ESM-3 | EvolutionaryScale | до 98B | послідовність + структура + функція білків | частково (менша некомерційна версія відкрита) | Генеративна, promptable; ~25× більше FLOPs і 60× більше даних, ніж ESM-2; тренована на H100 Andromeda |
| scGPT | Bo Wang lab (UofT) | ~51–53M | single-cell (scRNA-seq, multi-omics) | відкриті | 12 шарів, d=512, ~33M клітин, continuous-value gene encoding, MLM |
| Geneformer | Theodoris et al. | 10M/106M | single-cell транскриптоміка | відкриті | Rank-value tokens, ~30M клітин, context 2048–4096 |
| Boltz-2 | MIT/Recursion | ~1B | структура + binding affinity | MIT, відкриті (ваги+код) | ~FEP-точність у ~1000× швидше; open-source аналог AF3 |
| AlphaFold 3 | Google DeepMind | — | структура (білки+НК+ліганди) | обмежений доступ (сервер) | SOTA для 3D-структур комплексів |
| C2S-Scale 27B | Google/Yale (van Dijk) | 410M–27B | single-cell + текст | відкриті (HF) | На базі Gemma-2, «cell sentences», decoder-only, >50M клітин, тренована на TPU v5 |
| xTrimo | BioMap | великий (MoE) | 7 модальностей (DNA/RNA/білок/клітини/текст/системи) | закритий/комерційний | MoE, FP8, NVIDIA Megatron; партнерство з Sanofi |
Що унікального в MAMMAL: (1) справжня крос-модальність в одній моделі — може приймати в одному промпті білок + малу молекулу + профіль експресії; (2) prompt-синтаксис із динамічними комбінаціями токенів і скалярів; (3) безперервні скаляри без бінінгу/дискретизації; (4) один набір ваг для класифікації, регресії й генерації (замість окремих tailored-архітектур для кожної SOTA-задачі); (5) повна відкритість під Apache 2.0.
Обмеження MAMMAL: (1) sequence-only — не дає 3D-структур (на відміну від AF3/Boltz-2); (2) відносно невеликий масштаб (458M) проти ESM-3 (98B) чи C2S-Scale (27B); (3) single-cell частина відносно скромна (30M клітин проти >50M у C2S-Scale); (4) точні гіперпараметри архітектури (кількість шарів, розмірність, розмір словника) не наведені у статті — треба дивитися config.json у репозиторії; (5) відомість нішева — десятки зірок/форків на GitHub, тобто це не мейнстрім рівня ESM/AlphaFold.
Recommendations
Section titled “Recommendations”Етап 1 — Знайомство (кілька годин, $0): Запустіть офіційний Colab-тьюторіал для PPI-inference на готовому чекпойнті. Це дасть відчуття prompt-синтаксису й Modular Tokenizer без будь-яких витрат. Benchmark для переходу далі: ви розумієте, як формується промпт <@TOKENIZER-TYPE=AA>...<SEQUENCE_NATURAL_START>....
Етап 2 — Fine-tuning під свою задачу (дні, десятки $): Візьміть один A100-40GB (або RTX 4090) у бюджетному хмарному провайдері ($0.8–2/год) і зробіть fine-tuning на своєму датасеті через приклади з репозиторію. Це реалістична «власна» робота для соло-розробника, що добре лягає у портфоліо bio-AI. Benchmark: ваша fine-tuned модель б’є простий baseline (напр. ESM-2 embeddings + логістична регресія) на вашій задачі.
Етап 3 — Відтворення методології на зменшеному масштабі (тижні, сотні $): Оберіть ОДИН домен (наприклад білки з UniRef90) та ОДНУ задачу (span-denoising), натренуйте маленьку модель з нуля на 1–8 GPU. Це продемонструє розуміння pipeline без бюджету на повні 2 млрд зразків.
Коли переходити до повного pre-training: тільки якщо у вас є доступ до ≥16 A100/H100 на кілька місяців. Порогові показники, що змінюють рішення: бюджет ≥$50 тис. на compute АБО безкоштовний доступ до HPC-кластера з ≥16 GPU (грант, університет, хмарні кредити).
Для вашого кар’єрного переходу: MAMMAL — чудовий навчальний об’єкт, бо поєднує все, що ви вивчаєте (protein LM, drug discovery), в одній відкритій кодовій базі з Apache 2.0. Рекомендую паралельно вивчити ESM-2 650M (для інтуїції про pLM) і Boltz-2 (для структурного напрямку), бо разом вони покривають три стовпи сучасного bio-AI: послідовність (ESM), крос-модальність/взаємодії (MAMMAL), структура+афінність (Boltz-2/AF3).
Caveats
Section titled “Caveats”- Точні архітектурні гіперпараметри (кількість шарів енкодера/декодера, d_model, кількість attention heads, розмір словника, глобальна max-довжина) не опубліковані у статті; значення «768» згадується лише як приклад model_dim, а не підтверджена специфікація. Достовірні числа треба брати з
config.jsonу HuggingFace-репозиторії. - Компанія тренувала на 16 A100-80GB GPU загалом (два вузли), а не 2×16=32 — це важливо для коректної оцінки compute. Мої оцінки вартості хмарного тренування ($27–70 тис.) — приблизна екстраполяція з опублікованих IBM «16 GPU × 3 місяці» й ринкових цін A100 станом на 2026; фактична вартість залежить від провайдера, spot vs on-demand, кількості невдалих прогонів.
- Джерела трохи розходяться щодо переліку баз (UniProt vs UniRef90; наявність STRING у переліку) — я звів усі варіанти вище.
- Результати «перевершив AlphaFold 3» стосуються вузького antibody/nanobody-antigen binding classification (3/4 мішені в журнальній версії, 5/7 у ранній) і не означають загальної переваги над AF3, який розв’язує іншу задачу (3D-структура).
- Число завантажень і зірок репозиторію невелике (десятки), тобто модель відома у нішевих колах, але не є мейнстрімом рівня ESM/AlphaFold — публічної інформації про неї менше, ніж про топові моделі; частину технічних деталей доведеться діставати безпосередньо з коду.
Матеріали сайту мають освітній характер і не є медичною порадою. Рішення про будь-які втручання ухвалюйте разом із лікарем.