Фото: із відкритих джерел
Команда Аньхойського аграрного університету (Китай) опублікувала Crop-GPA 2.0 — онлайн-інструмент на основі deep learning, який прогнозує, які SNP-варіанти ДНК пов’язані з агрономічними ознаками, і може переносити знання між різними видами культур.
Про це повідомляє сайт Аграрії разом з посиланням на сайт Global Agriculture.
Дослідницька група Аньхойського аграрного університету (провінція Аньхой, Китай) представила Crop-GPA 2.0 — інструмент глибинного навчання для прогнозування зв’язків між генетичними варіаціями та господарсько цінними ознаками рослин. За повідомленням авторів, роботу під керівництвом професора Чженью Юе (перший автор — Юйцзя Гао) опубліковано 10 вересня 2026 року в журналі The Crop Journal. Платформа доступна онлайн і позиціонується як безкоштовна для використання без потреби у власній високопродуктивній обчислювальній інфраструктурі.
Ключова задача, на яку націлений інструмент, — так зване прогнозування «генотип—фенотип»: визначення, які саме з численних дрібних відмінностей у ДНК реально пов’язані з вимірюваними ознаками, такими як урожайність, стійкість до хвороб, толерантність до стресів або показники якості зерна. У фокусі Crop-GPA 2.0 — однонуклеотидні поліморфізми (SNP), тобто «однолітерні» відмінності в генетичному коді між окремими рослинами. Традиційно пошук значущих SNP для конкретної ознаки потребує великих спеціалізованих наборів даних, які збирають роками, що часто є недоступним для менш комерційно пріоритетних ознак або культур, поширених переважно в країнах, що розвиваються.
Як працює Crop-GPA 2.0
Crop-GPA 2.0 є розвитком попередньої версії Crop-GPA 1.0, яка аналізувала асоціації на рівні генів. Нова версія переходить на детальніший рівень — SNP — і, за описом розробників, поєднує три взаємопов’язані підходи.
- Ієрархічне геномне представлення (hierarchical genomic representation): модель аналізує послідовність ДНК і структурну інформацію на кількох масштабах навколо кожного кандидатного SNP, а не лише ізольовану «заміну літери». Це має допомагати враховувати як локальний контекст, так і ширші геномні патерни.
- Міжвидове попереднє навчання (cross-species pre-training): модель спочатку навчається на геномних даних з кількох видів культур, щоб засвоїти закономірності, які можуть повторюватися між різними рослинами, а потім донавчається під конкретний вид.
- Навчання з урахуванням ознаки (trait-aware learning): підхід, який уточнює «розуміння» моделі для окремих ознак, щоб вона могла розрізняти, наприклад, сигнали SNP, пов’язані зі стійкістю до хвороб, і сигнали, пов’язані з посухостійкістю, навіть якщо вони слабко виражені.
Результати тестування та валідація
За даними дослідників, інструмент тестували на рисі, кукурудзі та пшениці — і на ознаках, що включали урожайність, стійкість до хвороб, толерантність до стресів і якість зерна. Автори повідомляють, що Crop-GPA 2.0 показав кращі результати порівняно з конкуруючими методами прогнозування та зберігав працездатність під час перенесення на інший вид або за умов обмежених навчальних даних — ситуації, з якою часто стикаються селекційні програми для менш досліджених культур або регіональних різновидів.
Окремо команда звіряла прогнозовані модельні SNP із раніше описаними QTL (кількісними локусами ознак) — ділянками геному, вплив яких на певні ознаки підтверджено попередніми дослідженнями. За повідомленням авторів, передбачення узгоджувалися з наявними доказами, що, на їхню думку, підвищує довіру до біологічної значущості знайдених варіантів, а не лише до статистичних збігів.
Що це може дати селекційним програмам
Практичний сенс платформи автори пов’язують зі швидкістю та доступністю: замість того, щоб щоразу запускати тривалі й дорогі генетичні дослідження під кожну нову ознаку, селекціонери можуть отримувати ранжований список кандидатних SNP, пов’язаних із цільовою ознакою. Далі такі маркери можуть використовуватися в маркер-асоційованому доборі (marker-assisted selection), коли рішення про схрещування базують не лише на візуальних спостереженнях, а й на генетичних маркерах.
Оскільки, за описом розробників, інструмент здатен працювати навіть за обмеженої кількості даних, він може бути корисним для культур і ознак, які історично отримували менше уваги в дослідженнях, а також для програм із обмеженими ресурсами.
