Syngenta розробляє інформатичну платформу Data for Synthesis, яка перетворює розрізнені дані про хімічні реакції на граф знань у Neo4j. Мета — допомогти хімікам швидше підбирати синтетичні маршрути та враховувати ризики ще на етапі проєктування.
Про це повідомляє сайт Аграрії разом з посиланням на Agropages.
Syngenta повідомила про розробку інформатичної платформи Data for Synthesis, яка має підтримувати науковців у синтезі діючих речовин для засобів захисту рослин. У компанії зазначають, що ключова ідея — розглядати дані про реакції не як «побічний продукт» експериментів (записи в лабораторних журналах або файли у PDF), а як повноцінний актив, який можна повторно використовувати для ухвалення рішень.
В основі платформи — використання Neo4j для побудови єдиного графа знань, який об’єднує «мільйони роз’єднаних точок даних». За задумом, це має дозволити підвищувати ефективність синтезу та враховувати аспекти ланцюгів постачання ще до початку лабораторних робіт.
Чому табличні бази даних не завжди підходять для синтезу
У матеріалі пояснюється, що синтетичний маршрут — це «рецепт» побудови складної молекули з простіших, комерційно доступних стартових речовин. Хіміку потрібно обрати послідовність перетворень і знайти компроміс між кількома критеріями — вартістю, ефективністю, швидкістю, факторами сталості тощо. Для кожного кроку можуть існувати різні реакційні умови (зокрема температура, тиск), які також потрібно враховувати.
Syngenta підкреслює, що в реляційних (табличних) моделях складно формулювати «маршрутні» запити — наприклад, пошук усіх шляхів до певного інтермедіату з конкретним каталізатором, пошук альтернативних маршрутів або визначення найкоротшого шляху до цільової молекули. Такі задачі природніше описуються як проходження графом, де молекули й реакції — це сутності, а зв’язки відображають їхні ролі (реагент/продукт).
“The synthetic route is the main business object we work with… In the past, information about those steps was spread across different database tables, Word documents, and PowerPoint presentations. How do you make the connection? It’s difficult with anything other than graphs.”
Окремо згадується «розрив у простежуваності»: якщо в іншій лабораторії або країні вже отримали негативний результат за певних умов реакції, без пов’язаних даних немає простого способу автоматично підсвітити цей ризик колегам.
Як побудовано підхід із графом знань
Команда, за описом у джерелі, почала з аналізу щоденних робочих процесів хіміків і переліку найчастіших запитань, які ті ставлять до даних. Далі ці запити зіставили з можливостями Cypher — мовою запитів Neo4j. У матеріалі наголошується, що графовий підхід дає змогу інтерактивно проходити складні реакційні мережі «через 10+ кроків» без жорстко заданого обмеження глибини.
Python-пакет Noctis: міст між даними реакцій і Neo4j
Syngenta також повідомила, що створила й відкрила вихідний код Python-пакета Noctis. Його призначення — допомогти дослідникам і розробникам перетворювати власні набори даних про реакції на навігаційні графи знань для Neo4j.
У матеріалі Noctis описують як «міст» між реакційними даними, базою Neo4j та Python-середовищем. Пакет перетворює графові об’єкти (вузли та зв’язки) на Python-класи, які можна перевіряти, аналізувати та розширювати схемою без переписування базового коду взаємодії з БД. Зазначається, що ядро Noctis є schema-agnostic, а поверх нього додано базовий шар, адаптований під задачі хімічного синтезу.
“At its core, Noctis is schema-agnostic… We’ve added a base layer tailored to chemical synthesis, but anyone can extend it however they need.”
Поточний стан: дані, продуктивність і «негативні результати»
За даними Syngenta, proof-of-concept граф уже містить десятки тисяч записів реакцій, що охоплюють унікальні молекули. Також описано розширений шар схеми, орієнтований на потреби хіміків — для розширеного пошуку та гнучких групувань.
Окремо наведено два показники, які компанія подає як важливі для практичного використання:
- кастомний запит для «видобування маршрутів» (route-mining), розроблений як Java-плагін у співпраці з Neo4j, може витягувати 10 000 потенційних синтетичних маршрутів менш ніж за 10 секунд;
- після запровадження структурованого етапу валідації даних частка реакційних даних, які можна представити в графі без ручної «чистки», зросла приблизно з 1% історичних даних до майже 99%.
У матеріалі також підкреслюється роль фіксації «негативних результатів» — невдалих експериментів, які зазвичай погано індексуються у традиційній звітності. Граф знань, за задумом, зберігає контекст таких спроб і зменшує ризик повторення завідомо проблемних умов.
Що це може означати для розробки ЗЗР
Syngenta позиціонує Data for Synthesis як основу для подальших застосувань ШІ та машинного навчання: структурований і верифікований графовий набір даних може використовуватися для навчання моделей у хімічній інформатиці. Компанія також планує розширювати граф, додаючи більше експериментальних даних і пов’язуючи хімічні властивості з біологічними результатами, щоб підтримувати проєктування нових рішень для захисту рослин.
У практичній площині для R&D це означає спробу з’єднати етапи проєктування маршруту, проведення експериментів і подальшої аналітики в одному пов’язаному представленні даних — із можливістю швидко знаходити альтернативні шляхи синтезу та спільні кроки між різними маршрутами.
