Чому EOSC починається не з репозиторію, а з метаданих
Baumann K., Cecconi B., Dietrich M., Doerr M., Jouneau T., Tewatia P., Kokkinaki A., Med M., Marek J. et al. Landscape overview for the EOSC Federation Semantic Interoperability in 2025. EOSC Association Task Force: Technical and Semantic Interoperability, 2026. https://zenodo.org/records/19134873
Європейська хмара відкритої науки може здаватися великою системою зберігання файлів або іншим каталогом посилань на репозиторії. Однак наразі її справжньою метою є створення середовища, в якому дослідницькі дані, програмне забезпечення, публікації, навчальні матеріали, послуги та дослідницька інфраструктура можуть бути знайдені, зрозумілі, пов'язані між собою та повторно використані. Для досягнення цього недостатньо просто опублікувати файл у відкритому доступі. Файл має бути описаний таким чином, щоб він був зрозумілим не лише для людей, але й для машин, каталогів, пошукових служб, репозиторіїв та майбутніх інструментів штучного інтелекту.
Ось чому, окрім наявності репозиторію, основою практичної інтеграції з EOSC є якість метаданих та узгодженість словників. Метадані відповідають на основні питання: що це за ресурс, хто його створив, коли він був створений, до якого дослідження він належить, як його слід цитувати, за якою ліцензією його можна використовувати та з якими публікаціями, проектами чи наборами даних він пов'язаний. Словники, тезауруси та онтології відповідають на інше питання: що саме означають терміни, що використовуються в описі?
Наприклад, поле «метод» у наборі даних може містити різні значення: DFT, молекулярна динаміка, моделювання методом скінченних елементів, мікроскопія, спектроскопія, опитування, моделювання. Якщо ці значення вводяться вільно, різними мовами або з різним написанням, система може розглядати їх як непов'язані слова. Однак, якщо вони пов'язані з контрольованим словником, стають можливими групування, пошук, фільтрація, порівняння з іншими наборами даних та розробка міждисциплінарних сервісів.
У цьому сенсі принципи FAIR не зводяться до гасла «зробити дані відкритими». FAIR означає, що дані повинні бути доступними, сумісними та повторно використовуваними. Компоненти «знайдений», «сумісний» та «повторно використовуваний» найбільше залежать від метаданих, ідентифікаторів, ліцензій, стандартів опису, словників та семантичних зв'язків. Без цих елементів відкритий файл залишається ізольованим об'єктом. З ними він стає частиною ширшого простору дослідницьких даних та сервісів.
Метадані як інфраструктурний шар
У звичайній дослідницькій практиці метадані часто сприймаються як додатковий опис: назва, автори, короткий реферат та ключові слова. Для EOSC такого мінімуму недостатньо. Метадані повинні виконувати інфраструктурну функцію. Вони повинні підтримувати пошук, цитування, автоматичний обмін між системами та зв'язки з публікаціями, проектами, установами, фінансуванням, версіями даних, програмним забезпеченням та робочими процесами.
Тому метадані в EOSC слід розглядати на кількох рівнях.
Перший рівень – це загальний опис об'єкта дослідження. Він включає назву, авторів, організації, опис, дату, тип ресурсу, ідентифікатор, ліцензію, умови доступу, мову, ключові слова та пов'язані ресурси. Цей рівень необхідний майже для будь-якого об'єкта: набору даних, програмного забезпечення, публікації, навчального матеріалу, послуги чи робочого процесу.
Другий рівень – це опис у каталозі. Він потрібен для того, щоб ресурси могли бути представлені в каталогах, агрегаторах, порталах відкритої науки та пошукових сервісах. На цьому рівні важливими стають як властивості окремого набору даних, так і опис репозиторію, послуги, організації, колекції, тематичного простору чи дослідницької інфраструктури.
Третій рівень – це опис, специфічний для предметної області. Він залежить від конкретної галузі науки. У матеріалознавстві це може включати хімічний склад, кристалічну структуру, метод розрахунку, тип експерименту, програмний пакет, параметри моделювання, тип зразка, виміряну або розраховану властивість. У біоінформатиці поля будуть різними; в екології, соціальних науках чи астрономії вони знову будуть відрізнятися. Ось чому EOSC не може працювати за єдиним універсальним стандартом для всіх дисциплін. Потрібна сумісність між загальними стандартами та дисциплінарними профілями.
Четвертий рівень – це семантичний рівень. Він визначає, як значення полів пов'язані з контрольованими словниками, тезаурусами, онтологіями та зовнішніми ідентифікаторами. Без цього система бачить лише текст. З його допомогою система починає бачити поняття, зв'язки, класи ресурсів та типи об'єктів дослідження.
Чому словники – це не доповнення, а необхідна частина FAIR
Словники часто сприймаються як другорядна деталь. Фактично, вони є одним з основних інструментів семантичної сумісності. Якщо різні репозиторії, інститути чи дослідницькі групи використовують різні назви для одних і тих самих понять, інтеграція даних стає складною або неможливою. Якщо вони використовують контрольовані терміни, пов'язані зі стабільними ідентифікаторами, дані можна порівнювати, агрегувати та повторно використовувати в ширших контекстах.
У контексті EOSC, словниковий сервіс слід розуміти як керований сервіс для підтримки термінів. Він може включати контрольовані списки значень, багатомовні мітки, визначення понять, зв'язки між ширшими та вужчими поняттями, еквіваленти в інших словниках, версії, URI та машинозчитувані формати. Такий сервіс потрібен як для зручності користувача, так і для автоматизованого заповнення метаданих, контролю якості описів та побудови зв'язків між системами.
Наприклад, якщо Центр компетенцій підтримує шаблон метаданих для розрахунків DFT, він може містити такі поля, як «програмне забезпечення», «метод», «система матеріалів», «розрахункова властивість» та «етап робочого процесу». Для кожного з цих полів бажано мати не вільний текст, а контрольований список або посилання на словник. Це допомагає уникнути ситуацій, коли одна група пише «Квантовий еспресо», інша пише «Квантовий Еспресо», третя пише «квантовий еспресо», а четверта пише «PWscf», хоча в деяких випадках це стосується пов'язаних програмних компонентів того самого середовища.
Для локального Центру компетенцій це означає, що робота з даними FAIR не обмежується консультаціями щодо репозиторію. Необхідно створити та підтримувати практичний набір профілів метаданих, шаблонів README, прикладів JSON, таблиць зіставлення, контрольованих словників та зіставлень між локальними термінами та міжнародними стандартами.
Від локального опису до сумісності з EOSC
Практичною помилкою багатьох ініціатив щодо відкритих даних є те, що вони починаються з локальної зручності: як швидко описати набір даних, як заповнити форму, як додати файл до репозиторію. Це необхідний перший крок, але його недостатньо. Якщо локальний опис не можна зіставити з DataCite, Dublin Core, OpenAIRE, DCAT або дисциплінарними стандартами, ресурс залишатиметься слабо помітним за межами локального порталу.
Сумісність з EOSC означає, що кожен локальний профіль метаданих має бути пов'язаний з ширшим контекстом. Назва, автори, організації, ідентифікатор, дата, ліцензія, тип ресурсу та пов'язані публікації мають бути представлені таким чином, щоб їх могли зрозуміти зовнішні служби. Дисциплінарні поля мають бути описані за допомогою чітких схем. Локальні терміни мають бути задокументовані та, по можливості, пов’язані з міжнародними словниками або онтологіями.
Саме тут виникає роль схеми метаданих та реєстру перехресних переходів. Перехресний переход – це таблиця або формальний опис відповідностей між різними схемами метаданих. Наприклад, локальне поле, таке як «лід набору даних», може відповідати ролі автора в DataCite; поле, таке як «пов’язана публікація», може відповідати relatedIdentifier; поле, таке як «тип доступу», може відповідати правам доступу; поле, таке як «етап робочого процесу», може відповідати словнику предметної області або окремому профілю програми. Без таких відповідностей інтеграція залишається ручною. З ними автоматизація стає можливою.
Роль Центру компетенцій
Для Центру компетенцій з управління даними НАНУ ця тема має практичне значення. Центр може стати як місцем для консультацій щодо DataverseUA або принципів FAIR, так і координаційним центром для розробки та підтримки мінімальних профілів метаданих для українських дослідницьких груп. Мета полягає не в тому, щоб створити «власний стандарт замість міжнародних», а в тому, щоб побудувати чіткий місток між місцевими практиками інститутів та стандартами EOSC.
Такий місток має включати кілька елементів. По-перше, основні профілі метаданих для набору даних, програмного забезпечення, робочого процесу, навчальних матеріалів та послуг. По-друге, шаблони README та DMP, пов'язані з цими профілями. По-третє, контрольовані словники для типів ресурсів, дисциплін, методів, програмного забезпечення, ліцензій, режимів доступу та етапів робочого процесу. По-четверте, приклади у форматах, придатних для машинної обробки: JSON, CSV, Markdown та, з часом, SKOS/RDF. По-п'яте, зіставлення та переходи до DataCite, OpenAIRE, DCAT та інших стандартів.
У цій моделі веб-сайт Центру компетенцій перестає бути просто інформаційним ресурсом. Він стає робочою точкою доступу до рекомендацій, шаблонів, словників, навчальних матеріалів та прикладів, які допомагають інститутам готувати дані до публікації, збору, індексації та подальшої інтеграції з EOSC.
Перехід від декларації відкритої науки до EOSC починається з конкретної якості опису об'єктів дослідження. Якщо дані мають стабільні ідентифікатори, чіткі метадані, ліцензії, посилання на публікації, описи робочих процесів та контрольовані терміни, вони можуть стати частиною європейського простору даних FAIR. Якщо ці елементи відсутні, навіть відкритий файл залишається майже невидимим.
Саме тому основні стандарти для метаданих та словникових сервісів слід розглядати як одну з фундаментальних компетенцій сучасного Центру управління дослідницькими даними.