Збір даних для навчання Національної великої мовної моделі (LLM) в Україні продовжується, з бета-тестуванням, запланованим на весну 2026 року. Цю важливу інформацію оприлюднив Михайло Федоров, перший віцепрем’єр-міністр та міністр цифрової трансформації, через соціальну мережу.
Згідно з повідомленням, поточний етап проєкту зосереджений на зборі анонімних даних, які є критично важливими для навчання мовної моделі. Однак простого збору інформації з інтернету недостатньо. Тому команда співпрацює з державними установами, медіа, університетами і різними організаціями для накопичення терабайтів унікальних даних, що забезпечать якість майбутньої моделі.
Крім збору даних, фахівці вже активно працюють над розробкою тестів для оцінки та вдосконалення мовної моделі. Це дозволить моніторити ефективність та безпеку LLM на всіх етапах її розвитку. Протягом найближчого місяця планується створення першої бази текстів для тренування моделі, а також удосконалення токенізатора — ключового інструмента, який розбиває слова на елементи для більш швидкої та продуктивної обробки мови.
Крім того, у січні розпочнеться голосування у додатку «Дія» на тему вибору назви для національної моделі. Це ще один крок у напрямі підвищення громадської участі в проєкті.
Нагадаємо, що на початку літа 2025 року Міністерство цифрової трансформації України уклало меморандум з компанією «Київстар» о спільній роботі над створенням LLM, яка стане основою для впровадження штучного інтелекту у державний сектор та бізнес. Цей проєкт обіцяє стати важливим кроком у розвитку української технологічної інфраструктури.