Невдовзі після того, як Хантер Лайтмен приєднався до OpenAI в якості дослідника у 2022 році, він став свідком запуску ChatGPT, одного з найшвидше зростаючих продуктів. В той же час Лайтмен працював у команді, яка навчала моделі OpenAI вирішувати задачі із математичних олімпіад для середніх шкіл.
Сьогодні ця команда, відома як MathGen, вважається ключовою для зусиль OpenAI з розробки моделей штучного інтелекту, які здатні виконувати обчислення аналогічно людині. Хоча моделі OpenAI все ще далеки від ідеалу — останні AI-системи компанії все ще генерують неправдимі відповіді і мають труднощі з виконанням складних завдань.
Але, безсумнівно, їхні сучасні моделі суттєво покращилися в математичному мисленні. Одна з моделей OpenAI нещодавно отримала золоту медаль на Міжнародній математичній олімпіаді (IMO), конкурсі для найбільш обдарованих учнів середніх шкіл. OpenAI вважає, що ці можливості мислення можуть бути поширені на інші теми, в результаті чого створять універсальні агенти, про яких компанія завжди мріяла.
ChatGPT з’явився як несподіванка — скромний дослідницький проект перетворився на популярний споживчий продукт — але агенти OpenAI є результатом багаторічних цілеспрямованих зусиль компанії.
Відродження навчання з підкріпленням
Поява моделей і агентів розуміння OpenAI пов’язана з методом машинного навчання, відомим як навчання з підкріпленням (RL). RL надає зворотний зв’язок моделі штучного інтелекту про те, чи були її рішення правильними у змодельованому середовищі.
RL використовувалося протягом десятиліть. Наприклад, у 2016 році, приблизно через рік після заснування OpenAI у 2015 році, система штучного інтелекту, створена компанією Google DeepMind з використанням RL, AlphaGo, привернула увагу світової спільноти, перемігши чемпіона світу в настільній грі Го.
На той момент один з перших співробітників OpenAI, Андрій Карпати, почав міркувати, як використати RL для створення агента штучного інтелекту, здатного користуватися комп’ютером. Але OpenAI знадобилося кілька років, щоб розробити необхідні моделі та методи навчання.
До 2018 року OpenAI була піонером у розробці своєї першої великої мовної моделі в серії GPT, яка була попередньо навчена на великих обсягах даних з Інтернету та великих кластерах графічних процесорів. Моделі GPT досягали успіхів у обробці тексту, що зрештою призвело до створення ChatGPT, але мали труднощі з базовою математикою.
Лише в 2023 році OpenAI досягла прориву, спочатку названого “Q*”, а потім “Strawberry”, об’єднуючи LLM, RL та методи, відомі як “обчислення під час тестування”. Останнє дало моделям додатковий час та обчислювальні ресурси для планування та вирішення задач із перевіркою їхніх кроків перед наданням відповіді.
Це дозволило OpenAI ввести новий підхід, відомий як “ланцюг думок” (CoT), який покращив продуктивність AI у вирішенні математичних запитів, з якими моделі раніше не стикалися.
Хоча ці техніки в окремості не були новими, OpenAI унікально об’єднала їх для створення Strawberry, що безпосередньо призвело до розробки o1. OpenAI швидко зрозуміла, що можливості планування та перевірки фактів моделей розуміння можуть бути корисні для створення AI-агентів.
Масштабування розуміння
З моделями розуміння AI OpenAI виокремила два нових напрямки, які дозволили поліпшити моделі AI: використання більшої обчислювальної потужності під час після навчання моделей AI та надання моделям більше часу та ресурсів для обробки під час відповіді на запитання.
Невдовзі після прориву з Strawberry у 2023 році OpenAI сформувала команду “Агенти” під керівництвом дослідника OpenAI Даніеля Селсема для подальшого просування в цьому новому напрямку, стверджують два джерела. Хоча команда називалася “Агенти”, OpenAI спочатку не розмежовувала моделі розуміння та агентів так, як ми їх розуміємо сьогодні. Компанія просто прагнула створити AI-системи, здатні виконувати складні завдання.
Врешті-решт, робота команди Селсема стала частиною більшого проєкту зі створення моделі розуміння o1, в якому брали участь ключові фігури, включно з співзасновником OpenAI Іллею Сутскевером, керівником наукових досліджень Марком Ченом та головним науковцем Якубом Пачоцкі.
OpenAI довелося перерасподілити цінні ресурси — насамперед таланти та графічні процесори — для створення o1. За всю історію OpenAI дослідники змушені були вести переговори з керівниками компанії, щоб отримати ресурси; демонстрація проривів була надійним способом їх забезпечення.
Деякі колишні співробітники стверджують, що місія стартапу щодо розробки AGI була ключовим фактором у досягненні проривів у моделях розуміння AI. Зосередившись на варіанті розумних моделей AI, а не на продуктах, OpenAI змогла пріоритетизувати o1 над іншими зусиллями. Такий тип значних інвестицій в ідеї не завжди був можливий у конкурентних лабораторіях AI.
Рішення спробувати нові методи навчання виявилося передбачливим. Наприкінці 2024 року кілька провідних лабораторій AI почали спостерігати спад прибутковості від моделей, створених через традиційне підготовче масиви даних. Сьогодні велика частина імпульсу в сфері AI походить від революцій в моделях розуміння.