OpenAI привлекла независимую консультативную группу из девяти ведущих мировых ученых для оценки и обнародования достижений своей внутренней передовой модели искусственного интеллекта. Компания выложила в репозитории на GitHub 722 формализованные версии доказательств, которые можно проверить с помощью компьютера.
Каждая из публикаций посвящена решению отдельной открытой математической задачи. Их сгенерировала внутренняя модель OpenAI, которую еще не выпустили. Все результаты разработчики объединили в 372 группы связанных исследований по различным разделам математики.
Часть доказательств OpenAI представила на языке программирования Lean. Он позволяет формально записывать математические доказательства и проверять их правильность с помощью компьютера, поэтому результаты можно независимо проверить.
Вместе с математическими результатами компания опубликовала дополнительную информацию о работе модели. В частности, в репозитории есть 10 описаний ее логических рассуждений, статистика количества попыток решения задач и оценка использованных вычислительных ресурсов. Для получения среднего результата модель использовала вычислительные ресурсы, эквивалентные примерно трем часам работы ChatGPT Pro в режиме рассуждения.
Компания планирует в дальнейшем обновлять репозиторий новыми формализованными доказательствами. OpenAI также обещает совершенствовать математическое изложение, систему цитирования и способ представления результатов, чтобы их было легче оценивать ученым.
Решение открытых математических задач свидетельствует о способности ИИ строить сложные цепочки рассуждений, а инструменты вроде языка Lean позволяют четко верифицировать эти доказательства. Однако, как говорится в публикации издания Nature Machine Intelligence, успехи в математике не означают надежности алгоритмов в медицине или критических системах. Обнародованный массив данных от OpenAI демонстрирует беспрецедентный масштаб автоматизированных исследований, но его реальная ценность для науки будет зависеть от того, подтвердит ли независимая проверка ученых новизну и корректность этих результатов.
