Математика долго оставалась одной из областей, где генеративный ИИ буксовал. С хорошо формализованными задачами и проверяемыми ответами модели умели справляться заметно лучше, чем с открытыми исследовательскими вопросами. Но в 2025 году и особенно в начале 2026-го стали появляться кейсы, в которых большие языковые модели (LLM) помогали математикам находить рабочие ходы, гипотезы и промежуточные шаги в реальных исследованиях. Пока ограничения и пределы возможностей очевидны, но потенциальный вектор развития уже вырисовывается. «За науку» разбирается, для каких задач в математике LLM могут принести пользу.
Источник: ИИ-генерация, ChatGPT
Кнут в шоке
Легендарный Дональд Кнут — «отец алгоритмического анализа», получивший премию Тьюринга еще в 1974 году, — начал свой манускрипт 2026 года фразой, которую трудно было ожидать от автора The Art of Computer Programming («Искусство программирования»): «Шок! Шок!» Кнут несколько недель работал над задачей о направленных гамильтоновых циклах, а потом узнал, что выпущенная менее чем за месяц до этого Claude Opus 4.6 — гибридная языковая модель, которая совмещает генеративную и рассуждающую функции, — уже нашла решение.
Кнут пытался найти способ разбить все ребра графа на три цикла, каждый из которых проходит через все вершины ровно по одному разу. Он решил один частный случай, а его коллега Филип Стапперс нашел примеры, из-за которых гипотеза стала выглядеть правдоподобной и в более общем виде. Именно Стапперс «запромптил» Claude формулировку задачи, которую использовал Кнут. Claude пришел к ответу не сразу. Стапперсу приходилось перезапускать диалог, когда Claude останавливался из-за ошибок; при этом некоторые из предыдущих результатов терялись. Исследователю приходилось снова и снова напоминать языковой модели, что она должна тщательно документировать прогресс.
В целом система пробовала разные подходы и формулировки, проверяла простые конструкции, упиралась в ограничения перебора и несколько раз заходила в тупик. В итоге ей все же удалось найти рабочую схему: важная догадка появилась на 30-м этапе исследования, а конкретный ответ — на 31-м. Затем Стапперс проверил программу для всех нечетных значений параметра от 3 до 101 и каждый раз получил верный результат.
Эта история стала одним из самых ярких примеров того, что большие языковые модели могут быть полезны не только в учебных задачах, но и в актуальных математических исследованиях. Сам Кнут подчеркивает, что строгую доказательную часть еще нужно было дописать, но он все равно пересмотрел свое отношение к генеративному искусственному интеллекту. «Это, безусловно, впечатляющая история успеха, — заключает классик компьютерных наук. — Думаю, дух Клода Шеннона, вероятно, гордится тем, что его имя теперь ассоциируется с такими достижениями».
Свет в конце туннеля
В 2025 году математик из Калифорнийского университета в Лос-Анджелесе Эрнест Рю решил проверить, как новая на тот момент модель GPT-5 может работать с реальными исследовательскими задачами. Ранее он уже пробовал одну из предыдущих версий, ChatGPT-3.5, на простых логических задачах и был разочарован: модель была слишком непредсказуемой и часто давала неверные ответы. Продвинутая GPT-5 обещала более стабильные результаты. Для своего эксперимента Рю выбрал вопрос из теории оптимизации: сходятся ли итерации метода Нестерова к конкретной точке-минимуму, или алгоритм так и не останавливается на одном решении. Метод Нестерова известен с 1983 года и широко используется на практике, например в реконструкции медицинских изображений и повышении четкости фотографий, но вопрос сходимости оставался без ответа несколько десятилетий.
По словам Рю, GPT-5 не изобретала новых математических инструментов, а применяла уже существующие методы и находила результаты из смежных областей, до которых Рю мог бы не добраться самостоятельно. Многие из этих ходов оказывались неверными. Некоторые быстро приводили в тупик. Но сама скорость перебора была важна: там, где человек потратил бы дни на проверку одной линии рассуждений, модель могла накидать серию вариантов за часы. Это похоже на блуждание по лабиринту с напарником, который сразу освещает по 20 ответвлений. Большинство из них ведут в никуда, но тупики обнаруживаются за минуты.
Примерно после 12 часов работы появилось рабочее решение. Несколько ключевых шагов, которые в итоге оказались важны, подсказала именно модель, хотя собрать все доказательство целиком она не смогла, отмечает математик.
Диалог как доказательство
Истории Кнута и Рю, по сути, монологи ученых о том, как они приспособили языковую модель для конкретных задач. Но помимо этого с распространением генеративного ИИ стал развиваться отдельный жанр: научная статья, в основе которой лежит задоку-
ментированный диалог с LLM. Один из примеров — препринт исследователей из Брюссельского свободного университета, вышедший в феврале 2026 года.
Они занимались задачей из линейной алгебры: нужно было доказать гипотезу, сформулированную Андре Раном и Эмили Тэн в 2024 году. Речь шла о специальном семействе матриц с жесткой структурой переходов: каждое состояние системы может либо остаться на месте, либо перейти к следующему по циклу. Вопрос состоял в том, какие комплексные собственные значения возможны для таких матриц, то есть какие типы поведения эта система допускает в принципе.
Работа с ChatGPT-5.2 в режиме Thinking шла по схеме, которую авторы назвали generate, referee, repair: модель предлагает идею, человек ее проверяет, находит слабые места, чинит и снова запускает генерацию. Модель оказалась полезна на том этапе, который труднее всего описать словами: когда еще непонятно, как вообще подступиться к задаче. Исследователи направили ChatGPT в сторону классического тригонометрического метода 1940-х годов, и модель быстро выстроила на его основе общую архитектуру доказательства: как переформулировать задачу, какую стратегию оптимизации применить. Дальше начиналась работа, которую модель делала плохо. Математическое доказательство — это цепочка, где каждый шаг должен строго следовать из предыдущего. Здесь важно не упустить знак, правильно определить, в каком квадранте работает функция, аккуратно пройти через граничные случаи. Ранние версии доказательства, которые предлагал ChatGPT, раз за разом спотыкались именно на этом: арктангенс брался без учета квадранта, в одной из лемм оказалось ложное неравенство, в алгебраических выкладках пропадали промежуточные шаги. Каждую такую ошибку исследователи находили вручную, формулировали как явное требование и снова запускали модель с уточненным заданием.
Авторы отдельно подчеркивают: это не случайные сбои, которые исчезнут с более мощной моделью, а структурная особенность задачи. Большим языковым моделям по силам придумать правдоподобный ход — это быстро и дешево. Но каждый раз проверять, что решение верно, по-прежнему долгий процесс, который всегда требует участия человека. В примечаниях к статье авторы опубликовали ссылки на сохраненные диалоги с моделью. Процесс можно проследить шаг за шагом: где машина помогала, где ошибалась и как исправляла ошибки. Решение сделать диалог частью научной публикации, пожалуй, не менее интересно, чем математический результат.
Автономная математика
Все эти примеры объединяло одно: во всех трех случаях математики сидели за клавиатурой и направляли процесс. В феврале 2026 года DeepMind представила систему, которая делает шаг дальше.
Aletheia — математический исследовательский агент на базе модели Gemini 3 Deep Think. Его архитектура устроена как замкнутый цикл: генератор строит кандидата на решение, верификатор ищет в нем ошибки, и если находит, то система либо исправляет ответ, либо начинает заново. При необходимости агент обращается к поиску Google, чтобы не галлюцинировать, не выдумывать ссылки и не терять точность на сложном материале. Принципиальная деталь: если задача не решается, Aletheia так и говорит. Для нынешних языковых моделей, которые склонны выдавать правдоподобный ответ в любом случае, это действительно выглядит прорывом.
Разработчики привели примеры нескольких публикаций, подготовленных с помощью Aletheia, они отличаются как сложностью, так и степенью вовлечения людей-математиков. Одна статья по арифметической геометрии — разделу математики, где геометрические объекты изучают методами теории чисел, — была написана системой полностью без участия человека. Aletheia самостоятельно вычислила набор числовых характеристик, описывающих структуру таких объектов. Другая работа стала результатом соавторства машины и людей и касалась независимых многочленов в теории графов. Это инструмент для подсчета того, сколькими способами можно выбрать вершины графа так, чтобы никакие две из них не были соединены ребром.
Наконец, Aletheia в полуавтономном режиме разобрала 700 открытых задач из базы гипотез Эрдёша и нашла решения для четырех из них. Авторы оговаривают, что большинство из них, несмотря на десятилетия без ответа, оказались сравнительно несложными. Одно из решений — задача Erdős-1051 — вышло отдельной статьей.
Параллельно DeepMind опубликовала результаты участия Aletheia в конкурсе FirstProof. В его рамках математики предлагали ИИ-агентам задачи из своих исследований, чтобы проверить, на что способны современные системы. Задачи не были открытыми проблемами в полном смысле — у каждой уже существовало решение, просто нигде не опубликованное. Aletheia решила шесть задач из десяти. По четырем оставшимся модель сообщила, что решений не нашла, что, безусловно, само по себе заслуживает отдельного приза за честность.
Что говорят математики
Андрей Соболевский, директор Высшей школы современной математики МФТИ, профессор РАН, предлагает смотреть на эти инициативы без лишней эйфории. Да, LLM уже способны подбрасывать математикам новые идеи, но пока остаются скорее сильным учеником, чем самостоятельным исследователем: проверять, направлять и отсеивать ошибки все еще должен человек.
«Пока примеры использования LLM в математике эпизодичны, но думаю, мы увидим заметный сдвиг и в том, как занимаемся математикой, и в том, как учим студентов. Это напоминает то, как появление препринт-серверов вроде arXiv.org облегчило доступ к научным статьям и обмену идеями, одновременно увеличив поток научной продукции, зачастую плохого качества. Мне кажется, что сейчас мы тоже на пороге радикального облегчения некоторых важных практик исследовательской работы и обвального увеличения низкокачественного контента.
Уже известны примеры того, как с помощью LLM исследователи получали результаты, которые эксперты воспринимают как идейно новые, основанные на неизвестных ранее ходах мысли. Но важно и другое: каждый раз с системой работает специалист, который сам глубоко в теме, и поэтому может на ранней стадии распознать намечающийся успех и, наоборот, не позволить модели начать галлюцинировать. Иногда, но не всегда, успех LLM основан и на толковой и глубокой декомпозиции задачи на отдельные шаги, которую тоже делает специалист. В общем, LLM способны далеко не только на перебор известных подходов, но пока человек — учитель, а LLM — способная ученица.
Нужно помнить, что правдоподобные, но неверные рассуждения, которые порой выдают такие модели, очень опасны. Думаю, что это и будет негативный эффект появления LLM как инструмента. Выходом может быть создание с помощью интерактивных логических систем типа Rocq или Lean большого корпуса верифицированных доказательств, на котором можно обучать специализированные языковые модели. Такой корпус должен быть репрезентативным по всем разделам математики.
Но вне этого «острова» верифицированной математики мы будем наблюдать огромный вал текстов, хорошо имитирующих настоящую абстрактную математику, но ложных или бессодержательных (про похожую, но человеческую «научную» псевдопродукцию Вольфганг Паули в свое время говорил: «Not even wrong!»).
Выход из тупика
Все достоинства и все недостатки LLM в математических исследованиях — следствия общих принципов, по которым они работают. Во многих современных системах модель не пытается решить математическую задачу одним заходом. Сначала она разбирает ее на части: выписывает промежуточные утверждения, намечает каркас решения и выделяет подцели. Потом начинается поиск того, на что можно опереться. Для серьезной математики одной «памяти» модели или удачного угадывания мало, поэтому ее все чаще подключают к библиотеке теорем. Модель ищет, какие определения, леммы и уже доказанные результаты можно использовать на этом шаге.
Часто решающий ход состоит не в вычислении, а в том, чтобы добавить в задачу что-то новое. В геометрии это могут быть вспомогательные точки, прямые или окружности: без них не всегда удается связать условие с тем, что нужно доказать. В других задачах работает обратный ход: не доказывать гипотезу, а пытаться быстро найти контрпример.
Чтобы за всем этим стояли не только убедительные слова, модели все чаще подключают к внешним инструментам. Один путь — записать задачу на формальном языке и проверить, что такая версия не исказила исходное утверждение. Другой — проверять доказательство по шагам, сохраняя уже подтвержденные фрагменты и возвращаясь только туда, где возник сбой.
В итоге модель разбивает задачу на части, подтягивает подходящие теоремы, пробует вспомогательные конструкции или ищет контрпример, а затем отдает результат внешней системе проверки. Ее сила не в том, что она не ошибается. Сила в другом: она быстрее находит тупики, раньше отбрасывает неверные ходы и может продолжать удачную линию рассуждения, не начиная все заново.
Пока у больших языковых моделей в математике есть явный предел возможностей. Даже в задачах, где правильный ответ можно проверить автоматически, они часто ошибаются. Это видно по тесту FormalProofBench: там модель должна записать доказательство на языке Lean для задач университетского уровня, и лучший результат пока — всего 33,5%. То есть модель часто пишет текст, который выглядит как доказательство, но не выдерживает строгой проверки. Есть и другая слабость: модели очень чувствительны к мелочам. В 2025 году исследователи показали, что качество падает даже после простых изменений в условии, например если заменить одни числа на другие. Иногда достаточно добавить одну лишнюю фразу, вроде бы связанную с задачей, и точность ответа проседает на десятки процентов.
Главная проблема сейчас — проверка. Модель может написать рассуждение, которое звучит убедительно, но в длинной цепочке легко пропустить ошибку: потерянный случай, неверный переход, несуществующую лемму. Поэтому следующий шаг связывают не столько с более сильными моделями, сколько с формальной математикой, где каждый шаг можно проверить автоматически. Но и это не панацея: перевод живого математического текста в такую форму остается медленной и трудоемкой работой и по-прежнему требует внешних инструментов и участия человека.