Второй кризис. На этот раз не оснований
Тао начинает с истории, которая хорошо кончилась. Несколько веков математики спокойно работали, не умея точно сказать, что такое множество, число или само доказательство: эти вопросы отдавали философам. В начале XX века выяснилось, что так больше нельзя — наивная теория множеств противоречила сама себе, а Гёдель показал, что достаточно выразительная формальная система не может доказать собственную непротиворечивость.
Тридцать лет турбулентности закончились не катастрофой, а приобретением: явным, строгим, стандартизованным фундаментом, который можно проверять, преподавать и — как выяснилось позже — механизировать. Именно поэтому сегодня вообще возможны машинные доказательства.
Сейчас, считает Тао, начинается сопоставимая по силе турбулентность. Но под нагрузкой оказался не фундамент математической истины, а неписаный каркас ценностей и практик: что считать вкладом, что вознаграждать, что считать понятым — и кто (или что) считается сделавшим работу.
Историческая рамка: наивные основания работали веками, вопрос «что такое множество/число/доказательство» делегировался философам. Парадокс Рассела (1901)[14] и теоремы Гёделя (1931)[8] сделали неявные допущения предметом ревизии; кризис оснований 1900–1930 закончился явной, строгой, стандартизованной рамкой, которую можно проверять, преподавать и, как оказалось, механизировать.
Тезис Тао: мы входим в период сопоставимой турбулентности, но стресс-тестируется не фреймворк истины, а имплицитный фреймворк ценностей и практик — определение вклада, система вознаграждений, критерий «понято», атрибуция авторства. Вывод по аналогии: неписаные цели придётся кодифицировать явно, и сообщество после этого станет устойчивее.
Первый подвопрос — про способности — вынесен за скобки
Главный вопрос эссе: как математическому сообществу реагировать на ИИ и на его реальные и заявленные способности. Тао сразу оговаривается: вопрос не математический — он метаматематический, а ещё политический, этический, социологический и культурный. Чистой логикой его не закрыть.
Ответ упирается в подвопрос: а что модели вообще смогут? Тао формулирует его как «гипотезу со свободными параметрами»: в какой-то момент какие-то инструменты за какие-то деньги, при каком-то человеческом надзоре, будут решать какие-то исследовательские задачи в каких-то областях с какой-то вероятностью успеха. Подставляя разные значения, получаем десятки разных гипотез — от безобидной до радикальной.
Именно вокруг них идёт весь публичный спор, и Тао честно говорит: он сам потратил на этот спор много лекций и постов. Но данные, на которых спор ведётся, плохие. Успехи объявляют, провалы — нет. Число попыток, объём человеческих подпорок, потраченный компьют, степень «загрязнения» задачи прошлой литературой обычно не раскрывают. А ещё истинность гипотезы регулярно путают с её желательностью: люди спорят не о том, случится ли это, а о том, хотят ли они этого.
Единственное исключение, которое он приводит, — проект First Proof: независимая проверка на действительно новых задачах.
Вопрос 2.1 (Community Response Question) — как сообществу реагировать на реальные и заявленные способности ИИ. Тао подчёркивает статус вопроса: не математический, а метаматематический, политический, этический, социологический и культурный; язык гипотез и лемм используется как средство прояснения структуры, не как метод решения.
Гипотеза 3.1 задана шаблонно, с набором свободных параметров («some» в каждой позиции: срок, стоимость, уровень надзора, класс задач, область, доля успехов, качество). Тао работает только с грубым делением на слабые и сильные формы: опровержение слабых форм означало бы, что можно работать как раньше; истинность сильных делает нынешнюю культуру нежизнеспособной — особенно при сохранении приоритета «максимум решённых задач».
Методологическая претензия к доступным данным: reporting bias (публикуются успехи), нераскрытые переменные (число попыток, объём скаффолдинга, компьют, контаминация задачи литературой), плюс систематическое смешение истинности гипотезы с её желательностью.
First Proof, вторая партия[6,7]. Десять исследовательских задач от практикующих математиков из разных областей; решения известны автору задачи и нигде не публиковались. Оценка в контролируемых условиях на четырёх ИИ-системах, на моделях, публично доступных по состоянию на 28 мая 2026. Решения судили эксперты — и на корректность, и на качество изложения. Семь задач из десяти получили хотя бы одну проходную оценку (безупречно или с мелкими правками) хотя бы от одной системы. Стоимость — от десятков до сотен долларов за задачу. Планируются следующие партии.
Чего математика хочет на самом деле
Приняв это допущение, Тао переходит к вопросу, который от него ортогонален: каковы точные цели и ценности математического сообщества? Не те, что мы называем публике, студентам и грантодателям, а те, которые мы реально оптимизируем.
Раньше этот вопрос отдавали историкам, философам и социологам науки — как когда-то отдавали им вопрос «что такое доказательство». Теперь такой роскоши не будет.
Официального списка целей не существует, но примерно он такой: решать открытые задачи; строить новые теории и техники; понимать окружающий мир; поддерживать сообщество; учить следующее поколение и давать ему вести предмет дальше; пополнять общее накопленное знание; создавать долговечные вещи эстетической ценности.
Ключевое наблюдение: исторически эти цели тянули в одну сторону. Решая трудную задачу, вы попутно изобретали технику, вокруг техники собиралась группа, студенты в ней обучались, писались учебники, теория оказывалась применимой в другом месте. Поэтому одну-две цели можно было использовать как удобный прокси для остальных, а остальные — не проговаривать.
Далее — при Гипотезе 4.1. Вопрос 5.1 (Goals and Values Question): не декларируемые цели, а те, что фактически оптимизируются. Исторически делегирован гуманитарным дисциплинам; под рабочей гипотезой делегирование становится невозможным. Тао настаивает, что ревизия полезна независимо от статуса гипотезы.
Частичный список целей: решение задач (чистых и прикладных); построение теорий, структур и техник; понимание мира; поддержание сообщества; подготовка следующего поколения и передача ему направления; вклад в кумулятивную сеть знания; создание работ непреходящей эстетической ценности.
Существенно: цели исторически положительно коррелированы, поэтому любая из них служила рабочим прокси для остальных (см. также[18]). Корреляция — не свойство целей, а свойство режима, в котором доказательства дефицитны.
Закон Гудхарта и почему ИИ его включает
Когда мера становится целью, она перестаёт быть хорошей мерой. Гудхарт в формулировке Стратерн[16,9]
ИИ, по Тао, запускает этот эффект по двум независимым причинам.
Техническая. Генеративные модели неукоренены: они оптимизируют внешний вид удовлетворительного ответа, а не то свойство, которое ответ должен был бы обозначать. Поэтому они необычайно хорошо находят зазор между мерой и тем, что мера меряет.
Экономическая. Деньги индустрии награждают демонстрируемое, цитируемое, бенчмаркуемое достижение — ровно на тех показателях, которые математика исторически использовала как прокси.
Результат: цели, которые раньше двигались вместе, начинают расходиться.
Два независимых механизма, запускающих закон Гудхарта. (1) Технический: генеративный ИИ неукоренён (ungrounded) — оптимизирует наблюдаемый признак удовлетворительности вывода, а не индицируемое им свойство, и потому эффективно эксплуатирует зазор между метрикой и измеряемым. (2) Экономический: структура финансовых стимулов индустрии вознаграждает демонстрируемый, цитируемый и бенчмаркуемый результат — именно на исторических прокси-метриках сообщества.
Следствие: чрезмерная оптимизация одной-двух целей разрушает корреляцию и разводит ранее выровненные цели (рис. 1 и 2 в оригинале; схема умышленно упрощена — реальное пространство существенно большей размерности).
Кейс: что значит «решить задачу»
Чтобы разговор не остался абстрактным, Тао берёт одну составляющую профессии — решение задач. Не потому, что она главная (построение теории, преподавание и наставничество как минимум не менее важны), а потому, что она сильнее всего попадает под удар и потому, что именно здесь неявные цели дальше всего разошлись с явными.
Дальше он пять раз переписывает формулировку цели. Каждый раз — потому что предыдущая версия ломается.
Кейс выбран не как главная часть профессии (построение теорий требует отдельного разбора, как и преподавание, наставничество и сервисная работа), а как наиболее чувствительный к рабочей гипотезе и как область максимального расхождения имплицитных и эксплицитных целей.
Далее — итеративное уточнение Цели 6.1 → 6.5. Каждая итерация вводится отказом предыдущей.
Провал, который уже не гипотеза
Формально проверенное доказательство — это доказательство, корректность которого больше не зависит от репутации и добросовестности автора. Отличное свойство. Казалось бы, на этом вопрос закрыт: машина проверила — значит, всё в порядке. Но верификация закрывает вопрос об истинности и не закрывает вопрос о понимании.
Что если модель выдаст длинное доказательство, проверенное как верное, но которого не понимает никто — включая людей, которые её запускали? Это уже происходит: в базе задач Эрдёша[5] накопились десятки ИИ-сгенерированных заявок. Многие, вероятно, верны. Но в значительной части случаев ни один эксперт не вызвался проверить и поручиться, а в нескольких случаях сами приславшие заявили, что не обладают нужной квалификацией.
Мы вплотную подошли к ситуации, когда крупный результат будет верифицирован — и при этом ни один человек не сможет его объяснить.
Автоформализация на языках систем проверки доказательств — Rocq, HOL, Lean —[10,12] ускоряет и генерацию, и верификацию; формально верифицированное доказательство — то, чья корректность не зависит от репутации и добросовестности автора.
Новый режим отказа на шаге 6.3: верифицированное, но не понятое доказательство. Эмпирика: база Эрдёша[5] содержит десятки ИИ-сгенерированных заявок; в существенной доле случаев отсутствует эксперт, готовый верифицировать и поручиться, в ряде случаев сами отправители декларируют недостаток квалификации.
Изложение тоже можно переоптимизировать
Это, по-моему, самая недооценённая мысль эссе. У нынешних моделей с изложением смешанный результат: орфография, грамматика и вёрстка почти безупречны — можно сказать, слишком безупречны, — но текст подолгу топчется на тривиальностях и пробегает, а иногда и смазывает, самое интересное. Результат не помещают в контекст прошлых работ и не дают высокоуровневого обзора, по которому читатель решил бы, стоит ли текст его времени.
Дальше — неожиданный ход. Доказательство может быть написано слишком гладко: рутинные шаги и по-настоящему трудные поданы как одинаково лёгкие для усвоения.
В человеческом тексте трудные места сохраняют естественное трение: извиняющееся замечание, необычно аккуратная лемма, смена обозначений, абзац, который явно переписывали несколько раз. Это трение информативно. Оно сигналит, где притормозить, и это один из главных каналов, по которым передаётся неявное знание области.
Чрезмерно отполированный машиной текст сдирает и «искусственное» трение (опечатки, кривые фразы, беспорядок), и естественное. Остаётся текст, который легко читать и на котором трудно учиться. Парадоксально, но «огрехи» человеческого изложения бывают читателю прямой пользой.
Иллюстрация в статье — снимок страницы работы Бургейна 1991 года[3], исчёрканной молодым и очень раздражённым Тао. Продираясь через эти тексты, он и понял способ мышления Бургейна — и потом сам искал его статьи, чтобы читать.
Текущее состояние proof exposition у моделей: орфография, грамматика, форматирование — практически безупречны (Тао замечает в сноске, что, возможно, слишком); при этом типична диспропорция внимания — длинные проходы по тривиальностям, беглое или затемняющее изложение содержательных шагов, отсутствие позиционирования в литературе и отсутствие high-level обзора.
Нетривиальный тезис: exposition — переоптимизируемая цель. Доказательство может быть too slickly written, когда рутинные и трудные шаги предъявлены как равно усвояемые. Естественное трение человеческого текста (извиняющиеся ремарки, избыточно осторожная лемма, смена нотации, многократно переписанный абзац) несёт сигнал о рельефе аргумента и служит каналом передачи tacit knowledge. ИИ-полировка снимает и артефактное трение, и естественное; итог — легко читаемый и плохо обучающий текст. Ср. рис. 3 (исчёрканная страница Бургейна[3]) и[19,17].
Мера нашего успеха — в том, помогает ли сделанное нами людям думать о математике яснее. Тезис Тёрстона (1994)[21], в пересказе
Принятие и канонизация
Корректности и читаемости мало. Чтобы доказательство действительно вошло в область, другие математики должны его переварить и встроить в свою работу. Авторы могут этому помочь — рассказывая об инсайтах, ложных стартах и историях того периода, когда они бились над задачей. ИИ-инструменты о своём процессе решения непрозрачны, особенно проприетарные, у которых внутренности — коммерческая тайна.
Принятие сообществом по своей природе медленное и человеческое. Наша издательская инфраструктура держится на редакторах и рецензентах, работающих добровольно и почти без признания. Эта работа считается менее престижной, чем производство доказательств, — но именно она превращает индивидуальные достижения в коллективный прогресс.
Фильтры на входе журналов Тао считает допустимыми: пусть автоматика отсеивает заявки с недостаточной верификацией, отсутствующей атрибуцией или бессвязным изложением — примерно как сегодня работает антиплагиат. Это сберегло бы дефицитный ресурс экспертного внимания. Но прохождение фильтра не заменяет принятия, и убрать человека из процесса рецензирования, по его мнению, нельзя.
Последняя стадия — канонизация: результат переформулируют в естественной общности, дают ему правильное доказательство вместо первого, связывают с соседними и впитывают в стандартный инструментарий, в учебники, в то, чему учат студентов. Самая медленная стадия, требующая широкого обсуждения, и наименее поддающаяся автоматизации. И, по Тао, самая ценная: многие приложения математики становятся возможны только после того, как теория переварена таким образом.
И тут — сильнейший ход эссе. Успехи ИИ в математике сами держатся на канонических теориях, которые люди веками строили и перестраивали. Обучающие данные этих моделей буквально и есть продукт канонизации.
Цель 6.4: принятие сообществом. Авторы могут ускорять переваривание результата, проговаривая инсайты, ложные старты и историю работы над задачей; современные системы непрозрачны относительно собственного процесса, особенно проприетарные. Принятие — внешний процесс, не оптимизируемый авторами и их инструментами.
Инфраструктура публикации опирается на добровольный и никак не отмечаемый труд редакторов и рецензентов; по статусу этот труд ниже производства доказательств, по функции — механизм конвертации индивидуальных результатов в коллективный прогресс. автоматический отсев допустим как фильтр (по аналогии с проверкой на плагиат) для экономии экспертного внимания, но не как замена принятию; удаление человеческого рецензента из процесса Тао отвергает.
Цель 6.5: канонизация — переформулировка в естественной общности, замена первого доказательства правильным, встраивание в связи с соседними результатами и в стандартный инструментарий. Самая медленная стадия, требующая широкого коллективного согласия, наименее поддающаяся оптимизации и, по оценке Тао, наиболее ценная. Рефлексивный аргумент: обучающие данные фронтир-моделей суть выход процесса канонизации, то есть эффективность ИИ в математике производна от него.
От дефицита доказательств к их изобилию
Если рабочая гипотеза верна, то без изменений в политике и культуре по всему конвейеру пойдут заторы — Тао подбирает для них менее лестное слово: несварение доказательств.
- генерациядоказательства копятся быстрее, чем их успевают проверять
- верификацияпроверенные копятся быстрее, чем их успевают внятно записать
- рецензиядаже корректные и хорошо написанные перегружают систему, живущую на волонтёрском экспертном труде
- канони опубликованных слишком много, чтобы довести их до окончательной формы
Коротко: мы переходим из эпохи дефицита доказательств в эпоху их изобилия. Почти все наши институты — журналы, конвенции о приоритете, критерии найма и продвижения, премии, само понятие исследовательской программы — проектировались в расчёте на дефицит. Странно ожидать, что они хорошо себя поведут при изобилии.
Признаки несварения были и до ИИ: рост объёма литературы, растущая длина и специализация крупных доказательств, задокументированная перегрузка рецензирования. ИИ эти напряжения не создаёт — он их резко усиливает.
Прогноз при истинности рабочей гипотезы и отсутствии политических/культурных изменений — импедансные рассогласования на каждом стыке конвейера с рис. 4: генерация обгоняет верификацию, верификация обгоняет экспозицию, поток корректных и хорошо написанных текстов перегружает peer review на волонтёрском экспертном ресурсе, объём опубликованного превышает пропускную способность канонизации.
Фазовый переход: от дефицита доказательств к их изобилию (proof scarcity → proof abundance). Институциональный дизайн (журналы, конвенции приоритета, критерии найма и продвижения, премии, сама конструкция «исследовательской программы») исходил из дефицита; деградация под изобилием ожидаема. Предшествующие симптомы — рост объёма литературы, длина и специализация крупных доказательств, задокументированная нагрузка на рефери — датируются до появления современных систем; ИИ выступает усилителем, а не источником.
Что с этим делать
Полной программы Тао не предлагает. Он указывает на Лейденскую декларацию об искусственном интеллекте и математике[11] — она вышла в июне 2026, одобрена Международным математическим союзом, выросла из семинара 2025 года в Lorentz Center и содержит двадцать три рекомендации: отдельным математикам, организациям и фондам, политикам.
Программа не формулируется; в качестве отправной точки указана Лейденская декларация[11] (июнь 2026, одобрена IMU, выросла из семинара Lorentz Center 2025): 23 рекомендации трём адресатам — отдельным математикам, организациям и фондам, регуляторам. Тао комментирует четыре из тех, что адресованы отдельным математикам.
- раскрытиеПрозрачно раскрывать использование инструментов — языковых моделей, систем машинного обучения, программ проверки доказательств и прочего софта. Отдельный раздел в статье. Сценарий, которого надо избежать любой ценой: авторы используют ИИ скрытно, чтобы не нарваться на осуждение коллег.
- рецензияОблегчать работу рецензенту: раскрывать инструменты, давать точные и полные ссылки на предшествующие результаты, приводить формальные доказательства там, где это осмысленно.
- авторствоПризнание авторства и ответственность остаются за людьми и не передаются автоматическим системам. ИИ может заслонить коллективный человеческий труд, стоящий за результатом, но не заменяет его.
- атрибуцияИзвестная слабость инструментов в приписывании идей создаёт встречную обязанность: активно искать и указывать источники. Если удовлетворительная атрибуция невозможна — сказать об этом в публикации прямо.
Если авторы не могут убедительно показать, что способны сделать по своим результатам ясный экспертный доклад — корректный и с правильной атрибуцией, — результат публиковать не следует. Доказательство, которое ни один человек не в состоянии объяснить, следует считать неполным, даже если оно формально верифицировано.
Более широкий тезис: снизить культурный вес генерации доказательств и особенно первенства («кто первый решил») — и повысить вес переваривания: изложения, рецензирования, публикации, канонизации. Тао ссылается на эссе Бессиса о конце «теоремной экономики»[2].
Выводы, предупреждает он, будут разными для разных областей. В образовании и подготовке молодых математиков придётся жёстко ограничивать ИИ: цель обучения не достигается производством правильных домашних работ. В других местах, наоборот, придётся брать инициативу и определять практики использования на своих условиях, а не на условиях, заданных вендорами. Понадобятся и новые форматы: коллаборативные проекты формализации, структурированные базы задач, площадки для экспозиции и для публикации отрицательных и частичных результатов.
Нормативный тезис: снизить культурный вес производства доказательств и приоритета первенства, повысить — вес их переваривания (экспозиция, рецензирование, публикация, канонизация); ср. Бессис о падении theorem economy[2].
Дифференциация по областям: в образовании и подготовке исследователей — жёсткое ограничение инструментов (цель подготовки математика не достигается генерацией корректных домашних работ); в исследовательских практиках — сообщество само определяет практику использования, а не вендоры. Требуются новые инфраструктуры: коллаборативная формализация, структурированные базы задач, площадки для экспозиции и для публикации отрицательных и частичных результатов.
Математики обязаны поддерживать серьёзную научную журналистику и участвовать в публичном обсуждении — объясняя и помещая в контекст результаты, полученные с помощью ИИ. Особенно в собственных подобластях, где оценить заявленную глубину и значимость результата можно только со специальным знанием. Лейденская декларация, рекомендация об участии в публичном дискурсе — в пересказеЕдинственная рекомендация, адресованная не только математикам. Оценивать глубину результата без специалиста нельзя — а специалиста надо звать, и он должен согласиться прийти.