arXiv:2608.16753v1 · math.HO · 17 августа 2026

Математикав эпохуИИ

Тао предлагает не спорить о том, на что способны модели. Он предлагает допустить, что способны — и задать вопрос, который от этого спора не зависит: чего на самом деле хочет математика и что она считает сделанной работой.

Гипотеза 4.1 · рабочая

Разумно сильная версия гипотезы о способностях верна: ИИ-инструменты в обозримом будущем научатся выполнять заметную долю исследовательских математических задач — с разумным уровнем успеха, качества, надзора и стоимости.

Тао просит не верить в это и не хотеть этого. Просто принять на время чтения — весь дальнейший разбор условный.

Пересказ
Гипотеза 4.1 · принята на время чтения Разумно сильная версия гипотезы о способностях верна: ИИ-инструменты в обозримом будущем научатся выполнять заметную долю исследовательских математических задач — с разумным уровнем успеха, качества, надзора и стоимости. Всё, что идёт после §3, читается при этом условии. Тао не просит в это верить и не просит этого хотеть.
§ 1

Второй кризис. На этот раз не оснований

Тао начинает с истории, которая хорошо кончилась. Несколько веков математики спокойно работали, не умея точно сказать, что такое множество, число или само доказательство: эти вопросы отдавали философам. В начале XX века выяснилось, что так больше нельзя — наивная теория множеств противоречила сама себе, а Гёдель показал, что достаточно выразительная формальная система не может доказать собственную непротиворечивость.

Тридцать лет турбулентности закончились не катастрофой, а приобретением: явным, строгим, стандартизованным фундаментом, который можно проверять, преподавать и — как выяснилось позже — механизировать. Именно поэтому сегодня вообще возможны машинные доказательства.

Сейчас, считает Тао, начинается сопоставимая по силе турбулентность. Но под нагрузкой оказался не фундамент математической истины, а неписаный каркас ценностей и практик: что считать вкладом, что вознаграждать, что считать понятым — и кто (или что) считается сделавшим работу.

Историческая рамка: наивные основания работали веками, вопрос «что такое множество/число/доказательство» делегировался философам. Парадокс Рассела (1901)[14] и теоремы Гёделя (1931)[8] сделали неявные допущения предметом ревизии; кризис оснований 1900–1930 закончился явной, строгой, стандартизованной рамкой, которую можно проверять, преподавать и, как оказалось, механизировать.

Тезис Тао: мы входим в период сопоставимой турбулентности, но стресс-тестируется не фреймворк истины, а имплицитный фреймворк ценностей и практик — определение вклада, система вознаграждений, критерий «понято», атрибуция авторства. Вывод по аналогии: неписаные цели придётся кодифицировать явно, и сообщество после этого станет устойчивее.

Аналогия с кризисом оснований работает и как утешение, и как обещание: тогда тоже было страшно, а вышел инструмент. Проверить, не слишком ли она удобная.
§ 2–3

Первый подвопрос — про способности — вынесен за скобки

Главный вопрос эссе: как математическому сообществу реагировать на ИИ и на его реальные и заявленные способности. Тао сразу оговаривается: вопрос не математический — он метаматематический, а ещё политический, этический, социологический и культурный. Чистой логикой его не закрыть.

Ответ упирается в подвопрос: а что модели вообще смогут? Тао формулирует его как «гипотезу со свободными параметрами»: в какой-то момент какие-то инструменты за какие-то деньги, при каком-то человеческом надзоре, будут решать какие-то исследовательские задачи в каких-то областях с какой-то вероятностью успеха. Подставляя разные значения, получаем десятки разных гипотез — от безобидной до радикальной.

Именно вокруг них идёт весь публичный спор, и Тао честно говорит: он сам потратил на этот спор много лекций и постов. Но данные, на которых спор ведётся, плохие. Успехи объявляют, провалы — нет. Число попыток, объём человеческих подпорок, потраченный компьют, степень «загрязнения» задачи прошлой литературой обычно не раскрывают. А ещё истинность гипотезы регулярно путают с её желательностью: люди спорят не о том, случится ли это, а о том, хотят ли они этого.

Единственное исключение, которое он приводит, — проект First Proof: независимая проверка на действительно новых задачах.

Вопрос 2.1 (Community Response Question) — как сообществу реагировать на реальные и заявленные способности ИИ. Тао подчёркивает статус вопроса: не математический, а метаматематический, политический, этический, социологический и культурный; язык гипотез и лемм используется как средство прояснения структуры, не как метод решения.

Гипотеза 3.1 задана шаблонно, с набором свободных параметров («some» в каждой позиции: срок, стоимость, уровень надзора, класс задач, область, доля успехов, качество). Тао работает только с грубым делением на слабые и сильные формы: опровержение слабых форм означало бы, что можно работать как раньше; истинность сильных делает нынешнюю культуру нежизнеспособной — особенно при сохранении приоритета «максимум решённых задач».

Методологическая претензия к доступным данным: reporting bias (публикуются успехи), нераскрытые переменные (число попыток, объём скаффолдинга, компьют, контаминация задачи литературой), плюс систематическое смешение истинности гипотезы с её желательностью.

Данные, на которые Тао ссылается

First Proof, вторая партия[6,7]. Десять исследовательских задач от практикующих математиков из разных областей; решения известны автору задачи и нигде не публиковались. Оценка в контролируемых условиях на четырёх ИИ-системах, на моделях, публично доступных по состоянию на 28 мая 2026. Решения судили эксперты — и на корректность, и на качество изложения. Семь задач из десяти получили хотя бы одну проходную оценку (безупречно или с мелкими правками) хотя бы от одной системы. Стоимость — от десятков до сотен долларов за задачу. Планируются следующие партии.

7 из 10 — цифра, которую утащат в заголовки. В ней спрятано «хотя бы одна система из четырёх» и выборка в десять задач, выбранных самими авторами. Не заголовок, а первая приличная точка данных.
§ 4–5

Чего математика хочет на самом деле

Условие, под которым идёт всё дальнейшее Допустим, что ИИ действительно научится решать заметную долю исследовательских задач — с приемлемым качеством, надзором и ценой (гипотеза 4.1). Не «это случится», а «допустим, случилось». Дальше — разбор последствий, а не прогноз.

Приняв это допущение, Тао переходит к вопросу, который от него ортогонален: каковы точные цели и ценности математического сообщества? Не те, что мы называем публике, студентам и грантодателям, а те, которые мы реально оптимизируем.

Раньше этот вопрос отдавали историкам, философам и социологам науки — как когда-то отдавали им вопрос «что такое доказательство». Теперь такой роскоши не будет.

Официального списка целей не существует, но примерно он такой: решать открытые задачи; строить новые теории и техники; понимать окружающий мир; поддерживать сообщество; учить следующее поколение и давать ему вести предмет дальше; пополнять общее накопленное знание; создавать долговечные вещи эстетической ценности.

Ключевое наблюдение: исторически эти цели тянули в одну сторону. Решая трудную задачу, вы попутно изобретали технику, вокруг техники собиралась группа, студенты в ней обучались, писались учебники, теория оказывалась применимой в другом месте. Поэтому одну-две цели можно было использовать как удобный прокси для остальных, а остальные — не проговаривать.

Далее — при Гипотезе 4.1. Вопрос 5.1 (Goals and Values Question): не декларируемые цели, а те, что фактически оптимизируются. Исторически делегирован гуманитарным дисциплинам; под рабочей гипотезой делегирование становится невозможным. Тао настаивает, что ревизия полезна независимо от статуса гипотезы.

Частичный список целей: решение задач (чистых и прикладных); построение теорий, структур и техник; понимание мира; поддержание сообщества; подготовка следующего поколения и передача ему направления; вклад в кумулятивную сеть знания; создание работ непреходящей эстетической ценности.

Существенно: цели исторически положительно коррелированы, поэтому любая из них служила рабочим прокси для остальных (см. также[18]). Корреляция — не свойство целей, а свойство режима, в котором доказательства дефицитны.

Закон Гудхарта и почему ИИ его включает

Когда мера становится целью, она перестаёт быть хорошей мерой. Гудхарт в формулировке Стратерн[16,9]

ИИ, по Тао, запускает этот эффект по двум независимым причинам.

Техническая. Генеративные модели неукоренены: они оптимизируют внешний вид удовлетворительного ответа, а не то свойство, которое ответ должен был бы обозначать. Поэтому они необычайно хорошо находят зазор между мерой и тем, что мера меряет.

Экономическая. Деньги индустрии награждают демонстрируемое, цитируемое, бенчмаркуемое достижение — ровно на тех показателях, которые математика исторически использовала как прокси.

Результат: цели, которые раньше двигались вместе, начинают расходиться.

Два независимых механизма, запускающих закон Гудхарта. (1) Технический: генеративный ИИ неукоренён (ungrounded) — оптимизирует наблюдаемый признак удовлетворительности вывода, а не индицируемое им свойство, и потому эффективно эксплуатирует зазор между метрикой и измеряемым. (2) Экономический: структура финансовых стимулов индустрии вознаграждает демонстрируемый, цитируемый и бенчмаркуемый результат — именно на исторических прокси-метриках сообщества.

Следствие: чрезмерная оптимизация одной-двух целей разрушает корреляцию и разводит ранее выровненные цели (рис. 1 и 2 в оригинале; схема умышленно упрощена — реальное пространство существенно большей размерности).

Рис. 1 и 2 из статьи: что происходит с целями, когда одну из них начинают оптимизировать всерьёз. Связи с общим знанием при этом не рвутся демонстративно — они просто перестают что-либо стягивать.
состояние: цели выровнены, любая работает как прокси для остальных
Здесь я застрял. «Неукоренённый» — это не про враньё модели. Это про то, что у неё нет доступа к тому свойству, которое она должна бы индицировать, — только к признакам этого свойства. Отсюда всё остальное.
§ 6

Кейс: что значит «решить задачу»

Чтобы разговор не остался абстрактным, Тао берёт одну составляющую профессии — решение задач. Не потому, что она главная (построение теории, преподавание и наставничество как минимум не менее важны), а потому, что она сильнее всего попадает под удар и потому, что именно здесь неявные цели дальше всего разошлись с явными.

Дальше он пять раз переписывает формулировку цели. Каждый раз — потому что предыдущая версия ломается.

Кейс выбран не как главная часть профессии (построение теорий требует отдельного разбора, как и преподавание, наставничество и сервисная работа), а как наиболее чувствительный к рабочей гипотезе и как область максимального расхождения имплицитных и эксплицитных целей.

Далее — итеративное уточнение Цели 6.1 → 6.5. Каждая итерация вводится отказом предыдущей.

То, что начиналось как одна стрелка, превратилось в цепочку из пяти стадий — и явной целью сообщества когда-либо была только первая.

Провал, который уже не гипотеза

Формально проверенное доказательство — это доказательство, корректность которого больше не зависит от репутации и добросовестности автора. Отличное свойство. Казалось бы, на этом вопрос закрыт: машина проверила — значит, всё в порядке. Но верификация закрывает вопрос об истинности и не закрывает вопрос о понимании.

Что если модель выдаст длинное доказательство, проверенное как верное, но которого не понимает никто — включая людей, которые её запускали? Это уже происходит: в базе задач Эрдёша[5] накопились десятки ИИ-сгенерированных заявок. Многие, вероятно, верны. Но в значительной части случаев ни один эксперт не вызвался проверить и поручиться, а в нескольких случаях сами приславшие заявили, что не обладают нужной квалификацией.

Мы вплотную подошли к ситуации, когда крупный результат будет верифицирован — и при этом ни один человек не сможет его объяснить.

Автоформализация на языках систем проверки доказательств — Rocq, HOL, Lean —[10,12] ускоряет и генерацию, и верификацию; формально верифицированное доказательство — то, чья корректность не зависит от репутации и добросовестности автора.

Новый режим отказа на шаге 6.3: верифицированное, но не понятое доказательство. Эмпирика: база Эрдёша[5] содержит десятки ИИ-сгенерированных заявок; в существенной доле случаев отсутствует эксперт, готовый верифицировать и поручиться, в ряде случаев сами отправители декларируют недостаток квалификации.

Изложение тоже можно переоптимизировать

Это, по-моему, самая недооценённая мысль эссе. У нынешних моделей с изложением смешанный результат: орфография, грамматика и вёрстка почти безупречны — можно сказать, слишком безупречны, — но текст подолгу топчется на тривиальностях и пробегает, а иногда и смазывает, самое интересное. Результат не помещают в контекст прошлых работ и не дают высокоуровневого обзора, по которому читатель решил бы, стоит ли текст его времени.

Дальше — неожиданный ход. Доказательство может быть написано слишком гладко: рутинные шаги и по-настоящему трудные поданы как одинаково лёгкие для усвоения.

В человеческом тексте трудные места сохраняют естественное трение: извиняющееся замечание, необычно аккуратная лемма, смена обозначений, абзац, который явно переписывали несколько раз. Это трение информативно. Оно сигналит, где притормозить, и это один из главных каналов, по которым передаётся неявное знание области.

Чрезмерно отполированный машиной текст сдирает и «искусственное» трение (опечатки, кривые фразы, беспорядок), и естественное. Остаётся текст, который легко читать и на котором трудно учиться. Парадоксально, но «огрехи» человеческого изложения бывают читателю прямой пользой.

Иллюстрация в статье — снимок страницы работы Бургейна 1991 года[3], исчёрканной молодым и очень раздражённым Тао. Продираясь через эти тексты, он и понял способ мышления Бургейна — и потом сам искал его статьи, чтобы читать.

Текущее состояние proof exposition у моделей: орфография, грамматика, форматирование — практически безупречны (Тао замечает в сноске, что, возможно, слишком); при этом типична диспропорция внимания — длинные проходы по тривиальностям, беглое или затемняющее изложение содержательных шагов, отсутствие позиционирования в литературе и отсутствие high-level обзора.

Нетривиальный тезис: exposition — переоптимизируемая цель. Доказательство может быть too slickly written, когда рутинные и трудные шаги предъявлены как равно усвояемые. Естественное трение человеческого текста (извиняющиеся ремарки, избыточно осторожная лемма, смена нотации, многократно переписанный абзац) несёт сигнал о рельефе аргумента и служит каналом передачи tacit knowledge. ИИ-полировка снимает и артефактное трение, и естественное; итог — легко читаемый и плохо обучающий текст. Ср. рис. 3 (исчёрканная страница Бургейна[3]) и[19,17].

Разворот статьи Бургейна 1991 года, исписанный от руки: пометки на полях, подчёркивания, три вопросительных знака и надпись «I hate Jean Bourgain»
Рис. 3 из статьи Тао: страница работы Бургейна, исчёрканная им самим в молодости. На полях — подчёркивания, стрелки, ??? напротив пропущенного шага и «I hate Jean Bourgain» поперёк выкладки. Именно продираясь через такие тексты, Тао понял, как Бургейн думает. Отсюда и приём с полями на этой странице.
Выключите «Трение» наверху страницы — и эти поля, вычерки и оговорки исчезнут. Текст станет чище. Ровно об этой потере и говорит Тао.
Мера нашего успеха — в том, помогает ли сделанное нами людям думать о математике яснее. Тезис Тёрстона (1994)[21], в пересказе

Принятие и канонизация

Корректности и читаемости мало. Чтобы доказательство действительно вошло в область, другие математики должны его переварить и встроить в свою работу. Авторы могут этому помочь — рассказывая об инсайтах, ложных стартах и историях того периода, когда они бились над задачей. ИИ-инструменты о своём процессе решения непрозрачны, особенно проприетарные, у которых внутренности — коммерческая тайна.

Принятие сообществом по своей природе медленное и человеческое. Наша издательская инфраструктура держится на редакторах и рецензентах, работающих добровольно и почти без признания. Эта работа считается менее престижной, чем производство доказательств, — но именно она превращает индивидуальные достижения в коллективный прогресс.

Фильтры на входе журналов Тао считает допустимыми: пусть автоматика отсеивает заявки с недостаточной верификацией, отсутствующей атрибуцией или бессвязным изложением — примерно как сегодня работает антиплагиат. Это сберегло бы дефицитный ресурс экспертного внимания. Но прохождение фильтра не заменяет принятия, и убрать человека из процесса рецензирования, по его мнению, нельзя.

Последняя стадия — канонизация: результат переформулируют в естественной общности, дают ему правильное доказательство вместо первого, связывают с соседними и впитывают в стандартный инструментарий, в учебники, в то, чему учат студентов. Самая медленная стадия, требующая широкого обсуждения, и наименее поддающаяся автоматизации. И, по Тао, самая ценная: многие приложения математики становятся возможны только после того, как теория переварена таким образом.

И тут — сильнейший ход эссе. Успехи ИИ в математике сами держатся на канонических теориях, которые люди веками строили и перестраивали. Обучающие данные этих моделей буквально и есть продукт канонизации.

Цель 6.4: принятие сообществом. Авторы могут ускорять переваривание результата, проговаривая инсайты, ложные старты и историю работы над задачей; современные системы непрозрачны относительно собственного процесса, особенно проприетарные. Принятие — внешний процесс, не оптимизируемый авторами и их инструментами.

Инфраструктура публикации опирается на добровольный и никак не отмечаемый труд редакторов и рецензентов; по статусу этот труд ниже производства доказательств, по функции — механизм конвертации индивидуальных результатов в коллективный прогресс. автоматический отсев допустим как фильтр (по аналогии с проверкой на плагиат) для экономии экспертного внимания, но не как замена принятию; удаление человеческого рецензента из процесса Тао отвергает.

Цель 6.5: канонизация — переформулировка в естественной общности, замена первого доказательства правильным, встраивание в связи с соседними результатами и в стандартный инструментарий. Самая медленная стадия, требующая широкого коллективного согласия, наименее поддающаяся оптимизации и, по оценке Тао, наиболее ценная. Рефлексивный аргумент: обучающие данные фронтир-моделей суть выход процесса канонизации, то есть эффективность ИИ в математике производна от него.

Вот здесь — самый сильный ход. Не «ИИ угрожает канону», а «ИИ существует за счёт канона». Если канонизация встанет, через поколение обучать будет не на чем.
§ 7

От дефицита доказательств к их изобилию

Если рабочая гипотеза верна, то без изменений в политике и культуре по всему конвейеру пойдут заторы — Тао подбирает для них менее лестное слово: несварение доказательств.

  • генерациядоказательства копятся быстрее, чем их успевают проверять
  • верификацияпроверенные копятся быстрее, чем их успевают внятно записать
  • рецензиядаже корректные и хорошо написанные перегружают систему, живущую на волонтёрском экспертном труде
  • канони опубликованных слишком много, чтобы довести их до окончательной формы

Коротко: мы переходим из эпохи дефицита доказательств в эпоху их изобилия. Почти все наши институты — журналы, конвенции о приоритете, критерии найма и продвижения, премии, само понятие исследовательской программы — проектировались в расчёте на дефицит. Странно ожидать, что они хорошо себя поведут при изобилии.

Признаки несварения были и до ИИ: рост объёма литературы, растущая длина и специализация крупных доказательств, задокументированная перегрузка рецензирования. ИИ эти напряжения не создаёт — он их резко усиливает.

Прогноз при истинности рабочей гипотезы и отсутствии политических/культурных изменений — импедансные рассогласования на каждом стыке конвейера с рис. 4: генерация обгоняет верификацию, верификация обгоняет экспозицию, поток корректных и хорошо написанных текстов перегружает peer review на волонтёрском экспертном ресурсе, объём опубликованного превышает пропускную способность канонизации.

Фазовый переход: от дефицита доказательств к их изобилию (proof scarcity → proof abundance). Институциональный дизайн (журналы, конвенции приоритета, критерии найма и продвижения, премии, сама конструкция «исследовательской программы») исходил из дефицита; деградация под изобилием ожидаема. Предшествующие симптомы — рост объёма литературы, длина и специализация крупных доказательств, задокументированная нагрузка на рефери — датируются до появления современных систем; ИИ выступает усилителем, а не источником.

§ 8–9

Что с этим делать

Полной программы Тао не предлагает. Он указывает на Лейденскую декларацию об искусственном интеллекте и математике[11] — она вышла в июне 2026, одобрена Международным математическим союзом, выросла из семинара 2025 года в Lorentz Center и содержит двадцать три рекомендации: отдельным математикам, организациям и фондам, политикам.

Программа не формулируется; в качестве отправной точки указана Лейденская декларация[11] (июнь 2026, одобрена IMU, выросла из семинара Lorentz Center 2025): 23 рекомендации трём адресатам — отдельным математикам, организациям и фондам, регуляторам. Тао комментирует четыре из тех, что адресованы отдельным математикам.

  • раскрытиеПрозрачно раскрывать использование инструментов — языковых моделей, систем машинного обучения, программ проверки доказательств и прочего софта. Отдельный раздел в статье. Сценарий, которого надо избежать любой ценой: авторы используют ИИ скрытно, чтобы не нарваться на осуждение коллег.
  • рецензияОблегчать работу рецензенту: раскрывать инструменты, давать точные и полные ссылки на предшествующие результаты, приводить формальные доказательства там, где это осмысленно.
  • авторствоПризнание авторства и ответственность остаются за людьми и не передаются автоматическим системам. ИИ может заслонить коллективный человеческий труд, стоящий за результатом, но не заменяет его.
  • атрибуцияИзвестная слабость инструментов в приписывании идей создаёт встречную обязанность: активно искать и указывать источники. Если удовлетворительная атрибуция невозможна — сказать об этом в публикации прямо.
Личное правило Тао

Если авторы не могут убедительно показать, что способны сделать по своим результатам ясный экспертный доклад — корректный и с правильной атрибуцией, — результат публиковать не следует. Доказательство, которое ни один человек не в состоянии объяснить, следует считать неполным, даже если оно формально верифицировано.

Более широкий тезис: снизить культурный вес генерации доказательств и особенно первенства («кто первый решил») — и повысить вес переваривания: изложения, рецензирования, публикации, канонизации. Тао ссылается на эссе Бессиса о конце «теоремной экономики»[2].

Выводы, предупреждает он, будут разными для разных областей. В образовании и подготовке молодых математиков придётся жёстко ограничивать ИИ: цель обучения не достигается производством правильных домашних работ. В других местах, наоборот, придётся брать инициативу и определять практики использования на своих условиях, а не на условиях, заданных вендорами. Понадобятся и новые форматы: коллаборативные проекты формализации, структурированные базы задач, площадки для экспозиции и для публикации отрицательных и частичных результатов.

Нормативный тезис: снизить культурный вес производства доказательств и приоритета первенства, повысить — вес их переваривания (экспозиция, рецензирование, публикация, канонизация); ср. Бессис о падении theorem economy[2].

Дифференциация по областям: в образовании и подготовке исследователей — жёсткое ограничение инструментов (цель подготовки математика не достигается генерацией корректных домашних работ); в исследовательских практиках — сообщество само определяет практику использования, а не вендоры. Требуются новые инфраструктуры: коллаборативная формализация, структурированные базы задач, площадки для экспозиции и для публикации отрицательных и частичных результатов.

Математики обязаны поддерживать серьёзную научную журналистику и участвовать в публичном обсуждении — объясняя и помещая в контекст результаты, полученные с помощью ИИ. Особенно в собственных подобластях, где оценить заявленную глубину и значимость результата можно только со специальным знанием. Лейденская декларация, рекомендация об участии в публичном дискурсе — в пересказе
Единственная рекомендация, адресованная не только математикам. Оценивать глубину результата без специалиста нельзя — а специалиста надо звать, и он должен согласиться прийти.