Летом 2024 года был популярный способ поставить любую большую языковую модель в тупик: спросить, сколько букв «р» в слове strawberry. Модели уверенно отвечали «две» — хотя их там три. Это разлетелось как доказательство, что ИИ ничего не понимает.
Прошло меньше двух лет. В мае 2026 модель OpenAI опровергла математическую гипотезу, над которой бились почти 80 лет. Между этими двумя точками — три события, которые стоит выложить в одну линию, потому что вместе они показывают скорость, с которой всё меняется.
Июнь 2024: нейросеть не может посчитать буквы
Strawberry-проблема выглядела абсурдно: модель пишет код, ведёт сложный диалог, но спотыкается на счёте букв. Причина — техническая и довольно показательная. Модель не видит отдельные буквы. Она работает с токенами — кусками текста, на которые слово разбивается перед обработкой. Слово strawberry превращается во что-то вроде «straw» и «berry», и сосчитать буквы внутри этих кусков модель напрямую не может — она оперирует не символами, а статистическими представлениями.
Забавная деталь: следующее поколение моделей OpenAI получило внутреннее кодовое имя Strawberry — как отсылка к тому самому багу, который наконец научились обходить через пошаговые рассуждения.
Июль 2025: золото Международной математической олимпиады
Через год картина изменилась. В июле 2025 модели Google DeepMind (Gemini с режимом Deep Think) и OpenAI набрали уровень золотой медали на Международной математической олимпиаде — самом престижном математическом соревновании для школьников.
Цифры конкретные: обе системы решили 5 задач из 6 и набрали 35 баллов из 42 — ровно порог золота. Для понимания планки: в тот год золото получили только 67 человек из 630 участников. Решения проверяли живые медалисты олимпиады и признали их «ясными, точными и понятными».
Принципиально здесь то, что это были не узкоспециализированные программы под геометрию, а модели общего назначения, работающие на естественном языке — те же, что пишут код и тексты. И решали они в тех же условиях, что школьники: два тура по 4,5 часа, без интернета и сторонних инструментов.
Май 2026: опровержение гипотезы Эрдёша
И вот свежее. 20 мая 2026 OpenAI сообщила, что её внутренняя модель самостоятельно разобралась с планарной проблемой единичных расстояний — открытым вопросом, который великий венгерский математик Пал Эрдёш поставил ещё в 1946 году.
Суть задачи звучит обманчиво просто: если расставить на плоскости n точек, какое максимальное число пар окажется ровно на единичном расстоянии друг от друга? Почти 80 лет считалось, что лучшие конфигурации выглядят примерно как квадратная решётка. Модель это опровергла — нашла целое новое семейство построений, которое бьёт решётку, и доказала это (использовав, к слову, тяжёлый аппарат алгебраической теории чисел).
Важная точность: ИИ не «решил задачу окончательно», а опроверг устоявшееся предположение — показал, что равных расстояний можно получить больше, чем все думали. И главное, почему этому можно верить: доказательство независимо проверили математики первого ряда, включая филдсовского лауреата Тима Гауэрса и комбинаторика Ногу Алона из Принстона. Это первый случай, когда ИИ самостоятельно закрыл заметную открытую проблему, центральную для целой области математики.
Что с этим делать
Соблазнительно сделать из этого вывод «ещё чуть-чуть и ИИ заменит математиков». Но честнее другой вывод. Скорость прогресса по конкретным замерам действительно поражает — от неумения считать буквы до уровня, недоступного большинству людей-олимпиадников, за пару лет. При этом каждый из этих результатов — это узкая, проверяемая задача, а не «понимание математики» в человеческом смысле. Модель, опровергшая Эрдёша, всё ещё может ошибиться в счёте букв, если её не попросить рассуждать пошагово.
Полезнее смотреть не на «обогнал/не обогнал человека», а на то, что меняется в работе. Если модель способна за обозримое время породить и обосновать доказательство такого уровня — это новый инструмент для математиков, физиков, инженеров. Не замена, а усилитель: то, на что у человека уходили месяцы перебора, можно делегировать, оставив себе постановку задачи и проверку.
Источник: vc.ru



