Двадцать лет — это пять президентских сроков, целая карьера в академии или вечность в мире технологий. Именно столько фундаментальная статистика жила с дырой в фундаменте, которую все видели, но не могли заделать. Речь о процедуре Бенджамини — Хохберга (BH) — «золотом стандарте» обработки данных в геномике и A/B-тестировании. С 1995 года ученые гадали: сохраняет ли метод точность при сложных корреляциях, когда данные ходят строем? Эдгар Добрибан из Уортонской школы решил не тратить еще пару десятилетий на дискуссии и спросил GPT-5.6 Pro. Модель выдала контрпример, доказательство и код за полтора часа. Пока теоретики защищали диссертации на убедительных свидетельствах, алгоритм просто указал им на дверь.
Прецедент Добрибана и смерть интуиции
Механика процесса выглядит почти издевательски. Добрибан скормил модели математическое определение и задачу: доказать или опровергнуть. GPT-5.6 Pro не стала вежливо поддакивать профессору, а выстроила гауссовскую факторную модель из трех блоков координат. Результат: при заданном пороге ложных срабатываний в 0,01 реальный показатель составил 0,0104. В математике этот крошечный заступ за черту означает катастрофу — гипотеза неверна. Самое важное здесь не в цифре, а в численной сертификации: модель предоставила код, машинно подтверждающий неравенство. Это больше не вероятностная болтовня, а холодный reasoning высшего порядка. Для сравнения: предыдущая GPT-5.5 мучила ту же задачу двадцать часов с роем агентов и выдала ровно ничего.
«Гипотеза, стоявшая двадцать лет, оказалась просто неверной. Разрыв не оценочный: финальное неравенство подтверждено интервально-арифметическим сертификатом».
Для R&D-директоров это сигнал: эпоха «умных Т9» закончилась. Мы вошли в фазу, где AI становится ведущим исследователем, способным видеть комбинации, которые человеческий мозг отсеивает как маловероятные. Как признал сам Добрибан, модель соединила две известные техники, которые раньше никто не пробовал совместить. Проблема была не в дефиците инструментов, а в том, что люди просто не знали, в какую сторону смотреть.
Крах человеческого фактора в наукоемком бизнесе
Настоящая драма развернулась через три дня после публикации Добрибана. Лихуа Лей из Стэнфорда, бившийся над этой задачей пять лет, выпустил свой препринт. В благодарностях он честно признал: именно неожиданный контрпример модели реанимировал его исследование. Динамика производительности пугает: то, что буксовало пять лет, было решено за три недели благодаря полуторачасовому пинку от алгоритма. Лей потратил 180 часов, чтобы превратить сырой инсайт модели в девяносто страниц доказательств с точными формулами.
Бизнес-эффект от такой автоматизации интеллекта радикален. Представьте проверку 20 000 гипотез одновременно — например, поиск маркеров редкого заболевания. Старая добрая поправка Бонферрони просто задушит исследование невыполнимыми требованиями, а метод Бенджамини — Хохберга обещал гибкость, но не давал гарантий в реальных, коррелированных условиях. Теперь мы знаем: метод ошибается, и мы знаем, насколько именно. Такая автоматизация фальсификации догм убивает потребность в раздутом штате аналитиков-теоретиков, чья работа годами заключалась в осторожном прощупывании почвы. Теперь почву зондирует нейросеть за стоимость ланча.
Границы автономной науки и роль архитектуры
Качественный скачок GPT-5.6 Pro — это переход к проверке гипотез через логическое отрицание, а не через имитацию текста. Однако увольнять весь R&D-отдел преждевременно. В этой цепочке ключевым звеном остается постановщик задачи. Добрибан не просил сделать красиво, он формулировал запрос на языке строгой логики. Без точной дефиниции на входе мы бы получили лишь очередную порцию галлюцинаций. Человек сегодня — это архитектор смыслов и верификатор. Мы получили машину, которая закрывает двадцатилетние долгострои за время перерыва на кофе, но нам всё еще нужен тот, кто укажет, какую именно стену пора сносить. Экономика R&D смещается от оплаты процесса поиска к оплате навыка постановки вопроса.