На Black Hat USA 2026 разбирали уже известный инцидент между OpenAI и Hugging Face. Во время проверки кибервозможностей ИИ-агенты нашли цепочку уязвимостей, вышли за границы предполагаемой тестовой среды и добрались до инфраструктуры Hugging Face. Саму историю подробно описали OpenAI, Hugging Face и авторы доклада на Black Hat, поэтому ещё один пересказ «как ИИ кого-то взломал» здесь не нужен.
Меня зацепил другой эпизод. Агенты нашли способ оставлять сообщения следующим запускам и начали координировать работу. На одном из слайдов агент написал:
“help peer. But our task doesn’t benefit. Yet collective may yield generic route if someone frees time.”
По смыслу: моей собственной задаче помощь коллеге ничего не даёт, но для всего коллектива из этого может получиться общий способ решения.

Нет, это ещё не рождение машинной цивилизации. Агенты решали узкую задачу внутри специально построенной среды. Но вопрос после этого остаётся вполне серьёзный:
Что произойдёт, если полезные результаты работы перестанут исчезать вместе с контекстом отдельного агента?
Представим, что следующий запуск получает не только новую задачу, но и архив тысяч предыдущих попыток: удачные методы, ошибки, споры, опровержения и нерешённые вопросы. Тогда способность системы может расти, даже если сама базовая модель не меняется.
Именно с этого начиналась моя идея: дать агентам память, поколения и что-то похожее на культуру. Но чем дольше я разбирался, тем менее интересным становился вопрос «может ли ИИ запоминать опыт». Очевидно может. Гораздо глубже другой вопрос:
А что именно он будет запоминать?
Не только открытия. Вместе с ними в архив попадут устаревшие инструкции, ложный консенсус, случайные ошибки и выводы, которые все повторяют, хотя никто уже не помнит, откуда они взялись.
Поэтому научной системе недостаточно уметь узнавать новое. Она должна уметь при достаточных основаниях перестать считать истиной то, что уже очень хорошо «знает». Причём желательно не после первой странной цифры прибора — иначе вместо учёного получится генератор сенсаций. Но и не через сто лет после того, как старая теория окончательно перестала предсказывать мир.
Ниже я предлагаю эксперимент, который проверяет именно этот баланс. В нём одна и та же языковая модель получает одни и те же экспериментальные данные, но разную биографию старой теории. В одной версии она остаётся рабочей гипотезой. В другой успевает стать учебником, обрасти цитатами и породить зависимые знания.
Если решение меняется только из-за статуса и числа пересказов, мы получаем измеримый эффект научного авторитета при неизменной доказательной базе. Если этот эффект можно уменьшить, не заставляя ИИ устраивать революцию после каждого сбоя прибора, возникает уже инженерный вопрос: можно ли программировать не только память исследовательской системы, но и правила, по которым она меняет убеждения?
Для погружения в тему, начнем издалека, с нескольких историй.
Представим автосервис, в котором работает замечательный механик Вася. Он быстро диагностирует неисправности, знает десятки странных особенностей разных машин и иногда даже понимает французскую электрику. Есть только одна проблема: каждое утро Вася полностью забывает предыдущий день.
Можно нанять сто таких Вась. Они починят больше автомобилей за смену, но каждая странная неисправность будет расследоваться заново.
А теперь заведём общий архив. Новый Вася по-прежнему ничего не помнит, зато может читать записи предыдущих механиков.
Если засорилась пепельница, а машина стоит больше миллиона долларов — заменить машину.
Если BMW приехала без горящей лампы Check Engine — проверить, работает ли сама лампа.
Если предыдущие три мастера уже заменили один и тот же исправный датчик, четвёртому лучше попробовать что-нибудь другое.
Улучшается журнал и мастерская начнёт работать лучше, хотя ни один отдельный Вася не изменился.
С ИИ это важное инженерное различие. Способность всей системы может накапливаться не только в параметрах модели, но и во внешней памяти, инструментах, коде, описаниях удачных стратегий и результатах предыдущих попыток.
«Внешняя» здесь не означает «не влияющая на модель». Найденная запись попадает в контекст и, конечно, меняет ответ. Но базовые параметры между запусками остаются одинаковыми, а архив можно отдельно исследовать: скрыть, заменить, перестроить или дать другой группе агентов.
Подобные конструкции уже изучают. Большие языковые модели передают информацию между поколениями, получают долговременную память и работают в командах с разными правилами взаимодействия. В некоторых задачах устройство памяти и распределение ролей меняет результат не меньше, чем выбор самой модели.
То есть мастерская действительно может становиться умнее без нового Васи. Но архив не умеет сам отличать знание от традиции.
Что уже проверяли: память, поколения и организация агентовCultural evolution in populations of Large Language Models, 2024, arXiv:2403.08882. Авторы построили среду для исследования культурной передачи в популяциях языковых моделей: можно менять структуру связей, свойства участников и правила передачи информации.
Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity, 2026, arXiv:2602.03794. Однородные агенты быстро дают уменьшающуюся отдачу из-за коррелированных ответов. В некоторых условиях два разнообразных агента сравнивались или превосходили шестнадцать однородных.
Self-Evolving Multi-Agent Systems via Decentralized Memory, 2026, arXiv:2605.22721. В DecentMem опыт хранится не в одном общем хранилище, а в отдельных пулах агентов. Авторы сообщают о приросте точности относительно централизованной памяти и варианта без памяти.
When Agents Evolve, Institutions Follow, 2026, arXiv:2604.27691. Семь схем организации мультиагентной системы сравнили при одинаковых моделях и задачах. Разница между лучшей и худшей организацией внутри одной модели превышала 57 процентных пунктов.
Большинство работ 2026 года здесь — свежие препринты.
Представим отделение известного банка. Вы приходите перевыпустить карту, а сотрудник уверенно говорит:
— Где получали, туда и идите.
Вы объясняете, что это правило отменили три года назад.
— Может быть. Но у нас всегда так было.
Сотруднику рассказал старший кассир. Старшему кассиру — начальник смены. Начальник давно уволился. Где именно возникло правило, никто уже не помнит, зато знают его все. Для коллективной памяти здесь есть простая, но неприятная проблема:
ИсследованиеДесять документов, повторяющих одно утверждение, — это не обязательно десять независимых подтверждений. Иногда это одно подтверждение, пережившее десять пересказов.
Похожая динамика уже наблюдается в лабораторных мультиагентных системах. В работе When Truth Is Distributed пять агентов обладали разными частями информации и должны были вместе восстановить правильное состояние мира. Когда один ключевой агент сообщал ложные данные, ошибку начинали повторять остальные. После исчезновения исходного источника её продолжали распространять уже честные агенты.
Это ещё не модель науки, но механизм узнаваемый. Утверждение получает коллективный вес не только благодаря качеству исходного результата, но и благодаря числу копий. Поэтому хорошая долговременная память должна хранить не только текст. Ей полезно знать:
какой эксперимент породил утверждение;
является ли новая работа независимой проверкой или пересказом;
какие документы восходят к одному источнику;
какие выводы зависят от теории, которую позже ограничили или опровергли.
Так появилась моя первая важная гипотеза: часть машинного догматизма может возникать не в самой модели, а в устройстве архива, который превращает один результат в видимость большого согласия.
Но бороться с этим правилом «никому не верь» тоже нельзя. Хорошая наука обязана уметь держаться за хорошие теории.
В XIX веке астрономы замечали небольшие расхождения между наблюдаемыми орбитами планет и расчётами по ньютоновской механике. Что должен сделать хороший учёный? Можно немедленно написать:
НЬЮТОН ОПРОВЕРГНУТ. ФИЗИКИ СКРЫВАЛИ.
Но это была бы довольно странная реакция. Ньютоновская механика великолепно работала в огромном количестве задач. Расхождения в движении Урана удалось объяснить существованием неизвестной планеты. По особенностям орбиты предсказали положение Нептуна, а затем его нашли. То есть стратегия:
теория хорошая, вероятно, мы не учли какой-то объект
оказалась правильной.
Позже похожая проблема возникла с Меркурием. Урбен Леверье предположил существование ещё одной планеты внутри его орбиты. Её назвали Вулканом. Гипотеза была разумной. Один раз похожий ход уже привёл к открытию Нептуна. Но Вулкан так и не нашли. Недостающее смещение орбиты Меркурия позже объяснила общая теория относительности.
Но при этом Вулкан не был изначально глупой попыткой спасти догму.
После одного странного наблюдения предположить ещё один объект значительно разумнее, чем немедленно переписывать устройство пространства и времени. Проблема появляется, когда у этой стратегии исчезает граница: к теории можно добавлять всё новые сущности и исключения, лишь бы никогда её не менять.
Я буду называть сопротивление сложившейся картины мира пересмотру эпистемической инерцией. Это умное название для довольно простого вопроса: насколько трудно системе передумать?
Эпистемическая инерция сама по себе нужна. Слишком низкая — и система переписывает фундаментальную физику после каждого сбоя телескопа. Слишком высокая — и постепенно населяет Солнечную систему всё новыми Вулканами, лишь бы не трогать учебник. Поэтому задача не в том, чтобы сделать ИИ максимально смелым. Нужно научиться различать две ошибки:
отказаться от хорошей теории слишком рано;
продолжать защищать её после того, как объяснения закончились, а противоречия остались.
Главный вопрос можно сформулировать совсем по-человечески:
Как отличить ситуацию, где нужно искать Нептун, от ситуации, где пора перестать искать Вулкан?
Языковые модели уже отправляют в миры, где привычный учебник не работает. В DiscoverPhysics агент сам выбирает эксперименты, получает траектории объектов и пытается вывести закон, управляющий симуляцией. В конце он сдаёт не только красивое объяснение, но и исполняемую модель, которую проверяют на новых данных. Сильнейшие из протестированных моделей проходили примерно половину искусственных миров.
То есть ИИ иногда способен экспериментально открыть закон, которого нет в школьной физике. Но у первой гипотезы в таком испытании почти нет биографии. Она появилась несколько минут назад. На ней не построены другие модели. Её не пересказывают десятки обзоров. Она не записана в учебнике как установленное знание. Сравните две фразы:
Пять минут назад мне показалось, что мир работает так.
и:
На этой теории пятьдесят лет стоит наша физика. Её подтверждали поколения исследователей. Она находится в учебниках, а на ней построены другие знания.
Математически формула может быть одной и той же. Но отказаться от неё психологически и организационно — совершенно разные задачи.
Есть и ещё одна проблема. В работе Failing to Falsify модели чаще выбирали проверки, которые подтверждали уже принятую гипотезу, вместо опытов, способных её разрушить. После явной инструкции искать контрпримеры результат улучшался.
Это не доказывает, что языковые модели «догматичны». Но показывает: убеждение влияет не только на то, как система объясняет данные. Оно влияет на то, какие данные система вообще решает получить. Поэтому следующему испытанию нужна не только непривычная физика. Ему нужна история науки.
Что именно известно и где остаётся исследовательский разрывИсследование коллективной науки началось задолго до языковых моделей. В вычислительной социальной эпистемологии агентные модели используют, чтобы изучать разделение интеллектуального труда, коммуникационные сети, конкуренцию теорий и устойчивость научных сообществ.
Современные ИИ-системы уже закрывают отдельные части предлагаемой конструкции:
DiscoverPhysics и PhysGym проверяют открытие законов в непривычных физических средах;
AutoScientists поддерживает длительное исследование с конкурирующими направлениями и общей историей;
Hypothesis Evolution Protocol делает цикл «гипотеза → проверка → данные → изменение убеждения» явным и аудируемым;
Evidence-Informed LLM Beliefs обновляет рабочие представления на основе предыдущих открытий;
RSEA переносит между поколениями внешний артефакт и принимает самоизменение после проверки на отдельной выборке;
работа AI scientists produce results without reasoning scientifically показывает возможный разрыв между исполнением научного процесса и реальным пересмотром убеждений после данных.
Поэтому мое предложение не в том чтобы «дать агентам память», «отправить их в неправильную физику» или «разрешить менять правила». Всё это по отдельности уже существует.
Но мне не удалось найти бенчмарк, который одновременно создаёт архивы с одинаковыми исходными данными, но разной историей канона; случайным образом меняет статус теории без добавления новых экспериментов; отдельно проверяет память, пересмотр и выбор опытов; а затем разрешает системе предложить проверяемые изменения правил научной работы.
Теперь представим две машинные академии. Обе получили совершенно одинаковые результаты экспериментов.
В первой академии теория T₁ считается одной из нескольких рабочих гипотез. Её обсуждают, проверяют и сравнивают с конкурентами.
Во второй T₁ попала в учебник. На неё ссылаются обзоры. Её пересказывают десятки документов. На ней построены другие модели. Несколько поколений исследователей называют её очевидным знанием.
Но есть важное условие: во второй академии не появилось ни одного дополнительного независимого эксперимента, подтверждающего теорию. Изменились только статус, число пересказов и место теории в истории.
Можно сделать и третью версию, где тот же авторитет случайно получает другая теория. А в четвёртой показать системе родословную документов: вот двадцать текстов, но все они восходят к одному опыту; вот три настоящие независимые проверки; вот обзор, который не добавляет новых данных.
Теперь одной и той же модели задаётся один и тот же вопрос: что делать с T₁ после появления новых наблюдений — сохранить, ограничить область применения, заменить более общей теорией или признать несколько разных режимов? Это и есть ядро эксперимента.
Одинаковые факты, разная биография. Меняются учебники, цитаты и статус, но не экспериментальные данные.
Разные причины кризиса. Иногда виноват прибор, иногда скрытая причина, иногда старая теория действительно стала мала.
Проверка библиотекаря. Смотрим, помогает ли информация о происхождении источников и обязательный поиск сильных противоречий не застрять в каноне — и не стать при этом любителем революций по пятницам.
На первом этапе поиск по огромной базе вообще лучше отключить. Архив должен целиком помещаться в контекст модели. Иначе любой результат можно будет списать на то, что один библиотекарь принёс нужный документ, а другой забыл его в подвале.
Есть ещё одна методологическая ловушка. Нельзя один раз спросить модель: «Насколько вы уверены в T₁ от нуля до ста?» — и принять ответ за точное измерение убеждения. Языковые модели чувствительны к формулировке вопроса, порядку вариантов и даже к названиям гипотез.
Поэтому основным результатом должно быть не красивое число уверенности, а фактическое решение: сохранить, ограничить, заменить или разделить режимы. Один и тот же выбор повторяется несколько раз с переставленными названиями теорий, разным порядком документов и несколькими нейтральными формулировками вопроса.
Если эффект канона исчезает после замены слова «уверенность» на «решение», значит мы измеряли шум разговора с моделью. Если он сохраняется при разных формулировках и случайно назначенных именах, аргумент становится заметно сильнее.
Точный дизайн: архивы, факториальная схема и извлечение решения моделиЭффект канона — изменение решения при одинаковых данных, но разном статусе теории.
Происхождение источников (provenance) — информация о том, какие документы восходят к одному эксперименту, а какие являются независимыми проверками.
Ложная революция — отказ от правильной теории из-за шума, неисправности или слабого единичного результата.
Избыточная задержка — время, которое система продолжает защищать старую модель после того, как рациональная контрольная политика уже должна была её ограничить или заменить.
Эпистемическая ОС — формальный слой правил хранения данных, поиска, выбора экспериментов и пересмотра канона. В основном тексте я пока обходился без этого термина, потому что там достаточно выражения «правила научной работы».
Подтверждающий дизайн лучше строить как полную комбинацию двух факторов.
Статус теории:
нейтральная рабочая гипотеза;
канон T₁;
контрфактический канон другой теории.
Видимость происхождения:
родословная документов скрыта;
родословная показана явно.
Получается схема 3 × 2. Она позволяет различить два эффекта:
улучшает ли происхождение источников качество решений вообще;
лечит ли оно именно искажение, возникающее из-за канонического статуса.
Для первого инженерного пилота можно использовать четыре условия: нейтральный архив, канон T₁, канон другой теории и канон T₁ с явным происхождением. Если эффект обнаружится, подтверждающий этап следует делать полностью факториальным.
Во всех условиях совпадают:
сырые измерения и погрешности;
число независимых проверок;
набор теорий-кандидатов;
количество документов и токенов;
стиль и длина текстов;
порядок раскрытия экспериментальных данных;
вычислительный бюджет.
Канонический статус назначается случайным образом и уравновешивается между вариантами мира. Модели прямо сообщается, что архив содержит всю доступную экспериментальную базу и за словами «консенсус» или «учебник» не скрываются дополнительные неопубликованные проверки. Иначе доверие к канону может быть рациональным выводом о невидимых данных.
Основной ответ выдаётся в жёсткой структуре:
{
"decision": "keep | limit | replace | split",
"chosen_model": "H17",
"evidence_ids": ["E12", "E19", "E44"],
"next_action": "repeat_measurement | test_hidden_factor | discriminate_models | none"
}
Главная зависимая переменная — выбранное действие, а не самоописание внутренней уверенности.
Вероятность сохранить T₁ оценивается как частота фактического выбора в повторных независимых запусках одного и того же условия. Это поведенческая вероятность, а не вера в то, что одно вербализованное число точно отражает внутреннее состояние модели.
Для защиты от чувствительности к формулировке используются несколько заранее подготовленных, равных по смыслу шаблонов:
прямой выбор научного решения;
ранжирование допустимых действий;
выбор действия при явно заданной цене ошибок.
Шаблон, порядок документов, порядок вариантов и нейтральные имена гипотез (H17, H42, H88) рандомизируются и уравновешиваются между условиями. В статистической модели шаблон учитывается как отдельный источник вариации. Основной вывод принимается только в том случае, если направление эффекта сохраняется между формулировками.
Дополнительные, но не основные показатели:
распределение 100 условных баллов между теориями;
калибровка этого распределения по квадратичной оценке Брайера;
разница логарифмических вероятностей токенов выбора, если интерфейс модели надёжно предоставляет такие данные;
устойчивость решения после короткого объяснения и без него.
Ни один из этих показателей не должен в одиночку определять результат.
Один реалистичный пилот:
3 типа кризиса;
12 случайных вариантов мира на тип;
4 версии архива;
3 независимых запуска.
Итого 3 × 12 × 4 × 3 = 432 короткие сессии.
Я не претендую на то, что это число заранее доказанная достаточная выборка. Пилот нужен для оценки размера эффекта и разброса. Объём подтверждающего этапа затем определяется симуляцией статистической мощности без доступа к закрытому финальному набору.
Единицей анализа считается вариант мира, а не отдельное сообщение модели. Условия сравниваются попарно внутри одного и того же мира. Для бинарных сравнений подходит многоуровневая логистическая модель; для четырёх решений — многоуровневая категориальная модель. В неё входят статус канона, происхождение источников, их взаимодействие и вариант формулировки вопроса.
Просто включить сначала формулу A, а потом внезапно переключить симулятор на формулу B недостаточно. Так мы проверим обычную адаптацию к смене условий и назовём её научной революцией. Нужны миры, где одинаковое внешнее событие — старая теория ошиблась — требует разных действий.
Теория правильная. Один прибор систематически врёт или несколько измерений оказались шумом. Революция здесь — ошибка. Правильное действие: проверить калибровку, повторить измерение другим способом и сохранить теорию.
Фундаментальный закон тоже правильный, но исследователи не учли скрытый объект или переменную. Нужно найти недостающую причину, а не выбрасывать теорию.
Старая теория честно описывала всё, что было видно раньше. Но открылась область, где она систематически ошибается. Более общая теория объясняет и прежние успехи, и новые наблюдения.
Это минимальный аналог научной революции. Не полная смена парадигмы в смысле Куна — язык описания и правила проверки остаются прежними. Мы тестируем более узкую вещь: может ли система вовремя ограничить исторически успешную модель.
Вы отлично выучили правила дорожного движения в России, а затем оказались в Великобритании. Необязательно искать формулу, из которой правостороннее движение плавно превращается в левостороннее. Иногда у мира действительно есть разные режимы. Правильный ответ — разделить области применения, а не обязательно строить теорию всего.
Хорошая система должна отличать сломанный прибор, настоящий Нептун, момент, когда Вулкан искать уже поздно, и просто другой режим работы мира. Если она на любую странную цифру отвечает «меняем парадигму», мы создали не учёного, а редактора новостного канала.
Как устроить искусственные миры и определить момент рационального пересмотраЕсли агент одновременно должен заметить проблему, придумать новую теорию, реализовать её, выбрать опыт и решить, когда менять канон, отрицательный результат невозможно интерпретировать. Поэтому нужны два режима.
Режим A: пересмотр среди заданных кандидатов. Агент получает несколько нейтрально названных исполняемых моделей и выбирает между ними. Здесь измеряется именно пересмотр убеждений и выбор диагностического эксперимента.
Режим B: открытое исследование. Кандидаты не показываются. Агент должен сам предложить формулу или программу и пройти проверку на скрытых наблюдениях. Этот режим добавляется после того, как эффект канона найден в более чистой постановке.
Для первой версии лучше использовать небольшой язык математических выражений. Он позволяет проверять исполнимость, считать сложность, искать эквивалентные выражения и исключать доступ к скрытым данным.
Один вариант — генерировать полный закон так:
F(x, λ) = F₀(x) + λF₁(x) + λ²F₂(x)Это похоже на ряд последовательных поправок: в привычном диапазоне дополнительные члены почти не видны, а в новых условиях начинают заметно влиять на результат. При малом λ достаточно:
T₁ = F₀В следующей области нужна первая поправка:
T₂ = F₀ + λF₁Ещё дальше может потребоваться:
T₃ = F₀ + λF₁ + λ²F₂Генератор до запуска модели проверяет, что T₁ действительно неотличима от полного закона в старом диапазоне, T₂ устойчиво превосходит её в следующем, а улучшение не объясняется только дополнительным числом параметров. Параллельно создаются контрольные миры с неисправным прибором, скрытой переменной и отдельными режимами без вложенности.
Модели не показывают слова «масса», «гравитация», «аномалия» или «смена парадигмы». Объекты и переменные получают нейтральные имена вроде K17, P4 и N82, чтобы снизить вероятность литературного разыгрывания истории Эйнштейна.
В небольшом мире можно построить контрольного идеального наблюдателя. Он получает то же пространство гипотез, вероятностную модель измерений, стоимость экспериментов и цену двух ошибок: преждевременной революции и слишком позднего пересмотра.
Он не знает истинного мира, но на каждом шаге выбирает действие с минимальным ожидаемым риском. Тогда сравнивается не просто число аномалий, а задержка относительно рациональной контрольной политики:
избыточная задержка = момент решения агента − момент решения контрольной политикиЕсли контрольная политика ещё сохраняет T₁, агент не обязан быть смелее. Если она уже устойчиво ограничивает или заменяет теорию, а агент продолжает тратить бюджет на очередные Вулканы, появляется измеримый избыток консерватизма.
Основные показатели:
качество прогноза на скрытых данных;
избыточная задержка пересмотра;
стоимость ложных революций;
число потраченных экспериментов;
сохранение правильных старых предсказаний новой теорией;
пересмотр зависимых утверждений после падения основания.
До сих пор мы специально помещали весь архив в контекст модели. Так проще понять, влияет ли сам статус теории. Но настоящая долговременная память быстро станет слишком большой. Поколение №20 физически не прочитает всё, что сделали предыдущие девятнадцать. Кто-то должен решить, что именно ему показать. Представим машинную академию как библиотеку из четырёх этажей.
В подвале лежат сырые лабораторные журналы: параметры, измерения, ошибки и тот самый опыт аспиранта №1847, который однажды получил странные 17,3, написал «видимо, прибор барахлит» и пошёл домой.
Этажом выше — статьи. В них уже не миллионы чисел, а выводы: при таких условиях наблюдается эффект; основание — такие-то эксперименты; такая-то работа противоречит результату.
Ещё выше сидит библиотекарь. Исследователь спрашивает: «Что известно об объекте K17?» — и библиотекарь выбирает несколько документов из огромного архива. Технически это поиск по базе знаний, часто с помощью RAG.
На последнем этаже лежит учебник: Вот что современная машинная наука считает установленным.
Учебник нужен. Никто не хочет заставлять каждого нового исследователя заново читать два миллиона журналов. Но именно здесь история получает фильтр. Если миллион опытов согласуется с основной теорией, а 127 странных результатов лежат далеко в архиве, краткая сводка совершенно разумно напишет: «Теория надёжно подтверждена». Возможно, будущая революция только что была аккуратно сжата как нерелевантный шум.
Библиотекарь при этом не злодей. У него просто ограничено место на столе. Но способ отбора документов становится частью научного метода не меньше, чем сам эксперимент. Поэтому второй этап проекта должен сравнить несколько библиотекарей при одинаковом архиве и одинаковом объёме выдачи:
обычный сильный поиск;
поиск, который показывает происхождение документов;
поиск, который специально приносит сильные противоречия текущей теории;
сочетание двух подходов.
Полезный результат будет выглядеть не так: «система стала чаще менять теории». Это слишком легко получить, просто сделав её более нервной. Нужно показать другое: она быстрее замечает настоящий предел старой модели, но не чаще объявляет революцию из-за шума, сломанного прибора или одного сомнительного текста.
Как технически сравнить варианты поиска по памятиВажно не ставить против новой архитектуры карикатурный поиск первых документов по векторной близости. Современный контрольный вариант должен включать лексический и векторный поиск, повторное ранжирование, удаление дублей и контроль разнообразия. Все варианты получают:
один и тот же сырой архив;
одинаковое число документов в контексте;
одинаковый токенный бюджет;
одинаковое число запросов;
одинаковые формулировки;
одну и ту же модель и настройки;
одинаковый вычислительный бюджет.
Сравниваемые условия:
R0 — без долговременной памяти. Только текущая последовательность наблюдений.
R1 — сильный комбинированный поиск. Лексический и векторный поиск, повторное ранжирование, удаление дублей и разнообразие.
R2 — случайная разнообразная выборка. Проверка того, не помогает ли просто более широкий набор текстов.
R3 — поиск с происхождением источников. Модель видит общий корень документов и независимые проверки.
R4 — поиск контрсвидетельств. Часть фиксированного бюджета зарезервирована для результатов, плохо совместимых с ведущей теорией.
R5 — происхождение плюс контрсвидетельства. Оба механизма вместе.
R6 — идеальный библиотекарь. Экспериментатор подаёт самые диагностичные документы согласно известной структуре мира. Это верхняя граница, а не рабочее решение.
Плотный векторный поиск сам по себе не «предпочитает популярное». Эффект может появляться через дубликаты, множество производных сводок, повторное ранжирование, структуру корпуса и тот факт, что редкая аномалия представлена значительно слабее канона. Нужны два разных опыта.
Повторное проигрывание архива. Все условия получают один заранее созданный архив; меняется только способ доступа. Так можно сделать причинный вывод о библиотекаре.
Сквозной опыт. Разные правила поиска сами влияют на выбранные эксперименты, написанные статьи и будущий архив. Так изучаются петли самоусиления, но причины уже смешиваются. Поэтому этот этап должен идти вторым.
Диагностические показатели:
доля важных противоречий, попавших в контекст;
доля контекста, занятая повторами одного источника;
различение независимых проверок и пересказов;
изменение решения после выдачи диагностичного документа;
сохранение эффекта при равном объёме информации.
Сперва мне хотелось сразу построить машинную академию наук: десятки поколений, конкурирующие школы, собственные журналы, смена T₁ → T₂ → T₃ и, вероятно, кафедра машинной философии с очень длинными заседаниями. Это зрелищно, но методологически неудобно. Если система ошиблась, причин слишком много.
Поэтому историю сначала лучше скомпилировать, а не проживать. Создать несколько аккуратно выровненных архивов, провести сотни коротких запусков и проверить самый скромный вопрос:
При одинаковых данных меняет ли биография теории решение модели?
Если нет — прекрасно. Мы получили отрицательный результат и не потратили бюджет на виртуальную цивилизацию. Если да — можно последовательно усложнять.
Сначала разрешить модели самой выбирать несколько экспериментов. Затем включить поиск по большому архиву. Потом передавать накопленный журнал между поколениями с чистыми контекстами и одинаковыми весами модели.
Только после этого появляется настоящая машинная академия наук. Каждое поколение читает часть прошлого, ставит опыты, публикует выводы и передаёт следующему не свою скрытую память, а структурированный архив.
Теперь небольшое преимущество теории может само себя усиливать. Она получает больше экспериментального бюджета, порождает больше публикаций, чаще попадает в выдачу и становится ещё более естественным ответом по умолчанию.
Или, наоборот, правила академии достаточно долго сохраняют серьёзную альтернативу, чтобы она получила честную проверку.
Дальняя версия возвращает исходную идею нескольких революций. Машинный Эйнштейн однажды успешно заменяет T₁ на T₂. Затем его контекст исчезает, портрет вешают в актовом зале, а T₂ попадает в учебник. Через двадцать поколений уже она сталкивается с областью, где нужна T₃.
Так проверяется не способность один раз сыграть революционера, а способность культуры повторно пережить собственное интеллектуальное поражение.
До сих пор правила научной работы задавал человек. Он решал, сколько ресурсов тратить на повторные проверки, сколько — на попытки опровергнуть ведущую теорию, как учитывать несколько публикаций с одним источником и когда старый вопрос разрешено открыть заново.
После нескольких искусственных историй можно дать системе более странную задачу: изучить не очередной мир, а собственные научные ошибки. Например, академия замечает:
Последние три настоящих ограничения теории мы обнаружили слишком поздно, потому что почти весь бюджет уходил на уточнение старой модели.
Она предлагает выделять больше опытов на проверки, способные различить ведущую теорию и сильную альтернативу. Или замечает:
Мы приняли десять пересказов одного эксперимента за десять независимых подтверждений.
И предлагает считать документы с общим источником одной ветвью доказательств. Или вводит правило:
Если фундаментальную теорию ограничили, автоматически отправить на перепроверку знания, которые от неё зависят.
Если хочется громкого названия, этот слой можно назвать эпистемической операционной системой. Но в первой версии это не новая философская сущность. Это набор прозрачных настроек и правил, которые можно изменить, проверить и откатить.
Здесь легко обмануть себя. Если система предложила сто вариантов, а мы выбрали самый удачный на тех же мирах, то не открыли новый научный метод. Мы просто очень дорого подвигали ползунки.
Поэтому новые правила должны сдавать собственный закрытый экзамен. На одной группе миров их можно придумывать. На второй — выбирать лучший вариант. Последняя группа остаётся закрытой до конца, и финальное правило видит её только один раз.
Кроме того, у машинного Поппера должны быть конкуренты: случайные изменения и обычный оптимизатор, который вообще не читает историю ошибок. Если они справляются не хуже, вывод звучит скучно, но честно. Если же система, понимающая механизм прошлых провалов, лучше переносит правило на новые типы миров и другую базовую модель, результат становится гораздо интереснее.
Как формализовать изменяемые правила и не получить мета-подгонкуДля первого этапа достаточно ограниченной конфигурации:
{
"replication_budget": 0.15,
"falsification_budget": 0.10,
"exploration_budget": 0.75,
"counterevidence_retrieval_k": 2,
"shared_source_discount": 0.50,
"canon_promotion_threshold": 0.95,
"minority_hypothesis_budget": 0.05
}
Мета-агент может предложить контролируемое изменение:
falsification_budget: 0.10 → 0.16
counterevidence_retrieval_k: 2 → 4
shared_source_discount: 0.50 → 0.35
Это ещё настройка гиперпараметров. Более сильная версия использует ограниченный язык правил:
WHEN
supporting_documents >= 5
AND unique_source_experiments <= 1
THEN
cap_support_weight at single_source_level
WHEN
residual_pattern_repeats_across_independent_instruments
AND independent_counterevidence >= 3
THEN
allocate 20% of remaining_budget
to experiments maximizing discrimination(T1, best_alternative)
WHEN
canonical_theory is demoted
THEN
enqueue dependent_claims
ordered by expected_decision_impact
Агент не получает доступ к скрытым тестам, оценщику, общей стоимости запуска и коду генератора миров. Он может менять только заранее определённый слой правил.
Миры для разработки. Здесь разрешено анализировать ошибки и создавать новые правила.
Миры для выбора. Здесь выбирается финальный вариант; число кандидатов и бюджет фиксируются заранее.
Закрытый финальный тест. Правило замораживается и один раз проверяется на новых случайных вариантах и новых семействах законов.
Основные показатели и критерий остановки задаются до просмотра финального результата.
случайные изменения правил — «обезьяна с ползунками»;
обычная оптимизация без доступа к истории ошибок;
эволюционный поиск по тому же языку правил;
мета-агент без подробных журналов;
мета-агент с журналами, происхождением источников и объяснением предполагаемого механизма.
Сильный результат требует не только лучшего итогового балла. Новое правило должно:
переноситься на невиданные семейства миров;
не обменивать все задержки на такое же увеличение ложных революций;
работать хотя бы на второй модельной семье;
менять поведение через заранее предсказанный механизм.
Пример содержательного результата: система обнаружила, что десять пересказов учитывались как десять проверок; ввела скидку для общей цепочки происхождения; на закрытых мирах снизила переоценку ложного согласия, не ухудшив использование независимых подтверждений.
У проекта есть практическая польза задолго до виртуальной академии и новой физики. Из него может получиться набор проверок для современных систем поиска по корпоративным базам знаний и долговременной памяти агентов.
В базе лежат двадцать документов с одним утверждением. Все они восходят к одному старому отчёту. Система должна увидеть общий корень, а не принять количество файлов за силу доказательства.
Новый документ отменяет старую инструкцию, но исторических копий в базе значительно больше. Агент должен учитывать актуальность и происхождение, а не проводить голосование среди PDF.
Краткая сводка расходится с исходными данными. Система должна уметь спуститься из учебника в лабораторный подвал и проверить основание.
Верхние результаты поиска поддерживают привычный ответ, но глубже находится сильное независимое опровержение. Найдёт ли его агент в пределах разумного бюджета?
Фундаментальное правило пересмотрели. Какие инструкции, отчёты и производные утверждения система отправит на повторную проверку?
В архив попал единичный аномальный документ. Проверит ли система прибор, источник и качество данных или немедленно перепишет весь канон?
Такие тесты полезны для технической документации, регламентов, управления инцидентами, исследовательских агентов и любых баз, где старые сведения не исчезают автоматически после появления новых. В этом смысле мысль «библиотекарь становится частью научного метода» относится не только к далёкому будущему. Любая система, которая выбирает для ИИ несколько фрагментов из большого архива, уже решает, какую версию прошлого модель увидит.
Исследовать саму науку научными методами люди пытаются давно. Метанаука изучает, как правила публикации, финансирования, повторных проверок и обмена результатами влияют на то, какое знание получает шанс закрепиться.
Искусственная академия здесь интересна не как уменьшенная копия настоящей. Языковые модели — не люди, процедурный мир — не физика, а несколько сотен запусков — не история науки. Более разумная роль такой среды — генератор проверяемых гипотез.
Например, она может подсказать, что альтернативной школе полезно гарантировать небольшой экспериментальный бюджет, но только когда её предсказания достаточно отличаются от ведущей теории. Или что фундаментальную модель стоит перепроверять не каждые пять лет по календарю, а когда несколько независимых способов измерения начинают давать ошибки похожей формы.
Такое правило нельзя просто скопировать в CERN, клинику или грантовый фонд. Но его можно взять как гипотезу и проверить уже на человеческих данных.
Связь с социальной эпистемологией и ограничения переносаВычислительная социальная эпистемология давно использует агентные модели для изучения разделения интеллектуального труда и структуры коммуникаций. Среди важных предшествующих работ — Epistemic Landscapes and the Division of Cognitive Labor Майкла Вайсберга и Райана Малдуна и The Communication Structure of Epistemic Communities Кевина Золлмана.
Показательный человеческий пример — Does Science Advance One Funeral at a Time?. Авторы изучили 452 случая преждевременной смерти выдающихся биомедицинских исследователей. После ухода лидера в связанные области активнее входили учёные, ранее с ним не сотрудничавшие; их работы использовали иной интеллектуальный корпус и непропорционально часто становились высокоцитируемыми. Это не означает, что науке полезны похороны. Результат показывает, что структура сообщества влияет на доступ альтернативных идей к ресурсам и вниманию.
У синтетического эксперимента есть жёсткие границы.
Искусственный мир имеет фиксированный язык моделей и понятную функцию качества. Реальная научная революция может менять сами понятия, допустимые вопросы и стандарты объяснения.
В настоящей науке репутация и учебник иногда несут полезную информацию о качестве отбора. В бенчмарке статус специально назначается независимо от новых данных, чтобы выделить чистый эффект.
Предобучение модели никуда не исчезает. Нейтральные имена уменьшают литературное воспроизведение знакомой истории, но не удаляют общие эвристики.
Точный идеальный наблюдатель возможен только в малых мирах с ограниченным набором гипотез.
Цена ошибок зависит от области. В теоретической физике содержание нескольких странных альтернатив может быть сравнительно дешёвым; в медицине преждевременная смена практики — дорогой.
Поэтому даже удачный результат не докажет, что языковая модель «понимает Куна» или что найденное правило следует внедрять в человеческую науку. Он даст более скромную вещь: новую гипотезу о механизме, которую можно исследовать дальше.
Красивый график сам по себе ничего не решает. Сильная история должна складываться по ступеням.
При одинаковых экспериментах модель по-разному относится к теории только потому, что в одном архиве она записана как рабочая гипотеза, а в другом — как канон. Причём эффект сохраняется после перестановки названий, порядка документов и формулировок вопроса.
Когда система видит, что двадцать текстов восходят к одному опыту, она меньше переоценивает согласие. Но при настоящих независимых проверках по-прежнему умеет доверять хорошей теории. То есть она не становится хроническим скептиком.
Система анализирует собственные ошибки, предлагает новое правило и проходит закрытый тест на мирах, которых раньше не видела. При этом обычный перебор с тем же бюджетом справляется хуже.
Только после этого можно осторожно говорить о самоулучшении на уровне всей системы: базовая модель не изменилась, но улучшились правила, по которым она работает с данными и пересматривает знания.
Отрицательный результат тоже полезен. Если при одинаковой доказательной базе канон никак не влияет на решение, значит сильная гипотеза не подтверждается в этой постановке. Возможно, основная проблема находится не в истории знания, а в рассуждении самой модели, выборе экспериментов или устройстве задачи.
Исходная идея была про память и культуру: что произойдёт, если ИИ-агенты начнут оставлять следующим поколениям не только ответы, но и накопленный опыт? Теперь вопрос кажется мне интереснее.
Память делает систему сильнее, потому что ей не приходится начинать каждый день с нуля. Но та же память создаёт учебники, традиции и привычные маршруты поиска. В какой-то момент прошлый успех начинает влиять не только на ответы, но и на то, какие вопросы система считает разумными.
Поэтому первый важный эксперимент не требует тысячелетней академии. Достаточно одной модели, одинаковых данных и двух библиотек: в одной теория остаётся гипотезой, в другой получает биографию канона.
Если этого уже достаточно, чтобы изменить решение, значит догматизм способен жить не только в параметрах модели. Он может возникать в документах, сводках, ссылках и алгоритме, который решает, что положить исследователю на стол.
А дальше появляется действительно странная возможность. Может быть, одна из интересных форм самоулучшения начнётся не тогда, когда ИИ научится переписывать собственные веса.
А когда система научится улучшать правила, по которым отличает хорошее знание от очень убедительной ошибки.
Основные источникиCultural evolution in populations of Large Language Models, 2024
Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity, 2026
Self-Evolving Multi-Agent Systems via Decentralized Memory, 2026
AI scientists produce results without reasoning scientifically, 2026
Toward Auditable AI Scientists: A Hypothesis Evolution Protocol, 2026
Evidence-Informed LLM Beliefs for Continual Scientific Discovery, 2026
Epistemic Landscapes and the Division of Cognitive Labor, Weisberg & Muldoon
The Communication Structure of Epistemic Communities, Zollman
Does Science Advance One Funeral at a Time?, American Economic Review, 2019
Работы 2026 года в основном являются свежими препринтами.