Нейробиологи годами пытались расшифровать данные функциональной магнитно-резонансной томографии, чтобы визуализировать то, что видит человек, хотя ранние попытки обычно давали размытые, двусмысленные формы, больше похожие на тесты Роршаха, чем на реальные объекты. Прогресс в разрешении сканирования и архитектурах машинного обучения наконец изменил эту исходную точку.
Михаль Ирани и ее коллеги из Weizmann Institute of Science в Реховоте, Израиль, разработали инструмент ИИ, который декодирует визуальные стимулы напрямую из активности человеческого мозга и реконструирует увиденные изображения с высокой точностью. Система работает в двунаправленном режиме, позволяя исследователям как восстанавливать изображение по сигналам мозга, так и моделировать кортикальные ответы на основе визуальных входных данных.
Двухветвевое декодирование и синтетическое обучение
Первоначальный этап обучения опирался на наборы данных фМРТ высокого разрешения, собранные у добровольцев. Стандартные сканеры фМРТ захватывают активные воксели размером около трех кубических миллиметров, причем каждый кубический миллиметр содержит примерно 16 000 нейронов. Ирани и ее команда использовали оборудование с более высоким разрешением, где каждый записанный воксель соответствовал примерно одному кубическому миллиметру нейронов. Чтобы преодолеть дефицит парных нейровизуализационных данных, команда обучила энкодер в паре с двухветвевым декодером.
"Ключевым моментом является то, что их «декодер мозга» имеет две ветви: одна предсказывает структуру изображения (например, где находятся цвета), а вторая — его содержимое"
Одна ветвь прогнозирует структурную геометрию и распределение цветов визуального поля, в то время как вторая определяет высокоуровневое семантическое содержимое, например идентификацию конкретных объектов на тарелке. Энкодер моделирует ответы фМРТ для неиндексированных визуальных входных данных, создавая цикл синтетического обучения, который позволяет декодеру итеративно уточнять результат, не скатываясь в общий шум.
Эффективность калибровки и этические последствия
Практическое применение интерфейсов мозг-компьютер часто сталкивается с серьезными узкими местами при сборе данных. Ирани отмечает, что ее декодер требует данных калибровки от нового испытуемого, хотя этот метод значительно снижает порог получения данных для последующих сценариев использования по сравнению с устаревшими моделями, которые требовали исчерпывающего переобучения.
Медицинские приложения представляют собой ближайший операционный горизонт для таких архитектур. Джуди Иллес, нейроэтик и профессор неврологии в University of British Columbia в Канаде, которая не участвовала в исследовании, описывает эту работу как великолепную, отмечая, что терапевтическое использование этого подхода для помощи людям с неврологическими заболеваниями невероятно воодушевляет. Ирани надеется, что эта структура поможет пациентам с синдромом запертого человека в общении, даст механистическое понимание функции коры головного мозга и, возможно, позволит исследователям реконструировать визуальное содержание снов.
Однако повышенная точность декодирования порождает острые нейроэтические проблемы, касающиеся ментальной конфиденциальности. Томми Спраг, нейробиолог из University of California, Santa Barbara, предупреждает, что аналогичные структуры декодирования в конечном итоге могут быть развернуты для извлечения внутренних мыслей и ментальных образов без явного согласия человека. Хотя в настоящее время метод опирается на аппаратное обеспечение фМРТ высокого разрешения, алгоритмическая способность распознавать визуальные внутренние состояния подчеркивает острую необходимость установления регуляторных границ для управления нейроданными до того, как неинвазивные структуры декодирования перерастут в коммерческие продукты.