Мозг и LLM: совпадение представлений

В этой подборке описано несколько свежих работ, в которых большие языковые модели (LLM) оказываются полезным инструментом для фундаментальной нейронауки. В этих исследованиях используются скрытые векторные представления (так называемые эмбеддинги) — внутренние числовые коды, в которых модель фиксирует содержание входной информации. Именно эти представления соотносятся с данными мозговой активности или поведения, а выявленные совпадения позволяют по-новому взглянуть на то, как мозг кодирует информацию.
1️⃣ High-level visual representations in the human brain are aligned with large language models
Данные: фМРТ участников, которые смотрели на тысячи естественных изображений. Каждому изображению соответствовали подписи с описанием их содержания.
Подход: сопоставление векторных представлений из LLM (полученных по текстовым подписям к изображениям) с мозговой активностью, а также обучение нейросетей, которые по самим изображениям предсказывают эти LLM-представления.
Результаты:
— Представления LLM хорошо совпадают с активностью в высокоуровневых зрительных областях.
— По активности мозга можно восстановить текстовое описание сцены: значит, в изучаемых областях действительно присутствует семантический уровень кодирования.
— Нейросети, обученные предсказывать такие представления LLM по самим картинкам, объясняют мозговые данные лучше, чем многие современные модели зрительного восприятия.
— Авторы специально проверили разные варианты входных данных (категории объектов, отдельные существительные или глаголы из подписи) и показали, что именно полные описания, на основе которых LLM учитывают весь контекст, дают наилучшее совпадение с мозговой активностью.
— Хотя LLM вообще не имеют зрительного опыта, их представления могут совпадать с мозговыми потому, что они кодируют статистические закономерности окружающего мира, усвоенные с использованием языка.
2️⃣Contextual feature extraction hierarchies converge in large language models and the brain
Данные: инвазивные записи ЭЭГ пациентов во время прослушивания естественной речи, 707 электродов в слуховых и речевых зонах.
Подход: сравнение представлений разных слоёв LLM с иЭЭГ-сигналами и оценка того, какие слои лучше всего предсказывают активность разных участков слуховой и речевой коры.
Результаты:
— Более сильные модели лучше предсказывали нейронные ответы.
— Важным оказалось не только совпадение по точности предсказания в целом, но и совпадение по организации: у сильных моделей иерархия слоёв отражает иерархию обработки в мозге — от ранних слуховых областей к более высокоуровневым.
— При этом такие модели не только более “похожи на мозг”, но используют меньше слоёв для достижения адекватного уровня кодирования.
— Таким образом, улучшение качества моделей сопровождается сближением их вычислительных принципов с мозгом, а не только ростом точности предсказаний.
3️⃣Human-like object concept representations emerge naturally in multimodal large language models
Данные: изображения более 1800 предметов, по которым были собраны миллионы суждений “odd-one-out” (какой из трёх объектов лишний) у людей, LLM и мультимодальных LLM (MLLM), а также фМРТ-активность зрительных областей мозга в ответ на те же объекты.
Подход: извлечение векторных представлений объектов из суждений людей и моделей и сопоставление их структуры между собой и паттернами мозговой активности в зрительных областях.
— И у людей, и у моделей представления объектов складываются в понятные сематические кластеры (напр., живое VS неживое, естественное VS искусственное).
— Мультимодальные модели (MLLM), обученные одновременно на текстах и изображениях, особенно близки к людям: их представления объясняют поведенческие ответы почти на уровне верхней границы.
— Те же представления объясняют фМРТ-активность в областях мозга, чувствительных к категориям объектов.
— Таким образом, модели без прямого доступа к человеческим нейроданным самостоятельно развивают концептуальные схемы объектов, близкие к тем, что использует мозг.