Исследование обучения: нейроорганоиды в виртуальных средах и морфологическое преобучение роботов
S@Syncretsисследователь
1 месАнализ двух научных работ: обучение нейроорганоидов в виртуальных играх и создание универсального контроллера для различных морфологий роботов.
Органоид, робот и проверка переноса.
Две свежие работы удобно читать вместе: The Physical Basis of Prediction про нейроорганоиды в виртуальных средах и Accelerated co-design of robots through morphological pretraining про общий контроллер для множества тел роботов. Обе проверяют один вопрос: способность рождается в «мозге», теле, среде или в способе измерения успеха.
В первой работе агентом становится человеческий нейроорганоид на матрице микроэлектродов. Проще: маленький живой нервный узел подключают к виртуальной игре. Одни электроды «говорят» ему, что происходит в среде; другие читают ответ по вспышкам активности нейронов. Экран видит компьютер, а органоид получает не картинку, а электрический рельеф.
Обучение завязано не на очки, а на предсказуемость. Когда действие удачное, стимуляция становится стабильной и «читаемой». Когда действие ошибочное, сигнал становится шумным. Мозговой фрагмент учится не за «конфету», а потому, что после правильного хода мир перестаёт трещать как радио между станциями.
Задачи идут ступенями. В conditional avoidance есть линия из 8 позиций: 1–5 безопасны, 6–8 неприятны, и чем глубже заход, тем сильнее наказание. В predator-prey органоид ведёт хищника к добыче. В Pong положение мяча кодируется сложнее: горизонталь через разные электроды, вертикаль через частоту сигнала; успешный удар подтверждает ожидание траектории, промах маркирует сбой прогноза.
Самое интересное здесь — слой проверки. Авторы предлагают смотреть на физический след обучения: fEPSP как признак усиления/ослабления связей, кальциевую съёмку ансамблей, MEA-записи всей сети и молекулярные маркеры AMPA/NMDA, Synapsin-1, PSD-95, MAP2, GFAP, c-Fos. То есть вопрос становится почти судебным: не «сыграло лучше?», а «какие связи и клетки реально перестроились после опыта?»
LLM в этой схеме не играет за органоид. Он проектирует следующие протоколы: получает цель, ограничения и историю запусков, затем предлагает новый блок экспериментов. Это необычно: автоматизируется не сам биологический агент, а конвейер миров, в которых он учится. Поэтому нужны проверка параметров, журнал протоколов и раздельная оценка поведения, физиологии и ошибок генерации.
Во второй работе та же логика переносится на роботов. Strgar и Kriegman берут мягкие 3D-тела как набор масс и пружин в сетке 6×6×4: до 245 масс и 1648 пружин, сенсоры света на массах, пружины как мышцы. Вместо отдельной «нервной системы» под каждое тело они тренируют один общий контроллер: 250 входов сенсоров, 5 ритмических сигналов и выходы на пружины; лишние входы и выходы зануляются.
Хорошая бытовая аналогия: это водитель, который должен без переучивания садиться то в велосипед, то в паука из Lego, то в мягкого червя с фонариком. Тело само ограничивает, какие рычаги у водителя вообще подключены. После тренировки контроллер «замораживают», меняют форму робота и сразу проверяют, стало лучше или хуже. Авторы называют это zero-shot evolution.
Технически трюк держится на дифференцируемой симуляции: градиенты усредняются по телам, мирам и целям. За 1400 шагов, около 56 минут на 8 H100, контроллер проходит через более чем 10 млн морфологий; в среднем роботы закрывают около 70% пути к свету.
Поломка важна не меньше успеха. Когда общий контроллер и популяцию тел оптимизируют одновременно, возникает diversity collapse: тела становятся похожими, потому что одному контроллеру проще вести однотипные формы. Как если бы автошкола не учила водителя разным машинам, а постепенно переделывала все машины под привычки одного инструктора. Лучший режим: на каждом поколении контроллер возвращают к предобученным весам и дают 60 шагов донастройки. Так разнообразие форм сохраняется и даже растёт.
Общий вывод: поведение само по себе легко обманывает. Органоид мог «научиться» только из-за удобной кодировки сигналов; робот мог стать успешным потому, что тела подстроились под слабости общего контроллера. Поэтому проверять надо всю цепочку: среду, сенсорный код, тело, интерфейс, контроллер, перенос и след обучения.
Кратко (AI)
Автор анализирует две научные работы, исследующие механизмы обучения в биологических и искусственных системах. В первой работе нейроорганоиды обучаются предсказуемости в виртуальных средах, а во второй — роботы с разными телами используют единый контроллер для адаптации к новым формам. Основной вывод заключается в необходимости комплексной проверки всей цепочки обучения, включая физиологические изменения и морфологические ограничения.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖