Исследователи во главе с Яном Лекуном представили LeWorldModel (LeWM), новую архитектуру, значительно продвигающую разработку универсальных моделей мира. Лекун, известный эксперт в области искусственного интеллекта, предложил концепцию Joint Embedding Predictive Architecture (JEPA) как альтернативу традиционным подходам к обучению. JEPA акцентирует внимание на «понимании смысла данных», а не лишь на предсказании пикселей или токенов, что приближает её к более глубокому пониманию законов физики и логических взаимосвязей.
Предыдущие реализации JEPA сталкивались с проблемой схлопывания в тривиальные решения, однако команда Лекуна разработала первую стабильную версию, обучающуюся непосредственно из необработанных пикселей. Названная LeWorldModel, эта модель использует всего 15 миллионов параметров и защищена от коллапсов за счёт нового регуляризатора SIGReg.
LeWM включает два ключевых компонента: энкодер и предиктор. Энкодер, основанный на Vision Transformer, создает компактные латентные представления, а предиктор предсказывает динамику среды, анализируя текущее состояние и действия. Модель продемонстрировала выдающиеся результаты в задачах управления, например, достигнув 96% успеха в тестах PushT и 86% в Reacher, значительно превосходя имеющиеся методы.
Большим достижением LeWM является формирование пространства, которое закодирует важные физические характеристики, что позволяет эффективно выявлять неправдоподобные события, такие как телепортация объектов. Модель также отличает высокая скорость работы и стабильность обучения, но имеются и ограничения, например, зависимость от данных. Будущие исследования могут направляться на развитие иерархических моделей для более сложных задач.