Новый взгляд на искусственный интеллект от Nvidia

Джим Фан, руководитель отдела робототехники компании NVIDIA, объявил о важной смене парадигмы в области искусственного интеллекта. Он подчеркивает, что традиционное предсказание следующего слова уже не соответствует требованиям современности. Теперь акцент следует сделать на предсказании физических состояний окружающего мира.

На данный момент VLA-модели для роботов создаются на основе языковых моделей, но они больше хранят факты, такие как «это логотип Coca-Cola», нежели физические взаимодействия, например, «если наклонить бутылку, жидкость прольется». Эта ситуация демонстрирует архитектурный тупик.

Фан приводит интересный аргумент: приматы, которые катаются на гольф-картах, понимают язык хуже современных моделей, но 30% их коры мозга отвечает за обработку зрительных данных. Зрение напрямую связано с моторными навыками, не требуя словесного перевода.

Скорее всего, в этом году концепция «моделей мира», ориентированных на предсказание будущих состояний, станет основой робототехники. Рассуждения будут происходить в визуальном пространстве, используя симуляцию геометрии вместо текстового перевода. Это заявляет о редком случае, когда специалист из крупной корпорации открыто признает, что возможно выбрал неверное направление в исследованиях.

Понравилась статья? Поделиться с друзьями: