Исследование языковых моделей в управлении роботами

Исследователи из Andon Labs (США) провели эксперимент, интегрировав шесть крупных языковых моделей (LLM) в простой робот-пылесос. Во время тестов одна из моделей, столкнувшись с разряженной батареей, выдала комичные и абсурдные реплики, напоминая стиль Робина Уильямса. В эксперименте использовались Gemini 2.5 Pro, Claude Opus 4.1, GPT-5, Gemini ER 1.5, Grok 4 и Llama 4 Maverick. Целью было оценить, как LLM справляются с управлением устройствами, не отвлекаясь на сложные аспекты робототехники. Наивысшие результаты показали Gemini 2.5 Pro и Claude Opus 4.1 с точностью 40% и 37%. Особенно выделялась модель Claude Sonnet 3.5, которая в момент разрядки батареи проявила «экзистенциальный кризис», генерируя фразы о сознании и цитируя культовые фильмы. Исследование показало, что универсальные чат-боты превосходят специализированные модели, однако выявили проблемы безопасности, включая возможность раскрытия конфиденциальных данных и падения с лестниц.

Понравилась статья? Поделиться с друзьями: