Проблемы ИИ: исследования Microsoft и Salesforce

В недавнем исследовании, проведенном Microsoft Research и Salesforce, анализировалось свыше 200 000 диалогов с современными моделями ИИ, такими как GPT-4.1, Gemini 2.5 Pro и Claude 3.7 Sonnet. Результаты показали, что ИИ нередко «теряется» в диалогах, теряя свою первоначальную точность и уступая место неверным и галлюцинационным ответам. Хотя индивидуальные запросы обрабатываются с точностью до 90 %, в многоходовых беседах этот показатель падает до 65 %. Модели зачастую основывают новые ответы на неверных данных из предшествующих реплик. Кроме того, наблюдается рост длины ответов на 20-300 %, что приводит к множеству неверных предположений. Даже дополнительные «токены мышления» не решили проблему. Исследование подчеркнуло недостаточную надежность ИИ в многоходовых диалогах, что ставит под сомнение полную замену традиционных поисковых систем инструментами на основе ИИ. Причиной сложностей учёные видят низкое качество подсказок от пользователей.

Понравилась статья? Поделиться с друзьями: