Согласно результатам исследования, проведенного организацией Salesforce AI Research, многие известные инструменты искусственного интеллекта часто формируют выводы, не имея под собой достаточно веских оснований. В ходе анализа 303 запросов было установлено, что уровень неподтвержденных утверждений колебался от 25% до почти 50%. В случае длинных докладов этот показатель достигал 97,5%.
Эксперты выделили восемь важных метрик для оценки: односторонность, чрезмерная уверенность в тоне, доля релевантных и неподдержанных утверждений, отсутствие ссылок, необходимость указания источника, точность и полнота цитирования. Результаты проверки показали, что даже при наличии множества источников, количество действительно подтвержденных тезисов остается крайне малым — наличие ссылок не всегда гарантирует достоверность информации.
Авторы исследования рекомендуют как пользователям, так и разработчикам ИИ рассматривать его ответы как предварительные версии, сверяться с первоисточниками, обращать внимание на тональность и не полагаться исключительно на количество источников при оценке корректности информации.