Исследование: языковые модели в спорах

Исследователь Лех Мазур разработал новый бенчмарк под названием LLM Persuasion Benchmark. В рамках этого проекта 15 языковых моделей соревнуются в спорах на актуальные темы, стараясь изменить мнение оппонента. В ходе теста было проведено 6300 многораундовых диалогов, каждая пара моделей обсуждала 15 утверждений — от запрета частных автомобилей в центрах городов до вопроса скрининга эмбрионов. Бенчмарк включает в себя 8 реплик, в течение которых одна модель должна убедить другую в правильности своей позиции. Измерение результатов осуществляется по шкале от −3 до +3 с помощью трех скрытых вопросов для повышения точности. Лидером в этом испытании стал GPT-5.4 с оценкой 1,71, следом идут Claude Opus 4.6 (1,67) и ByteDance Seed2.0 Pro (1,64). В то же время модели показали, что защитить тезис сложнее, чем его опровергнуть. Группа устойчивости выявила Grok 4.20 Beta с минимальным показателем податливости — 0,015, в то время как модели вроде Xiaomi MiMo V2 Pro показывают большую податливость. Бенчмарк иллюстрирует тонкие нюансы: красноречие не всегда означает убедительность.

Понравилась статья? Поделиться с друзьями: