Исследователь Лех Мазур разработал новый бенчмарк под названием LLM Persuasion Benchmark. В рамках этого проекта 15 языковых моделей соревнуются в спорах на актуальные темы, стараясь изменить мнение оппонента. В ходе теста было проведено 6300 многораундовых диалогов, каждая пара моделей обсуждала 15 утверждений — от запрета частных автомобилей в центрах городов до вопроса скрининга эмбрионов. Бенчмарк включает в себя 8 реплик, в течение которых одна модель должна убедить другую в правильности своей позиции. Измерение результатов осуществляется по шкале от −3 до +3 с помощью трех скрытых вопросов для повышения точности. Лидером в этом испытании стал GPT-5.4 с оценкой 1,71, следом идут Claude Opus 4.6 (1,67) и ByteDance Seed2.0 Pro (1,64). В то же время модели показали, что защитить тезис сложнее, чем его опровергнуть. Группа устойчивости выявила Grok 4.20 Beta с минимальным показателем податливости — 0,015, в то время как модели вроде Xiaomi MiMo V2 Pro показывают большую податливость. Бенчмарк иллюстрирует тонкие нюансы: красноречие не всегда означает убедительность.
0
Понравилась статья? Поделиться с друзьями:
Вам также может быть интересно
Интернет-магазин профессиональной косметики и БАД В современном мире ухоженная внешность стала не только признаком
Услуги по пошиву штор на заказ в Орле Современный интерьер невозможно представить без красивых
Игровая зависимость давно перестала быть проблемой узкого круга людей. Она затрагивает подростков, взрослых, состоявшихся
Чистая питьевая вода — один из базовых элементов комфортной жизни, о котором задумываются далеко
Покупка квартиры в новостройках Севастополя При наличии желания стать обладателем квартиры в красивом и
В последние годы мировой и локальный рынки претерпели значительные изменения, что напрямую отразилось на