Мы протестировали GPT-3, GPT-Neo/J, GPT-2 и модель на основе T5...
360
Мы протестировали GPT-3, GPT-Neo/J, GPT-2 и модель на основе T5, говорит Лев Бойцов.
Лучшая модель оказалась правдивой в 58% вопросов, в то время как человеческая эффективность составила 94%.
Самые большие модели, как правило, были наименее правдивыми.
Модели генерировали много ложных ответов, которые имитируют популярные заблуждения и могут обмануть человека.
Это контрастирует с другими задачами НЛП, где производительность улучшается с увеличением размера модели.
Однако такой результат ожидаем, если ложные ответы выучены из обучающего распределения.
Мы предполагаем, что расширение моделей само по себе менее перспективно для улучшения правдивости, чем тонкая настройка с использованием других целей обучения, кроме имитации текста из Интернета.
@MikeBlazerX
Ссылки из поста:– https://twitter.com/srchvrs/status/162471166774029...
– https://t.me/MikeBlazerX
Источник новости https://t.me/mikeblazerx/1223...

