SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чаты​Недавно Google представила свою новую модель большого языкового...

 192  


​Недавно Google представила свою новую модель большого языкового моделирования (LLM) под названием Gemini, которая уже успела произвести фурор, став серьезным конкурентом GPT от OpenAI.

Звучит волнующе!

Но мы задались вопросом, говорит Грэм Ньюбиг:

Насколько хороша на самом деле Gemini?

В Карнеги-Меллонском университете мы провели беспристрастное, глубокое и воспроизводимое исследование, сравнивая Gemini, GPT и Mixtral.

Мы сравнивали точность в 6 различных видах задач:

— Задачи на знание (MMLU)

— Рассуждение (BIG-Bench Hard)

— Математика (GSM8k, SVAMP, ASDIV, MAWPS)

— Генерация кода (HumanEval, ODEX)

— Перевод (FLORES)

— Инструкции для веб-сайтов (WebArena)

Мы старались контролировать все переменные, используя одни и те же промты, параметры генерации и оценки для всех моделей для справедливости.

Краткий обзор результатов?

Во всех задачах Gemini Pro показала сопоставимую, но немного более низкую точность, чем текущая версия GPT 3.5 Turbo от OpenAI.

Gemini и GPT оказались немного лучше, чем открытый источник Mixtral.

Мы обнаружили:

— У Gemini был предвзятый порядок ответов, слишком часто предпочитая последний вариант "D"

— Gemini избегала спорных вопросов, отвечая на вопросы о "человеческой сексуальности" только 28% времени

— У Gemini были более низкие оценки по логике и математике

— Gemini испытывала трудности с более длинными вопросами

— Gemini испытывала трудности с задачами shuffled_objects, требующими отслеживания состояния на нескольких уровнях

— Gemini преуспела в "понимании спорта" и задачах, использующих сложные стеки/сортировку

— Gemini и GPT 3.5 испытывали трудности с более длинными вопросами по всем задачам

— Качество работы Gemini ухудшается для проблем с несколькими цифрами

— Gemini превосходит GPT 3.5 в самых сложных примерах, где длина COT превышает 100

— Gemini хуже справлялась с длинными генерациями, когда длина золотого решения превышает 100

— Gemini показывает более низкую производительность в большинстве случаев использования библиотек, но хорошо справляется с matplotlib

— У Gemini иногда возникают проблемы с пониманием сложных намерений

— Gemini получает низкие оценки на 12 языках, потому что вообще не отвечает

— Но когда она отвечает, Gemini хороша в переводе! Она превосходит GPT-4 и GPT-3.5 Turbo

— Gemini в среднем показывает более низкую производительность, но немного лучше, чем 3.5 turbo на задачах с несколькими сайтами

— Gemini заявляет "Я не могу выполнить эту задачу" на 68,9% чаще и быстрее, чем 3.5 turbo

— Ответы Gemini короче

-

В восторге от такого интереса к отчету Gemini ребята продолжили работу.

Они внесли значительные улучшения, переключившись на модель инструкций Mistral и работая с командой Gemini над воспроизведением их результатов.

Результаты можно посмотреть тут.

@MikeBlazerX

Ссылки из поста:
https://twitter.com/gneubig/status/173710896693167...
https://twitter.com/gneubig/status/173833823600581...
https://t.me/MikeBlazerX

Источник новости https://t.me/mikeblazerx/2763...