SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чаты​Gemini 3 Flash заявлен на 80% дешевле, чем GPT-5.4

 170  


​Gemini 3 Flash заявлен на 80% дешевле, чем GPT-5.4.

Но на 12 реальных задачах его использование обошлось на 38% дороже.

Сейчас каждая SaaS-команда, с которой я общаюсь, пытается порезать косты на ИИ, отмечает Серж Херкюль.

И большинство цепляется за единственную цифру, которая им врет: прайс-лист.

Новое исследование от Стэнфорда, Беркли, Университета Карнеги-Меллона и Microsoft прогнало 8 рассуждающих моделей через 12 задач и сравнило заявленную цену с фактическим счетом.

Почти в трети случаев "более дешевая" модель обошлась дороже.

В худшем сценарии — до 28 раз дороже.

Вы платите не за вопрос.

Вы платите за токены.

И разные модели сжигают абсолютно разное их количество, чтобы ответить на один и тот же запрос.

Одна модель потратила 60 000 токенов на размышления над задачей, которую другая решила за 25.

В агентной задаче одна сделала 57 шагов, тогда как другой хватило 7.

Дешевле за токен.

Дороже за задачу.

Уберите ИИ, и останется урок ценообразования стар как мир: цена за единицу — это не итоговая стоимость.

Если вы строите продукт на LLM, из этого следуют две вещи.

Ваша себестоимость — это не цена в прайсе.

Это цена из прайса, умноженная на потребление, а потребление — величина переменная, зависящая от конкретной модели и отчасти случайная.

Один и тот же запрос, та же модель, а стоимость от запуска к запуску скакала до 9,7 раз.

И если поверх этого вы берете фиксированную плату с клиентов, ваши самые активные юзеры тихо утащат вас в минус.

Вы доверили свою маржу генератору случайных чисел.

Цена в прайсе — это маркетинговая цифра.

Счет — это цифра поведения.

Часто они даже не одного порядка.

Самая дешевая модель в прайс-листе не значит самая дешевая в счете.

Считайте обе метрики, прежде чем принимать решение.

Инсайты комьюнити

— Эффективность токенов зависит от типа задачи, поэтому модель, которая выигрывает в бенчмарках по цене, часто проигрывает в реальном продакшене. Полевое внедрение в агентные клиентские системы показывает: единственная адекватная оценка — это сквозная стоимость, измеренная на репрезентативной нагрузке, а не заявленная цена за токен.

— Гипотеза из полевых наблюдений: некоторые модели со временем деградируют, сжигая больше токенов на выдачу того же результата. Фактическая стоимость растет, даже если цена за токен остается неизменной — это долгосрочный дрейф, который отличается от дисперсии между отдельными запусками.

@MikeBlazerX

⚠️ Закрытый канал: @MikeBlazerPRO

Ссылки из поста:
https://www.linkedin.com/posts/serge-herkul_gemini...
https://t.me/MikeBlazerX
https://t.me/tribute/app?startapp=sE4X

Источник новости https://t.me/mikeblazerx/6526...