SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чаты💸 Как экономить токены LLM Сегодня посчитал стоимость работы с...

 78  


💸 Как экономить токены LLM

Сегодня посчитал стоимость работы с несколькими старшими LLM и малость загрустил. Токены старших моделей стоят прилично и при массовой работе (а в SEO это обычное дело) это кушает бюджет крайне быстро.

Есть несколько наработанных приёмов снижающих расход токенов без потери качества.

1. Режем промпты на статичную и динамическую часть и никогда не трогаем порядок и текст статичной. Практически все LLM имеют кэширование префикса промпта, и повторяющийся неизменный блок обходится в разы дешевле при каждом следующем вызове (работа с кэшем в разы дешевле). Но ежели вы залезете в промпт и что то допишете, то кэш сбрасывается.

2. Маршрутизируем задачи по сложности, а не гоняем всё через старшую модель. Классификация запроса, извлечение сущностей, форматирование и т.д. это работа для младшей модели, и разница в цене может быть десятикратной. Старшую модель оставляйте только там, где реально нужно её рассуждение.

3. Используем batch API для всего, что не требует ответа в реальном времени. У основных провайдеров пакетная обработка стоит заметно дешевле обычных синхронных запросов, а массовая генерация контента почти никогда не требует немедленного ответа.

4. Задаем выходной контракт явной схемой. Как известно, output-токен обходится раза в три дороже input-токена, а размытая инструкция к выводу провоцирует модель отвечать многословнее, чем нужно.

5. Безжалостно рубим из контекста RAG-документы и tool-описания, не относящиеся к конкретному запросу, вместо "на всякий случай прикрепить всё". Лишний документ отъедает токены и размывает внимание модели.

6. И последнее, самое системное - компрессия самого промпта.

По компрессии промптов накоплен приличный пул исследований. По сути это целое направление исследований:

➡️Обзорная работа Prompt Compression for LLMs: A Survey раскладывает область на hard-подходы, которые режут обычный читаемый текст, и soft-подходы, кодирующие контекст в нечитаемые векторы.

➡️LLMLingua отбирает информативные токены и защищает числа от удаления, а LLMLingua-2 превращает тот же отбор в задачу классификации через дистилляцию и обгоняет первую версию по скорости и качеству.

➡️RECOMP показывает, что для RAG выгоднее сжимать документы в текст под конкретную задачу, а не делать общий пересказ.

➡️А работа Relevant but Incomplete поймала неприятный эффект: агрессивное сжатие часто оставляет факт, но вырезает его определение или условие, и такой обрубленный контекст выглядит релевантным, но реально бесполезен для модели.

Отдельного внимания стоит работа Compression Method Matters: при коэффициенте сжатия 0,3 средняя длина ответа на одном наборе задач выросла в 56 раз, потому что сжатие повредило центральную часть инструкции. Экономия на входе обернулась взрывным ростом на выходе, а с учётом того, что выходной токен дороже входного, итоговый счёт получился хуже исходного.

С последним мириться было нельзя, и за дело принялся знающий человек - наш военком.

Отсюда и родился PromptSculptor - хитрый и ловкий промпт для сжатия других промптов!!!!

У него два рабочих режима:

➡️COMPRESS сжимает промпт на одном из трёх уровней риска, от точечной нормализации до агрессивного переписывания, и никогда не трогает soft-пожелания без явного разрешения.

➡️AUDIT сравнивает оригинал и сжатую версию по конкретным проверяемым пунктам: не потерялось ли ограничение, не сломалась ли схема вывода, не осталась ли в тексте ссылка на определение, которое вырезали при сжатии. Там, где промпт слишком рискованно жать на запрошенном уровне, встроенный механизм сам понижает уровень сжатия.

Промпт PromptSculptor и хэлп к нему выложил на канал со спецпромптами.

Изучайте и тестируйте.

🔔 Узнайте как поддержать развитие канала.

📔 DrMax: Доказательное SEO 2026 + Введение в Промптоведение

📚 25 PRO промптов + Pocketbook DrMax: Промптоведение для SEO-стратегов 2026

❄️Всяческая SEO халява

Ссылки из поста:
https://www.alphaxiv.org/abs/2410.12388
https://www.alphaxiv.org/abs/2310.05736
https://www.alphaxiv.org/abs/2403.12968
https://www.alphaxiv.org/abs/2310.04408
https://www.alphaxiv.org/abs/2608.04569
https://www.alphaxiv.org/abs/2603.23527
https://t.me/drmaxprompt/94?single
https://t.me/drmaxseo/1543
https://t.me/drmaxseo/1144
https://t.me/drmaxseo/1355
https://t.me/drmaxseo/1249

Источник новости https://t.me/drmaxseo/1703...