💸 Как экономить токены LLM Сегодня посчитал стоимость работы с...
78
💸 Как экономить токены LLM
Сегодня посчитал стоимость работы с несколькими старшими LLM и малость загрустил. Токены старших моделей стоят прилично и при массовой работе (а в SEO это обычное дело) это кушает бюджет крайне быстро.
Есть несколько наработанных приёмов снижающих расход токенов без потери качества.
1. Режем промпты на статичную и динамическую часть и никогда не трогаем порядок и текст статичной. Практически все LLM имеют кэширование префикса промпта, и повторяющийся неизменный блок обходится в разы дешевле при каждом следующем вызове (работа с кэшем в разы дешевле). Но ежели вы залезете в промпт и что то допишете, то кэш сбрасывается.
2. Маршрутизируем задачи по сложности, а не гоняем всё через старшую модель. Классификация запроса, извлечение сущностей, форматирование и т.д. это работа для младшей модели, и разница в цене может быть десятикратной. Старшую модель оставляйте только там, где реально нужно её рассуждение.
3. Используем batch API для всего, что не требует ответа в реальном времени. У основных провайдеров пакетная обработка стоит заметно дешевле обычных синхронных запросов, а массовая генерация контента почти никогда не требует немедленного ответа.
4. Задаем выходной контракт явной схемой. Как известно, output-токен обходится раза в три дороже input-токена, а размытая инструкция к выводу провоцирует модель отвечать многословнее, чем нужно.
5. Безжалостно рубим из контекста RAG-документы и tool-описания, не относящиеся к конкретному запросу, вместо "на всякий случай прикрепить всё". Лишний документ отъедает токены и размывает внимание модели.
6. И последнее, самое системное - компрессия самого промпта.
По компрессии промптов накоплен приличный пул исследований. По сути это целое направление исследований:
➡️Обзорная работа Prompt Compression for LLMs: A Survey раскладывает область на hard-подходы, которые режут обычный читаемый текст, и soft-подходы, кодирующие контекст в нечитаемые векторы.
➡️LLMLingua отбирает информативные токены и защищает числа от удаления, а LLMLingua-2 превращает тот же отбор в задачу классификации через дистилляцию и обгоняет первую версию по скорости и качеству.
➡️RECOMP показывает, что для RAG выгоднее сжимать документы в текст под конкретную задачу, а не делать общий пересказ.
➡️А работа Relevant but Incomplete поймала неприятный эффект: агрессивное сжатие часто оставляет факт, но вырезает его определение или условие, и такой обрубленный контекст выглядит релевантным, но реально бесполезен для модели.
Отдельного внимания стоит работа Compression Method Matters: при коэффициенте сжатия 0,3 средняя длина ответа на одном наборе задач выросла в 56 раз, потому что сжатие повредило центральную часть инструкции. Экономия на входе обернулась взрывным ростом на выходе, а с учётом того, что выходной токен дороже входного, итоговый счёт получился хуже исходного.
С последним мириться было нельзя, и за дело принялся знающий человек - наш военком.
Отсюда и родился PromptSculptor - хитрый и ловкий промпт для сжатия других промптов!!!!
У него два рабочих режима:
➡️COMPRESS сжимает промпт на одном из трёх уровней риска, от точечной нормализации до агрессивного переписывания, и никогда не трогает soft-пожелания без явного разрешения.
➡️AUDIT сравнивает оригинал и сжатую версию по конкретным проверяемым пунктам: не потерялось ли ограничение, не сломалась ли схема вывода, не осталась ли в тексте ссылка на определение, которое вырезали при сжатии. Там, где промпт слишком рискованно жать на запрошенном уровне, встроенный механизм сам понижает уровень сжатия.
Промпт PromptSculptor и хэлп к нему выложил на канал со спецпромптами.
Изучайте и тестируйте.
🔔 Узнайте как поддержать развитие канала.
📔 DrMax: Доказательное SEO 2026 + Введение в Промптоведение
📚 25 PRO промптов + Pocketbook DrMax: Промптоведение для SEO-стратегов 2026
❄️Всяческая SEO халява
Ссылки из поста:– https://www.alphaxiv.org/abs/2410.12388
– https://www.alphaxiv.org/abs/2310.05736
– https://www.alphaxiv.org/abs/2403.12968
– https://www.alphaxiv.org/abs/2310.04408
– https://www.alphaxiv.org/abs/2608.04569
– https://www.alphaxiv.org/abs/2603.23527
– https://t.me/drmaxprompt/94?single
– https://t.me/drmaxseo/1543
– https://t.me/drmaxseo/1144
– https://t.me/drmaxseo/1355
– https://t.me/drmaxseo/1249
Источник новости https://t.me/drmaxseo/1703...

