Гайд · Витрати
11 способів зменшити рахунок за LLM, не погіршивши продукт.
Рахунки за LLM ростуть непомітно: довші промпти, більше знайденого контексту, більше викликів на запит, більша модель «про всяк випадок». Більшість цих витрат нічого не дає. Ось одинадцять важелів приблизно в тому порядку, в якому ми їх застосовуємо, — кожен перевірений на тестовому наборі, щоб якість не падала разом з витратами.
Автор: Nythrex EngineeringОновлено 2 хв читання
Системний промпт та інструкції
Знайдений контекст (RAG)
Історія розмови
Повідомлення користувача
Відповідь
Ілюстративний розподіл токенів на запит у типовому RAG-асистенті — не виміряні дані. Виміряйте свої перед оптимізацією.
11 важелів
- 1
1. Вимірюйте по запитах і компонентах
Логуйте токени системного промпту, контексту, історії й відповіді для кожного виклику. Сумарне число в рахунку не оптимізуєш.
- 2
2. Використовуйте кешування промптів
Тримайте стабільний вміст (інструкції, описи інструментів, статичні знання) на початку промпту, щоб провайдер міг кешувати його й тарифікувати повторювані префікси за зниженою ціною.
- 3
3. Маршрутизуйте за складністю
Прості запити (класифікація, витягування, короткі відповіді) — на малу швидку модель, і лише складні — на велику. Часто це найбільша економія.
- 4
4. Знаходьте менше, але краще
Краще ранжування дає змогу надсилати три сильні фрагменти замість десяти посередніх. Reranker зазвичай окуповується.
- 5
5. Підсумовуйте історію розмови
Замінюйте старі репліки поточним підсумком, а не надсилайте весь чат щоразу.
- 6
6. Скоротіть системний промпт
У промптах накопичуються правила, які ніхто не пам'ятає, як додав. Прибирайте, об'єднуйте й тестуйте — кожен токен оплачується в кожному виклику.
- 7
7. Обмежте й структуруйте відповідь
Задайте розумну максимальну довжину й просіть лаконічний структурований вихід. Вихідні токени зазвичай найдорожчі.
- 8
8. Кешуйте цілі відповіді
На однакові чи майже однакові питання (як у FAQ) можна відповідати з кешу — з інвалідацією, коли змінюється джерело.
- 9
9. Обробляйте пакетно офлайн
Нічну класифікацію чи збагачення даних часто можна робити через пакетні інтерфейси провайдерів — дешевше й без тиску на затримку.
- 10
10. Донавчіть малу модель для вузького кроку
На великих обсягах мала модель, донавчена на перевірених прикладах, може замінити велику загальну для однієї конкретної задачі. Див. RAG vs fine-tuning.
- 11
11. Бюджети в коді
Ліміти на запит, на користувача й на день з алертами. Зациклений агент чи скрейпер, що атакує ваш чат-бот, має впертися в ліміт, а не у фінансовий відділ.
Калькулятор вартості LLM API
Системний промпт + знайдений контекст + повідомлення користувача
Приклад цінових рівнів — замініть на актуальний прайс вашого провайдера.
Кешований вхід зазвичай тарифікується за частку звичайної ціни; тут припускаємо 10%.
Орієнтовна вартість на місяць
$251
/ місяць
За запит
$0,0042
За 1 000 запитів
$4,19
Той самий трафік на кожному прикладі рівня
Найбільші важелі: коротші системні промпти, менше знайдених фрагментів, кешування і маршрутизація простих запитів на меншу модель.
Уже в продакшні, а рахунок росте? Переглянемо промпти, пошук і маршрутизацію моделей і покажемо, куди йдуть гроші.
Замовити аудит витратНе міняйте якість на економію випадково
Кожен важіль вище може знизити якість, якщо застосувати його наосліп: менша модель пропускає нюанси, менше контексту — відповідь, коротший промпт — важливе правило. Тому кожна зміна має проганятися на тестовому наборі, а вартість і якість — показуватися поруч. Читайте Оцінювання LLM для не-ML команд.
Низька вартість → Висока вартість
Часті питання
Читайте також
Потрібен другий погляд на ваш проєкт?
Розкажіть, що ви будуєте і де застрягли. Протягом одного робочого дня відповімо з найпрактичнішим наступним кроком — навіть якщо цей крок не з нами.
