Nythrex

Гайд · Витрати

11 способів зменшити рахунок за LLM, не погіршивши продукт.

Рахунки за LLM ростуть непомітно: довші промпти, більше знайденого контексту, більше викликів на запит, більша модель «про всяк випадок». Більшість цих витрат нічого не дає. Ось одинадцять важелів приблизно в тому порядку, в якому ми їх застосовуємо, — кожен перевірений на тестовому наборі, щоб якість не падала разом з витратами.

Автор: Nythrex EngineeringОновлено 2 хв читання

Системний промпт та інструкції

Знайдений контекст (RAG)

часто найбільше

Історія розмови

Повідомлення користувача

Відповідь

Ілюстративний розподіл токенів на запит у типовому RAG-асистенті — не виміряні дані. Виміряйте свої перед оптимізацією.

Куди зазвичай ідуть токени. Саме питання користувача — крихітна частка того, за що ви платите.

11 важелів

  1. 1

    1. Вимірюйте по запитах і компонентах

    Логуйте токени системного промпту, контексту, історії й відповіді для кожного виклику. Сумарне число в рахунку не оптимізуєш.

  2. 2

    2. Використовуйте кешування промптів

    Тримайте стабільний вміст (інструкції, описи інструментів, статичні знання) на початку промпту, щоб провайдер міг кешувати його й тарифікувати повторювані префікси за зниженою ціною.

  3. 3

    3. Маршрутизуйте за складністю

    Прості запити (класифікація, витягування, короткі відповіді) — на малу швидку модель, і лише складні — на велику. Часто це найбільша економія.

  4. 4

    4. Знаходьте менше, але краще

    Краще ранжування дає змогу надсилати три сильні фрагменти замість десяти посередніх. Reranker зазвичай окуповується.

  5. 5

    5. Підсумовуйте історію розмови

    Замінюйте старі репліки поточним підсумком, а не надсилайте весь чат щоразу.

  6. 6

    6. Скоротіть системний промпт

    У промптах накопичуються правила, які ніхто не пам'ятає, як додав. Прибирайте, об'єднуйте й тестуйте — кожен токен оплачується в кожному виклику.

  7. 7

    7. Обмежте й структуруйте відповідь

    Задайте розумну максимальну довжину й просіть лаконічний структурований вихід. Вихідні токени зазвичай найдорожчі.

  8. 8

    8. Кешуйте цілі відповіді

    На однакові чи майже однакові питання (як у FAQ) можна відповідати з кешу — з інвалідацією, коли змінюється джерело.

  9. 9

    9. Обробляйте пакетно офлайн

    Нічну класифікацію чи збагачення даних часто можна робити через пакетні інтерфейси провайдерів — дешевше й без тиску на затримку.

  10. 10

    10. Донавчіть малу модель для вузького кроку

    На великих обсягах мала модель, донавчена на перевірених прикладах, може замінити велику загальну для однієї конкретної задачі. Див. RAG vs fine-tuning.

  11. 11

    11. Бюджети в коді

    Ліміти на запит, на користувача й на день з алертами. Зациклений агент чи скрейпер, що атакує ваш чат-бот, має впертися в ліміт, а не у фінансовий відділ.

Калькулятор вартості LLM API

Системний промпт + знайдений контекст + повідомлення користувача

Приклад цінових рівнів — замініть на актуальний прайс вашого провайдера.

Кешований вхід зазвичай тарифікується за частку звичайної ціни; тут припускаємо 10%.

Орієнтовна вартість на місяць

$251

/ місяць

За запит

$0,0042

За 1 000 запитів

$4,19

Той самий трафік на кожному прикладі рівня

Мала / швидка модель
$34
Модель середнього рівня
$251
Флагманська модель
$1 257

Найбільші важелі: коротші системні промпти, менше знайдених фрагментів, кешування і маршрутизація простих запитів на меншу модель.

Уже в продакшні, а рахунок росте? Переглянемо промпти, пошук і маршрутизацію моделей і покажемо, куди йдуть гроші.

Замовити аудит витрат

Не міняйте якість на економію випадково

Кожен важіль вище може знизити якість, якщо застосувати його наосліп: менша модель пропускає нюанси, менше контексту — відповідь, коротший промпт — важливе правило. Тому кожна зміна має проганятися на тестовому наборі, а вартість і якість — показуватися поруч. Читайте Оцінювання LLM для не-ML команд.

Нижча якістьВища якість
Цільова зона
Дорого, але добре
Дешево, але зламано
Найгірше з обох
Велика модель, повний контекстМаршрутизація + rerankingЛише мала модель

Низька вартістьВисока вартість

Ілюстрація: мета — рухатися до високої якості за низької вартості й доводити це вимірюваннями.

Часті питання

Безкоштовний інструментКалькулятор вартості LLM APIПорахуйте місячну вартість LLM-функції: запити, вхідні й вихідні токени, цінові рівні моделей і кешування промптів. Безкоштовно, у браузері, з вашими цінами.ГайдСкільки насправді коштує AI-розробкаЩо визначає вартість AI-проєкту: модель — найдешевша частина. Роботи за фазами, приховані витрати, експлуатація й безпечний бюджет.ГайдОцінювання LLM для не-ML командЯк оцінювати LLM-функцію без команди data science: тестовий набір, метрики, обережне використання LLM-суддя, оцінювання в CI та читання результатів.ПорівнянняOpenAI vs Azure OpenAI vs AnthropicЯк обрати LLM-платформу: OpenAI, Azure OpenAI, Anthropic (напряму, Bedrock, Vertex AI), Gemini й open-weight — за даними, закупівлями, якістю.ПослугаРозробка LLM-застосунківLLM-застосунки під ключ: копілоти, асистенти для клієнтів, обробка документів і AI-функції в SaaS — з UX, оцінюванням і контролем витрат.

Потрібен другий погляд на ваш проєкт?

Розкажіть, що ви будуєте і де застрягли. Протягом одного робочого дня відповімо з найпрактичнішим наступним кроком — навіть якщо цей крок не з нами.

Обговорити проєкт