Разбор дня

Из чего складывается цена запроса к нейросети — и почему счёт растёт незаметно

МАВИИ — Агентные системы··~3 мин чтения
Из чего складывается цена запроса к нейросети — и почему счёт растёт незаметно

Компания подключает чат-бота к сайту, гоняет его неделю на тестах — счёт три доллара. Запускает на реальных клиентов, а через месяц приходит цифра, от которой брови ползут вверх. Ничего не сломалось: просто мало кто заранее понимает, за что именно нейросеть берёт деньги. А платит бизнес не за «запрос» и не за «подписку по числу сотрудников» — платит за слова. За каждое, которое отправил, и за каждое, которое получил в ответ.

Нейросеть берёт деньги не за вопрос, а за слова

Внутри модель не видит текст так, как мы. Она режет его на мелкие кусочки — по-английски их называют токенами. Один токен — это примерно кусочек слова: короткое слово целиком, длинное разбивается на два-три. Для русского текста грубая прикидка такая: тысяча знаков — это где-то 400–500 таких кусочков. Счётчик тикает на каждом: чем длиннее ваш вопрос и чем длиннее ответ, тем больше кусочков прошло через модель, тем выше цена.

Ответ стоит дороже вопроса — иногда в разы

Тут прячется главная ловушка счёта. Слова, которые вы отправили модели, и слова, которые она сгенерировала в ответ, тарифицируются по-разному — и ответ обычно в три-пять раз дороже. Причина в том, как модель работает: входной текст она «прочитывает» разом, а ответ выдаёт слово за словом, каждый раз прогоняя через себя всё написанное. Отсюда простое следствие для бюджета: болтливый бот, который на «да или нет?» пишет три абзаца с вежливыми расшаркиваниями, сжигает деньги там, где хватило бы одной строки.

Память диалога — это тоже деньги, и они копятся

Нейросеть не помнит прошлые сообщения сама по себе. Чтобы она держала нить разговора, ей при каждом новом вопросе заново подсовывают всю предыдущую переписку — и всё это снова считается словами, за которые идёт оплата. В длинном диалоге двадцатый вопрос тащит за собой все девятнадцать предыдущих. Добавьте сюда инструкцию боту на пару страниц и приложенный документ, которые едут в модель при каждом обращении, — и короткий с виду запрос на деле оказывается совсем не коротким.

Почему одна и та же задача стоит то копейки, то тысячи

Разброс цен между моделями — десятки раз. Маленькая быстрая модель разбирает «это жалоба или вопрос?» за доли копейки. Старшая, «умная» модель за то же обращение возьмёт в двадцать-тридцать раз больше — и для сортировки писем это выброшенные деньги, а для разбора сложного договора, наоборот, экономия на ошибке. Отдельная статья расходов — «думающие» режимы: модель прогоняет длинную цепочку рассуждений про себя, прежде чем ответить, и все эти скрытые размышления тоже оплачиваются как слова. Точность выше, но и чек заметно толще.

Что реально снижает счёт

Хорошая новость: на цену можно влиять, и провайдеры сами дают рычаги. Если одна и та же большая инструкция или база знаний уходит в модель раз за разом, её умеют запоминать на стороне сервиса — повторное обращение к этому куску стоит в разы дешевле. Задачи, которым не нужен ответ сию секунду — ночная разметка тысяч заявок, разбор архива, — можно складывать в пакет и обрабатывать со скидкой около половины цены. А самое дешёвое слово — то, которое не отправили: короткая инструкция, ответы по делу и мелкая модель там, где хватает мелкой, экономят больше любых скидок.

Вывод

Экономика ИИ проще, чем кажется: считаются слова на входе и на выходе, ответ дороже вопроса, а память диалога и длинные инструкции тихо умножают счёт. Кто это понимает, платит за результат, а не за болтовню бота. В МАВИИ мы как раз и собираем ИИ-решения так, чтобы они работали на бизнес, а не на счётчик — с трезвым выбором модели под каждую задачу.

Хотите такого ИИ-агента себе?

Разберём ваши процессы и покажем, что можно автоматизировать за 5–7 дней.

Получить бесплатный разбор