Нейросети на практике

Токены, контекст, температура: что значат эти слова в нейросетях

МАВИИ — Агентные системы··~3 мин чтения
Токены, контекст, температура: что значат эти слова в нейросетях

Вы просите нейросеть переписать письмо, а она обрывает мысль на середине или выдаёт что-то мимо. В настройках висит ползунок «температура», в справке мелькает «контекст», а расход почему-то считают в «токенах». Слова звучат технически, хотя за каждым — простая идея. Разберём четыре главных, чтобы вы понимали, что происходит и на что нажать, когда ответ вышел не таким.

Токены — кусочки, из которых собирается текст

Нейросеть читает текст не буквами и не целыми словами, а кусочками — их и называют токенами. Слово «переписать» может разбиться на «пере», «пис» и «ать», короткое «кот» уйдёт одним куском, а знак препинания или пробел — отдельным. Точного правила «один токен — это столько-то букв» нет, но для русского прикидка простая: примерно два-три токена на слово.

Зачем это знать. Токены — это счётчик длины. По ним считают, сколько текста поместится за один раз, и по ним же часто берут плату за работу через платные тарифы и API. Залили в чат длинный отчёт на десять страниц — потратили много токенов ещё до того, как получили ответ. Отсюда практический вывод: не кидайте в запрос весь документ целиком, если нужен один раздел — дайте только его.

Контекст — сколько нейросеть держит в голове разом

Окно контекста — это объём текста, который модель видит одновременно: ваш вопрос, её ответ и вся история переписки в этом чате. Как только разговор перерастает окно, самое старое начинает выпадать — нейросеть буквально забывает, что вы писали в начале.

Живой пример: вы час обсуждали в одном чате условия договора, потом попросили свести всё в таблицу — а она путает цифры из первых сообщений. Дело не в глупости, а в том, что начало уже вышло за окно. Признаки, что контекст переполнен:

Что делать: под новую задачу заводите новый чат, а в длинном разговоре время от времени коротко напоминайте ключевое — «напомню, бюджет 300 тысяч, срок до пятницы».

Температура — сухой ответ или творческий

Температура — это ползунок предсказуемости, обычно от 0 до 1 (в некоторых сервисах до 2). Низкая — нейросеть отвечает почти одинаково на один и тот же запрос, держится фактов, меньше фантазирует. Высокая — ответы разнообразнее и живее, но растёт и риск отсебятины.

Проще всего почувствовать разницу на слоганах. На нулевой температуре вы получите пять почти близнецов, скучных и ровных. Поднимите ползунок — и варианты станут неожиданными, среди них попадётся тот самый. А вот для юридического текста или расчёта высокая температура вредна: там нужна точность, а не полёт мысли.

Ползунок температуры есть не везде — в простых чатах вроде Алисы или бесплатного режима его прячут. Но в ChatGPT, Claude, Gemini и GigaChat через настройки или API до него добраться можно.

Промпт — что и как вы просите

Промпт — это ваш запрос к нейросети, сам текст задания. Есть ещё системный промпт: правила, которые задают заранее и которые действуют на весь разговор. Фраза «ты редактор деловых писем, пиши коротко и без канцелярита» — это системная установка, она развернёт все дальнейшие ответы в нужную сторону.

Разница между слабым и сильным промптом видна сразу. «Напиши пост про доставку» даст воду. «Напиши пост про доставку за 2 часа по городу, аудитория — занятые родители, тон дружелюбный, до 60 слов, без восклицательных знаков» даст готовый текст. Чем конкретнее рамка — роль, задача, аудитория, объём, запреты, — тем меньше придётся переписывать.

Пара слов про «модель» и «параметры»

Когда пишут «модель на столько-то миллиардов параметров», речь про внутренний размер нейросети — грубо говоря, сколько настроек у неё внутри. Больше не всегда значит лучше под вашу задачу: тяжёлая модель точнее в сложных рассуждениях, но медленнее и дороже, а для короткого письма хватит и лёгкой. Поэтому у одного сервиса бывает несколько моделей — быстрая для мелочей и мощная для серьёзного.

С чего начать

Не заучивайте определения — потрогайте их руками. Задайте нейросети один и тот же запрос дважды, поменяв температуру, и сравните ответы. Заметьте, в какой момент в долгом чате она начинает забывать начало, — вот вы и увидели окно контекста. Перепишите ленивый промпт в подробный и посмотрите, насколько чище стал результат. Через полчаса таких проб слова из настроек перестанут пугать, а ответы станут заметно точнее. А когда захочется, чтобы нейросеть работала на бизнес не в чате, а внутри процессов — с этим помогает наша команда МАВИИ.

Хотите такого ИИ-агента себе?

Разберём ваши процессы и покажем, что можно автоматизировать за 5–7 дней.

Получить бесплатный разбор