Токены, контекст, температура: что значат эти слова в нейросетях

Вы просите нейросеть переписать письмо, а она обрывает мысль на середине или выдаёт что-то мимо. В настройках висит ползунок «температура», в справке мелькает «контекст», а расход почему-то считают в «токенах». Слова звучат технически, хотя за каждым — простая идея. Разберём четыре главных, чтобы вы понимали, что происходит и на что нажать, когда ответ вышел не таким.
Токены — кусочки, из которых собирается текст
Нейросеть читает текст не буквами и не целыми словами, а кусочками — их и называют токенами. Слово «переписать» может разбиться на «пере», «пис» и «ать», короткое «кот» уйдёт одним куском, а знак препинания или пробел — отдельным. Точного правила «один токен — это столько-то букв» нет, но для русского прикидка простая: примерно два-три токена на слово.
Зачем это знать. Токены — это счётчик длины. По ним считают, сколько текста поместится за один раз, и по ним же часто берут плату за работу через платные тарифы и API. Залили в чат длинный отчёт на десять страниц — потратили много токенов ещё до того, как получили ответ. Отсюда практический вывод: не кидайте в запрос весь документ целиком, если нужен один раздел — дайте только его.
Контекст — сколько нейросеть держит в голове разом
Окно контекста — это объём текста, который модель видит одновременно: ваш вопрос, её ответ и вся история переписки в этом чате. Как только разговор перерастает окно, самое старое начинает выпадать — нейросеть буквально забывает, что вы писали в начале.
Живой пример: вы час обсуждали в одном чате условия договора, потом попросили свести всё в таблицу — а она путает цифры из первых сообщений. Дело не в глупости, а в том, что начало уже вышло за окно. Признаки, что контекст переполнен:
- нейросеть повторяет вопросы, на которые вы уже отвечали;
- теряет детали и договорённости из начала диалога;
- ответы становятся общими, будто она забыла тему.
Что делать: под новую задачу заводите новый чат, а в длинном разговоре время от времени коротко напоминайте ключевое — «напомню, бюджет 300 тысяч, срок до пятницы».
Температура — сухой ответ или творческий
Температура — это ползунок предсказуемости, обычно от 0 до 1 (в некоторых сервисах до 2). Низкая — нейросеть отвечает почти одинаково на один и тот же запрос, держится фактов, меньше фантазирует. Высокая — ответы разнообразнее и живее, но растёт и риск отсебятины.
Проще всего почувствовать разницу на слоганах. На нулевой температуре вы получите пять почти близнецов, скучных и ровных. Поднимите ползунок — и варианты станут неожиданными, среди них попадётся тот самый. А вот для юридического текста или расчёта высокая температура вредна: там нужна точность, а не полёт мысли.
- Низкая (ближе к 0): факты, инструкции, код, переводы, работа с цифрами.
- Высокая (ближе к 1): идеи, слоганы, сюжеты, мозговой штурм, тексты «с настроением».
Ползунок температуры есть не везде — в простых чатах вроде Алисы или бесплатного режима его прячут. Но в ChatGPT, Claude, Gemini и GigaChat через настройки или API до него добраться можно.
Промпт — что и как вы просите
Промпт — это ваш запрос к нейросети, сам текст задания. Есть ещё системный промпт: правила, которые задают заранее и которые действуют на весь разговор. Фраза «ты редактор деловых писем, пиши коротко и без канцелярита» — это системная установка, она развернёт все дальнейшие ответы в нужную сторону.
Разница между слабым и сильным промптом видна сразу. «Напиши пост про доставку» даст воду. «Напиши пост про доставку за 2 часа по городу, аудитория — занятые родители, тон дружелюбный, до 60 слов, без восклицательных знаков» даст готовый текст. Чем конкретнее рамка — роль, задача, аудитория, объём, запреты, — тем меньше придётся переписывать.
Пара слов про «модель» и «параметры»
Когда пишут «модель на столько-то миллиардов параметров», речь про внутренний размер нейросети — грубо говоря, сколько настроек у неё внутри. Больше не всегда значит лучше под вашу задачу: тяжёлая модель точнее в сложных рассуждениях, но медленнее и дороже, а для короткого письма хватит и лёгкой. Поэтому у одного сервиса бывает несколько моделей — быстрая для мелочей и мощная для серьёзного.
С чего начать
Не заучивайте определения — потрогайте их руками. Задайте нейросети один и тот же запрос дважды, поменяв температуру, и сравните ответы. Заметьте, в какой момент в долгом чате она начинает забывать начало, — вот вы и увидели окно контекста. Перепишите ленивый промпт в подробный и посмотрите, насколько чище стал результат. Через полчаса таких проб слова из настроек перестанут пугать, а ответы станут заметно точнее. А когда захочется, чтобы нейросеть работала на бизнес не в чате, а внутри процессов — с этим помогает наша команда МАВИИ.
Хотите такого ИИ-агента себе?
Разберём ваши процессы и покажем, что можно автоматизировать за 5–7 дней.
Получить бесплатный разбор