Каждый день только в ChatGPT отправляется несколько миллиардов запросов. Люди просят придумать тексты, переписать письма, собрать презентации, нарисовать картинку, объяснить сложное простыми словами. Ответы, которые они получают от нейросетей, генерируются LLM — большими языковыми моделями.
В этой статье разберемся, как устроены современные LLM, почему они иногда ошибаются и как будут развиваться дальше. Материал подойдет специалистам, которые хотят работать вместе с ИИ — копирайтерам, маркетологам, дизайнерам.
Что такое LLM
Мы знаем, как работает поиск в интернете или режим Т9 в смартфоне. Под капотом у них — простые языковые модели, которые умеют предсказывать последовательность слов. Они опираются на частоту использования и заданные разработчиками правила.
Следующее поколение этой технологии — LLM (Large Language Model). Это большая языковая модель, которая предсказывает следующий элемент текста на основе всего предыдущего контекста. Она работает уже не с одним словом, а сразу собирает целое предложение. К LLM относят зарубежные ChatGPT, Gemini, Claude, DeepSeek, Grok, а также российские YandexGPT и GigaChat.
Чтобы LLM могла предсказывать следующее слово и выстраивать целые фразы, ее обучили на огромных массивах текста — веб-страницах, книгах, статьях. В процессе она усвоила миллиарды примеров того, какие слова и фразы обычно следуют друг за другом.
LLM похожа на робота, который прочитал все книги в библиотеке, прежде чем начал уверенно отвечать на вопросы пользователя. Он не заучивал ответы заранее, но впитал лексику, интонации, ритм речи. Поэтому может не только объяснять факты, но и придерживаться стиля.
Что такое токены и почему от них зависит генерация
Большая модель не видит текст как цельные слова. Вместо этого она разбивает его на кусочки или токены: части слов, слоги, символы. Это нужно для того, чтобы подобрать максимально подходящее продолжение фразы. Например, «информационная» для LLM выглядит примерно так: ["ин", "форма", "ционная"].
Человек с большой вероятностью продолжит мысль словами «информационная… безопасность» или «информационная… архитектура». Модель рассуждает похожим образом, но математически. Каждый токен превращается в числовой вектор и занимает свою позицию в многомерном пространстве — это называют эмбеддинг. Токены с похожим значением оказываются «ближе» друг к другу.
В этом пространстве у начала следующего слова ["без"] может оказаться больше веса и семантической близости к «информационная», чем у ["арх"] — это зависит от контекста разговора с пользователем.
Как работает популярный ChatGPT
Современные чат-боты и ассистенты вроде ChatGPT от OpenAI устроены сложнее — модель читает текст не по строчке, а видит связи сразу между всеми частями фразы. Но генерирует ответ все также по одному токену, каждый раз переоценивая вероятности.
GPT (Generative Pre-trained Transformer) — это конкретный класс LLM. В аббревиатуре зашита логика работы такой модели.
Generative. Модель генерирует текст, каждый раз выбирая наиболее вероятное продолжение на основе контекста. Она собирает его токен за токеном.
Pre-trained. Модель заранее обучена на больших массивах данных и уже знает, как устроен язык: стиль, структуру фраз, типовые паттерны аргументации. В диалоге она не учится с нуля, а использует эти знания через параметры.
Transformer. Архитектура, в которой каждый токен соотносится с другими токенами в тексте и получает от них взвешенную информацию. Так работает механизм внимания (attention). Упрощенно его можно представить как ответ на три вопроса:
- Query — «Что я сейчас ищу» (Какой смысл важен в этом месте текста?).
- Key — «Что у меня есть» (Какие элементы контекста потенциально релевантны?).
- Value — «Что я могу взять» (Какую информацию реально использовать для ответа?).
Запрос напрямую влияет на то, какие части контекста модель сочтет важными, а какие проигнорирует. А вместе с тем и каким будет качество ее ответа. Поэтому копирайтеру и маркетологу важно понимать, как работает GPT. Чем точнее вы формулируете задачу, расставляете акценты и даете контекст, тем правильнее ответ по параметру Query модели. С грамотным запросом вы можете получить нужный результат — по тону, логике и пользе для бизнеса.
Почему языковая модель галлюцинирует
LLM устроена так, что она всегда должна продолжать генерацию и дать законченный ответ. На уровне механики у нее нет опции « не знаю» или «я не уверена». В каждый момент времени она выбирает самый вероятный следующий токен — даже если он не опирается на заданный контекст или ведет к вымышленному выводу. Так она может уверенно соврать или по-другому — галлюцинировать.
Галлюцинации — это побочный эффект сильных сторон нейросети. Тот же механизм внимания, который делает ответы связными, логичными и удобными для чтения, не проверяет их на истинность.
У галлюцинаций LLM обычно есть три основные причины.
Данные обучения. Языковые модели учатся на текстах, созданных людьми. А значит наследуют не только знания и факты, но и ошибки, устаревшие сведения, культурные перекосы и стереотипы.
Контекстное окно. Каждый новый запрос отправляется в модель вместе с контекстом — предыдущими запросами и сгенерированными ответами. Когда этот буфер переполняется или в нем слишком много разнородных смыслов, модель начинает терять фокус.
Недостаток данных. Если в запросе мало фактов или вопрос сформулирован двусмысленно, модель может выбрать уверенно звучащую, но вымышленную версию ответа.
Вернемся к LLM-роботу, который прочитал все издания в самой крупной мировой библиотеке. В его памяти миллионы источников, мнений и формулировок — достоверных и ошибочных, «хороших» и «плохих». Иногда они смешиваются, но он не замечает этого и выдает ложные сведения вперемешку с фактами как уверенный ответ.
В работе маркетолога и копирайтера языковую модель важно воспринимать как ассистента — она отлично помогает на этапе идей, структуры, черновиков. Но в этом результате могут быть логические и математические ошибки, юридические неточности. Поэтому все выводы должен проверять человек.
Как уменьшить риск ошибки LLM
Снизить риск галлюцинации можно, если использовать подход RAG (Retrieval-Augmented Generation). По нему модель сначала ищет релевантную информацию во внешних или загруженных источниках, затем добавляет ее в контекст запроса и после этого формирует свой ответ.
RAG можно сравнить с проектом или папкой, куда подгружают документацию, базу знаний, файлы компании и просят нейросеть сначала проанализировать их. Важно, что LLM при этом все так же предсказывает следующий токен, но в проценте вероятности больше веса отдается вашим материалам.
Другой вариант — выбрать режим «глубокого исследования» или модель со встроенным рассуждением. Обычно возле номера есть слово Thinking. Тогда LLM не будет сразу подбирать токены и писать ответ — сначала разделит задачу на отдельные шаги и проанализирует каждый, выстроит логическую цепочку и только потом перейдет к формулировке ответа. А значит, его качество будет выше.
Почему сейчас везде мультимодальные LLM
Раньше изображение и текст обрабатывались разными моделями, а затем по внутренним правилам собирались в единый ответ пользователю. В современных мультимодальных LLM связи между словами, объектами и звуками строятся внутри одной модели. Она может прочитать запрос или «услышать» голос, сгенерировать картинку и выдать пользователю связный ответ.
Мультимодальность работает по уже знакомому алгоритму:
- Звук или изображение разбиваются на токены: фрагменты звуковой волны, части визуального пространства.
- Включается механизм внимания, после чего модель обрабатывает звук или картинку в едином контексте вместе с текстом.
Хороший пример — модель GPT-5.2 Thinking от OpenAI, лежащая в основе ChatGPT. Модель справляется с мультимодальными задачами, потому что умеет удерживать в памяти большие объемы информации, связывать их между собой. А еще она может проверять промежуточные шаги и выполнять многоэтапные проекты. Например, созданием электронных таблиц, подготовкой презентаций, написанием кода, генерацией изображений.
При всех преимуществах мультимодальности LLM по-прежнему работает лишь с приближенными данными об изображении или звуке. А значит, может уверенно ошибаться в деталях.
Как дообучают LLM и почему это важно для любых задач
После предварительного обучения языковая модель почти всегда донастраивается. Один из ориентиров — reasoning-метрики. Они показывают, способна ли модель выстраивать цепочку мыслей, а не просто угадывать правдоподобные фразы. Процесс делает ответы полезнее, аккуратнее по стилю и снижает количество ошибок.
Сегодня можно выделить два основных подхода к обучению — на основе оценок пользователей и по заданным критериям.
RLHF — обучение с подкреплением от людей. Нейросеть дополнительно настраивается в общении с пользователями. Они оценивают ответы — какой полезнее, точнее, понятнее по тону. А модель постоянно учится выбирать такие формулировки, которые лучше подходят для связного ответа.
RLVR — обучение с валидацией и подкреплением проверяемыми критериями. Нейросеть автоматически получает награду, если ее ответ подходит под критерии от разработчика. Например:
- совпадение с эталонным ответом;
- отсутствие логических противоречий;
- учет альтернативных вариантов;
- соответствие ограничению по возрасту.
Благодаря RLHF модели уже умеют общаться и формулировать мысли наравне с человеком. Но принцип оценки пользователями плохо работает там, где нужна строгая проверка: в расчетах, юридических формулировках, логике. RLVR компенсирует этот перекос, потому что наказывает модель именно за ошибочный ответ. В итоге комбинация живой обратной связи и проверяемых критериев постепенно делает LLM точнее, стабильнее и полезнее в любых задачах — от прикладных до творческих.
Как отличать прогресс LLM от маркетинга
В новостях о нейросетях постоянно появляются слова вроде «революция» и «модель стала умнее». Под такими формулировками могут скрываться как реальные инженерные прорывы, так и аккуратные косметические апдейты. Часто меняется не сама LLM, а интерфейс, системные инструкции или набор внешних инструментов вокруг нее.
Есть несколько ориентиров, которые помогают это различать. Маркетологам, они нужны, чтобы понимать, какой сервис выбрать для работы. И главное — не завышать свои или клиентские ожидания.
Смотрите, что изменилось в механике. Инженерный прогресс почти всегда можно описать конкретно: увеличилось контекстное окно, добавился другой способ дообучения, улучшились метрики.
Обращайте внимание на метрики. Прогресс почти всегда сопровождается новыми бенчмарками, сравнением с предыдущими версиями, перечислением ограничений и слабых мест.




Ограничения нейросетей: в каких ситуациях не помогут боты 



