Каждый день только в ChatGPT отправляется несколько миллиардов запросов. Люди просят придумать тексты, переписать письма, собрать презентации, нарисовать картинку, объяснить сложное простыми словами. Ответы, которые они получают от нейросетей, генерируются LLM — большими языковыми моделями. 

В этой статье разберемся, как устроены современные LLM, почему они иногда ошибаются и как будут развиваться дальше. Материал подойдет специалистам, которые хотят работать вместе с ИИ — копирайтерам, маркетологам, дизайнерам.

Что такое LLM

Мы знаем, как работает поиск в интернете или режим Т9 в смартфоне. Под капотом у них — простые языковые модели, которые умеют предсказывать последовательность слов. Они опираются на частоту использования и заданные разработчиками правила.

Традиционная языковая модель это
Если ввести в поиске Яндекса «нейросети», под строкой отобразятся варианты от традиционной языковой модели. Скриншот автора

Следующее поколение этой технологии — LLM (Large Language Model). Это большая языковая модель, которая предсказывает следующий элемент текста на основе всего предыдущего контекста. Она работает уже не с одним словом, а сразу собирает целое предложение. К LLM относят зарубежные ChatGPT, Gemini, Claude, DeepSeek, Grok, а также российские YandexGPT и GigaChat.

Чтобы LLM могла предсказывать следующее слово и выстраивать целые фразы, ее обучили на огромных массивах текста — веб-страницах, книгах, статьях. В процессе она усвоила миллиарды примеров того, какие слова и фразы обычно следуют друг за другом. 

LLM похожа на робота, который прочитал все книги в библиотеке, прежде чем начал уверенно отвечать на вопросы пользователя. Он не заучивал ответы заранее, но впитал лексику, интонации, ритм речи. Поэтому может не только объяснять факты, но и придерживаться стиля.

Что такое языковая модель llm
Нейросеть может написать стих в стиле Пушкина — воспроизвести общий ритм и манеру

Что такое токены и почему от них зависит генерация

Большая модель не видит текст как цельные слова. Вместо этого она разбивает его на кусочки или токены: части слов, слоги, символы. Это нужно для того, чтобы подобрать максимально подходящее продолжение фразы. Например, «информационная» для LLM выглядит примерно так: ["ин", "форма", "ционная"]. 

Человек с большой вероятностью продолжит мысль словами «информационная… безопасность» или «информационная… архитектура». Модель рассуждает похожим образом, но математически. Каждый токен превращается в числовой вектор и занимает свою позицию в многомерном пространстве — это называют эмбеддинг. Токены с похожим значением оказываются «ближе» друг к другу. 

В этом пространстве у начала следующего слова ["без"] может оказаться больше веса и семантической близости к «информационная», чем у ["арх"] — это зависит от контекста разговора с пользователем.

Что такое llm в нейросетях
Вес токенов на схеме выше показан упрощенно — это их цвет. LLM самостоятельно проанализировала массив данных и собрала словосочетание

Как работает популярный ChatGPT

Современные чат-боты и ассистенты вроде ChatGPT от OpenAI устроены сложнее — модель читает текст не по строчке, а видит связи сразу между всеми частями фразы. Но генерирует ответ все также по одному токену, каждый раз переоценивая вероятности. 

GPT (Generative Pre-trained Transformer) — это конкретный класс LLM. В аббревиатуре зашита логика работы такой модели.

Generative. Модель генерирует текст, каждый раз выбирая наиболее вероятное продолжение на основе контекста. Она собирает его токен за токеном.

Pre-trained. Модель заранее обучена на больших массивах данных и уже знает, как устроен язык: стиль, структуру фраз, типовые паттерны аргументации. В диалоге она не учится с нуля, а использует эти знания через параметры.

Transformer. Архитектура, в которой каждый токен соотносится с другими токенами в тексте и получает от них взвешенную информацию. Так работает механизм внимания (attention). Упрощенно его можно представить как ответ на три вопроса:

  • Query — «Что я сейчас ищу» (Какой смысл важен в этом месте текста?).
  • Key — «Что у меня есть» (Какие элементы контекста потенциально релевантны?).
  • Value — «Что я могу взять» (Какую информацию реально использовать для ответа?).

Запрос напрямую влияет на то, какие части контекста модель сочтет важными, а какие проигнорирует. А вместе с тем и каким будет качество ее ответа. Поэтому копирайтеру и маркетологу важно понимать, как работает GPT. Чем точнее вы формулируете задачу, расставляете акценты и даете контекст, тем правильнее ответ по параметру Query модели. С грамотным запросом вы можете получить нужный результат — по тону, логике и пользе для бизнеса.

Почему языковая модель галлюцинирует

LLM устроена так, что она всегда должна продолжать генерацию и дать законченный ответ. На уровне механики у нее нет опции « не знаю» или «я не уверена». В каждый момент времени она выбирает самый вероятный следующий токен — даже если он не опирается на заданный контекст или ведет к вымышленному выводу. Так она может уверенно соврать или по-другому — галлюцинировать. 

Галлюцинации — это побочный эффект сильных сторон нейросети. Тот же механизм внимания, который делает ответы связными, логичными и удобными для чтения, не проверяет их на истинность. 

У галлюцинаций LLM обычно есть три основные причины.

Данные обучения. Языковые модели учатся на текстах, созданных людьми. А значит наследуют не только знания и факты, но и ошибки, устаревшие сведения, культурные перекосы и стереотипы. 

Контекстное окно. Каждый новый запрос отправляется в модель вместе с контекстом — предыдущими запросами и сгенерированными ответами. Когда этот буфер переполняется или в нем слишком много разнородных смыслов, модель начинает терять фокус.

Недостаток данных. Если в запросе мало фактов или вопрос сформулирован двусмысленно, модель может выбрать уверенно звучащую, но вымышленную версию ответа.

Вернемся к LLM-роботу, который прочитал все издания в самой крупной мировой библиотеке. В его памяти миллионы источников, мнений и формулировок — достоверных и ошибочных, «хороших» и «плохих». Иногда они смешиваются, но он не замечает этого и выдает ложные сведения вперемешку с фактами как уверенный ответ. 

Что такое api llm
Если мы спрашиваем, что написал Лермонтов, в ответе нейросети может быть как картина, так и стихотворение

В работе маркетолога и копирайтера языковую модель важно воспринимать как ассистента — она отлично помогает на этапе идей, структуры, черновиков. Но в этом результате могут быть логические и математические ошибки, юридические неточности. Поэтому все выводы должен проверять человек.

Как уменьшить риск ошибки LLM

Снизить риск галлюцинации можно, если использовать подход RAG (Retrieval-Augmented Generation). По нему модель сначала ищет релевантную информацию во внешних или загруженных источниках, затем добавляет ее в контекст запроса и после этого формирует свой ответ. 

RAG можно сравнить с проектом или папкой, куда подгружают документацию, базу знаний, файлы компании и просят нейросеть сначала проанализировать их. Важно, что LLM при этом все так же предсказывает следующий токен, но в проценте вероятности больше веса отдается вашим материалам. 

Запрос в LLM
При ответе пользователю ChatGPT сначала просмотрит 7 загруженных файлов, и только после этого даст ответ

Другой вариант — выбрать режим «глубокого исследования» или модель со встроенным рассуждением. Обычно возле номера есть слово Thinking. Тогда LLM не будет сразу подбирать токены и писать ответ — сначала разделит задачу на отдельные шаги и проанализирует каждый, выстроит логическую цепочку и только потом перейдет к формулировке ответа. А значит, его качество будет выше. 

Что такое ллм модель
Можно сказать, что модель беседует сама с собой. Например, когда разбирается с подходящим моторным маслом

Почему сейчас везде мультимодальные LLM

Раньше изображение и текст обрабатывались разными моделями, а затем по внутренним правилам собирались в единый ответ пользователю. В современных мультимодальных LLM связи между словами, объектами и звуками строятся внутри одной модели. Она может прочитать запрос или «услышать» голос, сгенерировать картинку и выдать пользователю связный ответ.

Мультимодальность работает по уже знакомому алгоритму:

  1. Звук или изображение разбиваются на токены: фрагменты звуковой волны, части визуального пространства. 
  2. Включается механизм внимания, после чего модель обрабатывает звук или картинку в едином контексте вместе с текстом.

Хороший пример — модель GPT-5.2 Thinking от OpenAI, лежащая в основе ChatGPT. Модель справляется с мультимодальными задачами, потому что умеет удерживать в памяти большие объемы информации, связывать их между собой. А еще она может проверять промежуточные шаги и выполнять многоэтапные проекты. Например, созданием электронных таблиц, подготовкой презентаций, написанием кода, генерацией изображений.

Какую llm выбрать лучшие и примеры
Наш робот не только прочитал книги в библиотеке, но и прошел курсы по рисунку, съемке сторис и созданию электронной музыки — и он очень доволен!

При всех преимуществах мультимодальности LLM по-прежнему работает лишь с приближенными данными об изображении или звуке. А значит, может уверенно ошибаться в деталях.

Как дообучают LLM и почему это важно для любых задач

После предварительного обучения языковая модель почти всегда донастраивается. Один из ориентиров — reasoning-метрики. Они показывают, способна ли модель выстраивать цепочку мыслей, а не просто угадывать правдоподобные фразы. Процесс делает ответы полезнее, аккуратнее по стилю и снижает количество ошибок. 

В работе лучше пользоваться современными моделями — они отличаются высоким качеством этой донастройки. Посмотреть, какая версия сейчас в топе, можно в таблице лидеров LMArena.

Сегодня можно выделить два основных подхода к обучению — на основе оценок пользователей и по заданным критериям.

RLHF — обучение с подкреплением от людей. Нейросеть дополнительно настраивается в общении с пользователями. Они оценивают ответы — какой полезнее, точнее, понятнее по тону. А модель постоянно учится выбирать такие формулировки, которые лучше подходят для связного ответа. 

Что такое токен в контексте llm
На оценках пользователей учится ChatGPT от OpenAI

RLVR — обучение с валидацией и подкреплением проверяемыми критериями. Нейросеть автоматически получает награду, если ее ответ подходит под критерии от разработчика. Например:

  • совпадение с эталонным ответом;
  • отсутствие логических противоречий;
  • учет альтернативных вариантов;
  • соответствие ограничению по возрасту.

Благодаря RLHF модели уже умеют общаться и формулировать мысли наравне с человеком. Но принцип оценки пользователями плохо работает там, где нужна строгая проверка: в расчетах, юридических формулировках, логике. RLVR компенсирует этот перекос, потому что наказывает модель именно за ошибочный ответ. В итоге комбинация живой обратной связи и проверяемых критериев постепенно делает LLM точнее, стабильнее и полезнее в любых задачах — от прикладных до творческих.

llm что это в ит
Если нейросеть знает, что не получит награду, она будет меньше ошибаться

Как отличать прогресс LLM от маркетинга

В новостях о нейросетях постоянно появляются слова вроде «революция» и «модель стала умнее». Под такими формулировками могут скрываться как реальные инженерные прорывы, так и аккуратные косметические апдейты. Часто меняется не сама LLM, а интерфейс, системные инструкции или набор внешних инструментов вокруг нее.

Есть несколько ориентиров, которые помогают это различать. Маркетологам, они нужны, чтобы понимать, какой сервис выбрать для работы. И главное — не завышать свои или клиентские ожидания.

Смотрите, что изменилось в механике. Инженерный прогресс почти всегда можно описать конкретно: увеличилось контекстное окно, добавился другой способ дообучения, улучшились метрики.

Обращайте внимание на метрики. Прогресс почти всегда сопровождается новыми бенчмарками, сравнением с предыдущими версиями, перечислением ограничений и слабых мест.

Если описание нельзя свести к изменению архитектуры, данных, обучения — перед вами, скорее всего, упаковка продукта для инвесторов из серии «модель лучше понимает вас». Особенно, если компания не говорит, где модель все еще плохо справляется.

Поделиться ВКонтакте Telegram