open atlas
↑ К треку
AI / LLM AI · 00 · 01

С нуля: что такое интеграция LLM на самом деле

Интегрировать LLM — значит вызывать вероятностную текстовую модель как сервис и проектировать код с учётом её ограничений — конечного контекстного окна, оплаты за токены и галлюцинаций. Это карта и слова, которые остальной трек считает знакомыми.

AI Основы ◷ 10 min
Уровень
ОсновыJuniorMiddleSenior
Уже знаешь этот юнит? Пройди быструю проверку за минуту →

Ты задал вопрос в ChatGPT и получил на удивление толковый ответ. Теперь менеджер хочет эту возможность внутри продукта — свой API-ключ компании, свои промпты, свои защитные барьеры. И магия чат-бота сразу растворяется в стопке инженерных решений: как передавать контекст? Что делать, если модель выдумывает факт? Во сколько это обойдётся, когда тысяча пользователей ударит одновременно? Этот урок — карта перед восхождением: восемь слов, которые старшие уроки используют, не останавливаясь на определениях, и один абзац, показывающий, как они связаны.

Одна идея, лежащая в основе интеграции LLM

Большая языковая модель — это не база данных, у которой запрашивают сохранённые факты. Это статистический движок, обученный на текстах: зная токены, которые он уже видел, он предсказывает распределение вероятностей по следующему токену, сэмплирует его и повторяет. Этот процесс — инференс — выполняется на мощном железе, которое обслуживает кто-то другой. Ты обращаешься к нему через HTTP. Все инженерные трудности этого трека вытекают из одной механической реальности: модель вероятностна, ограничена и тарифицируется.

«Интегрировать» LLM означает написать код, который сидит между твоим приложением и этим HTTP-эндпоинтом, — формировать ввод, обрабатывать вывод, агрессивно кэшировать, измерять стоимость и защищаться от режимов отказа, которых нет в детерминированных API.

Восемь слов, которые остальной трек считает знакомыми

Старшие уроки дальше используют эти термины, не останавливаясь на определениях. Прежде чем рассуждать о кэшировании промптов, защите от галлюцинаций или конвейерах извлечения данных, нужно, чтобы эти восемь слов уже ощущались как привычная мебель — тогда, встретив одно из них в живом инциденте, ты сразу тянешься к нужному инструменту. Вот они, по одному предложению — что это и зачем оно.

СловоЧто этоЗачем оно
ТокенАтомарная единица, которую модель читает и пишет — примерно фрагмент слова (≈¾ английского слова).Чтобы модель работала с любым текстом через фиксированный словарь; цены и лимиты всегда указываются в токенах, а не символах.
ПромптТекст, который ты отправляешь модели на вход — инструкции, контекст, примеры и вопрос пользователя вместе.Чтобы модель имела всё необходимое для полезного ответа в одном безсостоятельном запросе.
Контекстное окноМаксимальное количество токенов, которое модель видит за раз — промпт плюс ответ вместе.Чтобы знать жёсткий потолок для истории и данных; превышение усекает ввод или вызывает ошибку.
МодельКонкретный обученный чекпоинт, вызываемый по имени (например, gpt-4o, claude-3-5-sonnet).Чтобы зафиксировать приложение на известных возможностях и стоимости и обновляться осознанно.
ИнференсЗапуск модели на промпте для получения вывода — вычислительный шаг на железе провайдера.Чтобы понимать, за что платишь: GPU-время, пропорциональное сумме входных и выходных токенов.
ЭмбеддингВектор чисел фиксированной длины, кодирующий смысл фрагмента текста.Чтобы делать семантический поиск в векторной базе — основа RAG (Retrieval-Augmented Generation, подача извлечённых фактов в промпт).
ГаллюцинацияПравдоподобно звучащий вывод модели, который фактически неверен или полностью выдуман.Чтобы строить шаги верификации и заземления; доверять сырому выводу модели на критичных путях — ошибка проектирования.
ТемператураЧисло (0–2), масштабирующее то, насколько узким или плоским будет распределение вероятностей токенов при сэмплировании.Чтобы управлять балансом между детерминизмом (0 = самый вероятный токен) и творчеством (выше = больше разнообразия).

Как они складываются вместе

Прочитанные по порядку, слова рассказывают одну историю: ты пишешь промпт — блок текста из токенов — и отправляешь его именованной модели в пределах её контекстного окна. Модель запускает инференс: она сэмплирует следующий токен из распределения вероятностей, настроенного температурой, повторяет до стоп-токена и стримит результат обратно. Ты платишь за каждый входной и выходной токен. Если у модели нет заземления, она может галлюцинировать — именно поэтому продакшен-системы заранее извлекают факты как эмбеддинги. Это одно предложение — весь трек в миниатюре; каждый следующий юнит увеличивает один из этих шагов.

Почему это работает

Почему бы просто не пользоваться чат-интерфейсом и копировать ответы? Потому что твоим пользователям нужны ответы о твоих данных, твоих бизнес-правилах, состоянии твоего пользователя — ничего из этого публичный чат-бот не знает. Вызов API напрямую позволяет вставить этот контекст в промпт, стримить ответы в свой UI, агрессивно кэшировать для снижения затрат и добавлять защитные барьеры, которые публичный UI не предоставляет. Инженерная работа — это разрыв между «впечатляющим демо» и «надёжным продуктом».

Это не нужно зубрить

Две честные ремарки перед восхождением. Первая: никто не держит все восемь слов в голове сразу в первый день — ты встретишь каждое снова, в глубине, в своём юните, и тогда оно уляжется. Эта страница — вешалка, а не экзамен. Вторая: не каждая интеграция использует каждое слово. Простой суммаризатор может никогда не трогать эмбеддинги. Senior-трек учит полной картине, потому что этого требует продакшен под нагрузкой, — но «начни с простейшего промпта, добавляй части когда заболит» — и есть senior-инстинкт.

Викторина

Почему LLM может дать уверенный, но неверный ответ?

Расставь шаги по порядку

Расставь путь от твоего кода до стримингового ответа, который получает пользователь:

  1. 1 Собрать промпт (токены) из системных инструкций, извлечённого контекста и сообщения пользователя
  2. 2 Отправить промпт на эндпоинт модели — он должен поместиться в контекстное окно
  3. 3 Модель запускает инференс, сэмплируя токены из распределения вероятностей, настроенного температурой
  4. 4 Стримить выходные токены обратно, проверить на галлюцинации и показать пользователю
Вспомните перед уходом
  1. 01
    В одном дыхании: что такое интеграция LLM и в чём её ключевая инженерная проблема?
  2. 02
    Проследи путь от вопроса пользователя до ответа, называя каждое понятие.
Итог

Интеграция LLM — это одна идея с кучей навешанной инженерии: вызывай вероятностную текстовую модель как сервис и строй каркас, который делает её надёжной, быстрой и доступной по цене в реальном продукте. Половина модели — это инференс: предсказание следующего токена из распределения вероятностей, ограниченное контекстным окном, тарифицируемое за токен. Инженерная половина — всё остальное: собрать промпт, который влезает в окно; кэшировать повторяющиеся префиксы, чтобы не платить дважды; извлекать эмбеддинги, чтобы модель имела заземление вместо угадывания; стримить токены обратно, не блокируя UI; выставлять температуру так, чтобы балансировать творчество и детерминизм; запускать эвалы, чтобы галлюцинации всплывали в CI, а не перед пользователями. Тебе не нужно держать все восемь слов сразу — у каждого впереди свой юнит. Теперь, когда коллега скажет «модель галлюцинировала» или «мы упираемся в лимит контекста», ты точно знаешь, какой рычаг сломан и где в конвейере искать — вот что дают тебе эти восемь слов. Дальше: Unit 01, кэширование промптов — как перестать платить за одни и те же токены дважды.

Что-то непонятно?

Задай вопрос по этому уроку. Вопросы анонимны и попадают напрямую автору — урок станет лучше.

Примени это

Примени этот урок в реальном проекте.

хоткеи развернуть
поиск
K
пред. пьеса
k
след. пьеса
j
тиры
t
это меню
?
sources4
expand
  1. 01
  2. 02
  3. 03
  4. 04

Trademarks belong to their respective owners. Editorial reference only.