ai-llm
AI / LLM
Как строить функции поверх больших языковых моделей — подавать им свои данные, давать вызывать твой код и проверять, что ответы и правда хорошие.
Начать трек →С нуля
Перед senior-материалом: что вообще такое интеграция с LLM и горстка слов, которые остальной трек считает уже знакомыми.Prompt caching
Кэширование промпта: как стабильный префикс режет стоимость входа в 10 раз
Кэш переиспользует точный префикс токен-в-токен по цене ~0.1x от входа. Любой байт, сдвигающий префикс — таймстамп,…
Tool calls
Вызовы инструментов: цикл round-trip, валидация схемы и защита от зацикливания агента
Вызов инструментов превращает модель в вызывающего функцию, но модель лишь шлёт запрос — выполняешь его ты. Каждый…
Rag architecture
Архитектура RAG: пайплайн, который ломается на ретривале, а не на генерации
RAG — это задача ретривала в костюме генерации. Размер чанка, top-k, реранкинг и порядок контекста двигают recall и…
Streaming
Стриминг ответов LLM: SSE, частичные токены и прокси, который их съедает
Стриминг меняет общее время генерации на time-to-first-token. SSE шлёт delta-события, которые ты накапливаешь;…
Cost budgets
Бюджеты на LLM: асимметрия токенов, роутинг и kill switch
Output-токены стоят ~5x от input, а system prompt + история + RAG-контекст пересылаются каждый ход — поэтому…
Agents
Цикл агента: ReAct, неуправляемые шаги и контекст, растущий каждый ход
LLM-агент — это while-цикл: вызвать модель, выполнить инструмент, добавить результат, снова вызвать модель. Опасность —…
Evals
LLM-evals: регрессионный тест для недетерминированной фичи
LLM-фичу нельзя выкатывать без evals: один и тот же ввод даёт разный вывод, а смена модели или промпта тихо роняет…
Putting it together
Сборка production LLM-приложения: баг живёт в шве
Кэширование, RAG, стриминг, тулзы, агенты и evals проходят каждый свой тест, а вместе падают. Трассируй один запрос…
Проекты по этому треку
Guided-проекты, которые закрепляют изученное здесь.
Инженерная практика
Привычки, которые отличают пет-проект от профессиональной команды, — хорошо тестировать, безопасно выкатывать изменения и поддерживать сервис живым в продакшене.