Новость
Инференс LLM: от KV-кэша до продакшен-деплоя
Саша Рыжов, MLOps-инженер hh.ru, рассказывает о развитии инфраструктуры для ИИ в компании, запуске LLM на собственном железе и движках инференса в 2026 году.
Привет! Я Саша Рыжов, MLOps-инженер в hh.ru, уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед.
Источники
2
-
RAG — это про замеры, а не про код: история одного бота, где «правильные» улучшения ухудшили результат
Habr AI
RAG — это про замеры, а не про код. История одного бота, где почти всё «правильное» сделало хуже Есть жанр статей про RAG, который выглядит так: подключаем векторную базу, берём эмбеддер, сверху реранкер, для верности — гибридный поиск с BM25, и вот у нас продакшн-ready система. Двадцать строк кода, стрелочки на схеме, всё летает. Я прошёл этот путь до конца на реальных данных. И почти каждое «правильное» улучшение из этого списка на моих данных сделало хуже. BM25 уронил метрику. Реранкер уронил метрику. Дважды, в двух разных конфигурациях. Единственное, что реально помогло, — не код, а несколько дней возни с данными и замерами. Это не статья «RAG не работает». RAG работает. Это статья о том, что настоящая работа в RAG — не в коде, который пишется за день, а в eval-харнессе, чистке корпуса и честных замерах, которые показывают, что из индустриальных дефолтов вам подходит, а что вредит. И проверить это можно только на своих данных — «так принято» тут не аргумент. Читать далее #rag #rag_система #rag_техники #rag_pipeline #rag_ai #retrieval_augmented_generation #retrival_augumented_generation #retrieval_augmented_generation | @habr_ai
-
Инференс LLM: от KV-кэша до продакшен-деплоя
Habr AI
Инференс LLM: от KV-кэша до продакшен-деплоя Привет! Я Саша Рыжов, MLOps-инженер в hh.ru, уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед. Читать далее #sglang #llm #inference #kv_cache #sram #vllm | @habr_ai