Саша Рыжов, MLOps-инженер hh.ru, рассказывает о развитии инфраструктуры для ИИ в компании, запуске LLM на собственном железе и движках инференса в 2026 году.

Привет! Я Саша Рыжов, MLOps-инженер в hh.ru, уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед.

Источники 2
  • RAG — это про замеры, а не про код: история одного бота, где «правильные» улучшения ухудшили результат Habr AI
    RAG — это про замеры, а не про код. История одного бота, где почти всё «правильное» сделало хуже
    
    Есть жанр статей про RAG, который выглядит так: подключаем векторную базу, берём эмбеддер, сверху реранкер, для верности — гибридный поиск с BM25, и вот у нас продакшн-ready система. Двадцать строк кода, стрелочки на схеме, всё летает.
    
    Я прошёл этот путь до конца на реальных данных. И почти каждое «правильное» улучшение из этого списка на моих данных сделало хуже. BM25 уронил метрику. Реранкер уронил метрику. Дважды, в двух разных конфигурациях. Единственное, что реально помогло, — не код, а несколько дней возни с данными и замерами.
    
    Это не статья «RAG не работает». RAG работает. Это статья о том, что настоящая работа в RAG — не в коде, который пишется за день, а в eval-харнессе, чистке корпуса и честных замерах, которые показывают, что из индустриальных дефолтов вам подходит, а что вредит. И проверить это можно только на своих данных — «так принято» тут не аргумент. Читать далее
    
    #rag #rag_система #rag_техники #rag_pipeline #rag_ai #retrieval_augmented_generation #retrival_augumented_generation #retrieval_augmented_generation | @habr_ai
  • Инференс LLM: от KV-кэша до продакшен-деплоя Habr AI
    Инференс LLM: от KV-кэша до продакшен-деплоя
    
    Привет! Я Саша Рыжов, MLOps-инженер в hh.ru, уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед. Читать далее
    
    #sglang #llm #inference #kv_cache #sram #vllm | @habr_ai