Полный текст
Собственный AI-инференс: экономика и архитектураТокенизированные API удобны, но несут риски безопасности и непредсказуемый OpEx. Альтернатива для корпоративного контура — собственный инференс на выделенных мощностях. Реализован стек из четырёх on-premise-сервисов: векторный поиск Kaken (Qdrant + Qwen), корпоративная LLM, транскрибация встреч и Copilot.Железо варьируется от бюджетных Tesla T4 до кластеров H100. Экономика проекта прозрачна: при затратах на инфраструктуру в 1,6 млн рублей стоимость генерации одного ответа составляет от 138 рублей. Точка безубыточности достигается при экономии всего 15 минут времени инженера в день.Оценим рентабельность внедрения.