Полный текст
Prompt Caching: анатомия 10-кратной экономииСкидка 90% на входные токены и снижение задержки до 85% — звучит как маркетинговая уловка, но за этим стоит конкретная инженерная оптимизация. Важно понимать: это не кэширование ответов, генерация остаётся вероятностной и уникальной.Речь о сохранении состояния на уровне GPU. Провайдеры кэшируют результаты вычислений механизма внимания (Self-Attention) для префикса промпта — так называемый KV-cache (Key-Value). Это избавляет железо от повторной матричной математики для статичного контекста.Изучим механику работы трансформеров и природу «закэшированного токена».