Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Как я потратил вечер, разбираясь, почему кэш в клоде, gpt и джемини — это три разных зверя

Дата публикации: 24-07-2026 22:46:35

Устал переплачивать за одну и ту же память, которуе гоняю по кругу, и решил разобраться, как у кого на самом деле устроен кэш, а не просто верить строчке "у нас есть кэширование" и "так дешевле" в доке.Начал с клода, как с самой популярной тулы. Кэш там не работает сам по себе, нужно руками вешать cache_control: ephemeral на кусок промпта (тулы, системный промпт, длинный документ, что угодно стабильное). Ничего не закэшируется, если явно не попросишь. При этом ценой все прозрачно: запись на 5 минут стоит 1.25 от обычной цены, запись на час — уже 2x, а вот чтение из кэша дешевле раз в 10. Если один и тот же кусок дергается хотя бы пару раз за окно, уже в плюсе.Но! Где-то в марте anthropic тихо поменял дефолтный TTL с часа на пять минут, без нормального анонса, просто взяли и поменяли поведение по умолчанию для тех, кто не указал TTL явно. У меня был пайплайн, заточенный под часовое окно, и я не сразу понял, почему счет подрос процентов на 15, пока не полез в changelog. Так что если у вас что-то крутится на клоде на автомате уже давно, стоит перепроверить, какой TTL у вас реально стоит сейчас, а не какой вы когда-то настраивали.С openai все проще, и в хорошем смысле. Там кэш вообще не настраивается руками, он просто есть у любого промпта от 1024 токенов: система сама ищет совпадающий префикс с шагом в 128 токенов, и если находит, режет цену пополам. Ничего в коде трогать не надо. Из минусов, контроля тоже никакого, попал в кэш или нет, узнаешь только постфактум по usage в ответе. И живет это недолго: 5-10 минут простоя, максимум час, потом стирается железно. Читать далее

Основное содержимое страницы с новостью.

Устал переплачивать за одну и ту же память, которуе гоняю по кругу, и решил разобраться, как у кого на самом деле устроен кэш, а не просто верить строчке "у нас есть кэширование" и "так дешевле" в доке.

Начал с клода, как с самой популярной тулы. Кэш там не работает сам по себе, нужно руками вешать cache_control: ephemeral на кусок промпта (тулы, системный промпт, длинный документ, что угодно стабильное). Ничего не закэшируется, если явно не попросишь. При этом ценой все прозрачно: запись на 5 минут стоит 1.25 от обычной цены, запись на час — уже 2x, а вот чтение из кэша дешевле раз в 10. Если один и тот же кусок дергается хотя бы пару раз за окно, уже в плюсе.

Но! Где-то в марте anthropic тихо поменял дефолтный TTL с часа на пять минут, без нормального анонса, просто взяли и поменяли поведение по умолчанию для тех, кто не указал TTL явно. У меня был пайплайн, заточенный под часовое окно, и я не сразу понял, почему счет подрос процентов на 15, пока не полез в changelog. Так что если у вас что-то крутится на клоде на автомате уже давно, стоит перепроверить, какой TTL у вас реально стоит сейчас, а не какой вы когда-то настраивали.

С openai все проще, и в хорошем смысле. Там кэш вообще не настраивается руками, он просто есть у любого промпта от 1024 токенов: система сама ищет совпадающий префикс с шагом в 128 токенов, и если находит, режет цену пополам. Ничего в коде трогать не надо. Из минусов, контроля тоже никакого, попал в кэш или нет, узнаешь только постфактум по usage в ответе. И живет это недолго: 5-10 минут простоя, максимум час, потом стирается железно.

Gemini оставил напоследок, потому что там гугл как обычно умудрился сделать сразу два механизма и оба назвать кэшированием. Есть implicit caching, работает сам, аналог подхода опенаи, только без гарантий вообще: может закэшировать, а может и нет, зависит от того, что там у них на бэкенде творится в моменте. И есть explicit caching, там уже сам создаешь объект cachedContent, сам ставишь TTL, и платишь отдельно за само хранение — от 1 до 4.5 доллара за миллион токенов в час в зависимости от модели. Скидка на чтение хорошая, 90 процентов на новых моделях, но если контекст не долбят постоянно в рамках этого окна, платишь за хранение того, что никто не читает, и экономика уходит в минус.

Если сводить к одному выводу, для себя я решил так - клод выгоднее всего, если готов сам следить за TTL, но именно поэтому мартовское изменение и ударило по тем, кто настроил один раз и забыл. Openai — это вариант "просто работает", без сюрпризов, но и без возможности выжать по максимуму. А explicit-кэш у джемини имеет смысл только под конкретный сценарий: огромный документ, который реально долбят одним и тем же контекстом весь день, иначе хранение сожрет всю экономию на чтении.

Так что прежде чем сравнивать, лучше сначала честно посчитать, как часто у вас реально переиспользуется один и тот же контекст и в каком окне времени. Без этого что 90 процентов скидка, что 50 — просто красивая цифра на слайде у вендора.

Для справки - проекты с гитхаба, по обзервабилити и управлению кэшем (нашел поиском по ключевым словам):

  • traceframe — вьювер хуков для coding-агентов. Есть визуализация кэша по каждому сообщению, но у проекта нет звезд, судя по всему чья то ручная поделка

  • GPTCache — семантический кэш поверх LLM: не точное совпадение промпта, а похожесть через эмбеддинги и векторный поиск.

  • Helicone — открытая обсервабилити-платформа для LLM, кэширование включается заголовками к запросу, плюс метрики стоимости и латентности на дашборде.

  • Portkey AI Gateway — шлюз перед 1600+ моделями, поддерживает и простой кэш по точному совпадению, и семантический (через векторную базу на enterprise-тарифах).

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Открытые LLM в продакшене: 8 выводов о llama.cpp, Gemma и Qwen0714-07-2026
2Переделка стоила два дня, теперь два часа. Что в разработке подорожало взамен0626-06-2026
3А нам точно нужны code agents?0517-07-2026
4Теперь вы можете защититься от утечки данных при работе с любыми языковыми моделями09.522-07-2026
5Klipper: опенсорс без сообщества, или почему у вашего принтера никогда не будет тулченджера из коробки011.1824-07-2026
6RUMBA: русскоязычный бенчмарк для оценки долгосрочной памяти07.5224-07-2026
7Бенчмаркая ключи Dictionary: забыл IEquatable — получил ×5 и 96 байт на каждый поиск19.1325-07-2026
8Playwright не спасает от флапающих тестов: разбираемся, как он ждёт на самом деле08.6524-07-2026
9LLM (ИИ) - О СЕРЬЕЗНОМ И НЕМНОГО ЮМОРА, КАК ОБЫЧНО ...2601-07-2026
10📱 Маркетплейсы всё? Как чат-боты готовятся отжать привычный шопинг. На ...010.7625-07-2026

Классификация: Мнения. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 6.67. Источник: habr.com.