Устал переплачивать за одну и ту же память, которуе гоняю по кругу, и решил разобраться, как у кого на самом деле устроен кэш, а не просто верить строчке "у нас есть кэширование" и "так дешевле" в доке.Начал с клода, как с самой популярной тулы. Кэш там не работает сам по себе, нужно руками вешать cache_control: ephemeral на кусок промпта (тулы, системный промпт, длинный документ, что угодно стабильное). Ничего не закэшируется, если явно не попросишь. При этом ценой все прозрачно: запись на 5 минут стоит 1.25 от обычной цены, запись на час — уже 2x, а вот чтение из кэша дешевле раз в 10. Если один и тот же кусок дергается хотя бы пару раз за окно, уже в плюсе.Но! Где-то в марте anthropic тихо поменял дефолтный TTL с часа на пять минут, без нормального анонса, просто взяли и поменяли поведение по умолчанию для тех, кто не указал TTL явно. У меня был пайплайн, заточенный под часовое окно, и я не сразу понял, почему счет подрос процентов на 15, пока не полез в changelog. Так что если у вас что-то крутится на клоде на автомате уже давно, стоит перепроверить, какой TTL у вас реально стоит сейчас, а не какой вы когда-то настраивали.С openai все проще, и в хорошем смысле. Там кэш вообще не настраивается руками, он просто есть у любого промпта от 1024 токенов: система сама ищет совпадающий префикс с шагом в 128 токенов, и если находит, режет цену пополам. Ничего в коде трогать не надо. Из минусов, контроля тоже никакого, попал в кэш или нет, узнаешь только постфактум по usage в ответе. И живет это недолго: 5-10 минут простоя, максимум час, потом стирается железно. Читать далее
Устал переплачивать за одну и ту же память, которуе гоняю по кругу, и решил разобраться, как у кого на самом деле устроен кэш, а не просто верить строчке "у нас есть кэширование" и "так дешевле" в доке.
Начал с клода, как с самой популярной тулы. Кэш там не работает сам по себе, нужно руками вешать cache_control: ephemeral на кусок промпта (тулы, системный промпт, длинный документ, что угодно стабильное). Ничего не закэшируется, если явно не попросишь. При этом ценой все прозрачно: запись на 5 минут стоит 1.25 от обычной цены, запись на час — уже 2x, а вот чтение из кэша дешевле раз в 10. Если один и тот же кусок дергается хотя бы пару раз за окно, уже в плюсе.
Но! Где-то в марте anthropic тихо поменял дефолтный TTL с часа на пять минут, без нормального анонса, просто взяли и поменяли поведение по умолчанию для тех, кто не указал TTL явно. У меня был пайплайн, заточенный под часовое окно, и я не сразу понял, почему счет подрос процентов на 15, пока не полез в changelog. Так что если у вас что-то крутится на клоде на автомате уже давно, стоит перепроверить, какой TTL у вас реально стоит сейчас, а не какой вы когда-то настраивали.
С openai все проще, и в хорошем смысле. Там кэш вообще не настраивается руками, он просто есть у любого промпта от 1024 токенов: система сама ищет совпадающий префикс с шагом в 128 токенов, и если находит, режет цену пополам. Ничего в коде трогать не надо. Из минусов, контроля тоже никакого, попал в кэш или нет, узнаешь только постфактум по usage в ответе. И живет это недолго: 5-10 минут простоя, максимум час, потом стирается железно.
Gemini оставил напоследок, потому что там гугл как обычно умудрился сделать сразу два механизма и оба назвать кэшированием. Есть implicit caching, работает сам, аналог подхода опенаи, только без гарантий вообще: может закэшировать, а может и нет, зависит от того, что там у них на бэкенде творится в моменте. И есть explicit caching, там уже сам создаешь объект cachedContent, сам ставишь TTL, и платишь отдельно за само хранение — от 1 до 4.5 доллара за миллион токенов в час в зависимости от модели. Скидка на чтение хорошая, 90 процентов на новых моделях, но если контекст не долбят постоянно в рамках этого окна, платишь за хранение того, что никто не читает, и экономика уходит в минус.
Если сводить к одному выводу, для себя я решил так - клод выгоднее всего, если готов сам следить за TTL, но именно поэтому мартовское изменение и ударило по тем, кто настроил один раз и забыл. Openai — это вариант "просто работает", без сюрпризов, но и без возможности выжать по максимуму. А explicit-кэш у джемини имеет смысл только под конкретный сценарий: огромный документ, который реально долбят одним и тем же контекстом весь день, иначе хранение сожрет всю экономию на чтении.
Так что прежде чем сравнивать, лучше сначала честно посчитать, как часто у вас реально переиспользуется один и тот же контекст и в каком окне времени. Без этого что 90 процентов скидка, что 50 — просто красивая цифра на слайде у вендора.
Для справки - проекты с гитхаба, по обзервабилити и управлению кэшем (нашел поиском по ключевым словам):
traceframe — вьювер хуков для coding-агентов. Есть визуализация кэша по каждому сообщению, но у проекта нет звезд, судя по всему чья то ручная поделка
GPTCache — семантический кэш поверх LLM: не точное совпадение промпта, а похожесть через эмбеддинги и векторный поиск.
Helicone — открытая обсервабилити-платформа для LLM, кэширование включается заголовками к запросу, плюс метрики стоимости и латентности на дашборде.
Portkey AI Gateway — шлюз перед 1600+ моделями, поддерживает и простой кэш по точному совпадению, и семантический (через векторную базу на enterprise-тарифах).
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Открытые LLM в продакшене: 8 выводов о llama.cpp, Gemma и Qwen | 0 | 7 | 14-07-2026 |
| 2 | Переделка стоила два дня, теперь два часа. Что в разработке подорожало взамен | 0 | 6 | 26-06-2026 |
| 3 | А нам точно нужны code agents? | 0 | 5 | 17-07-2026 |
| 4 | Теперь вы можете защититься от утечки данных при работе с любыми языковыми моделями | 0 | 9.5 | 22-07-2026 |
| 5 | Klipper: опенсорс без сообщества, или почему у вашего принтера никогда не будет тулченджера из коробки | 0 | 11.18 | 24-07-2026 |
| 6 | RUMBA: русскоязычный бенчмарк для оценки долгосрочной памяти | 0 | 7.52 | 24-07-2026 |
| 7 | Бенчмаркая ключи Dictionary: забыл IEquatable — получил ×5 и 96 байт на каждый поиск | 1 | 9.13 | 25-07-2026 |
| 8 | Playwright не спасает от флапающих тестов: разбираемся, как он ждёт на самом деле | 0 | 8.65 | 24-07-2026 |
| 9 | LLM (ИИ) - О СЕРЬЕЗНОМ И НЕМНОГО ЮМОРА, КАК ОБЫЧНО ... | 2 | 6 | 01-07-2026 |
| 10 | 📱 Маркетплейсы всё? Как чат-боты готовятся отжать привычный шопинг. На ... | 0 | 10.76 | 25-07-2026 |