17 дней работы с ИИ-агентами, 436 сессий, 22 200 обращений к модели. Разобрал собственные логи по токенам и деньгам — и проверил, окупается ли подписка Ollama за $20 вместо оплаты по токенам.
Замеры с 4 по 20 августа 2026 · модель DeepSeek V4 Flash · агентный харнесс Pi · данные из локальных логов сессий
22 200
ответов модели
436 сессий за 17 дней
4,05 млрд
токенов контекста
прочитано моделью
15,7 млн
токенов ответов
то, что она написала
$15,05
заплачено по токенам
≈ $0,89 в день
Что здесь мерилось
Это логи одного человека, работающего с ИИ-агентами по-настоящему каждый день: агенты читают код, правят файлы, гоняют тесты, ревьюят друг друга. Не чат-вопросики, а полноценный рабочий цикл — по несколько параллельных сессий.
Модель везде одна — DeepSeek V4 Flash, «средняя» из линейки. Она ходила через три канала: официальный API DeepSeek, шлюз OpenCode и — с 20 августа — подписку Ollama Cloud за $20. Первые два берут деньги по токенам, третий — фиксированную сумму в месяц. Вопрос ровно один: что дешевле и где ломается.
Главное открытие: платишь не за ответы, а за перечитывание
Соотношение прочитанного к написанному — 257 : 1. На каждый токен, который модель пишет, приходится 257 токенов, которые она перечитывает.
Так устроен агент: на каждом шаге он заново получает весь контекст — историю разговора, содержимое файлов, вывод команд. В среднем это 175 тысяч токенов на один ответ — примерно том «Войны и мира» на каждое «ага, понял, правлю строку 42». А в ответ пишет 700 токенов.
Отсюда единственный рычаг цены — кэш. Повторно прочитанный контекст стоит у DeepSeek в разы дешевле нового. Без кэша те же 4 миллиарда токенов стоили бы не $15, а несколько сотен долларов. Все дешёвые агенты держатся на этом.
Расход по дням
Деньги: сколько стоил день работы
оплата по токенам, доллары · 20 августа канал переключён на подписку
API DeepSeekшлюз OpenCodeподписка Ollama — $0 сверх абонплаты
Пик 18 августа — $2,01: в тот день гонялась более тяжёлая модель Pro. Средний рабочий день — около доллара.
Объём: сколько раз агенты обратились к модели
ответов модели в день
API DeepSeekшлюз OpenCodeподписка Ollama
Заметьте расхождение с деньгами: 9 августа — рекордные 2 703 обращения, а стоил день $1,35. Цена определяется не числом запросов, а тем, сколько контекста тащится в каждом.
Режимы «сколько думать»
У модели три уровня рассуждения. Разница в цене оказалась не там, где её ждёшь.
Режим
Ответов
Доля
Контекст на ответ
Из ответа — размышления
$ за 1000 ответов
low
3 209
14 %
160 тыс.
40 %
$0,85
high — рабочий режим
13 388
60 %
174 тыс.
62 %
$0,64
max
5 591
25 %
219 тыс.
50 %
$0,76
Самый думающий режим — не самый дорогой. Средний режим high вышел дешевле обоих соседей: длина размышления добавляет копейки, а платишь за размер контекста. Экономить на глубине мысли бессмысленно — экономить надо на объёме того, что агент тащит в запрос.
Всё это — про оплату по токенам. На подписке правило переворачивается: там глубина как раз и стоит денег. Ниже опыт, который это показал.
Как устроены лимиты Ollama
Подписка Ollama Cloud считает не токены, а время работы видеокарты. Два окна: одно сбрасывается каждые 5 часов, второе — раз в неделю. Модели поделены на четыре класса тяжести: лёгкие тратят квоту медленно, тяжёлые — быстро. Точных чисел Ollama не публикует нигде.
Но их можно достать. У сервиса есть недокументированная ручка, которая отдаёт остаток в процентах:
Пересчёт честен только для этого профиля нагрузки: тяжёлый режим max и контекст под 180 тысяч токенов. Лёгкие запросы жгут квоту медленнее.
Сколько квоты съедает один запрос
Дальше я перестал догадываться и поставил опыт. Снял остаток квоты, прогнал 40 одинаковых запросов (по 20 в каждом режиме рассуждения) с фиксированным контекстом в 42 тысячи токенов и вопросом, который заставляет модель долго думать. Снова снял остаток. Разница, делённая на число запросов, — цена одного запроса в процентах квоты.
Результат оказался обратным ожиданию.
Сколько запросов помещается в недельную квоту
пересчёт по замеренной доле квоты на один вызов
Тестовый запрос нёс вчетверо меньше контекста, чем настоящий рабочий, — и стоил в 4,4 раза дороже.
Разница между ними одна: рабочий агент пишет в среднем 626 токенов ответа, а подопытный — от трёх до шестидесяти тысяч, потому что его заставили считать вслух. Контекст при этом сократился впятеро и на цену не повлиял никак.
Две экономики устроены противоположно. Когда платишь по токенам, счёт делает чтение — контекст в 257 раз объёмнее ответа. Когда платишь подпиской, счёт делает письмо — квота считает время видеокарты, а карта занята ровно столько, сколько модель печатает. Прочитать 180 тысяч токенов она успевает за один присест, а вот выписать 60 тысяч — это минуты работы.
Различить внутри опыта режимы high и max не удалось: оба дали одинаковые +0,4 % недельной квоты при разрешении счётчика в 0,1 %. Разница между ними, если она и есть, меньше погрешности.
Практическое следствие: потолок «22 000 запросов в неделю» верен для нормальной агентной работы с короткими ответами. Если гонять модель на длинных генерациях — переводах, простынях кода, отчётах, — та же подписка кончится в несколько раз быстрее.
Так стоит ли платить $20?
Месяц работы в этом темпе
39 000 обращений к модели — фактический темп, продлённый на 30 дней
Разрыв невелик. Подписка выигрывает около $7 в месяц — примерно четверть счёта.
Где подписка упирается в потолок
Недельный лимит — около 22 000 запросов. Средний темп в этих логах — 9 100 запросов в неделю, 41 % квоты. Запас двукратный. Но если каждый день недели будет как пиковое 9 августа (2 703 обращения), выйдет 18 900 запросов — 85 % лимита. То есть неделя настоящей гонки почти выбирает подписку целиком.
Недельная квота: сколько её съедают разные темпы работы
доля недельного лимита Ollama Pro
Вердикт
Если вы работаете с агентами каждый день — подписка окупается: $20 против ~$27 по токенам, и потолок вы задеваете только в авральную неделю.
Если агенты у вас пару раз в неделю — не берите. Мой пиковый день стоил по токенам $1,35. Десять таких дней в месяц — это $14, дешевле подписки, и без всяких лимитов.
Настоящая выгода не в деньгах, а в предсказуемости. Разница в $7 — это не аргумент. Аргумент в том, что счёт не может внезапно вырасти втрое из-за одного заигравшегося агента.
Считайте не запросы, а контекст. Вся экономика упирается в 175 тысяч токенов на ответ. Урезав контекст вдвое, вы сэкономите больше, чем любым выбором тарифа.
И проверьте, что именно вы генерируете. Подписка выгодна тому, кто гоняет агентов короткими репликами. Если у вас модель пишет простынями — переводы, документация, генерация кода целыми файлами, — квота сгорит в разы быстрее моей, и весь расчёт нужно делать заново.
Границы этих цифр
Это одна выборка одного человека за 17 дней, а не бенчмарк. Ваш профиль нагрузки может отличаться в разы.
Ollama-канал наблюдался один день (686 обращений). Недельный лимит не выбирался — потолок посчитан пересчётом от 3,3 %, а не встречен вживую.
Ручка /api/usage недокументирована; отдаёт долю с точностью до 0,1 %, и что именно она измеряет внутри — Ollama не раскрывает. Грубость счётчика — причина, по которой опыт не смог различить два режима рассуждения: обе дельты уложились в одно деление шкалы.
Опыт ставился на задании, которое намеренно провоцирует длинное размышление. Оно показывает направление зависимости, но его абсолютные числа — не средняя температура по вашим задачам.
Стоимость по токенам взята из расчётов самого агентного харнесса, а не из счетов провайдеров.
Ollama не сообщает метрику кэша вообще — там, где другие каналы показывают отдельно «новое» и «перечитанное», у неё весь контекст падает в одно число. На подписке это не влияет на цену, но сравнивать каналы токен-в-токен нельзя.