Сколько на самом деле жрёт агентная разработка

17 дней работы с ИИ-агентами, 436 сессий, 22 200 обращений к модели. Разобрал собственные логи по токенам и деньгам — и проверил, окупается ли подписка Ollama за $20 вместо оплаты по токенам.

Замеры с 4 по 20 августа 2026 · модель DeepSeek V4 Flash · агентный харнесс Pi · данные из локальных логов сессий

22 200
ответов модели
436 сессий за 17 дней
4,05 млрд
токенов контекста
прочитано моделью
15,7 млн
токенов ответов
то, что она написала
$15,05
заплачено по токенам
≈ $0,89 в день

Что здесь мерилось

Это логи одного человека, работающего с ИИ-агентами по-настоящему каждый день: агенты читают код, правят файлы, гоняют тесты, ревьюят друг друга. Не чат-вопросики, а полноценный рабочий цикл — по несколько параллельных сессий.

Модель везде одна — DeepSeek V4 Flash, «средняя» из линейки. Она ходила через три канала: официальный API DeepSeek, шлюз OpenCode и — с 20 августа — подписку Ollama Cloud за $20. Первые два берут деньги по токенам, третий — фиксированную сумму в месяц. Вопрос ровно один: что дешевле и где ломается.

Главное открытие: платишь не за ответы, а за перечитывание

Соотношение прочитанного к написанному — 257 : 1. На каждый токен, который модель пишет, приходится 257 токенов, которые она перечитывает.

Так устроен агент: на каждом шаге он заново получает весь контекст — историю разговора, содержимое файлов, вывод команд. В среднем это 175 тысяч токенов на один ответ — примерно том «Войны и мира» на каждое «ага, понял, правлю строку 42». А в ответ пишет 700 токенов.

Отсюда единственный рычаг цены — кэш. Повторно прочитанный контекст стоит у DeepSeek в разы дешевле нового. Без кэша те же 4 миллиарда токенов стоили бы не $15, а несколько сотен долларов. Все дешёвые агенты держатся на этом.

Расход по дням

Деньги: сколько стоил день работы
оплата по токенам, доллары · 20 августа канал переключён на подписку
API DeepSeek шлюз OpenCode подписка Ollama — $0 сверх абонплаты
Пик 18 августа — $2,01: в тот день гонялась более тяжёлая модель Pro. Средний рабочий день — около доллара.
Объём: сколько раз агенты обратились к модели
ответов модели в день
API DeepSeek шлюз OpenCode подписка Ollama
Заметьте расхождение с деньгами: 9 августа — рекордные 2 703 обращения, а стоил день $1,35. Цена определяется не числом запросов, а тем, сколько контекста тащится в каждом.

Режимы «сколько думать»

У модели три уровня рассуждения. Разница в цене оказалась не там, где её ждёшь.

РежимОтветовДоляКонтекст на ответИз ответа — размышления$ за 1000 ответов
low3 20914 %160 тыс.40 %$0,85
high — рабочий режим13 38860 %174 тыс.62 %$0,64
max5 59125 %219 тыс.50 %$0,76

Самый думающий режим — не самый дорогой. Средний режим high вышел дешевле обоих соседей: длина размышления добавляет копейки, а платишь за размер контекста. Экономить на глубине мысли бессмысленно — экономить надо на объёме того, что агент тащит в запрос.

Всё это — про оплату по токенам. На подписке правило переворачивается: там глубина как раз и стоит денег. Ниже опыт, который это показал.

Как устроены лимиты Ollama

Подписка Ollama Cloud считает не токены, а время работы видеокарты. Два окна: одно сбрасывается каждые 5 часов, второе — раз в неделю. Модели поделены на четыре класса тяжести: лёгкие тратят квоту медленно, тяжёлые — быстро. Точных чисел Ollama не публикует нигде.

Но их можно достать. У сервиса есть недокументированная ручка, которая отдаёт остаток в процентах:

curl -H "Authorization: Bearer $KEY" https://ollama.com/api/usage

13,9 %
5-часового окна
израсходовано за 517 запросов
3,3 %
недельного лимита
израсходовано за 732 запроса
≈3 700
запросов в 5-часовое окно
пересчёт по замеру
≈22 000
запросов в неделю
пересчёт по замеру

Пересчёт честен только для этого профиля нагрузки: тяжёлый режим max и контекст под 180 тысяч токенов. Лёгкие запросы жгут квоту медленнее.

Сколько квоты съедает один запрос

Дальше я перестал догадываться и поставил опыт. Снял остаток квоты, прогнал 40 одинаковых запросов (по 20 в каждом режиме рассуждения) с фиксированным контекстом в 42 тысячи токенов и вопросом, который заставляет модель долго думать. Снова снял остаток. Разница, делённая на число запросов, — цена одного запроса в процентах квоты.

Результат оказался обратным ожиданию.

Сколько запросов помещается в недельную квоту
пересчёт по замеренной доле квоты на один вызов
Тестовый запрос нёс вчетверо меньше контекста, чем настоящий рабочий, — и стоил в 4,4 раза дороже.

Разница между ними одна: рабочий агент пишет в среднем 626 токенов ответа, а подопытный — от трёх до шестидесяти тысяч, потому что его заставили считать вслух. Контекст при этом сократился впятеро и на цену не повлиял никак.

Две экономики устроены противоположно. Когда платишь по токенам, счёт делает чтение — контекст в 257 раз объёмнее ответа. Когда платишь подпиской, счёт делает письмо — квота считает время видеокарты, а карта занята ровно столько, сколько модель печатает. Прочитать 180 тысяч токенов она успевает за один присест, а вот выписать 60 тысяч — это минуты работы.

Различить внутри опыта режимы high и max не удалось: оба дали одинаковые +0,4 % недельной квоты при разрешении счётчика в 0,1 %. Разница между ними, если она и есть, меньше погрешности.

Практическое следствие: потолок «22 000 запросов в неделю» верен для нормальной агентной работы с короткими ответами. Если гонять модель на длинных генерациях — переводах, простынях кода, отчётах, — та же подписка кончится в несколько раз быстрее.

Так стоит ли платить $20?

Месяц работы в этом темпе
39 000 обращений к модели — фактический темп, продлённый на 30 дней
Разрыв невелик. Подписка выигрывает около $7 в месяц — примерно четверть счёта.

Где подписка упирается в потолок

Недельный лимит — около 22 000 запросов. Средний темп в этих логах — 9 100 запросов в неделю, 41 % квоты. Запас двукратный. Но если каждый день недели будет как пиковое 9 августа (2 703 обращения), выйдет 18 900 запросов — 85 % лимита. То есть неделя настоящей гонки почти выбирает подписку целиком.

Недельная квота: сколько её съедают разные темпы работы
доля недельного лимита Ollama Pro

Вердикт

Границы этих цифр