RTK — утилита, которая сжимает вывод терминала перед тем, как его прочитает AI-агент. Идея простая: агенту не нужны тысячи строк логов, ему нужен результат. У RTK 79 тысяч звёзд, и он обещает срезать до 90% вывода bash. Дальше включился испорченный телефон: в соцсетях это превратилось в «Claude Code тратит на 60% меньше токенов». Разница принципиальная — одно дело байты на экране, другое дело счёт за токены. Это и стоило проверить по-настоящему.
Что такое RTK и почему вокруг него шум

RTK работает как прослойка между агентом и командной строкой: команды вроде ls или grep отдают многострочный вывод, а плагин вырезает из него лишнее и передаёт модели компактную версию. Для агентной разработки это логичный ход — контекстное окно конечно, и каждый лишний килобайт логов оплачивается.
Популярность инструмента объяснима: 79 тысяч звёзд — это уровень доверия, при котором обещания редко кто-то перепроверяет. И вот здесь начинается самое интересное, потому что «срезать 90% вывода» и «сэкономить 90% денег» — утверждения из разных измерений, и второе из первого не следует автоматически.
Как устроена проверка

Quesma прогнала RTK на Terminal-Bench 2.1 — бенчмарке для агентов, решающих задачи в командной строке. Условия получились честные:
- 1740 прогонов, больше $1500 ушло на оплату токенов;
- два стека: Claude Code с моделью Fable 5.0 и OpenCode с DeepSeek V4 Pro;
- каждая задача прогонялась по пять раз с RTK и по пять раз без него.
Пять повторов на задачу — это то, чего почти всегда не хватает постам про экономию токенов. Агенты недетерминированы: одна и та же задача в двух прогонах может решаться разным числом шагов, и на одиночном прогоне можно доказать что угодно.
Что показали цифры
Главная метрика — расход на одну решённую задачу, а не на один вызов. По ней у Fable 5.0 с RTK результат ниже на 3%, у DeepSeek V4 Pro — выше на 7%.
Но и эти 3% обманчивы. Почти вся экономия Fable пришла из одной задачи, где агент уложился вдвое меньшим числом ходов; по остальным задачам разница — меньше процента. У DeepSeek та же самая задача пошла наоборот: он потратил больше ходов, а значит, и больше токенов. То есть перед нами не эффект инструмента, а разброс на одной задаче, который тянет за собой среднее.
Если считать среднее по задачам, а не по решённым, картина ещё хуже: DeepSeek с RTK стал дороже на 17%, Fable — на 1%. Доля решённых задач упала на 1–2 пункта у обоих стеков. Итог: заявленной экономии нет, есть шум в пределах погрешности, местами — прямое ухудшение.
Счётчик rtk gain измеряет не то

Отдельная история — счётчик rtk gain, которым хвастаются в постах. Он показывает байты вырезанного вывода, делённые на четыре. К оплаченным токенам это отношения не имеет вообще: разные токенизаторы режут один и тот же текст по-разному, а вырезанные байты могли бы и не попасть в контекст. Счётчик измеряет объём мусора, который утилита не пропустила, а не деньги, которые вы сэкономили.
Пример из прогонов показательный. В одной задаче модель дважды запросила head -1 от файла — то есть одну строку. RTK записал себе 120 млн «сэкономленных токенов» за каждый вызов: он сравнил одну строку с целым файлом. Это не экономия, это артефакт подсчёта, и на таких числах и строятся посты про «минус 60% токенов».
Баг, который нашли уже после замеров
В прогонах вылезла и техническая проблема: rtk find не знал флаг, который использовал агент. Плагин переписывал команду снова и снова, и агент накопил 339 ошибок подряд. Починили это в версии 0.46.0 — уже после того, как замеры были сделаны.
Такие циклы — не мелочь. Агент, который раз за разом повторяет неудачный вызов, сжигает токены на ошибки и заодно теряет контекст задачи. Для вайбкодинга это знакомая боль: чем больше прослоек между моделью и реальным инструментом, тем больше мест, где что-то тихо ломается. Хороший оракул здесь один — бюджет и доля решённых задач, а не внутренние метрики плагина.
Выводы
- Сжатие вывода терминала и экономия денег — не одно и то же: 90% вырезанных байт не превратились в сопоставимое сокращение счёта.
- На Terminal-Bench 2.1 RTK дал минус 3% у Fable 5.0 и плюс 7% у DeepSeek V4 Pro на решённую задачу; в среднем по задачам DeepSeek стал дороже на 17%, Fable — на 1%.
- Почти вся экономия Fable — эффект одной задачи, а не инструмента: агент просто сделал вдвое меньше ходов.
- Доля решённых задач упала на 1–2 пункта у обоих стеков, то есть бесплатной оптимизации не бывает.
- Счётчик rtk gain считает байты, а не токены, и в отдельных случаях выдаёт за экономию сравнение одной строки с целым файлом.
Практический вывод для тех, кто гоняет агентов каждый день: проверяйте инструменты на своём стеке и своих задачах, а метрику берите из биллинга — стоимость на решённую задачу плюс pass rate. Всё остальное — маркетинг.