← к умной ленте

pxpipe: как перевод контекста в PNG экономит до 70% токенов Fable 5

Разработчики нашли способ обойти дорогую текстовую тарификацию нейросети Fable 5 (Claude) от Anthropic: утилита pxpipei кодирует объёмный контекст — системные промпты, документацию инструментов и историю переписки — в PNG-картинки перед отправкой в Claude Code. Изображения тарифицируются по количеству пикселей, а не по числу символов, поэтому длинный контекст обходится заметно дешевле.

В тестах стоимость сессии упала с $42 до $6 — то есть в 7 раз, а по расчётам одного из авторов экономия составляет 59–70%. Fable 5 при этом почти без потерь распознаёт текст на картинках, но у других моделей (Opus 4.7, 4.8, GPT 5.5) метод даёт заметный процент ошибок.

59–70%снижение стоимости запроса к Fable 5
$42 → $6падение стоимости тестовой сессии
≈7%доля ошибок Opus 4.7/4.8 на картиночном контексте
  • pxpipe — локальный прокси с открытым кодом (MIT Licensei, доступен на GitHub), который перехватывает запросы к Claude Code и рендерит самые объёмные и редко меняющиеся блоки контекста в PNG; свежие сообщения и ответы модели остаются текстом
  • Механика экономии: плотный контент (код, JSON, вывод инструментов) содержит примерно 3,1 символа на токен изображения против примерно 1 символа на токен текста в реальном трафике Claude Code
  • Пример из Machinelearning: ~48 тыс. символов системного промпта и документации, которые как текст стоили бы ~25 тыс. токенов, помещаются на одну PNG-страницу за ≈2700 токенов
  • Конкретный расчёт стоимости: $6,06 с запасом контекста (73,5 тыс./1 млн) против $42,21 без сжатия
  • На бенчмарке с новыми задачами Fable 5 читает такие рендеры практически без потерь (100% точности), тогда как Opus 4.7 и 4.8 ошибаются примерно на 7% изображений, а GPT 5.5 тоже деградирует на картиночном контексте — поэтому обе модели по умолчанию отключены и включаются вручную
  • Метод lossy: важные строки вроде хешей и идентификаторов при чтении с картинки могут искажаться, причём ошибки выглядят не как сбои, а как правдоподобные выдумки — зрение модели работает через патч-эмбеддингиi, а не OCR, и там, где пикселей не хватает, модель «достраивает» похожее
  • Побочный минус — задержка: PNG-кодирование через визуальный энкодер занимает больше времени, чем чтение обычного текста
Что дальше

Авторы надеются, что при массовом распространении трюка вендоры не поднимут цены на обработку изображений — это могло бы обесценить всю экономию.

Здесь появится ссылка, когда это произойдёт.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖