← к ленте

Проблемы использования OpenRouter для разработки AI-агентов

A@oestickAI-инженер
1 мес

Автор делится негативным опытом использования OpenRouter для тестирования AI-агентов и предлагает альтернативный подход с арендой GPU.

Хз как люди пользуется OpenRouter По дурости тестили на нем систему, которая на локалках должна будет работать в контуре клиента, и это такая боль: - низкие лимиты у провайдеров - хрен пойми у кого реально есть поддержка structured output, даже если заявлено - а у кого есть, часто некорректная – натолкнулся на имплементацию с сортировкой ключей в алфавитном порядке 🥴 - нет моделей в целевом кванте - в какой-то момент провайдер просто лег на два часа (а другие не поддерживают норм SO для нужной модели, ага) Да, можно сразу тестить на целевой системе, но а) это нужно получать доступ в контур клиента и б) ждать пока одна его карточка все обработает А у нас autoresearch-like флоу, где агенты в 4 потока эксперименты крутят, нам такое не подходит Короче, надо было сразу арендовать GPU и поднимать там, а не страдать херней. Благо это делается в один промпт (если настроено управление браузером):
Codex, сходи через мой браузер на hf и подними мне vLLM на h200 с <model-name> на <context-len> токенов максимального контекста с <concurrency-num> параллельных запросов. Посмотри в документации и на реддите рекомендации по конфигам и проверь, что мои требования вообще выполнимы или предложи трейдоф
P.s. если нужно часто, установите huggingface_hub и дайте токен админский, чтобы агент через браузер не мучался P.p.s. не забываем потом остановить ноду, а то можно без штанов остаться (если хочется автоматически, юзаем scale_to_zero_timeout=20) Альтернативы: runpod.io, modal.com, cloud.ru (не реклама, а зря) Хз, для кого-то это очевидно, но у нас это первый проект, на котором сошлись локальные модели, отсутствие доступа к железу клиента, и огромный трафик autoresearch подхода

Кратко (AI)

Автор критикует использование OpenRouter для разработки систем с агентами из-за нестабильности провайдеров, проблем со структурированным выводом и ограничений по лимитам. Вместо этого рекомендуется арендовать GPU и разворачивать модели самостоятельно через vLLM для обеспечения стабильной работы autoresearch-флоу.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖