Облако или покупка GPU
The Wall Street Journal
пишет, что американские компании перестали соревноваться, кто потратил больше токенов и начали считать себестоимость ИИ. Мощные дорогие модели типа Opus оставили на сложных задач типа планирования, а регулярную работу стали отдавать дешёвым китайским моделям. Все начинают считать экономику ИИ внедрений 🙂
В России токены зарубежных вендоров корпорации обычно не покупают, у нас оптимизируют выбор инфраструктуры.
Допустим, мы решили не отдавать данные OpenAI / Anthropic и работать на открытой модели типа Qwen 3.6-35B.
Она подходит для большинства типовых задач: тех.поддержка, речевая аналитика, RAG и поиск по документам и пр.
Дальше есть три варианта:
1. Для коротких тестов можно взять в
аренду облачные мощности на vast.ai, годится для экспериментов, там платим только за часы работы. Никакие приватные данные туда не отдаём, годится чтобы потестировать метрики опенсорс модели на пилоте.
2.
Защищённое рос.облако, 152-ФЗ. От 230 тыс. руб. в месяц за выделенную карту под такую модель . Запуск за день, там уже допустимы любые конф.данные.
3.
Покупка сервера с RTX 6000. От 1,5 до 2 млн руб., но сама поставка и настройка займут месяц или больше.
Теперь посчитаем. Аренда за год выходит около 2.8 млн руб. Покупка того же железа – 1,5–2 млн. Окупаемость 7-8 месяцев, дальше становится дешевле владеть, чем арендовать.
Но при аренде рос.облака мы платим мы не столько за GPU, сколько за соответствие требованиям, за скорость запуска и за право отложить решение о закупке конкретной конфигурации до конца пилота.
👉
Получается логика такая:
• если проект короче полугода, конфигурация ещё не ясна, нужен быстрый запуск - выбираем облако.
• горизонт больше года, нагрузка постоянная, требования к данным жёсткие - выбираем своё железо
• эксперименты без чувствительных данных - почасовая аренда.