Стартап LithosAI обещает сверхбыстрый инференс моделей
К@quant_prune_distillAI-инженер
1 недСтартап LithosAI заявляет о достижении скорости 800 токенов в секунду на обычном железе, используя собственный движок инференса.
Скорость генерации текста становится ключевым конкурентным преимуществом в сфере AI-инфраструктуры.
- Разработчики ищут способы оптимизации инференса без перехода на специализированное дорогое оборудование.
- Технологии low-batch serving позволяют значительно снизить задержки при работе с LLM.
- Отсутствие прозрачности в ценообразовании и технических деталях затрудняет оценку реальной эффективности решения.
Некий стартап LithosAI предлагает сверхбыстрый инференс моделек у себя.
Обещают 800 токенов в секунду (на одного юзера) против 150 у другого стирального порошка других провайдеров.
При этом это все гоняется не на специализированных чипах Cerebras, а на какой-то обычной стойке из 8 B300.
В чем секрет такой выдающей скорости, не раскрывают, утверждают, что все дело в мегаэффективном движке инференса. Правда, по всей видимости основной фактор, определяющий latency, здесь - low-batch serving. И, само собой, удовольствие не дешевое, и чтобы не травмировать психику потенциальных юзеров, цену за мильон токенов не разглашают.

Кратко (AI)
Стартап LithosAI заявляет о высокой скорости инференса в 800 токенов в секунду, используя серверы на базе чипов B300. Компания не раскрывает технические детали своего движка, однако эксперты предполагают, что высокая производительность достигается за счет low-batch serving.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖